Вернуться к статье
Исследование использования библиотек Pandas, Polars и PySpark для анализа крупномасштабного датасета Expedia Hotel Recommendations
Quality of models (on a test sample of 1,2 million records)
Task | Metric | Value | Baseline |
Regression | RMSE (км) | 1250,4 | 2100,7 |
R² | 0,63 | - | |
Clustering | Silhouette Score | 0,42 | 0,0 (random) |
Inertia | 1,87e+9 | - | |
Classification | Accuracy | 0,68 | 0,58 (share is_booking = 1) |
F1-score (macro) | 0,32 | - | |
AUC-ROC | 0,61 | - |
