Вернуться к статье

Исследование использования библиотек Pandas, Polars и PySpark для анализа крупномасштабного датасета Expedia Hotel Recommendations

Quality of models (on a test sample of 1,2 million records)

Task

Metric

Value

Baseline

Regression

RMSE (км)

1250,4

2100,7

0,63

-

Clustering

Silhouette Score

0,42

0,0 (random)

Inertia

1,87e+9

-

Classification

Accuracy

0,68

0,58 (share is_booking = 1)

F1-score (macro)

0,32

-

AUC-ROC

0,61

-