Вернуться к статье
Исследование использования библиотек Pandas, Polars и PySpark для анализа крупномасштабного датасета Expedia Hotel Recommendations
Table 1 - Run time (seconds) and memory consumption (GB)
Operation | Polars (lazy) | Pandas | PySpark | Polars vs Pandas Speedup |
CSV Loading (5,2 GB) | 18,3 | 124,7 | 89,2 | 6,8× |
Filtering + creating 'weekday' | 24,1 | 118,6 | 76,4 | 4,9× |
Group by 'hotel_cluster' | 31,5 | 207,3 | 142,8 | 6,6× |
Total ETL Time | 73,9 | 450,6 | 308,4 | 6,1× |
Peak RAM Consumption | 4,8 GB | 10,2 GB | 8,7 GB | 53% savings |
