Por qué DataStore es más rápido
1. SQL Pushdown
2. Poda de columnas
3. Evaluación diferida
Benchmark: DataStore frente a pandas
Entorno de prueba
- Datos: 10 millones de filas
- Hardware: portátil estándar
- Formato de archivo: CSV
Resultados
Puntos clave
- Operaciones de GroupBy: DataStore hasta 19.93 veces más rápido
- Canalizaciones complejas: DataStore 5-6 veces más rápido (beneficio de SQL Pushdown)
- Operaciones de slicing simples: Rendimiento comparable; la diferencia es insignificante
- Mejor caso de uso: Operaciones de varios pasos con GroupBy/agregación
- Zero-copy:
to_df()no tiene sobrecarga por conversión de datos
Cuándo destaca DataStore
Agregaciones intensivas
Canalizaciones complejas
Procesamiento de archivos grandes
Operaciones con varias columnas
Cuándo pandas ofrece un rendimiento comparable
Conjuntos de datos pequeños (<1.000 filas)
Operaciones simples de slicing
Funciones lambda personalizadas en Python
ImportanteIncluso en los casos en que DataStore sea “más lento”, el rendimiento suele estar a la altura de pandas; la diferencia es insignificante en la práctica. Las ventajas de DataStore en operaciones complejas superan con creces estos casos puntuales.Para tener un control detallado de la ejecución, consulta la configuración del motor de ejecución.
Integración de DataFrames con zero-copy
to_df()es prácticamente gratuito: no requiere serialización ni copia de memoria- Crear un DataStore a partir de un pandas DataFrame es instantáneo
- La memoria se comparte entre el DataStore y las vistas de pandas