- Python 3.8 o superior
- un entorno virtual
- un servicio de ClickHouse Cloud en funcionamiento y sus datos de conexión
- Conectarse a ClickHouse Cloud desde notebooks de Marimo usando chDB
- Consultar conjuntos de datos remotos y convertir los resultados en DataFrames de Pandas
- Visualizar datos con Plotly en Marimo
- Aprovechar el modelo de ejecución reactivo de Marimo para la exploración interactiva de datos
Configuración
Carga del conjunto de datos
Data sources. Después, haz clic en Predefined sample data:
Selecciona Get started en la tarjeta de datos de precios de propiedades pagados del Reino Unido (4GB):
Después, haz clic en Import dataset:
ClickHouse creará automáticamente la tabla pp_complete en la base de datos default y la rellenará con 28,92 millones de filas de datos de precios.
Para reducir la probabilidad de exponer tus credenciales, te recomendamos añadir tu nombre de usuario y contraseña de Cloud como variables de entorno en tu máquina local.
Desde una terminal, ejecuta el siguiente comando para añadir tu nombre de usuario y contraseña como variables de entorno:
Configuración de credenciales
Las variables de entorno anteriores solo se mantienen mientras dure la sesión de tu terminal.
Para configurarlas de forma permanente, añádelas al archivo de configuración de tu shell.
Instalar Marimo
Instalar dependencias
Explorar los datos
remoteSecure de ClickHouse permite recuperar fácilmente los datos de ClickHouse Cloud.
Puede indicar a chDB que devuelva estos datos dentro del proceso como un data frame de Pandas, una forma práctica y familiar de trabajar con datos.
Consultar datos de ClickHouse Cloud
pandas.DataFrame:
chdb.query(query, "DataFrame") ejecuta la consulta especificada y devuelve el resultado como un Pandas DataFrame.
En la consulta usamos la función remoteSecure para conectarnos a ClickHouse Cloud.
La función remoteSecure recibe como parámetros:
- una cadena de conexión
- el nombre de la base de datos y de la tabla que se van a usar
- su nombre de usuario
- su contraseña
remoteSecure se conecta al servicio remoto de ClickHouse Cloud, ejecuta la consulta y devuelve el resultado.
Según el volumen de datos, esto puede tardar unos segundos.
En este caso, devolvemos un precio medio por año y aplicamos el filtro town='LONDON'.
A continuación, el resultado se almacena como un DataFrame en una variable llamada df.
Visualización de los datos
Selección interactiva de localidades
Exploración de la distribución de precios con diagramas de caja interactivos
Resumen
remoteSecure() y convertir los resultados directamente en DataFrames de Pandas para su análisis y visualización.
Gracias a chDB y al modelo de ejecución reactivo de Marimo, los científicos de datos pueden aprovechar la potencia de SQL de ClickHouse junto con herramientas de Python conocidas, como Pandas y Plotly, con la ventaja adicional de los widgets interactivos y el seguimiento automático de dependencias, que hacen que el análisis exploratorio sea más eficiente y reproducible.