Préparation
Si vous utilisez Jupyter Lab, vous devrez créer un notebook avant de poursuivre le guide.
Téléchargement d’un jeu de données
Configurer chDB et JupySQL
dbapi pour chDB :
taxi.chdb :
sql et créons une connexion à chDB :
Interroger des données dans des fichiers TSV
trips_.
Utilisons la clause DESCRIBE pour connaître le schéma :
SELECT directement sur ces fichiers pour voir à quoi ressemblent les données :
trip_distance, fare_amount et tip_amount — ont été inférées comme String plutôt que comme un type numérique.
Nous corrigerons cela lors de l’importation des données dans une table.
Importer des fichiers TSV dans chDB
trips, dont le schéma sera dérivé de la structure des données des fichiers TSV.
Nous utiliserons la clause REPLACE pour convertir les colonnes liées aux montants en Float64, ainsi que la fonction transform pour convertir la colonne numérique pickup_borocode en un nom de borough compréhensible :
zones à partir du contenu du fichier CSV :
Interroger chDB
Enregistrement de requêtes
--save, sur la même ligne que la commande magique %%sql.
Le paramètre --no-execute permet d’ignorer l’exécution de la requête.
Requêtes avec paramètres
{{variable}} dans notre requête.
La requête suivante identifie les quartiers où le pourboire moyen est le plus élevé parmi ceux comptant plus de 10 000 trajets :