Configuração
Se você estiver usando o Jupyter Lab, precisará criar um notebook antes de seguir com o restante do guia.
Baixando um conjunto de dados
Configurando o chDB e o JupySQL
dbapi do chDB:
taxi.chdb:
sql e criar uma conexão com o chDB:
Consultando dados em arquivos TSV
trips_.
Vamos usar a cláusula DESCRIBE para entender o esquema:
SELECT diretamente nesses arquivos para ver como os dados se apresentam:
trip_distance, fare_amount e tip_amount — foram inferidas como String, em vez de um tipo numérico.
Vamos corrigir isso ao importar os dados para uma tabela.
Importando arquivos TSV para o chDB
trips, cujo esquema será derivado da estrutura dos dados nos arquivos TSV.
Usaremos a cláusula REPLACE para converter as colunas de valores monetários em Float64 e a função transform para converter a coluna numérica pickup_borocode em um nome de distrito legível:
zones com base no conteúdo do arquivo CSV:
Consultando o chDB
Salvando consultas
--save na mesma linha do magic %%sql.
O parâmetro --no-execute faz com que a execução da consulta seja ignorada.
Consultas com parâmetros
{{variable}} em nossa consulta.
A consulta a seguir encontra os bairros com a maior média de gorjetas entre aqueles com mais de 10.000 viagens: