Posts、Users、Votes、Comments、Badges、PostHistory、PostLinks が含まれています。
2024 年 4 月までのすべての投稿を含む、あらかじめ用意された Parquet 版のデータをダウンロードすることも、最新の XML フォーマットのデータをダウンロードして読み込むこともできます。Stack Overflow はこのデータを定期的に更新しており、これまではおおむね 3 か月ごとに更新されてきました。
次の図は、Parquet フォーマットで利用することを前提とした利用可能なテーブルのスキーマを示しています。
このデータのスキーマの説明は こちら を参照してください。
あらかじめ用意されたデータ
eu-west-2 に配置された 96 GiB・24 vCPU の ClickHouse Cloud クラスターでの所要時間です。データセットは eu-west-3 にあります。
Posts
Votes
Comments
Users
Badges
PostLinks
PostHistory
元のデータセット
stackoverflow.com* のファイルです。
ダウンロード
JSON に変換する
jq ラッパーである Linux ツール xq の使用を推奨します。
xq と jq をインストールします:
stackoverflow.com-Posts.7z ファイルを例に説明します。必要に応じて読み替えてください。
p7zip を使ってファイルを展開します。展開すると、1 つの XML ファイルが生成されます。この例では Posts.xml です。
ファイルはおよそ 4.5 倍に圧縮されています。圧縮後のサイズが 22GB の場合、Posts ファイルの非圧縮サイズは約 97GB になります。
posts.json という単一のファイルが生成されます。
次のコマンドで ClickHouse に読み込みます。posts.json ファイルにはスキーマが指定されている点に注意してください。ターゲットテーブルに合わせるには、データ型ごとにこれを調整する必要があります。
クエリ例
回答数が最も多いユーザー (アクティブなアカウント)
UserId が必要です。
最も物議を醸した投稿
帰属表示
cc-by-sa 4.0 ライセンスのもとで提供してくださった Stack Overflow に感謝するとともに、その尽力と、https://archive.org/details/stackexchange にあるデータの元の出典に敬意を表します。