OPTIMIZE TABLE ... FINAL の使用は通常推奨していません (こちらのドキュメント を参照してください) 。これは日常的な運用ではなく、管理目的のユースケースを想定しているためです。
OPTIMIZE では パーツが多すぎる エラーを解消できません。OPTIMIZE クエリは、MergeTree ファミリー (materialized view を含む) および Buffer エンジンでサポートされています。その他のテーブルエンジンではサポートされていません。
OPTIMIZE を ReplicatedMergeTree ファミリーのテーブルエンジンに対して使用すると、ClickHouse はマージ用のタスクを作成し、すべてのレプリカで実行されるのを待機します (alter_sync 設定が 2 の場合) 。または、アクティブなレプリカでの実行を待機します (3 の場合) 。あるいは、現在のレプリカでの実行を待機します (1 の場合) 。
- 何らかの理由で
OPTIMIZEがマージを実行しなかった場合、クライアントには通知されません。通知を有効にするには、optimize_throw_if_noop 設定を使用します。 PARTITIONを指定すると、指定したパーティションだけが最適化されます。パーティション式の設定方法。FINALまたはFORCEを指定すると、すべてのデータがすでに 1 つのパーツにまとまっている場合でも最適化が実行されます。この動作は optimize_skip_merged_partitions で制御できます。また、同時実行のマージが行われている場合でも、マージは強制されます。DEDUPLICATEを指定すると、完全に同一の行は重複排除されます (BY句が指定されていない場合は、すべてのカラムが比較されます) 。これは MergeTree エンジンでのみ意味があります。
OPTIMIZE クエリを実行するのを待機する時間 (秒単位) は、replication_wait_for_inactive_replica_timeout 設定で指定できます。
alter_sync が 2 に設定されていて、一部のレプリカが replication_wait_for_inactive_replica_timeout 設定で指定された時間を超えて非アクティブなままの場合は、例外 UNFINISHED がスローされます。alter_sync = 3 の場合、非アクティブなレプリカは待機されないため、例外はスローされません。DRY RUN
DRY RUN 句は、指定されたパーツのマージを、結果をコミットせずにシミュレートします。マージされたパーツは一時的な場所に書き込まれ、検証された後に破棄されます。元のパーツとテーブルデータは変更されません。
これは次のような場合に役立ちます。
- ClickHouse のバージョン間でマージの正しさをテストする。
- マージ関連のバグを決定論的に再現する。
- マージ性能をベンチマークする。
DRY RUN は MergeTree ファミリーのテーブルでのみサポートされています。パーツ名のリストを指定した PARTS キーワードが必要です。指定するすべてのパーツは存在し、アクティブであり、同じパーティションに属している必要があります。
DRY RUN は FINAL および PARTITION とは併用できません。DEDUPLICATE (任意でカラムを指定可能) および CLEANUP (ReplacingMergeTree テーブル用) とは組み合わせて使用できます。
構文
CHECK TABLE クエリと同様の方法で検証されます。この動作は optimize_dry_run_check_part 設定で制御されており、既定で有効です。これを無効にすると検証がスキップされるため、マージ自体のベンチマークを行う場合に役立ちます。
例
BY 式
すべてのカラムではなく、任意のカラムの組み合わせに対して重複排除を行いたい場合は、カラムのリストを明示的に指定するか、*、COLUMNS、EXCEPT 式を任意に組み合わせて使用できます。明示的に記述した、または暗黙的に展開されたカラムのリストには、行の順序付け式 (プライマリキーとソートキーの両方) およびパーティション化式 (パーティション化キー) で指定されるすべてのカラムを含める必要があります。
* は SELECT と同様に動作することに注意してください。MATERIALIZED カラムおよび ALIAS カラムは展開に使用されません。また、空のカラムリストを指定したり、結果として空のカラムリストになる式を記述したり、ALIAS カラムを使って重複排除を行ったりすると、エラーになります。Query
Query
Query
Response
DEDUPLICATE
重複排除の対象カラムが指定されていない場合は、すべてのカラムが対象になります。行が削除されるのは、すべてのカラムの値が直前の行の対応する値とすべて等しい場合に限られます。
Query
Query
Response
DEDUPLICATE BY *
カラムが暗黙的に指定されている場合、テーブルは ALIAS または MATERIALIZED ではないすべてのカラムを基準に重複排除されます。上記のテーブルでは、該当するのは primary_key、secondary_key、value、partition_key の各カラムです。
Query
Query
Response
DEDUPLICATE BY * EXCEPT
ALIAS または MATERIALIZED ではなく、かつ value を明示的に除いたすべてのカラム、つまり primary_key、secondary_key、partition_key の各カラムを対象に重複排除します。
Query
Query
Response
DEDUPLICATE BY <list of columns>
重複排除の対象として、primary_key、secondary_key、partition_key の各カラムを明示的に指定します:
Query
Query
Response
DEDUPLICATE BY COLUMNS(<regex>)
regex に一致するすべてのカラムを対象に重複排除します: primary_key、secondary_key、partition_key の各カラム:
Query
Query
Response