Appearance
Dataproc クラスタ idle
ルール ID: gcp.dataproc.cluster.idle ・ カテゴリ: zombie ・ 必要な読み取り: インベントリ + 利用メトリクス 計画中
分析ジョブが終わった後も消し忘れた Dataproc クラスタは、ジョブが 1 本も走らないままノードの課金が続きます。このルールは、ジョブ投入が途絶えた常設クラスタを見つけます。
このページは判定規範に従う予定仕様です。閾値・観測窓の根拠(出典)は実装時に付記します。
何を無駄とみなすか
稼働状態のまま、YARN アプリケーション(Hadoop / Spark ジョブ)が長期間 1 本も実行されていないクラスタ。ジョブが無くてもワーカーノードの課金は止まりません。
判定条件
- 30 日間、YARN アプリケーション(実行中・待機中とも)が 0 である
- 稼働(RUNNING)への遷移から 15 日以上経過している(作り直した直後のクラスタを誤検知しないための時間ゲート)
必須 facts
- クラスタの状態と稼働遷移からの経過日数
- 観測窓(30 日)内の YARN 実行中アプリ数・待機中アプリ数の最大値
- 所属リージョンとノード構成
取得できない facts がある場合は「観測不能」と表示し、候補にしません(候補を捏造しない)。
誤検知・危険になり得る条件
- 30 日を超える周期のバッチ(四半期処理など)専用のクラスタ
- YARN を経由しないワークロード(ノードへ直接ログインして実行する処理など)は YARN アプリ数に現れない
- HDFS 上に退避していないデータを保持しているクラスタ — 削除するとデータも失われる
実行前の確認
- 命名・ラベルから用途(定期バッチ / アドホック分析)と実行周期を確認する
- HDFS 上に永続化が必要なデータが残っていないか(Cloud Storage 等へ退避済みか)を確認する
- IaC(Terraform 等)・ジョブスケジューラからの参照有無を確認する
- 所有チームに次回のジョブ実行予定を確認する
非破壊テストとロールバック
Safety Tier: high — 削除は復元に手順が要る操作のため、バックアップ取得と観察期間を必須にします。
- HDFS 上の必要データを Cloud Storage へ退避し、クラスタ構成(IaC または構成のエクスポート)を保存する
- まずクラスタを停止して観察期間を置き、問い合わせがないことを確認してから削除する
ロールバック: 保存した構成からクラスタを再作成し、退避したデータを戻す。
効果検証
削減の確定は、変更前ベースラインと変更後請求の比較で行います(Verify)。
その他のルールはルールカタログを参照してください。