Skip to content

Dataproc クラスタ idle

ルール ID: gcp.dataproc.cluster.idleカテゴリ: zombie ・ 必要な読み取り: インベントリ + 利用メトリクス 計画中

分析ジョブが終わった後も消し忘れた Dataproc クラスタは、ジョブが 1 本も走らないままノードの課金が続きます。このルールは、ジョブ投入が途絶えた常設クラスタを見つけます。

このページは判定規範に従う予定仕様です。閾値・観測窓の根拠(出典)は実装時に付記します。

何を無駄とみなすか

稼働状態のまま、YARN アプリケーション(Hadoop / Spark ジョブ)が長期間 1 本も実行されていないクラスタ。ジョブが無くてもワーカーノードの課金は止まりません。

判定条件

  • 30 日間、YARN アプリケーション(実行中・待機中とも)が 0 である
  • 稼働(RUNNING)への遷移から 15 日以上経過している(作り直した直後のクラスタを誤検知しないための時間ゲート)

必須 facts

  • クラスタの状態と稼働遷移からの経過日数
  • 観測窓(30 日)内の YARN 実行中アプリ数・待機中アプリ数の最大値
  • 所属リージョンとノード構成

取得できない facts がある場合は「観測不能」と表示し、候補にしません(候補を捏造しない)。

誤検知・危険になり得る条件

  • 30 日を超える周期のバッチ(四半期処理など)専用のクラスタ
  • YARN を経由しないワークロード(ノードへ直接ログインして実行する処理など)は YARN アプリ数に現れない
  • HDFS 上に退避していないデータを保持しているクラスタ — 削除するとデータも失われる

実行前の確認

  • 命名・ラベルから用途(定期バッチ / アドホック分析)と実行周期を確認する
  • HDFS 上に永続化が必要なデータが残っていないか(Cloud Storage 等へ退避済みか)を確認する
  • IaC(Terraform 等)・ジョブスケジューラからの参照有無を確認する
  • 所有チームに次回のジョブ実行予定を確認する

非破壊テストとロールバック

Safety Tier: high — 削除は復元に手順が要る操作のため、バックアップ取得と観察期間を必須にします。

  1. HDFS 上の必要データを Cloud Storage へ退避し、クラスタ構成(IaC または構成のエクスポート)を保存する
  2. まずクラスタを停止して観察期間を置き、問い合わせがないことを確認してから削除する

ロールバック: 保存した構成からクラスタを再作成し、退避したデータを戻す。

効果検証

削減の確定は、変更前ベースラインと変更後請求の比較で行います(Verify)。

その他のルールはルールカタログを参照してください。