削除されたバックエンドを参照する Trident の孤立ボリュームによるワーカーノードの高い CPU 使用率
環境
- NetApp Astra Trident CSIドライバー
- Kubernetes / OpenShift環境
- ONTAP SAN/NASバックエンド
問題
Trident CSI コントローラーポッドが稼働しているワーカーノードは、持続的に高い CPU 使用率(最大 100%)を示します。
結果として:
- クラスター全体のパフォーマンス低下
- 複数のポッドにわたるアプリケーションの中断
- プロビジョニングおよび削除ワークフローにおける遅延の増加
観測されたログパターン:
Tridentコントローラーログから:
level=error msg="Invalid backend state." expectedState=online/deleting state=failed workflow="core=node_reconcile"msg="Unable to delete snapshot from backend."error="backend <backend-name> is not Online or Deleting"msg="Unable to delete volume from backend."error="backend <backend-name> is not Online or Deleting"- これらのエラーは継続的に繰り返されます(高頻度リトライ)
- コントローラーが永続的な調整ループに入る