NVIDIAが、共有GPUインフラ上で複数のKubernetesクラスターを分離して運用する方法を紹介しています。KAI SchedulerとvClusterを組み合わせることで、各チームが独立した制御プレーンを持ちながらも、GPUリソースを共有することが可能になります。
共有GPUインフラでのクラスター分離の課題
複数のチームが専用のKubernetesクラスターを持つと、過剰な分離が生じることがあります。特に、チーム数が増えると調整コストが上昇し、リソースの競合や管理の複雑さが増します。NVIDIAは、ハードウェアを分割せずにチームの独立性を確保する方法を提案しています。
KAI SchedulerとvClusterの役割
KAI Schedulerは、AIワークロードに最適化されたGPUリソースの割り当てを行うスケジューラです。vClusterは、仮想化されたKubernetesクラスターを提供し、各チームが独自のAPIサーバーやRBACを持つことを可能にします。これにより、物理的なハードウェアを分割せずに論理的な分離を実現します。
具体的な運用例とデモ環境
記事では、NLPチーム、ビジョンチーム、レコメンダーシステムチームがそれぞれ独自のクラスターを持ち、GPUを共有する例が示されています。NVIDIAのBrev GPUインスタンス上でデモが行われ、各チームが個別の環境で作業できることが確認されています。
- GPU
- Graphics Processing Unitの略。画像処理やAIの計算に特化したプロセッサです。
- Kubernetes
- コンテナ化されたアプリケーションのデプロイや管理を自動化するオープンソースのプラットフォームです。
- RBAC
- Role-Based Access Controlの略。ユーザーの役割に基づいてアクセス権を管理する方法です。
- CRD
- Custom Resource Definitionの略。Kubernetesに独自のリソースを追加するための定義です。
- How to Run Isolated Tenant Kubernetes Clusters on Shared GPU Infrastructure(NVIDIA Technical Blog)
配信日: 2026-08-03

