
テクノロジー
クラウドGPUの「不都合な真実」:2万基を運用してわかったAWS・GCP・Azureの性能差と監視の鉄則
生成AI革命の裏側には、華々しいモデルの性能向上とは対照的な、泥臭く、過酷なハードウェアの現実が存在する。NVIDIA H100をはじめとする最新鋭GPUは、驚異的な演算能力を持つ反面、その運用は極めて不安定だ。 サーバ […]
NVIDIA Data Center GPU Manager (DCGM) は、クラスター環境におけるNVIDIA GPUの管理と監視を目的としたスイートです。アクティブなヘルスチェック、診断テスト、テレメトリの収集、電力やクロックの管理機能を提供します。Modalのようなインフラプロバイダーは、DCGMを使用してGPUのハードウェア故障や性能低下を自動的に検知します。