← 落地页
面向 Kubernetes 的厂商中立 GPU 可观测性
Kubernetes 中的 GPU 可观测性是割裂的。每家厂商都自带一套指标栈:NVIDIA DCGM、AMD ROCm SMI。运行异构集群的平台团队需要拼凑三套不同的仪表盘,才能回答同一个问题:「我的 GPU 是否被高效利用?」HAMi(CNCF 孵化项目)位于调度层,能够看到每一次 GPU 操作。这个单一的集成点让你在 NVIDIA、AMD、Ascend 以及任何具备 device plugin 的加速器上获得集中式可观测性。HAMi 会托管底层厂商指标,并将其中相关数据归属到各个工作负载,因此你无需深入了解各家厂商的 exporter 及其指标细节,同样能按工作负载获得利用率、显存压力和分配效率,无论底层硬件是什么。本次演讲将介绍:为什么 GPU 可观测性比 CPU 可观测性更难(CUDA 上下文模型、MIG 分区、device plugin 的不透明性),以及 HAMi 的调度层埋点如何为异构加速器提供统一的厂商中立视图。