NVIDIA MIG等GPU资源切分机制适合把支持的物理GPU划分为更细粒度、具有明确资源边界的可分配单元。企业资源池不应为了提高表面利用率而全面切分,而应根据硬件支持、工作负载显存、性能隔离、生命周期和运维复杂度,决定独占、切分或共享。
完整GPU对轻量推理或开发任务可能过大,静态独占会产生空闲。资源切分可以帮助:
但切分不会自动提高模型吞吐,也不适合所有任务。
| 方式 | 适用倾向 | 主要考虑 |
|---|---|---|
| 整卡独占 | 大模型、关键任务、强性能要求 | 成本较高,但边界清晰 |
| MIG切分 | 支持硬件上的中小型稳定任务 | 需验证规格、显存和兼容性 |
| 时间共享 | 开发、测试或可接受波动任务 | 性能干扰和可预测性 |
| 专属资源池 | 高风险或高保障服务 | 容量利用与隔离成本 |
具体MIG能力因GPU型号、驱动和软件栈而异,本文不列未经核验的实例规格。
只看平均显存占用不足以决定切分规格。
资源模型可以是:
物理GPU → 切分配置 → 可分配实例 → 标准规格 → 项目配额 → 模型服务
每个标准规格应描述显存、适用任务、服务等级、最大时长、计量单位和已知限制。应用申请规格,不直接修改底层切分配置。
切分变更可能影响运行任务,必须根据产品和驱动机制设计维护流程。
不要只看GPU利用率。还应观察:
如果资源效率提高但服务质量下降,切分策略并不成功。
MIG是一类硬件支持的资源切分机制,但企业还可能采用其他虚拟化或共享方式。具体能力边界需看硬件和软件栈。
不是。支持范围及规格会变化,应以目标硬件与当前官方技术文档为准,并完成本地验证。
不一定。任务规格不匹配、切分过碎或容量波动都可能产生新的空闲和运维成本。
取决于模型规模、显存、互联和性能要求。大型训练通常更倾向整卡或多卡资源,但必须以实际评测为准。
选择两类典型任务,分别测试整卡与候选切分规格,比较质量、延迟、稳定性、等待时间和单位成本后再发布规格。