NVIDIA MIG与GPU资源切分:企业资源池应该怎样使用?

NVIDIA MIG等GPU资源切分机制适合把支持的物理GPU划分为更细粒度、具有明确资源边界的可分配单元。企业资源池不应为了提高表面利用率而全面切分,而应根据硬件支持、工作负载显存、性能隔离、生命周期和运维复杂度,决定独占、切分或共享。

资源切分解决什么问题

完整GPU对轻量推理或开发任务可能过大,静态独占会产生空闲。资源切分可以帮助:

  • 提供更小的标准规格;
  • 让多个兼容任务共享物理设备;
  • 明确分配边界和配额;
  • 提高资源池调度粒度;
  • 将设备能力产品化为服务规格。

但切分不会自动提高模型吞吐,也不适合所有任务。

MIG、时间共享和整卡独占如何选择

方式 适用倾向 主要考虑
整卡独占 大模型、关键任务、强性能要求 成本较高,但边界清晰
MIG切分 支持硬件上的中小型稳定任务 需验证规格、显存和兼容性
时间共享 开发、测试或可接受波动任务 性能干扰和可预测性
专属资源池 高风险或高保障服务 容量利用与隔离成本

具体MIG能力因GPU型号、驱动和软件栈而异,本文不列未经核验的实例规格。

切分前必须回答六个问题

  1. 当前GPU型号与软件版本是否支持目标切分方式;
  2. 模型显存、计算和带宽需求是多少;
  3. 工作负载能否接受共享物理设备;
  4. 性能与故障边界是否经过压力测试;
  5. 监控、计量和故障定位能否识别切分实例;
  6. 服务扩缩容、升级和回收如何执行。

只看平均显存占用不足以决定切分规格。

把切分实例纳入资源池

资源模型可以是:

物理GPU → 切分配置 → 可分配实例 → 标准规格 → 项目配额 → 模型服务

每个标准规格应描述显存、适用任务、服务等级、最大时长、计量单位和已知限制。应用申请规格,不直接修改底层切分配置。

切分配置如何进入生命周期

  • 规划:依据任务画像设计候选规格;
  • 验证:测试性能、稳定性和故障影响;
  • 发布:加入资源目录并定义配额;
  • 分配:由调度根据兼容与容量选择;
  • 监控:关联物理设备、实例和服务;
  • 变更:维护窗口内调整配置;
  • 回收:释放实例并核对残留任务;
  • 复盘:比较实际使用和服务产出。

切分变更可能影响运行任务,必须根据产品和驱动机制设计维护流程。

如何衡量切分是否有效

不要只看GPU利用率。还应观察:

  • 规格申请等待时间;
  • 任务成功率和尾部延迟;
  • 显存不足与被驱逐情况;
  • 物理GPU与切分实例使用;
  • 单位成功任务成本;
  • 运维事件和配置变更成本。

如果资源效率提高但服务质量下降,切分策略并不成功。

FAQ

MIG是否等于GPU虚拟化?

MIG是一类硬件支持的资源切分机制,但企业还可能采用其他虚拟化或共享方式。具体能力边界需看硬件和软件栈。

所有NVIDIA GPU都支持MIG吗?

不是。支持范围及规格会变化,应以目标硬件与当前官方技术文档为准,并完成本地验证。

MIG一定比整卡利用率高吗?

不一定。任务规格不匹配、切分过碎或容量波动都可能产生新的空闲和运维成本。

MIG适合训练大模型吗?

取决于模型规模、显存、互联和性能要求。大型训练通常更倾向整卡或多卡资源,但必须以实际评测为准。

下一步

选择两类典型任务,分别测试整卡与候选切分规格,比较质量、延迟、稳定性、等待时间和单位成本后再发布规格。