跳到正文
Hugging Face Blog·· 40 分钟前精选

Ai2用GPU时间预算和公平共享改造GPU集群调度

Impactful scheduling for GPU clusters

研究任务与主要进展

Ai2 AI基础设施团队将GPU时间预算、层级公平共享和最短运行时调度契约引入GPU集群,以减少资源抢占、占坑和优先级膨胀。团队在30天测试中报告,团队获得应分配GPU时间的98%、集群占用率保持98%,需人工介入的维修减少74%;最大H100集群的中位排队时间从5分钟降至24秒。材料同时指出,交互式会话的受保护运行时间上限为8小时,容量碎片化对大型任务的影响仍在模拟器与生产环境中测量。

阶段、条件与复现 · 深读核对

  • 新能力对应什么具体任务与最小输入输出?
  • 代码、模型、数据、许可与可用入口是否明确?
  • 效果、总成本、失效条件与实际工作流如何验证?

这些是阅读核对问题;材料未说明的条件保留未知。请阅读原文核验。

本站判断

Ai2将GPU时间预算、层级公平共享和最短运行时调度契约引入GPU集群调度,把资源分配从人工协商转为透明预算管理。材料报告30天测试中团队获得应分配GPU时间的98%、集群占用率保持98%,人工参与维修减少74%,但交互式长会话变差和容量碎片化仍需验证;这些结果受需求超过容量2—3倍、集群规模及工作负载结构影响。本站设想:可在相同负载需求下比较不同最短运行时和回看窗口对大任务碎片化与等待时间的影响。

来源:Hugging Face Blog · huggingface.co