TwKit

推文

@fireandstart · 2026-10-11 02:49

这套机制把“资源份额”从占住几张卡,改成按实际消耗的 GPU-hours 记账,解决的是共享集群里很常见的错觉:名义上各有一半设备,不代表各自获得了一半算力时间。四张卡跑两小时就是八 GPU-hours;当两队份额相同、近期却分别用了 75% 和 25% 的额度时,让后者在双方都有排队任务时优先,既给低使用团队追赶机会,也避免把设备永久切成互不相通的两块。 不过,GPU-hours 是公平性的起点,不是完整的成本模型。不同型号的卡、显存占用、互联带宽和任务是否能被切分,都会让同样的“卡时”产生不同产出;如果只优化账面份额,还可能让短任务不断插队,或让大任务因碎片化长期等不到合适的连续资源。好的调度器需要同时解释额度如何累积、队列何时让步,以及紧急任务用了多少借用额度。 因此我更看重这种设计的两个特征:按时间共享而非物理切割,并且能让沉寂的额度逐渐恢复优先权。它把公平做成可观察、可调整的规则,而不是静态承诺。下一步若能把等待时长、利用率、任务完成率和不同硬件的归一化成本一起公开,团队就能判断系统究竟是在“平均分配”,还是让更多实验更快完成。

曝光 41 · 评论 1 · 点赞 0 · 书签 0 · 曝光/时 14.481974593964852

TwKit
正在载入