TwKit

推文

@Zen_with_AI · 2026-10-09 18:20

小路带你看大厂系统架构--SageMaker HyperPod on EKS AWS 把multi tenant GPU 集群做成了开箱即用的产品:SageMaker HyperPod on EKS。 痛点大家现在都知道:一个大集群分给几个团队,A 占着卡不放,B 的训练干等,文件系统还互相踩。 方案上了三板斧:按团队划分 Kubernetes namespace;用基于 Kueue 的 HyperPod Task Governance 设置 GPU/CPU quota,忙时按优先级抢占、闲时互相借卡;再用 mutating admission webhook 自动注入 POSIX UID/GID,把各团队的 FSx 目录彻底隔离。 Kueue 是 CNCF 的任务队列项目,AWS 等于把它收编成 HyperPod 的调度大脑。多租户隔离 + 公平调度 + 存储隔离一次配齐,平台团队不用再自己写胶水代码拼这套了。 https://aws.amazon.com/blogs/machine-learning/share-gpu-clusters-across-teams-with-isolation-and-fairness-using-amazon-sagemaker-hyperpod/

曝光 367 · 评论 2 · 点赞 1 · 书签 1 · 曝光/时 67.81140389222928