跳到正文
热点事件持续更新

AWS发布HyperPod EKS多团队共享GPU集群参考架构

1 篇报道1 个报道来源23 小时前更新

先了解这件事

AI 综述

AWS在机器学习博客发布一套参考架构,介绍如何在 Amazon SageMaker HyperPod with EKS 上让多个团队共享同一个 GPU 集群。方案用 AWS IAM Identity Center 做集中认证,每个团队有独立的 SageMaker AI 域名,用 Kubernetes 命名空间隔离工作负载,通过 HyperPod Task Governance 做资源公平分配,并按命名空间做成本分摊以便查看各团队支出。 该架构明确适用于同一组织内、共享集群且彼此有基本信任的多团队场景,不适用于互不信任租户间的多客户隔离。文中说明 NetworkPolicies 只能减少意外的跨团队访问、缩小影响范围,不构成共享节点上对抗性的安全边界。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. AWS Machine Learning Blog
    Amazon SageMaker HyperPod 多团队共享GPU集群参考架构

    AWS提出一套在 Amazon SageMaker HyperPod with EKS 上供多个团队共享单一GPU集群的参考架构,通过 AWS IAM Identity Center。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。