电科云
将智能知识库一体机交付至项目现场独立运行,基于 Kubernetes 与 HAMi 实现文本生成、Embedding、Rerank 等模型的 GPU 共享混部。
单台一体机开发环境容量提升 15 倍,显存回收 87.5%
- 同一台 8 卡一体机可承载的并发开发 Pod 由 2 个增至 30 个(15 倍)。
- Embedding 服务由独占一整张 64 GB GPU 改为 8 GB 显存 / 20% 算力切片,性能几乎无损。
- 在线服务、批处理任务与研发调试统一纳入同一 Kubernetes 调度体系。
基于 Kubernetes、Volcano 与 HAMi 构建生产级 GPU 共享平台,支撑 2000+ 研发工程师日常使用。
GPU 利用率提升 3 倍以上,外部模型调用成本降低 50%
- 单卡混部模型数从 1 个增至 8 个以上,GPU 利用率提升 3 倍以上。
- 外部模型调用成本减半,从每月 40 万元降至 20 万元。
- 模型故障恢复时间从约 1 小时缩短至 10 分钟以内,3 倍峰值流量下成功率保持 95% 以上。
基于 Kubernetes 与 HAMi 构建统一的异构 AI 算力调度平台,实现拓扑感知调度与加速器细粒度共享。
拓扑感知调度下硬件资源池利用率达 100%
- 通过超节点模块感知的成对分配,硬件资源池利用率达 100%。
- 分布式训练的跨机调度下降 30%。
- 细粒度切分最小至单卡 1 GB 显存 / 1% 算力。
通过 HAMi GPU 共享和 KEDA 自动伸缩,编排 1000+ A100 GPU 为全球 2 亿用户提供 GenAI 服务。
借助 HAMi GPU 共享减少 50% GPU 需求,从容应对 700% 流量洪峰
- 通过 HAMi GPU 共享,训练与推理流水线所需 GPU 减少一半。
- 相比等量按需云 GPU,预估节省成本 1740 万美元。
- MTTR 降低 91%(约 2 小时缩短至约 10 分钟);GPU 涌流错误减少 85%。
基于 HAMi 的 GPU 虚拟化,提升自动驾驶工作负载的 GPU 利用率。
CI 流水线 GPU 利用率提升 10 倍
- 仿真工作负载 GPU 时间减少 30%。
- 采用混合 GPU 共享策略,结合 HAMi、MIG 和时间切片。
基于 Kubernetes 和 HAMi 的 GPU 虚拟化,支撑机器学习基础设施规模化。
平台 GPU 利用率提升 3 倍
- 在混合负载下提升集群整体 GPU 资源效率。
- 通过更可预测的调度能力,加速 AI 功能上线。
基于 HAMi 构建灵活 GPU 云,提升利用率并加快交付速度。
采用 vGPU 后,平均 GPU 利用率超过 80%
- GPU 运营成本降低约 50%。
- 典型环境交付时间由约 1 天缩短至约 20 分钟。
基于 HAMi 构建异构 AI 虚拟化资源池方案(Effective GPU)。
生产与测试集群最高节省 57% GPU 成本
- 在生产与非生产环境中降低 GPU 闲置浪费。
- 通过异构加速器统一资源池,提升整体利用率。
在教育场景 AI 推理业务中,借助 HAMi 优化资源编排。
90% GPU 基础设施通过 HAMi 得到优化
- 多数 GPU 基础设施通过 HAMi 实现标准化与优化。
- 增强了推理型高并发流量下的稳定性与效率。