阿里云智能-异构 GPU集群资源优化专家-杭州Company AliyunFocus Tech · BackendLocation 杭州Published August 23, 2026岗位职责 负责智算集群中GPU资源的全面监控、质量巡检及故障预测,通过智能化运维手段确保系统的高可用性和稳定性,提前识别并解决潜在问题。 保障在线POD的集群资源管理与切分业务,优化资源分配策略,提高资源利用率和任务处理效率,支持大规模分布式计算的需求。 开发和维护KuberGPU技术,实现GPU资源的高效切分与容器化部署,支持多款智算相关产品的多种应用场景,提供灵活且强大的GPU资源共享解决方案。 开发和实施容器热迁移技术,提升集群灵活性和容错能力,确保在不停机的情况下进行系统维护和资源调度,进一步增强用户体验和服务连续性。 任职要求 精通C/C++/Go等核心开发语言,具备Python、Rust、Shell等一种或多种语言的开发经验,拥有规范的工程化编码能力。 深入理解Linux系统,具有Kubernetes及容器化技术的实战经验,有大规模生产系统软件的开发与运维经验。 熟悉异构计算编程,具备AI相关背景;有CUDA、分布式计算或高性能计算相关项目经验者优先。 具备GPU虚拟化、资源隔离、热迁移、集群资源调度管理、大规模监控、巡检及稳定性建设等相关经验者优先。 计算机相关专业,5年及以上相关领域经验,具备优秀的学习能力,有责任心,具备团队协作精神。