阿里云智能-机器学习平台研发专家-AI平台管控与资源调度
Company Aliyun
Focus Tech · Algorithm
Location 北京, 杭州
Published July 9, 2026
岗位职责
-
参与模型服务平台云原生管控系统的开发,包括服务生命周期管理、弹性伸缩、灰度发布等核心能力建设
-
负责大规模GPU集群的资源管理与调度系统开发,包括资源分配、超卖策略、异构资源调度等
-
参与基于Kubernetes的调度器与Operator开发,实现GPU资源的精细化调度与利用率优化
-
负责大规模GPU集群的稳定性建设,包括故障检测与自愈、可观测体系、安全管控等
-
参与平台产品化与计量计费系统的开发,支撑商业化运营
-
根据用户反馈快速定位线上问题,将运维经验沉淀为平台能力,持续提升系统可靠性
任职要求
-
计算机相关专业,具备golang开发经验,三年以上分布式系统相关工作经历,具备复杂系统软件的设计能力和调试能力
-
精通Kubernetes架构与调度机制,有Scheduler/Controller开发经验,深入理解K8s资源模型与调度扩展
-
熟悉GPU资源管理,了解GPU共享、MIG、拓扑感知调度等技术在K8s中的实现
-
掌握微服务架构、容器技术、Prometheus监控体系等相关技能,有大规模集群运维经验者优先
-
丰富的软件工程开发经验,对软件开发流程、质量保障、风险控制、部署交付、维护诊断等流程有清晰的认识和实践
-
良好的学习和自我驱动能力,具备良好的跨团队沟通协作能力
-
积极拥抱AI辅助编程工具,善于利用AI提升开发效率与代码质量