阿里云智能-机器学习平台研发专家-AI平台管控与资源调度

Company Aliyun

Focus Tech · Algorithm

Location 北京, 杭州

Published July 9, 2026

岗位职责

  1. 参与模型服务平台云原生管控系统的开发,包括服务生命周期管理、弹性伸缩、灰度发布等核心能力建设

  2. 负责大规模GPU集群的资源管理与调度系统开发,包括资源分配、超卖策略、异构资源调度等

  3. 参与基于Kubernetes的调度器与Operator开发,实现GPU资源的精细化调度与利用率优化

  4. 负责大规模GPU集群的稳定性建设,包括故障检测与自愈、可观测体系、安全管控等

  5. 参与平台产品化与计量计费系统的开发,支撑商业化运营

  6. 根据用户反馈快速定位线上问题,将运维经验沉淀为平台能力,持续提升系统可靠性

任职要求

  1. 计算机相关专业,具备golang开发经验,三年以上分布式系统相关工作经历,具备复杂系统软件的设计能力和调试能力

  2. 精通Kubernetes架构与调度机制,有Scheduler/Controller开发经验,深入理解K8s资源模型与调度扩展

  3. 熟悉GPU资源管理,了解GPU共享、MIG、拓扑感知调度等技术在K8s中的实现

  4. 掌握微服务架构、容器技术、Prometheus监控体系等相关技能,有大规模集群运维经验者优先

  5. 丰富的软件工程开发经验,对软件开发流程、质量保障、风险控制、部署交付、维护诊断等流程有清晰的认识和实践

  6. 良好的学习和自我驱动能力,具备良好的跨团队沟通协作能力

  7. 积极拥抱AI辅助编程工具,善于利用AI提升开发效率与代码质量