智能引擎-大模型训练平台研发工程师-AI InfraCompany AlibabaFocus Tech · AlgorithmLocation 北京, 杭州Published August 27, 2026岗位职责 我们关注模型训练系统,为深度学习模型训练和超大规模训练提供算力基座,包括但不限于以下职责: 基于阿里云原生底座,设计实现数万卡规模的多租户、多种异构硬件、高性能计算集群的调度系统; 研发轻量级的训练重启、故障备份迁移、代码-依赖分发系统,面向有效训练时间极致优化; 针对基座模型训练,打造全面的可观测、可视化系统,洞察全生命周期软硬件故障动态; 结合大规模分布式训练框架、前沿的异构硬件,分析并解决预训练、后训练过程中软硬件缺陷; 构建大模型的模型训练、模型评测、模型管理、模型交付在内的MLOps平台; 平台化的支撑多模态生成模型的训练、迭代,以及在AIGC场景的生产化落地应用。 任职要求 有扎实的工程算法基础,精通数据结构和常用算法,熟练掌握各种编译、调试、性能分析工具; 有极佳的工程实现能力,精通Java、Go、Python之一; 有调度系统开发经验者优先,有MLOps系统开发经验者优先; 有AI服务器架构、异构计算系统、网络系统优化经验者优先; 有TensorFlow/PyTorch全链路算法开发、交付经验者优先; 勤于动手,善于动脑,乐于挑战的同学优先。 岗位标签 NEW