蚂蚁集团-AI infra工程师-杭州
Company Antgroup
Focus Tech · Algorithm
Location 杭州
Published August 4, 2026
岗位职责
- 负责大模型分布式训练与推理框架的研发和性能优化,持续提升训练效率、推理吞吐、资源利用率及系统稳定性。
- 深度参与蚂蚁自研RL框架的研发,推进基于 MoE 的模型架构与训推框架协同设计(co-design),实现千亿级模型的高效训练与推理。
- 熟悉分布式训练任务调度与资源编排,通过AI Infra全栈优化充分挖掘和利用空闲 GPU 资源,提升集群 GPU 利用率和整体训练产能。
任职要求
- 具备 2 年及以上 AI 系统、任务调度或高性能并行计算相关领域的研发经验,拥有良好的工程实践能力。
- 熟悉 Transformer、MoE 等大模型架构,以及分布式训推与调度、大模型 Agent 系统或高性能软硬件架构中的至少一个方向。
- 熟悉 SGLang、vLLM、Megatron-LM 等训推框架,或具备大规模模型训练、推理性能优化及 GPU 集群调度经验者优先。
- 熟悉 GRPO、PPO、DPO 等强化学习或偏好对齐算法,或了解 AReaL、veRL、Slime、OpenRLHF 等 RL 框架者优先。
- 对大模型及 AI 系统新技术保持热情,具备良好的逻辑思维、问题分析、沟通表达和团队协作能力。
岗位标签
NEW
特色标签
AI基础设施、AI系统架构、C/C++、Docker、GPU算力利用率、HPC、Kubernetes、Linux开发/部署经验、Python、PyTorch、Reinforcement Learning、RL、Sparse MoE、专家并行、云原生、云服务、云计算、云计算经验、人工智能基础平台、作业调度、偏好对齐、分布式并行训练、分布式经验、分布式计算、分布式训练、千亿参数模型、图计算、基础设施、多机多卡训练、大模型算法、大语言模型、巨型模型、并行计算、并行计算优化、强化学习、微服务经验、推理加速框架、推理引擎、推理系统、支付、数据库、显卡利用率、智能体、智能研发、有前端经验/技能、服务端开发经验、机器学习经验、模型加速/性能优化、混合专家模型、研发效能、算法工程化经验、系统架构设计经验、计算资源利用率、训推一体化框架、训练任务编排、训练推理引擎、训练推理框架、调度、资源调度、金融、集群训练、高性能计算