蚂蚁集团-大语言模型后训练算法专家-杭州/上海/北京
Company Antgroup
Focus Tech · Algorithm
Location 北京, 上海, 杭州
Published June 29, 2026
岗位职责
- 负责包括 SFT(监督微调)、Model Merge(模型合并)、OPD(在线/离线知识蒸馏)以及 RL(强化学习)在内的后训练算法研发与优化,探索更高效、更稳定的新型训练范式。
- 提升大模型在Reasoning、General Agent 以及Coding Agent等专项任务上的上限,构建具备深度思考和自主行动能力的基座模型。
- 模型架构探索与优化,探索更高效更有效的模型架构。
- 训练与推理效率的优化,如算子优化、显存优化等,实现高吞吐、低延迟的模型研发和落地。
任职要求
- 硕士及以上学历,计算机科学或相关专业背景。
- 具备大模型研发经验,在 Post-Training(如SFT、RL、OPD等)某一方向上有实操积累。
- 算法与工程兼备。熟悉数据与训练策略,也了解主流训练和推理框架(如 Megatron、SGLang、vLLM等)。
- 具备极强的“发现问题-分析问题-解决问题”的闭环能力。
- 拥有良好的团队协作精神与跨团队沟通能力。
加分项:
- 相关领域的研究和实践经验,顶级会议发表过大模型相关论文,或作为核心贡献者参与过社区高 Star 开源项目。
- 具备大规模模型训练、调优及稳定性保障的实际研发和工程经验。
- 优秀的研究品味,卓越的动手能力,强大的自我驱动力等。
特色标签
Python、代码代理、代码智能体、分布式训练、发表算法相关优秀论文、在线知识蒸馏、基础模型、大模型后训练、大模型算法、并行计算、强化学习、思维链推理、推理效率、推理能力、智能体、有监督微调、机器学习、模型加速、模型加速/性能优化、模型合并、模型后训练、模型融合、深度学习、监督微调、知识蒸馏、离线知识蒸馏、算法工程化经验、编程智能体、自然语言处理算法、训练效率、通用代理、通用智能体、逻辑推理、预训练大模型