【蚂蚁星】大模型创新算法工程师-蚂蚁数科-27届
Company Antgroup
Focus Tech · Algorithm
Location 杭州
Published May 14, 2026
岗位职责
部门介绍: 数科致力于打造适合to B业务的大模型,围绕业务实际需求,通过Mid/post training提升模型的关键核心能力如数据分析、长文本推理、agentic coding、安全,将模型应用于数科众多商业化业务场景。
职位描述: 1.大规模预训练与中期训练:参与模型架构设计和优化,提升分布式训练稳定性与效率;负责中期连续训练(Mid-training)的数据配比与能力增强,提升模型基座能力; 2.有监督微调与多模态对齐:设计和优化高质量SFT数据流程,提升指令遵循能力; 3.强化学习与人类反馈:研发和优化大规模强化学习算法(PPO、DPO等),解决RL训练收敛难题;构建精细奖励模型(如PRM),提升复杂推理任务表现; 4.数据驱动与模型评测:建立数据与模型效果的反馈闭环,探索数据筛选与合成技术;设计精细评测体系,衡量模型在真实场景中的智能水平。
任职要求
- 学历背景: 计算机科学、人工智能、数学等相关专业硕士研究生及以上。
- 编程能力:熟练掌握Python,精通PyTorch深度学习框架。
加分项: 1.有分布式训练经验(Megatron-LM/DeepSpeed),熟悉CUDA编程等,能优化底层算子 。学术/竞赛产出(需至少满足一项): 2.论文: 在NeurIPS、ICML、ICLR、ACL、EMNLP、CVPR、ICCV等CCF-A类会议或期刊以第一作者发表过论文 ; 3.竞赛: 在Kaggle、KDD Cup、ACM-ICPC等国际顶尖赛事中取得突出成绩; 4.深度参与过千亿/万亿参数大模型的全流程训练(不仅仅是微调); 5.对强化学习(eg. RLHF/PPO/GRPO)有深入理解和实战经验; 6.熟悉多模态模型架构(eg. Diffusion Model)或有相关的项目落地经验 ; 7.重要的开源项目贡献者(如PyTorch、HuggingFace Transformers、vLLM等)。
特色标签
Python、RL、中期训练、人类反馈强化学习、偏好优化算法、偏好奖励模型、分布式深度学习训练、分布式训练、参加算法相关竞赛/获奖、发表算法相关优秀论文、基于人类反馈的强化学习、基座模型、多模态协同、多模态算法、大模型算法、大规模分布式训练、大语言模型、奖励建模、并行计算、强化学习、指令微调、有监督微调、机器学习、机器强化学习、模型中期增强、模型加速/性能优化、模态融合、深度学习、生成式人工智能、监督微调、直接偏好优化、策略优化算法、算法工程化经验、自然语言处理算法、跨模态对齐、近端策略优化、连续训练