【蚂蚁星】大模型创新算法工程师-蚂蚁数科(实习)
Company Antgroup
Focus Tech · Algorithm
Location 杭州
Published April 17, 2026
岗位职责
部门介绍: 数科致力于打造适合to B业务的大模型,围绕业务实际需求,通过Mid/post training提升模型的关键核心能力如数据分析、长文本推理、agentic coding、安全,将模型应用于数科众多商业化业务场景。
职位描述: 1.大规模预训练与中期训练:参与模型架构设计和优化,提升分布式训练稳定性与效率;负责中期连续训练(Mid-training)的数据配比与能力增强,提升模型基座能力; 2.有监督微调与多模态对齐:设计和优化高质量SFT数据流程,提升指令遵循能力; 3.强化学习与人类反馈:研发和优化大规模强化学习算法(PPO、DPO等),解决RL训练收敛难题;构建精细奖励模型(如PRM),提升复杂推理任务表现; 4.数据驱动与模型评测:建立数据与模型效果的反馈闭环,探索数据筛选与合成技术;设计精细评测体系,衡量模型在真实场景中的智能水平。
任职要求
1.学历背景: 计算机科学、人工智能、数学等相关专业博士(或优秀硕士),26/27届毕业生 。编程能力: 2.熟练掌握Python,精通PyTorch深度学习框架。
加分项: 1.有分布式训练经验(Megatron-LM/DeepSpeed),熟悉CUDA编程等,能优化底层算子 。学术/竞赛产出(需至少满足一项): 2.论文: 在NeurIPS、ICML、ICLR、ACL、EMNLP、CVPR、ICCV等CCF-A类会议或期刊以第一作者发表过论文 ; 3.竞赛: 在Kaggle、KDD Cup、ACM-ICPC等国际顶尖赛事中取得突出成绩; 4.深度参与过千亿/万亿参数大模型的全流程训练(不仅仅是微调); 5.对强化学习(eg. RLHF/PPO/GRPO)有深入理解和实战经验; 6.熟悉多模态模型架构(eg. Diffusion Model)或有相关的项目落地经验 ; 7.重要的开源项目贡献者(如PyTorch、HuggingFace Transformers、vLLM等)。
特色标签
DeepSpeed、Diffusion Model、DPO、Megatron-LM、PPO、Python、RLHF、SFT、Shell、云原生、云服务、云计算、人类反馈强化学习、代码智能体、保险、信贷、分布式系统训练、分布式计算、分布式训练、区块链、参加算法相关竞赛/获奖、反洗钱、发表算法相关优秀论文、合规、商业化、图计算、基础模型、多模态对齐、多模态模型、多模态算法、大数据、大数据处理工具(Spark/Hadoop/Hive)、大模型算法、大规模预训练模型、安全、客服、巨量参数模型、并行计算、并行训练、广告、强化学习、指令微调、推荐、支付、效果评测、数据合成、数据安全、数据库、数据筛选、数据配比、智能代码生成、智能体、智能水平衡量、智能研发、有留学背景、有监督微调、机器学习、模型加速/性能优化、模型评估体系、测试工具、深度学习、特征计算、知识图谱、研发效能、聊天机器人、自主编程、自然语言处理算法、英美留学生、营销、金融、银行、长上下文建模、长文本理解、长文本生成、隐私计算、预训练流程、预训练策略、预训练阶段、风控