蚂蚁集团-大模型算法工程师/专家-LLM后训练
Company Antgroup
Focus Tech · Algorithm
Location 北京, 杭州
Published June 15, 2026
岗位职责
- 参与大语言模型(LLM)后训练全流程优化,包括但不限于通用能力提升、安全对齐等方向。
- 实现并应用SFT/RLHF/DPO/PPO/GRPO等算法,探索多目标奖励模型、过程监督等前沿技术,提升模型在指令遵循、逻辑推理、多任务泛化等方面的性能。
- 构建模型效果评估体系,设计自动化评估方案,持续跟踪模型优化效果。
- 参与技术开源与学术研究,发表顶会论文或贡献核心开源项目。
任职要求
- 计算机科学、人工智能、数学等相关专业硕士及以上学历(优秀本科生可放宽)。
- 熟练掌握 Python 和 PyTorch,具备分布式训练(如多机多卡调优)经验。
- 深入理解 Transformer 架构及SFT/RLHF/DPO/PPO/GRPO等算法。
- 在NeurIPS、ICML、ICLR、 ACL等顶会发表论文,或 Kaggle、ACM 竞赛获奖者优先。
加分项
- 具备大规模(千卡级)训练调优经验。
- 大规模MoE架构训练/调优经验。
- 长思维链/复杂任务推理经验。
- 在开源社区(如 HuggingFace、GitHub)有突出贡献。
特色标签
ChatGLM、CNN/RNN/LSTM、GPT、ICLR、KDD、Llama、NeurIPS、NLP、Python、PyTorch、TensorFlow、TensorFlow/PyTorch、人工智能生成、内容生成、分布式训练、创意智能、参数优化、图像处理、多模态大模型、多模态算法、大模型算法、广告、性能评估、推荐、搜索、搜索/推荐、数据图谱、数据测试、文本处理、智能营销/广告、机器学习、框架开发、模型加速/性能优化、模型压缩、模型调优、深度学习、深度学习模型、知识推理、知识表示、自然语言处理算法、视觉算法、视觉识别、语义理解、语言大模型、语音/图像识别、质量检测、金融、风控、风控/反欺诈、风控算法