蚂蚁集团-大模型后训练算法工程师(Agent / 语言方向)-健康事业群
Company Antgroup
Focus Tech · Algorithm
Location 上海, 杭州
Published September 15, 2026
岗位职责
负责大模型 SFT、偏好优化、RLHF/RLVR 等后训练算法研发与效果优化; 负责 Agent 能力建设,包括 Tool Use、多轮交互、任务执行与复杂指令遵循; 提升模型语言理解、生成质量、多轮对话和风格控制能力; 负责训练数据构建、评测分析和问题定位,推动模型能力持续迭代; 跟进后训练、Agent 等方向前沿技术,并完成实验验证和业务落地。
任职要求
熟悉各类后训练方法,包括 PPO/GRPO、OPD 等等; 有 Agent、Tool Calling、Harness 优化等相关项目经验; 熟练使用 AI Coding,同时具备较强的工程能力和个人品味; 能够独立负责一个模型能力方向,从问题分析、方案设计到实验落地。
加分项 有大模型后训练、Agent 相关实际落地经验; 有高质量论文、开源项目或大规模模型训练经验。
岗位标签
NEW
特色标签
Llama训练框架、Python、人工智能顶级会议、分布式训练、医疗、医疗推理、发表算法相关优秀论文、可扩展强化学习框架、增强学习、大模型、大模型算法、大规模语言模型、大语言模型、并行计算、强化学习、微软大模型训练框架、机器学习、深度学习、深度学习框架