蚂蚁数字科技-Agent后训练算法工程师

Campus

Company Antgroup

Focus Tech · Algorithm

Location 杭州

Published October 23, 2025

岗位职责

项目简介: 如何让大模型在多轮交互中"边决策、边使用工具、边进化",是 Agent 后训练的核心命题。当前大模型已具备基础工具调用能力,但在多轮交互中仍面临奖励信号稀疏、长轨迹信用分配困难、工具环境不可复现、安全边界难以编码化等挑战。单纯的 Prompt 约束无法改写模型的固有行为模式,必须通过 Agentic RL 让模型在真实工具环境中自主探索并持续改进。 本项目围绕 Agentic RL 全栈建设展开,从四个互补维度推进研究:构建面向多轮 Agent 交互的 RL 训练管线(rollout→reward→replay→update),设计融合硬约束规则、过程奖励(PRM)、结果奖励(ORM)与 Pairwise 比较的多维奖励体系,研究在策略蒸馏(On-Policy Distillation, OPD)与 RL 联合优化中的置信门控与退火调度机制,以及建设可复现、可审计的工具沙箱与结构化 trace 数据闭环。核心目标是让模型在真实工具环境中学会识别用户真实目标、何时追问、选择什么工具、如何组织调用顺序,并在安全边界内给出严谨结论。项目涉及 GRPO/PPO 等策略优化算法、多轮工具调用 RL、On-Policy 蒸馏、用户仿真与对抗训练、沙箱环境工程等后训练核心技术,具有明确的学术前沿性和发表潜力。

任职要求

  1. 在读硕士或博士研究生,计算机科学、人工智能、机器学习等相关专业;

  2. 熟悉大语言模型(LLM)的基本原理,了解 Transformer 架构与主流开源模型(如 Qwen、LLaMA 等);

  3. 具备扎实的 Python 编程能力和 PyTorch 深度学习框架使用经验;

  4. 对强化学习(尤其是 RLHF/RLVR/GRPO/PPO)、大模型后训练方向有了解或研究兴趣;

  5. 了解或使用过主流 Agentic RL 训练框架(如 veRL、OpenRLHF、TRL、OpenPipe ART 等)者优先;

  6. 对 Agent 工具调用、多轮交互、知识蒸馏或 LLM 推理能力提升方向有了解或研究兴趣;

  7. 具有良好的文献阅读能力和数学基础,能理解优化目标推导与理论分析;

  8. 逻辑思维清晰,具备独立设计和执行实验的能力,能从实验结果中提炼规律并迭代方案。 加分项:

  9. 有 RLHF/RLVR/GRPO/DPO 等大模型后训练方法的实践经验,能独立跑通 SFT→RL 全流程;

  10. 有使用分布式训练框架(如 veRL、DeepSpeed、FSDP、Megatron-LM 等)的经验;

  11. 有多轮 Agent RL、工具调用 RL、或 On-Policy Distillation 方向的论文发表;

  12. 熟悉 GRPO、PPO 等策略优化算法的原理与实现,理解 advantage 估计、KL 约束、clip 机制等细节;

  13. 有奖励设计经验,包括规则奖励、过程奖励模型(PRM)、结果奖励模型(ORM)或 LLM-as-Judge;

  14. 有沙箱环境、工具仿真或 Agent 评测体系建设经验(如 τ-bench、SWE-bench、OSWorld 等);

  15. 了解知识蒸馏、自蒸馏或在线蒸馏的相关方法。

特色标签

Advantage估计、Agent 工具调用、Agentic RL、API 调用、clip机制、DeepSpeed、FSDP、GRPO、KL约束、LLM、Megatron-LM、On-Policy Distillation、OPD、ORM、Pairwise 比较、Post-Training、PPO、PRM、Python、RL、RLHF、RLHF/RLVR 训练、RLVR、self-distillation、SFT→RL 流程、Shell、veRL、云计算、分布式训练、区块链、发表算法相关优秀论文、可复现环境、在线蒸馏、增强学习、多轮 Agent 交互、多轮决策、多轮对话、多轮推理、大型语言模型、大模型算法、大模型调优、大规模并行训练、大语言模型、奖励建模、安全、审计环境、工具 API 接入、工具仿真、工具沙箱、强化学习、智能体、智能体工具调用、模型加速/性能优化、知识蒸馏、策略更新、策略梯度、结果奖励、自然语言处理算法、规则奖励、过程奖励、金融