面向工业界Agent的强化学习后训练研究

Campus

Company Jd

Focus Tech · Algorithm

Location 北京

Published July 20, 2026

岗位职责

  1. 开展复杂Agent场景下的强化学习算法研究,攻坚多轮工具调用与长链路决策核心痛点,涵盖稀疏奖励建模、信用分配(Credit Assignment)及策略优化稳定性等;
  2. 探索并落地适用于Agentic场景的新型RL(强化学习)算法,推动前沿技术在工业界的真实业务中落地;
  3. 深度挖掘京东海量用户行为日志(涵盖购买、加购、点击等),设计面向转化目标的多粒度Reward信号体系,将真实用户反馈转化为模型优化信号;
  4. 构建与完善面向工业界Agent的系统性评测体系,以多维度的评测数据驱动底层算法能力的持续迭代与升级。

任职要求

  1. 获得本科及以上学历,计算机、人工智能等相关专业;
  2. 具备扎实的强化学习理论基础,熟练掌握PPO、GRPO、DPO等主流对齐与强化学习算法;
  3. 具备大语言模型(LLM)后训练实践经验,熟悉SFT、RLHF或RLAIF等核心技术流程;
  4. 具备Agent训练、工具调用(Tool-use)或多步推理相关的实战经验,或在相关AI顶级会议有高质量论文发表记录;
  5. 熟练使用PyTorch深度学习框架,具备大规模分布式训练的实际工程经验。

部门/板块

京东零售