购物智能体强化学习后训练算法探索
Campus/Intern
Company Jd
Focus Tech · Algorithm
Location 北京
Published July 20, 2026
岗位职责
- 面向复杂电商购物智能体场景,研究多轮工具调用与长链路决策下的强化学习核心问题。
- 攻坚稀疏奖励建模、信用分配及策略优化稳定性等技术瓶颈,探索新型Agentic RL算法落地。
- 深度挖掘海量用户行为日志,设计面向转化目标的多粒度Reward信号体系。
- 建立并完善面向购物Agent的系统性评测体系,以评测驱动模型能力持续演进。
任职要求
- 计算机科学、人工智能或机器学习等相关领域的本硕博在校生。
- 具备扎实的强化学习理论基础,熟悉PPO、GRPO、DPO等主流前沿优化算法。
- 具备优秀的工程代码能力,熟悉PyTorch及大规模分布式计算,拥有大厂相关实习经验者优先。
- 在Agent训练、工具调用(Tool-use)或多步推理相关方向有扎实的实战工作经验。
- 拥有大模型后训练实操经验,或在相关领域顶级会议有论文发表经历者优先。
部门/板块
京东零售