基于电商大模型的Mid-train及RL研究
Campus/Intern
Company Jd
Focus Tech · Algorithm
Location 北京
Published July 20, 2026
岗位职责
- 设计并实现电商场景下的大模型中期训练(Mid-train)算法,解决领域知识注入与能力对齐等核心难题;
- 负责电商场景下Agentic大模型的强化学习后训练,攻坚奖励模型(RM)、策略优化(如PPO、GRPO)及多轮交互决策优化等关键技术;
- 构建面向电商业务的高质量训练数据、奖励数据及评测基准(Benchmark),通过数据闭环迭代驱动模型性能优化;
- 推动大模型研究成果在智能推荐、智能导购及智能运营等真实业务场景中的端到端落地,解决实际业务痛点。
任职要求
- 计算机、人工智能或相关专业博士 / 硕士,有扎实的机器学习、强化学习理论基础。
- 熟悉大语言模型(LLM)训练与后训练流程,有 SFT/RLHF/RLOO/GRPO 等相关项目经验。
- 有 Agent 训练、Tool-use、多步推理等相关研究或工程落地经验者优先。
- 熟悉 PyTorch,有大规模分布式训练(如 DeepSpeed、Megatron-LM)经验者优先。
- 有顶会论文(ICML/NeurIPs/ICLR 等)或开源项目贡献者优先。
部门/板块
京东零售