飞猪-大模型算法专家-RL 环境合成

Company Fliggy

Focus Tech · Algorithm

Location 杭州

Published September 17, 2026

岗位职责

结合旅行、大消费领域域需求,研发面向大模型智能体强化学习(Agentic RL)的训练任务与环境合成方法,设计任务验证与奖励机制,提升模型在旅行大消费领域、工具使用和复杂任务中的执行能力。

岗位职责

  1. 训练任务与环境合成 根据模型能力目标和评测结果,确定训练任务的覆盖范围与难度分布。围绕行程规划、交通住宿选择、多约束决策等旅行场景,设计任务目标、初始状态、可用工具及环境反馈,研究任务与环境的自动合成方法,提升任务的可解性、多样性和训练价值。
  2. 验证算法与奖励设计 将任务完成条件和质量要求转化为可执行的验证器(Verifier)与评分标准(Rubric),覆盖信息准确性、时间与预算约束、方案完整性及可执行性等维度。结合程序测试、环境状态检查、模型评判及智能体主动核验,设计结果与过程奖励,分析验证误判、评分偏差和奖励漏洞。
  3. 交互数据生成与质量优化 研究 Agent 执行轨迹的生成、筛选与质量评估方法,建设任务生成、轨迹采样、自动验证和数据过滤流程;识别题目歧义、环境问题及错误反馈,从失败样本中挖掘新的训练任务。
  4. 训练实验与策略迭代 将任务、环境和奖励机制接入大模型后训练流程,开展对照实验,分析任务分布、环境难度和奖励设计对模型学习的影响;根据训练与独立评测结果调整合成和采样策略,提升模型在未见任务、需求变化和长流程任务中的成功率。

任职要求

  1. 具备大模型后训练或强化学习的研究、项目经验,了解监督微调及 PPO、GRPO 等强化学习方法,理解训练数据、采样策略和奖励信号对模型效果的影响。
  2. 熟悉 Agent 的任务规划、工具调用、多轮交互与状态管理,能够分析复杂执行轨迹,识别模型的行为模式和失败原因。
  3. 在任务或环境合成、Agent 数据构造、自动验证、奖励设计中至少一个方向有实践经验,能够为具体任务设计明确的完成条件和可执行的评价方法。
  4. 熟练使用 Python 和 PyTorch,熟悉 ROLL、verl 等大模型强化学习训练框架,具备环境接入、轨迹采样、奖励计算或训练调试经验。
  5. 能够独立提出研究假设、设计对照与消融实验,判断效果变化来自数据、环境、奖励还是训练方法,并形成可复现的实验结论。

加分项:

  • 有奖励模型(Reward Model)的数据构建、训练、评估或应用经验,包括过程奖励模型和结果奖励模型。
  • 有任务难度自动调节、课程学习、Agent 自我博弈或模型反馈驱动的数据合成经验。
  • 有旅行规划、交通住宿、目的地推荐等旅行领域的算法或数据经验,理解真实旅行任务中的约束、信息变化和用户偏好。
  • 在大模型训练、强化学习、智能体、环境合成或自动验证等方向发表过相关论文,或对相关开源项目有实质贡献

岗位标签

NEW