数据技术及产品部-大模型RL Data工程师-长程 Agent 环境(RL 数据)
Company Alibaba
Focus Tech · Algorithm
Location 杭州
Published September 22, 2026
岗位职责
主导大模型「长程 Agent 环境」方向的数据体系建设,覆盖数据生产、模型评测与质量管控全链路,定义模型在多步、有状态、需工具调用与长程规划的复杂 agentic 任务上的能力边界,构建高质量、可复现、可自动判分的任务环境与评测数据集。本岗位为横向底座,不绑定单一行业,所搭建的长程任务环境统一服务编程、数据分析、办公、科研、金融等各垂直方向;其核心不是判定单点答案正误,而是把真实任务转化为可复现、难度分级、抗奖励作弊的环境,并按执行过程对整条轨迹打分。具体包括:
- 能力体系与标准制定:定义长程 agentic 任务的能力维度(任务分解与规划、跨步状态跟踪、长上下文保持、模糊性与中断处理、错误恢复与反思、长程一致性与终止判断),建立以步数、分支、不可逆性、信息完整度刻画难度的分级与可解性标定方法,制定过程级评分标准(里程碑 checkpoint + 子目标 + 最终态 + rubric 软标准)与金标准轨迹规范,沉淀为各垂直方向复用的统一方法论。
- 数据生产与标注:把真实任务构建为可复现的有状态环境(固定初始状态、可重置 / 回放 / 分支的中间态、以录制或 mock 替代真实工具与 API、结果自动校验钩子)并容器化交付;将领域专家提供的任务抽象为可参数化的环境模板族,批量生成难度递增的变体;产出多步专家示范轨迹——尤其是「中途出错并恢复」「应对中断与模糊指令」等高价值样本,供 SFT、偏好学习与可验证奖励强化学习(RLVR)使用。
- 模型评测建设:为每个环境配套自动判分机制,兼顾最终结果与过程关键节点、支持按步骤部分给分(credit assignment);用前沿模型跑 pass@k 标定长程难度与可解性;通过大规模 rollout 定位长程特有失败模式(规划漂移、误差累积、状态漂移、上下文丢失、工具误用、过早终止 / 死循环、中断后无法恢复),沉淀轨迹级失败案例库并反哺各垂直方向。
- 质量管控与质检:逐条审阅数十步执行轨迹、判断每一步动作与环境状态是否合理;建立环境分层校验(静态检查 → 冒烟 → 可达性 → 领域合理性)、双标注一致性校验、资深专家抽检、难度标定校准与查重去污;重点排查奖励作弊(reward hacking、绕过 checkpoint、伪造完成)与判分器可靠性、结果可复现性;对 bad case 做根因分析(数据 / rubric / verifier / 环境实例 / 具体轨迹步)并回流到模板与标准。
- 数据基础设施共建:与工程团队共建长程任务沙箱、状态快照与重置 / 回放 / 分支机制、mock API 与工具 / MCP 编排、rollout 与过程打分管线、环境模板库与数据血缘,把「一次设计、批量生成变体」的能力工程化,供所有垂直方向复用。
- 行业跟踪与跨团队协同:持续关注长程 agent、过程监督(process supervision)、可验证奖励与 agent 环境评测方向动态;与各垂直领域岗协作——领域岗负责任务真实性与答案正确性,本岗负责长程环境、过程奖励与轨迹质检——与研究、算法、工程团队形成「数据生产 → 训练 → 评测 → 回流」闭环。
任职要求
- 对长程多步 agentic 任务及其失败模式有深入判断,能将真实复杂任务转化为可复现、可自动判分、难度可控且抗作弊的训练与评测环境;有 Agent 产品实测、长程任务或轨迹设计、过程级评测、RL 环境或数据经验者优先。
- 具备很强的抽象与系统化能力,能将长任务拆解为子目标与里程碑 checkpoint,设计难度分级与变体生成策略,并把模糊的「做得好不好」落成可自动验证的过程评分,沉淀为可跨垂直复用的方法论。
- 工程能力扎实,熟练掌握 Python(能独立编写判分器 verifier、解析长轨迹、处理大规模 rollout 数据),熟悉至少一类 agent 执行环境(终端 / shell、浏览器自动化、桌面自动化、代码沙箱或 MCP 工具编排),掌握以 mock / 录制替代真实依赖、容器化(Docker)与环境状态的重置 / 回放 / 分支。
- 了解 Agent 核心机制(ReAct、Tool Use、Planning、多步推理与反思)与后训练范式(SFT / RLHF / 可验证奖励 RL、RLVR),理解过程监督(step-level reward)、跨步 credit assignment、reward hacking 与长上下文下的误差累积,对长程 agentic 任务的能力边界有认知或实践。
- 领域呈 T 型即可,熟悉任一垂直(编程、数据分析、办公、科研、金融等)到能判断长任务是否贴近真实,但核心能力在长程环境与过程奖励工程、服务所有方向;有以下经验者优先:agent 评测框架 / RL 环境搭建、benchmark / 任务集构建、过程级 verifier 与自动评分器开发、大规模 rollout 与数据管线、仿真 / 沙箱环境工程、agent 安全(提示注入 / 越狱)评测。
- 严谨细致、结果导向、强可复现意识;优秀的技术写作与沟通能力,能向研究、算法、工程与领域专家清晰传达环境与奖励设计,产出高质量的规范、评分标准与分析报告。
岗位标签
NEW