数据基础及产品部-RL Data 工程师-work(数据构造)Company AlibabaFocus Tech · BackendLocation 杭州Published August 10, 2026岗位职责 职位描述 从 0 到 1 生产合成 RL Instance:围绕种子任务构建完整 Instance(任务描述、运行环境、输入资产、评测钩子),通过参数化模板实现批量合成与自动校验,保证 Instance 的正确性、完整性与可复现性,作为 rollout 数据生产的起点。 搭建 Agent 与 rollout 产线:基于主流 harness/agent 框架搭建 Agent 运行环境,端到端跑通轨迹采样、自动校验、质量过滤的生产 Pipeline,对 rollout 结果做预校验与失败模式分析,保障进入训练的数据可信、可追溯。 建设 Verifier 与 Rubric:将模糊的质量目标拆解为可量化的 Verifier 和多维度打分 Rubric,与领域专家、标注团队以人机协作方式完成标注与校准,持续迭代以应对 Reward Hacking,确保评估信号与训练目标对齐。 对接算法侧形成闭环:与算法/训练团队紧密配合,将模型效果反馈转化为数据策略调整(任务难度、Reward 信号、标注规范等),驱动“数据 → 训练 → 评测”持续迭代。 任职要求 岗位要求 了解 RL 基本原理:理解 Reward Modeling 的基本原理及 Reward 信号设计对 RL 训练(PPO/GRPO 等)的影响,能从训练视角判断什么样的 Instance 是有效数据,并据此设计能力覆盖与难度分布。 具备从 0 到 1 的合成生产能力:熟练使用 Python,能独立完成任务定义、容器化环境构建与参数化批量合成,有搭建端到端数据产线的工程经验,保障数据生产的规模化与可复现。 动手能力强:熟悉主流 harness/agent 框架,能独立搭建 Agent 并批量采集 rollout 轨迹,能对多轮工具调用、代码执行等复杂轨迹识别行为模式与失败模式。 具备 Verifier/Rubric 设计能力:能将模糊的质量目标拆解为可量化的 Verifier 与多维度打分 Rubric,具备识别和应对 Reward Hacking 的判断力。 加分项:有办公、数据分析、金融、法律、医疗等 Cowork 场景任务的深度经验者优先;对 LLM、AGI 感兴趣,践行 AI Native 工作范式者优先。