jdwatch
  • Home
  • CLI
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

数据技术及产品部 AI Data-RL Data算法工程师-RL Instance构建方向

Company 阿里巴巴

Focus 技术 · 算法

北京, 杭州

July 29, 2026

岗位职责

  1. 通过分析主流Benchmark及模型评测结果等方式,结合训练需求确定 RL 数据的能力覆盖范围与优先级;从多种渠道的海量数据里筛选挖掘样本并构建出清晰、可执行的问题描述,作为后续rollout数据生产的起点。
  2. 针对 Coding 及 Work 等场景,以人机协作的方式设计并构建Agent的运行环境,以及可量化的 Verifier 或多维度打分 Rubric。需要保证环境和Judge的正确性、完整性、鲁棒性,且持续迭代以应对 Reward Hacking等各类挑战,确保评估信号与训练目标对齐。
  3. 端到端搭建批量化的数据生产与验证 Pipeline,涵盖任务生成、轨迹采样、自动校验和质量过滤;构建 QA 框架,对rollout结果进行预校验与失败模式分析,保障进入训练的数据可信、可追溯。
  4. 与领域专家和算法/训练等团队紧密配合,将模型效果反馈转化为数据策略调整(任务难度、Reward 信号、标注规范等);与标注、工程等团队协作,推动产线持续优化,形成"评测 → 数据 → 训练 → 评测"的闭环飞轮。

任职要求

  1. 具备 RL/Post-Training 研究或机器学习Applied Scientist 相关经历,理解 Reward Modeling 基本原理及 Reward 信号设计对 RL 训练(PPO/GRPO/DAPO 等)的影响;有 Agentic 场景的轨迹评估分析经验,可以对多轮工具调用、代码执行等复杂轨迹识别行为模式与失败模式。
  2. 能将模糊的质量目标拆解为可执行、可量化、可扩展的评估标准(Verifier / Rubric),并具备持续迭代以应对 Reward Hacking 的判断力。能与领域专家和标注团队协同,以人机协作的方式完成各类任务。
  3. 熟练使用 Python,熟悉主流的harness/agent框架,能独立完成数据处理脚本、自动化 Pipeline 和 QA 校验工具的开发;具备搭建端到端数据产线,构建容器环境的工程经验,保障数据生产的规模化与可追溯性。
  4. 沟通与文档能力:优秀的书面表达能力,能产出清晰的 Rubric 规范、技术方案和问题定义文档;善于跨团队协作,能将算法侧的模型反馈准确翻译为数据策略调整。
  5. 有大规模机器学习任务调优经验者优先,有某个领域任务深度经验者优先(数学物理,ACM,kernel研发,高并发/HFT,软件工程,research,science等)
  6. 对LLM,AGI/ASI感兴趣,践行AI Native工作范式者优先

岗位标签

NEW

Apply now

You'll be redirected to the official careers page. You can also sign in to save jobs and search more roles.