数据技术及产品部-RL Data Rubric 算法设计专家-Work
Company 阿里巴巴
Focus 技术 · 算法
北京, 杭州
July 29, 2026
岗位职责
- Rubric 与 Reward 设计:和领域专家一起,把领域的专业判断(漏洞是否成立、时序是否收敛、回答是否可用等)拆成可自动化验证的评分规则;覆盖硬验证(工具退出码/规则)+ 数值指标 + milestone + LLM judge 的多层组合。
- Reward Hacking 规避:识别评分规则里可能被模型钻空子的路径,设计验证规则闭环;对已上线的 rubric 做持续的 hacking 检测与规则加固。
- 训练验证与反查:用设计出的 rubric 与数据真实训练模型(SFT/RFT/RL),从训练曲线与 benchmark 结果反查 rubric 与数据的问题,形成"设计→训练→反查"迭代闭环。
- RL 数据筛选:对海量候选数据做面向 RL 的精筛,识别"表面合理但实际错误"、难度合适、覆盖度合理的样本;设计筛选阈值与采样策略,平衡数据规模与质量。
- 领域标注 → RL 数据的转化:把领域标注的标准与规范转成可用于 RL 训练的评分模板、reward 计算逻辑与训练样本;与领域专家共同定义黄金集与奖励信号。
- 效果验收:持续跟踪 rubric 上线后对训练效果的实际提升,输出 rubric 版本管理与效果对比报告,给出下一版迭代方向。
任职要求
- 有实际 RL/RFT 训练经验,理解 reward 设计、rubric 与训练效果的关系,能独立跑通训练闭环。
- 熟悉主流 rubric 设计范式,能大批量生成高质量 rubric,并把主观评价拆成可校验的子问题。
- 具备 reward hacking 识别与规避能力,理解常见 hacking 模式与验证机制。
- 熟悉 SFT/RFT/RL 各阶段数据需求差异,能筛选与构建高质量训练数据。
- 工程能力:熟练 Python,能独立完成数据处理、批量调用 LLM、结果聚合等工作,读得懂训练框架与训练日志。
- 与领域专家的协作能力,能把领域专业判断转成可执行评分规则。
- 数据质量意识,对分布、异常、偏见风险有敏锐直觉。
岗位标签
NEW