数据技术及产品部-RL Data工程师-Work(千问C端领域)

Company Alibaba

Focus Tech · Backend

Location 北京, 杭州

Published September 11, 2026

岗位职责

  1. 千问 C 端数据体系设计与 Bad Case 挖掘:针对千问 C 端多种真实使用场景(日常问答、对话/多轮、办公类任务、开放性问题、安全对齐等)做结构化拆解(意图分类、场景分级、任务原子化),设计可复用的任务模板与数据构造方式;从线上真实对话与模型 rollout 中系统性发现 bad case(回答错误、意图误判、答非所问、拒答过度、多轮体验断裂、安全对齐问题等),做根因分类并输出结构化改进清单,驱动数据补充与评测修正。
  2. 用户意图识别与问答/开放性问题分析:对 C 端多样化、口语化、含糊或多意图的真实 query 做意图拆解与分类,还原用户真实诉求,沉淀可复用的意图体系;覆盖高频日常问答(生活/办公/学习/常识/信息查询)分析回答的准确性、有用性与完整性;针对无标准答案的开放性问题(观点表达、创作、多轮探讨、复杂推理)设计可评价的质量维度,把主观判断拆成可校验、可自动化的子问题。
  3. 大模型行为轨迹生产与激励标注、Rubric 共建:驱动大模型在真实 C 端场景中产出推理与操作轨迹,设计多阶段过程激励(Process Reward)与结果激励(Outcome Reward)标注方案;与 Rubric 团队一起把主观体验类判断(回答质量、有用性、安全性、意图满足度)拆成可自动化验证的评分规则,识别本方向 rubric 的领先能力点,将数据转化为可用于 SFT / DPO / RLHF 的高质量训练样本。
  4. 外部专家与标注生态管理:负责外部专家 / BPO 众包的需求定义、标注规范撰写、任务分发、试标校准、答疑、抽检验收与分歧仲裁,通过流程、模板与工具优化持续提升人效与标注质量、降低单位成本,构建"内部研发 + 外部众包"的双轮驱动数据管线。
  5. 与模型团队协同推进:作为数据侧对接人,与产品、算法、评测团队深度协作,读得懂千问 C 相关 benchmark 与线上指标,参与能力评测集设计、数据配比与训练策略制定,定位模型能力短板并反推所需数据,推动"数据 → 模型 → 评测"闭环。

任职要求

  1. 对千问 C 端产品或类似 C 端 AI 助手场景有系统性理解,能对模型输出做准确的对错与体验裁定;日常能使用大模型辅助分析问题,把 LLM 稳定嵌入到意图识别、bad case 归因、问答质量评估等真实场景中,了解 Agent 开发与 Harness 工程者优先。
  2. 具备强 bad case sense 与用户意图识别能力:能从海量真实对话中识别模型易错点、意图误判与低质量回答并做准确归因,熟悉 C 端用户表达习惯,能对模糊 / 多意图 query 做结构化拆解与分类。
  3. 具备开放性问题评价与 Rubric / 标注设计能力:能对无标准答案的问题设计质量维度,把主观判断拆成可校验子问题;能独立完成从场景拆解 → 任务类型定义 → instance 模板设计的 Taxonomy 链路;有标注(含 BPO / 外包)流程设计、规范制定、质检校准与人效优化经验者优先。
  4. 具备扎实的工程与数据开发能力:熟练 Python,能独立完成数据抓取、清洗、批量调用 LLM、结果聚合等脚本化工作,读得懂 Agent 执行日志;能通过工程设计(数据链路、任务编排、Agent 工作流、反馈闭环)系统性放大领域专家的经验,有数据构造(instance 构造、数据合成 / 增广、标注体系搭建、种子样本设计)经验者优先。
  5. 具备团队管理与跨团队协作能力,能带 5~10 人规模的数据交付,把用户反馈、线上 bad case 与内部标注拧成一条产线;有模型训练(SFT/RFT/RL、reward 设计、训练效果反查)或 Agent 搭建经验、有安全对齐 / 多轮体验类数据设计经验者优先。

岗位标签

NEW