晓天衡宇-大模型标注评测工程师-泛领域Company AlibabaFocus Tech · AlgorithmLocation 杭州Published August 11, 2026岗位职责 负责包括但不局限于人力资源、制造业、娱乐、游戏、行政管理、咨询、教育等白领办公方向 AI 训练数据(SFT / RL 阶段)的标注管理与质检工作;与算法及产品团队协作,理解 RM 训练和 rollout 打分的数据诉求,交付满足研发需求的高质量数据。 设计并落地覆盖办公生产力(文档、PPT、Excel)和电商运营场景的标注与质检流程,持续优化 rubric 与 verifier,推动双标一致率等核心指标达成。 统筹本方向的评测方案与数据生产方案,为 rubric 设计、verifier 校验、轨迹打分等环节制定可操作的标准;定期开展 pass 与非 pass 双向抽检,迭代标注规范。 构建并维护本方向的数据质量管理体系,对轨迹根因归因(模型能力 / 评测缺陷 / 任务定义)的闭环负责;警惕分数虚高等隐性风险,持续优化迭代。 管理标注专家团队,统筹日常任务分配与产能调度;与上下游(算法、产品、领域专家)充分协作,把个人判断力沉淀为团队方法论。 任职要求 本科及以上学历,在 AI 评测、RLHF / RL 轨迹标注、rubric 设计等领域有实际项目经验;具备人力资源、制造业、娱乐、游戏、行政管理、咨询、教育等白领办公领域 3 年以上从业或研究经历,能独立判断""轨迹哪里错、为什么错""。 对标注质量和 reward signal 分布敏感,能通过科学方法发现问题(如 verifier 漏洞、LLM Judge 偏好拟合等),推动业务指标达成。 熟悉数据标注工具与质检平台,掌握 Python,能进行抽检统计、一致性分析与自动化脚本编写;了解 reward modeling 基本概念,熟悉 agent / 工具调用领域常见的评测与训练范式。 具备目标管理和团队管理能力,能统筹 5 人以上标注专家团队;善于跨团队沟通协作,关注效果数据和目标达成。 积极主动,对 AI 有激情;思维严谨,拒绝""感觉上 / 差不多"",每个判断都能指向具体证据。