晓天衡宇-大模型评测专家-work方向(杭州)Company AlibabaFocus Tech · AlgorithmLocation 杭州Published August 14, 2026岗位职责 设计通用办公场景(文档撰写、表格处理、邮件沟通、会议纪要、日程规划、多步骤 Agent 工作流等)以及各垂类领域(如法律、金融、医疗、数据分析等)评测体系的设计。 将算法团队的能力改进诉求转化为可执行的评测方案(场景选型、题目难度配比、领域覆盖配额)。 主导通用办公场景(文档撰写、表格处理、邮件沟通、会议纪要、日程规划、多步骤 Agent 工作流等)以及各垂类领域(如法律、金融、医疗、数据分析等)评测 rubric 的设计与终审,确保判据原子化、可举证、可复现。 提炼跨任务类型的通用 rubric 范式(如否决项设计、分级量表、过程性与结果性判据拆分),沉淀为可复用的模板与判例库。 主动识别 rubric 生产中的效率瓶颈与质量风险(判据歧义、一致性偏低、伪需求条目等),推动标准化与""合成初稿 + 人工校验""等自动化改进。 深入分析模型在真实办公任务中的 bad case,精准归因问题来源,输出模型能力弱点分布图谱,为算法与训练团队提供可操作的优化方向与针对性数据反馈。 持续跟踪办公 Agent / 长文档 / 表格 / 多模态办公等评测领域前沿方法,对业界主流评测基准进行充分调研与优缺点分析。 任职要求 本科及以上学历,金融、法律、医疗、财务、会计、经济学、数据分析、商业分析等相关专业;硕士优先。 有大模型评测、数据标注生产或质量管理相关经验,熟悉 rubric 式评测方法论优先。 熟悉标注信度指标(κ / 一致率 / unsure 率)及质量管控手段者优先。 有办公协同产品(文档、表格、邮件、项目管理等)领域知识或真实业务经验者优先。 具备较强的项目管理与跨团队沟通能力,能在多任务并行下保障交付质量与节奏。