晓天衡宇-大模型评测专家-tocCompany AlibabaFocus Tech · AlgorithmLocation 杭州Published August 14, 2026岗位职责 评测体系建设与项目管理 统筹评测任务的排期、分工与交付管理,确保多条线并行推进、按时交付。 制定并迭代评测任务的 SOP,建立质量管控机制(一致率监控、数据验收等)。 管理评测团队,负责质量验收、能力培养、效率提升等。 Rubric 设计 主导toC场景(agentic search、多轮能力等) rubric 的设计与终审。 提炼通用 rubric 范式,沉淀为可复用的模板。 主动识别效率瓶颈与质量风险,推动标准化和自动化改进。 跨部门协同与需求对接 作为接口人,与算法等团队对接评测需求,明确评测目标、验收标准与交付节奏。 将算法团队的改进需求转化为可执行的评测方案。 利用AI 辅助工具提升标注效率。 深入分析模型在真实场景任务中的 bad case,精准归因问题来源(指令遵循失败、幻觉、上下文遗忘等),输出模型能力弱点分布图谱,为算法与训练团队提供可操作的优化方向与数据反馈。 探索评测自动评估方案,研究主观评测新方法(如 LLM-as-Judge、对比评分、多维度量表等),将主观判断转化为可量化、可复现的评估指标,持续提升评测覆盖度与效率。 持续跟踪评测领域前沿方法,对现有评测基准进行充分调研与优缺点分析,建立评测数据的版本管理与防泄露机制,保障评测集的时效性与区分度。 任职要求 本科及以上学历,计算机、人工智能、金融、统计学等相关专业。 深度参与过 A/B 盲评、rubric 设计等评测任务,有自动化评测平台或评测流水线建设经验优先; 有团队管理经验,有带 5 人以上标注/评测团队的实际经历优先; 较强的跨领域沟通能力与团队协作意识,能与不同学科背景的研究人员、算法团队及外部专家高效配合,将学科需求准确转化为可落地的评测方案。 有良好的自驱力和学习能力,持续跟踪大模型与评测领域技术进展。