晓天衡宇-大模型评测工程师-应用方向(北京)Company AlibabaFocus Tech · AlgorithmLocation 北京Published August 14, 2026岗位职责 负责 LLM 人工评测竞技场(Arena)的整体设计与运营,统筹题库构建、对战机制、评委组织与排名算法。 负责评测题库的规划与建设,覆盖创作、设计、中文、GUI 等重点场景,把控自建题占比与数据来源分类(开源/自建/混合),保证题目的区分度与抗刷分能力。 负责 Elo/BT + bootstrap 排名体系的落地与维护,处理胜率矩阵的传递性、一致性与显著性问题,确保结论的统计可靠性。 负责 AI Agent 办公助手类产品(如 QwenWork、WorkBuddy 等)的端到端评测,围绕真实办公工作流构建任务集,覆盖文档处理、数据分析、跨应用协作、检索问答等场景。 建立端到端成功率与分步归因指标体系,评估任务完成度、多步推理与工具调用、长上下文与记忆、稳定性与可用性等能力,输出产品横向对比与迭代建议。 负责榜单口径的统一维护,制定在榜数量与版本汰换规则,定期产出能力榜与性价比榜。 任职要求 计算机、统计学、数据科学等相关专业本科及以上学历,具备大模型评测、数据分析或产品测评相关工作经验。 熟悉 LLM 能力评测体系与主流公开榜单,理解 Arena 对战机制及 Elo/BT 排名算法的统计原理,能够准确判断胜率差异所需样本量与置信区间。 具备评测题库设计与标注一致性管理经验,能够独立完成评测方案设计与质检流程搭建。 熟悉 AI Agent 及办公助手类产品形态与典型工作流,理解任务型评测与单模型评测的差异,能够定义可量化的成功标准与归因维度。 具备良好的 Python 数据分析能力,可独立完成胜率矩阵计算、bootstrap 抽样与显著性检验。 对维度共线性与权重设定具备清晰认知,理解避免双重计分、合规项以否决门方式处理等评测设计原则。