晓天衡宇-大模型评测工程师-代码方向(北京)Company AlibabaFocus Tech · AlgorithmLocation 北京Published August 14, 2026岗位职责 负责代码评测集的建设、维护与迭代,覆盖 SWE-bench 系、Terminal-Bench、LiveCodeBench、BigCodeBench、SciCode 等主流评测集,把控子指标权重与维度聚合口径。 负责 CodeArena 人工对战评测的设计与运营,制定打分标准与评委质检机制。 负责代码 badcase 的人工分析与三轴归因体系落地,即表现层(可运行性、内容、功能、视觉)、根因层(意图偏差、指令遵循、知识缺失、能力不足、幻觉)及对战相对结论,产出 Coding 能力榜与短板诊断报告。 负责评测数据的采集、清洗、去重、脱敏与格式标准化,保障数据质量与样本代表性。 负责标注任务的设计、质检与一致性管理,建立评测结果的入库、聚合与可视化流程,维护题库版本与数据溯源机制。 负责评测数据结构设计与自动化能力建设,包括模型、成本、token 消耗等数据表设计及批量编辑入口,支撑各方向榜单数据的自动更新。 任职要求 计算机相关专业本科及以上学历,具备扎实的编程能力,熟练掌握 Python 及至少一门主流开发语言。 具备代码审阅能力,能够准确评判模型生成代码的正确性、可运行性与工程质量。 熟悉主流代码评测集及其区分度与局限,理解分层评测设计思路,熟悉沙箱执行或 Agentic 代码评测流程。 具备代码 badcase 人工归因经验,能够独立完成结构化根因分析并形成结论。 熟练进行大规模数据处理(pandas 等),掌握数据清洗、去重、脱敏与质检方法,熟悉 JSON/JSONL 等评测数据格式。 理解标注一致性(IAA)度量与抽检机制,具备数据管线搭建能力,重视流程可复现性与数据溯源。