晓天衡宇-评测平台-评测方向Company AlibabaFocus Tech · BackendLocation 杭州Published August 21, 2026岗位职责 评测平台架构与框架建设。设计并研发面向大模型与Agent的通用评测框架,支持多模态输入输出、长程任务执行、工具调用链路、执行反馈等评估维度;推动评测流水线标准化,打通数据集管理、环境隔离、任务调度、指标计算、结果归档与可视化各环节;对评测结果做数据清洗、统计分析与可视化,向算法团队输出分析报告与洞察。 评测集适配与建设。吃透业界主流评测集(如SWE-bench、Terminal-Bench、JobBench等),完成向平台的精准适配;面向代码生成、工具使用、推理、多轮对话、多模态生成等任务场景,设计可量化的评估方式与指标体系;建立Benchmark版本管理机制,让评测过程与结果可追踪、可对比、可复现,支撑模型迭代决策。 评测任务Agent化与Harness Engineering。以Harness Engineering思路把评测任务本身Agent化,提升评测集接入效率与执行的智能化水平;开发自动化诊断工具,定位评测适配异常、指标抖动、环境漂移等问题,降低人工排查成本;探索LLM-as-Judge、多智能体评判、人类偏好对齐等前沿评测范式,提升评估的客观性与覆盖度。 任职要求 计算机相关专业本科及以上学历,3年以上平台研发或AI工程经验。 工程功底扎实,精通Python或Java至少一门,熟练使用Linux开发环境与Shell脚本自动化。 理解大模型评测体系,熟悉开源评测集与主流评测框架,具备评测框架、数据Pipeline、分布式任务调度或MLOps平台的设计与落地经验。 熟悉Docker、Kubernetes、Conda等环境隔离与资源调度技术,能独立处理复杂依赖管理与可复现性问题。 对AI评测有热情,看重指标设计的科学性与工程实现的严谨性;能阅读英文文献、分析开源项目源码,准确抽象评测集核心逻辑并完成平台化落地。