数据技术及产品部-评测平台研发工程师-北京/杭州Company AlibabaFocus Tech · BackendLocation 北京, 杭州Published August 26, 2026岗位职责 负责阿里集团评测平台的整体架构设计与核心能力建设,覆盖基座模型、Agent与Skills等评测对象,支撑文本/生图/音频/视频等多模态模型,Agent以及集团内各类Skills的评测需求。 搭建评测诊断、归因分析与报告生成能力,沉淀一套可复用的评测分析方法论;针对评测失败原因、得分分布、执行轨迹与Badcase做深度归因,为基座模型、Agent与Skills的能力迭代提供依据。 跟进业界模型与Benchmark的最新进展,制定评测实施计划与应急预案,推进评测任务落地、验收评测结果并产出高质量分析报告,把评测元信息、结果与报告沉淀为可管理、可检索的数据资产。 与领域专家团队协作,支撑评测集的制作、验收与上架,配合完成敏捷评测与全面评测,提升评测全链路的自动化程度与工程效率。 支撑集团内各类Agent及竞品接入EVA+自动化评测体系,开发Agent接入诊断与提效工具,建设业务评测集的自动化生成能力,降低业务方的接入与维护成本。 任职要求 硕士及以上学历,计算机、人工智能等相关专业优先;3年以上平台研发或AI工程经验。 工程功底扎实,精通Python或Java至少一门,熟练使用Linux开发环境,能用Shell脚本完成自动化。 对AI技术有热情,理解AI评测体系,具备AI应用类平台从设计到落地的完整经验。 复杂问题的拆解与解决能力强,跨团队沟通协作顺畅,能协调组内外资源推动项目高质量落地。 加分项 主导过评测框架或评测产品研发,有基座模型、Agent或Skills的评测实战经验。 主导过Agent系统开发,理解Agent评测原理与指标体系设计。 有评测集设计与开发经验,熟悉Harbor等评测集规范标准。