晓天衡宇-大模型评测开发工程师-Eva+评测平台
Company 阿里巴巴
Focus 技术 · 测试
杭州
July 30, 2026
岗位职责
- 评测框架和平台开发:构建面向代码生成、电商、Data Agent、多模态生成(图文/视频)等多领域的评测能力,参与Agent评测平台能力建设,建设灵活、稳定、高效的评测框架。
- 评测构建与任务执行:深入理解业界主流的AI/Agent评测集,负责将其数据结构、评测逻辑和评估指标精准适配到平台评测框架上,解决适配过程中面临的问题。负责大规模评测任务的部署、执行与监控,确保评测过程的稳定性和评测分数的准确性,为评测集方案专业性负责。
- 结果分析与报告:对评测结果进行初步的数据清洗和格式化,为算法团队提供清晰、可靠的性能和trajectory数据报告,并能定位因适配问题导致的指标异常。
- 评测任务Agent开发:利用Harness Engineering构建评测任务Agent,提升评测任务接入效率。
任职要求
- 计算机相关专业,本科及以上学历,3年以上相关工作经验。
- 具备python/java开发能力,熟悉JSON、YAML等数据格式,熟悉Linux开发环境,能够使用Shell脚本进行自动化任务。
- 有AI应用/服务端应用开发经验,了解Agent的评估指标,不仅限于文本生成质量,还包括规划能力、工具调用成功率等维度,了解代码类评测基准,能够确保评测集适配准确性。
- 能够快速阅读并理解技术论文和开源项目文档,准确把握评测集的核心逻辑。能够与算法研究员和框架开发工程师进行高效沟通,清晰表达适配过程中遇到的问题和需求。
岗位标签
NEW