jdwatch
  • Home
  • CLI
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

晓天衡宇-大模型评测开发工程师-Eva+评测平台

Company 阿里巴巴

Focus 技术 · 测试

杭州

July 30, 2026

岗位职责

  1. 评测框架和平台开发:构建面向代码生成、电商、Data Agent、多模态生成(图文/视频)等多领域的评测能力,参与Agent评测平台能力建设,建设灵活、稳定、高效的评测框架。
  2. 评测构建与任务执行:深入理解业界主流的AI/Agent评测集,负责将其数据结构、评测逻辑和评估指标精准适配到平台评测框架上,解决适配过程中面临的问题。负责大规模评测任务的部署、执行与监控,确保评测过程的稳定性和评测分数的准确性,为评测集方案专业性负责。
  3. 结果分析与报告:对评测结果进行初步的数据清洗和格式化,为算法团队提供清晰、可靠的性能和trajectory数据报告,并能定位因适配问题导致的指标异常。
  4. 评测任务Agent开发:利用Harness Engineering构建评测任务Agent,提升评测任务接入效率。

任职要求

  1. 计算机相关专业,本科及以上学历,3年以上相关工作经验。
  2. 具备python/java开发能力,熟悉JSON、YAML等数据格式,熟悉Linux开发环境,能够使用Shell脚本进行自动化任务。
  3. 有AI应用/服务端应用开发经验,了解Agent的评估指标,不仅限于文本生成质量,还包括规划能力、工具调用成功率等维度,了解代码类评测基准,能够确保评测集适配准确性。
  4. 能够快速阅读并理解技术论文和开源项目文档,准确把握评测集的核心逻辑。能够与算法研究员和框架开发工程师进行高效沟通,清晰表达适配过程中遇到的问题和需求。

岗位标签

NEW

Apply now

You'll be redirected to the official careers page. You can also sign in to save jobs and search more roles.