jdwatch
  • Home
  • CLI
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

数据技术及产品部-Coding & Agent 评测专家-杭州/北京

Company 阿里巴巴

Focus 技术 · 后端

北京, 杭州

July 29, 2026

岗位职责

主导 Coding & Agent 方向评测体系的设计与落地实施,定义模型能力,设计评测方法并构建专业评测集。具体包括:

  1. 主导设计并构建面向代码生成与智能体的评测基准,涵盖能力维度拆解、任务难度分级、数据集构造、评分标准制定等全流程,具备从 0 到 1 打造高区分度评测集的能力。
  2. 持续跟踪学术界与工业界在代码智能(Code Intelligence)和 Agent 领域的前沿进展,提出评测方向演进策略的专业判断,确保评测体系能有效度量模型的真实能力边界。
  3. 设计覆盖真实开发场景的代码评测任务,包括但不限于:代码补全、多文件编辑、调试修复、重构优化、仓库级理解、工具调用链路等,推动评测从"解题"向"工程实践"演进。
  4. 设计面向复杂 Agent 场景的评测任务体系,涵盖多步推理、环境交互、工具编排、长程规划、错误恢复等维度,构建能反映真实 Agentic 工作流的端到端评测方案。
  5. 建立评测数据质量管控机制,包括题目查重与污染检测、难度标定与校准、人工标注规范制定与一致性审核,确保评测结果的可信度与可复现性。
  6. 与模型训练团队紧密协作,将评测洞察转化为模型能力改进方向;与工程团队协同推动评测基础设施建设,支撑高频次、大规模的自动化评测流程。

任职要求

  1. 对代码生成与智能体领域有深入理解和判断,能清晰阐述"什么是好的代码能力"和"什么是好的 Agent 能力",并将其转化为可量化的评测维度。
  2. 具备从零设计 Benchmark 的完整经验,理解评测集在区分度、抗污染性、生态效度等方面的设计权衡。
  3. 扎实的软件工程背景,具备实际的中大型项目开发经验,能从一线开发者视角审视代码能力评测的合理性。
  4. 熟悉主流代码评测集(如SWE-bench、LiveCodeBench、BigCodeBench 等)和 Agent 评测集(如 WebArena、OSWorld、GAIA、AgentBench 等)的设计理念与局限性。
  5. 熟练掌握 Python,具备数据处理、统计分析与可视化能力;了解主流 LLM 推理服务的调用方式与工程约束。
  6. 了解 Agent 框架的核心机制(如 ReAct、Tool Use、Planning 等范式),对 MCP 等工具协议有认知或实践经验。
  7. 优秀的技术写作与沟通能力,能将评测设计思路清晰传达给研究与工程团队,并撰写高质量的评测报告与技术文档。 加分项
  8. 研发背景、在代码智能或 Agent 评测领域有学术发表或开源项目贡献(如参与 SWE-bench、BigCodeBench 等项目建设)。
  9. 有评测数据污染检测、动态评测集构建等方向的研究或工程经验。
  10. 有竞赛编程或开源社区深度参与背景,对代码能力的分层评估有直觉认知。
  11. 有将评测能力产品化的经验,如构建过评测平台、Leaderboard 或内部评测服务。
  12. 对模型训练流程有基本了解,能将评测信号与训练策略对齐。

岗位标签

NEW

Apply now

You'll be redirected to the official careers page. You can also sign in to save jobs and search more roles.