jdwatch
  • Home
  • CLI
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

数据技术及产品部-大模型评测算法工程师-杭州/北京

Company 阿里巴巴

Focus 技术 · 算法

北京, 杭州

July 29, 2026

岗位职责

1.评测集自动构建技术:研究跨模态通用的评测集自动生成方法,构建不同模态(文本/图像/视频/音频/3D 等)评测集生产框架;研究动态评测集与抗污染技术,解决各模态静态评测集被"刷榜"后失效的通用问题;探索面向模型弱点的定向探测数据生成,通过错误模式分析自动生成针对性测试样本。 2.自动裁判技术:构建多模态通用的自动评判算法框架,统一支撑文本质量评判、生成内容质量评估、交互过程评估等不同评判范式,设计可插拔的评判策略组件;研究LLM as a judge及Agent as a judge,支撑 Agent 轨迹的中间步骤质量评估、推理链路正确性验证、世界模型的时序物理一致性检验等既需要结果评分也需要过程评分的评判场景。 3.Agent评测技术:设计Coding Agentic应用的端到端评估算法,包括多轮对话质量建模、用户意图满足度预测、任务完成率估计等;研究评测信号与用户真实体验的对齐技术,通过线上行为数据反标定离线评测指标的有效性,构建离线评测可预测线上表现的校准模型。

任职要求

  1. 计算机科学、人工智能、机器学习或相关领域硕士及以上学历,博士优先。
  2. 对大模型评测方法论有体系化认知,能判断不同方法在不同模态/场景下的适用边界。
  3. 对数据合成与数据质量有研究深度,理解合成数据的质量控制与多样性保障机制。
  4. 扎实的机器学习基础,具备模型训练(预训练或微调)的完整实操经验,熟悉 PyTorch 及主流训练框架。
  5. 具备跨模态的技术视野,不要求精通所有模态,但需要能快速理解不同领域的评测需求并抽象出通用技术方案。
  6. 良好的学术敏感度,能持续跟进最新研究并快速转化。
  7. 优秀的技术沟通与协作能力,能作为评测技术中台与多个业务方向团队有效对接需求。 加分项
  8. 在 LLM evaluation、reward modeling、data synthesis、image/video quality assessment 等方向有顶会/顶刊发表。
  9. 有评测数据自动生成或动态评测集构建的实际经验。
  10. 有训练过 Judge Model / Reward Model经验。
  11. 具备多模态研究背景,在视觉生成评估或音频评估算子构建方面有实操经验。
  12. 有产品级评测技术经验,理解如何将离线评测指标与线上 A/B 实验指标建立映射关系。

岗位标签

NEW

Apply now

You'll be redirected to the official careers page. You can also sign in to save jobs and search more roles.