多模态大模型评测工程师-【可灵AI专项】

Company Kuaishou

Focus Tech · Algorithm

Location 北京

Published July 9, 2026

岗位职责

岗位亮点:

  1. 面向多模态大模型核心能力建设评测体系,覆盖文生图、图像编辑、caption/PE评测等方向;
  2. 既需要工程能力,也需要数据分析和模型效果理解,如果你没有相关经验,也适合希望从测试开发、数据工程、平台工程转向大模型评测方向的同学;
  3. 参与评测 Agent、模型竞技场、偏好模型、自动化机评、应用数据飞轮等前沿工具链建设;
  4. 工作结果直接影响模型迭代、产品体验和算法优化方向。

职位描述

  1. 以算法视角,参与快手大模型文生图、图像编辑评测工作、算子评估和相关评测体系建设;
  2. 参与评测相关自动化评测工具开发及维护,最大化提高评测效率;
  3. 以算法手段,对基座大模型和AI Native应用进行分阶段、端到端评测;
  4. 参与构建评测Agent工具链、机评设计、对战平台、模型竞技场、模型效果判别模型、应用数据飞轮等工具链建设。

任职要求

  1. 本科及以上学历,计算机、人工智能、软件工程、数据科学、自动化等相关专业优先;

  2. 具备扎实的软件工程能力,能够独立完成评测工具、自动化流程、数据处理 pipeline 或平台系统的设计与实现;

  3. 具备较好质量意识,且对大模型、多模态模型、图像生成或图像编辑有兴趣,能够主动理解模型能力、模型缺陷与数据分布之间的关系;

  4. 具备较强的数据分析和问题归因能力,能够从评测结果、线上数据和用户行为中定位问题,并推动后续优化;

  5. 具备良好的沟通能力,能够与算法、数据、产品、平台团队协作,推动评测标准和工程方案统一;

  6. 具备以下任一方向经验即可:

    • 测试开发:有自动化测试、测试平台、质量体系、稳定性保障、效果评测相关经验;
    • 数据分析:有数据清洗、分布分析、指标建设、A/B test、实验分析相关经验;
    • 算法评测 / 模型评测:有 CV、多模态/LLM、AIGC、推荐、搜索、广告等模型评测经验。 加分项:
  7. 有 AIGC、多模态大模型、图像生成、图像编辑、VLM、Agent 等相关项目经验;

  8. 有评测平台、对战平台、模型竞技场、自动化评测系统、数据飞轮建设经验;

  9. 熟悉 diffusion、VLM、LLM、prompt engineering、偏好模型、reward model、VLM-as-Judge 等相关概念;

  10. 熟悉 SuperCLUE、LMArena、GenAI-Bench、HEIM、T2I-CompBench、DPG-Bench、EditBench 等评测基准或方法论;

  11. 有较好的图像审美能力,能够从构图、风格、真实感、文字准确性、主体一致性、指令遵循等角度判断生成效果;

  12. 有复杂项目推进经验,能够跨团队推动评测标准、工具链或数据流程落地。