多模态大模型评测工程师-【可灵AI专项】
Company 快手
Focus 技术 · 算法
北京
July 9, 2026
岗位职责
岗位亮点: 1、面向多模态大模型核心能力建设评测体系,覆盖文生图、图像编辑、caption/PE评测等方向; 2、既需要工程能力,也需要数据分析和模型效果理解,如果你没有相关经验,也适合希望从测试开发、数据工程、平台工程转向大模型评测方向的同学; 3、参与评测 Agent、模型竞技场、偏好模型、自动化机评、应用数据飞轮等前沿工具链建设; 4、工作结果直接影响模型迭代、产品体验和算法优化方向。
职位描述: 1、以算法视角,参与快手大模型文生图、图像编辑评测工作、算子评估和相关评测体系建设; 2、参与评测相关自动化评测工具开发及维护,最大化提高评测效率; 3、以算法手段,对基座大模型和AI Native应用进行分阶段、端到端评测; 4、参与构建评测Agent工具链、机评设计、对战平台、模型竞技场、模型效果判别模型、应用数据飞轮等工具链建设。
任职要求
1、本科及以上学历,计算机、人工智能、软件工程、数据科学、自动化等相关专业优先; 2、具备扎实的软件工程能力,能够独立完成评测工具、自动化流程、数据处理 pipeline 或平台系统的设计与实现; 3、具备较好质量意识,且对大模型、多模态模型、图像生成或图像编辑有兴趣,能够主动理解模型能力、模型缺陷与数据分布之间的关系; 4、具备较强的数据分析和问题归因能力,能够从评测结果、线上数据和用户行为中定位问题,并推动后续优化; 5、具备良好的沟通能力,能够与算法、数据、产品、平台团队协作,推动评测标准和工程方案统一; 6、具备以下任一方向经验即可: ○ 测试开发:有自动化测试、测试平台、质量体系、稳定性保障、效果评测相关经验; ○ 数据分析:有数据清洗、分布分析、指标建设、A/B test、实验分析相关经验; ○ 算法评测 / 模型评测:有 CV、多模态/LLM、AIGC、推荐、搜索、广告等模型评测经验。 加分项: 1、有 AIGC、多模态大模型、图像生成、图像编辑、VLM、Agent 等相关项目经验; 2、有评测平台、对战平台、模型竞技场、自动化评测系统、数据飞轮建设经验; 3、熟悉 diffusion、VLM、LLM、prompt engineering、偏好模型、reward model、VLM-as-Judge 等相关概念; 4、熟悉 SuperCLUE、LMArena、GenAI-Bench、HEIM、T2I-CompBench、DPG-Bench、EditBench 等评测基准或方法论; 5、有较好的图像审美能力,能够从构图、风格、真实感、文字准确性、主体一致性、指令遵循等角度判断生成效果; 6、有复杂项目推进经验,能够跨团队推动评测标准、工具链或数据流程落地。