晓天衡宇-大模型评测工程师-多模态方向(北京)Company AlibabaFocus Tech · AlgorithmLocation 北京Published August 14, 2026岗位职责 负责多模态评测框架的整体设计,围绕跨模态一致性、时空连续性、物理常识等核心内核拆解可量化子指标,并建立子指标至能力维度的聚合口径。 负责 Omni 理解方向评测集的建设与迭代,覆盖图文、视频、音频、文档等混合输入场景下的跨模态对齐、长视频理解、音视频联合理解及多模态指令遵循等能力。 负责世界模型生成方向评测方案的设计与落地,覆盖文生视频、图生视频、长时序一致性、物理规律遵循、镜头与运镜控制、可交互世界模拟等评测维度。 搭建自动化指标与人工 GSB/Arena 对战相结合的评测链路,制定打分协议与质检机制,控制主观评测的偏差与平局问题。 持续跟踪 GPT、Gemini、Qwen-Omni、Sora、Veo、可灵、Genie 等主流模型的能力演进,输出能力榜与性价比榜。 负责 badcase 的结构化归因分析,定位模型在感知、对齐、推理、幻觉及物理真实性、可控性等方面的短板,形成可执行的改进结论。 任职要求 计算机、人工智能、电子信息等相关专业本科及以上学历,具备大模型评测、算法或数据相关工作经验。 熟悉多模态大模型的主流架构与输入形态,理解视觉编码器、跨模态对齐、时序建模的基本原理,了解扩散模型、视频生成及世界模型的技术脉络。 熟悉 MMBench、MMMU、Video-MME、OmniBench 等理解类评测集及主流视频生成榜单,能够客观判断其区分度与适用边界。 掌握 GSB、Elo/BT 等主观评测方法,具备打分协议设计与标注一致性管理能力。 具备良好的 Python 工程能力,能够独立搭建数据处理管线及生成、采样、打分的完整评测链路。 对样本代表性、指标加权聚合、结果可复现性具备清晰认知,具备较强的数据分析与报告输出能力。