jdwatch
  • Home
  • CLI
  • Skills
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

【蚂蚁星】多模态理解与生成评测算法研究-27届

Campus

Company Antgroup

Focus Tech · Algorithm

Location 北京, 杭州

Published August 26, 2026

岗位职责

我们聚焦实时多模态交互、数字人、虚拟环境、音视频生成等前沿 AI 场景,建设面向下一代多模态模型的评测算法与 Benchmark 体系。随着模型从“文本问答”走向 实时音视频理解、全双工语音交互、数字人生成、虚拟行为生成与多模态环境交互,传统静态评测已无法准确刻画模型能力。我们希望构建一套覆盖“理解 → 交互 → 生成 → 反馈”的多模态评估体系,帮助模型和产品持续发现能力边界、定位失败原因,并推动算法优化和产品体验提升。

重点研究方向:

  1. 实时多模态理解评测:
  • 面向 audio-video-text 原生多模态模型,评估模型在连续音视频流中的理解能力;
  • 研究 streaming understanding、micro-turn understanding、audio-visual grounding、多轮上下文保持等能力评估方法;
  1. 实时交互能力评测:
  • 评估模型在 full-duplex interaction、streaming speech-to-speech、turn-taking、barge-in、interrupt handling 等场景下的交互质量;
  • 设计首响延迟、首音频延迟、抢话率、漏听率、打断成功率、会话连续性等指标体系;
  1. 多模态生成评测:
  • 面向 digital human、virtual avatar、talking head、full-body avatar、virtual environment、embodied behavior generation 等方向,评估生成内容的自然性、一致性和可控性;
  • 重点研究 lip-sync、audio-motion alignment、co-speech gesture、identity consistency、emotion/prosody consistency、temporal consistency 等评测方法;
  1. 交互式生成评测:
  • 研究用户实时输入下,数字人、虚拟角色或虚拟环境是否能持续、稳定、可控地响应;
  • 评估用户中途打断、修改意图、切换任务、改变情绪或环境状态时,生成系统的响应质量;
  1. 自动化 Judge 与评测可信度:
  • 探索 VLM Judge、Audio Judge、Multimodal Judge、LLM-as-Judge 在多模态评测中的应用;
  • 研究人评一致性、Judge 校准、Rubric 设计、评测偏差控制和评测结果可信度分析;
  1. 多模态 Benchmark 建设:
  • 构建面向实时音视频交互、数字人、虚拟环境和多模态生成的高质量 Benchmark;
  • 解决静态测试集覆盖不足、主观体验难量化、真实用户场景不足、评测结果与产品体感不一致等问题。

岗位职责:

  1. 设计面向实时多模态理解、交互和生成能力的评测指标体系与 Benchmark;
  2. 构建音视频流式评测任务、数字人/虚拟环境交互任务、多模态生成任务等数据集;
  3. 研发自动化评测方法,结合规则评分、模型裁判、人评校准和统计分析提升评测效率与可信度;
  4. 分析多模态模型在理解、交互、生成、时序一致性、音画同步、行为自然性等方面的失败原因;
  5. 跟踪 GPT-realtime、Gemini Live、SeedRealtime、Sora、Seedance、数字人、虚拟角色、世界模型等方向的前沿进展,并转化为内部评测方法;
  6. 推动研究成果在真实业务中落地,产出评测基准、技术报告、专利、论文或开源项目。

任职要求

  1. 计算机科学、人工智能、机器学习、语音、多模态、计算机视觉、图形学等相关专业硕士及以上学历,博士或具备同等研究能力者优先;
  2. 熟练使用 Python,熟悉 PyTorch 或其他深度学习框架,能够独立完成算法实验、评测原型和数据分析;
  3. 熟悉以下一个或多个方向:Multimodal LLM / Omni-modal Model、Vision-Language Model、Speech LM / Audio LM、Streaming ASR / Streaming TTS、Audio-Visual Understanding、Digital Human / Virtual Avatar、Talking Head / Full-body Avatar、Motion Generation / 3D Facial Animation、Neural Rendering / 3D Gaussian Splatting、Video Diffusion / Diffusion Transformer;
  4. 具备较强的实验设计和问题抽象能力,能够把“自然不自然”“像不像真人”“交互顺不顺”这类主观体验转化为可验证的评测指标;
  5. 对多模态前沿技术有持续兴趣,能够快速阅读论文、复现方法,并结合业务场景形成可落地方案;
  6. 具备良好的工程能力和沟通能力,能够与算法、产品、工程团队协作推动评测体系落地。

加分项:

  1. 在 ICLR、NeurIPS、ICML、ACL、EMNLP、CVPR、ICCV、ECCV、SIGGRAPH、AAAI 等会议发表过高质量论文;
  2. 有多模态大模型、语音大模型、数字人、视频生成、3D 生成、虚拟环境或世界模型相关项目经验;
  3. 参与过 Benchmark、评测框架、数据集、开源项目或算法竞赛;
  4. 有 VLM-as-Judge、LLM-as-Judge、Audio Judge、人评一致性校准等评测经验;
  5. 熟悉 WebRTC、流媒体、实时推理、音视频处理、Unity、Unreal、WebGL、Three.js 等实时交互技术;
  6. 有数字人、虚拟陪伴、实时语音助手、AI 视频生成、交互式 AIGC 产品体验或研究经验。

特色标签

AI裁判、Python、PyTorch、Shell、主观评价对齐、云原生、云服务、云计算、人工评估一致性、仿真环境、优秀开源项目经历、全双工对话、内容、分布式训练、动作生成、发表算法相关优秀论文、唇音对齐、图像、图像算法、在线音视频感知、基准数据集建设、声画一致、多模态基准测试、多模态度量体系、多模态算法、多模态评估、大模型算法、姿态生成、实时双向语音交互、实时视听理解、对话系统、广告、意图挖掘、数字化身、数字孪生环境、新媒体、智能交互、智能体、智能评分器、有留学背景、机器人、机器学习、标准测试集构建、标注者一致性、模型加速/性能优化、模型裁判、流媒体音视频理解、深度学习、直播、短视频、算法工程化经验、聊天机器人、自动驾驶、英美留学生、营销、虚拟人、虚拟场景、虚拟形象、虚拟行为合成、视频、评测基准搭建、语义理解、语音、语音算法、边听边说交互、音画同步