蚂蚁集团-实时音视频大模型算法专家-北/上/杭

Company Antgroup

Focus Tech · Algorithm

Location 北京, 上海, 杭州

Published August 26, 2026

岗位职责

  1. 负责推动LLaDA系列扩散模型在实时音视频多模态场景的技术探索和突破;
  2. 负责实时音视频大模型技术带来的新特性(如交错交互等)从实验性走向实用性全流程所需的训练、语料优化、评测反馈等环节相关工作;

任职要求

  1. 有丰富的音视频大模型相关一手研发经验,包括不限于模型结构、tokenizer、预训练、后训练、语料采集优化、评测体系等;
  2. 动手能力强;
  3. 参与过有影响力的音视频开源模型研发者优先;
  4. 在顶会如NeurIPS、ICML、ICLR、ACL、CVPR、ICCV等上面有代表性高质量工作发表;
  5. 较强的表达和沟通能力,工作认真、严谨、敬业。有强烈的责任心和自驱力;
  6. 有扩散模型相关经验者优先。

特色标签

CNN/RNN、Python、TensorFlow/PyTorch、WebRTC、人机对话相关经验、声学相关专业、多模态扩散模型、多模态评测、多模态语料、大规模多模态模型、大规模语言模型、实时多媒体通信、实时流媒体、数学/统计相关专业、有国际期刊/会议论文发表、概率扩散模型、模型评估、生成式扩散模型、英文读写能力良好、计算机相关专业、训练数据、语音识别工作经验、跨模态、音视频多模态、音视频扩散模型