蚂蚁集团-实时音视频大模型算法专家-北/上/杭
Company Antgroup
Focus Tech · Algorithm
Location 北京, 上海, 杭州
Published August 5, 2026
岗位职责
- 负责推动LLaDA系列扩散模型在实时音视频多模态场景的技术探索和突破;
- 负责实时音视频大模型技术带来的新特性(如交错交互等)从实验性走向实用性全流程所需的训练、语料优化、评测反馈等环节相关工作;
任职要求
- 有丰富的音视频大模型相关一手研发经验,包括不限于模型结构、tokenizer、预训练、后训练、语料采集优化、评测体系等;
- 动手能力强;
- 参与过有影响力的音视频开源模型研发者优先;
- 在顶会如NeurIPS、ICML、ICLR、ACL、CVPR、ICCV等上面有代表性高质量工作发表;
- 较强的表达和沟通能力,工作认真、严谨、敬业。有强烈的责任心和自驱力;
- 有扩散模型相关经验者优先。
岗位标签
NEW
特色标签
CNN/RNN、Python、TensorFlow/PyTorch、WebRTC、人机对话相关经验、声学相关专业、多模态扩散模型、多模态评测、多模态语料、大规模多模态模型、大规模语言模型、实时多媒体通信、实时流媒体、数学/统计相关专业、有国际期刊/会议论文发表、概率扩散模型、模型评估、生成式扩散模型、英文读写能力良好、计算机相关专业、训练数据、语音识别工作经验、跨模态、音视频多模态、音视频扩散模型