蚂蚁集团-语音交互算法专家-杭州

Company Antgroup

Focus Tech · Algorithm

Location 杭州

Published September 21, 2026

岗位职责

  1. 全双工语音模型研发:参与或主导面向全双工交互的 Audio-LLM / Speech-to-Speech 模型设计与训练,研究流式音频输入输出、跨模态表征及语音理解与生成的一体化建模。
  2. 交互感知与状态决策:面向全双工语音交互,研究多维信息融合与交互状态建模,提升复杂交互场景下的轮次判断、打断处理及交互决策能力。
  3. 语音前端算法研发:研发面向实时语音交互的语音前端算法,包括 AEC、语音增强、VAD、说话人感知与目标语音提取等,提升复杂声学环境下的语音质量与交互鲁棒性。
  4. 数据、训练与评测体系建设:建设面向真实复杂交互场景的数据与评测体系,开展数据构建、模型训练与难例优化,结合业务反馈持续提升模型效果与端到端交互体验。

任职要求

  1. 计算机、人工智能、电子信息、声学、信号处理等相关专业,硕士及以上学历,具备扎实的深度学习基础,以及语音、音频或多模态算法研发经验。
  2. 在以下至少一个方向具备深入研究或落地经验:Audio-LLM / Speech-to-Speech、语音大模型与跨模态对齐、流式语音理解与生成、全双工交互状态建模、轮次决策与打断识别、说话人感知与目标语音提取、AEC / 语音增强等语音前端算法。
  3. 具备良好的模型研发与工程实践能力,熟悉 PyTorch 等主流深度学习框架,能够独立完成数据构建、模型训练、评测分析与算法迭代,并推动算法能力在真实业务场景中落地。
  4. 加分项:具有端到端 Speech-to-Speech、流式 Audio-LLM、全双工语音交互或端侧语音前端研发经验;在 ICASSP、Interspeech、ACL、NeurIPS 等相关会议发表论文,或在语音、多模态相关竞赛及开源项目中有突出成果。

岗位标签

NEW

特色标签

C/C++、Python、Shell/Perl、TensorFlow/PyTorch、交互上下文建模、人机对话相关经验、全双工语音交互模型、双向语音交互模型、回声去除、回声抑制、在线语音输入输出、声学回声消除、声学相关专业、多模态音频语言模型、实时语音对话模型、实时音频流处理、对话状态追踪、对话轮次状态建模、数学/统计相关专业、智能交互、有国际期刊/会议论文发表、有留学背景、流式语音识别与合成、用户插话处理、目标说话人提取、直接语音对语音模型、端到端语音转换模型、英文读写能力良好、计算机相关专业、语音、语音到语音合成模型、语音去混响、语音大模型、语音打断恢复、语音打断检测、语音活动检测、语音清晰度提升、语音端点检测、语音识别工作经验、语音起止点识别、语音降噪、说话人分离、说话人识别、通信/信号处理相关专业、音频大模型