【蚂蚁星】语音信号处理与语音算法-平台技术-27届
Company Antgroup
Focus Tech · Algorithm
Location 杭州
Published May 14, 2026
岗位职责
感知与生成引擎部门,打造下一代AI研发范式和AI应用原生架构的基础设施,包括模型训推、Agent引擎、多模态交互、多媒体技术等。 1.主导前沿语音信号处理算法的研究与开发,包括但不限于语音增强、降噪、分离及信号重构等核心技术创新; 2.深入研发新一代端到端语音识别(ASR)、语音合成(TTS)算法,突破现有架构性能瓶颈; 3.构建面向多语种/低资源场景的自适应语音处理系统,解决跨语言/跨场景的泛化性问题; 4.探索语音处理与大语言模型(LLM)的深度融合,开发创新性语音交互系统; 5.主导从理论创新到工业级落地的完整技术闭环,确保算法在真实场景中的高可靠性。
任职要求
学术要求: 1.博士学位,专业方向为语音信号处理、计算声学、人工智能或相关领域; 2.在语音处理顶级会议(ICASSP/Interspeech)或期刊(IEEE TASLP)以第一作者发表2篇以上高质量论文; 3.具有系统性科研经历,深度参与过国家级重点语音相关课题研究者优先。 技术要求: 1.精通语音信号处理全技术栈(从传统信号处理到时序深度学习); 2.对端到端语音模型(Conformer/Transformer架构)有深刻理论理解与实践经验; 3.熟悉语音处理前沿方向(如神经声码器、语音分离、语音抗噪等); 4.至少主导过一项完整的语音系统研发全流程。 工程能力: 1.精通Python/C++及主流深度学习框架的底层优化; 2.具备大规模语音数据训练与模型压缩的实际经验; 3.具有构建工业级语音系统的完整工程实现能力。 附加要求: 1.获得过重要学术奖项(如IEEE最佳论文奖)者优先; 2.具有国际顶级语音实验室(如Microsoft Research、Google Brain)研究经历者优先; 3.具备跨学科创新思维,在相关领域有专利成果者优先。
特色标签
C/C++、CNN/RNN、Kaldi、Python、TensorFlow/PyTorch、WebRTC、低资源语音识别、噪声抑制、基础语言模型、声学相关专业、多语言ASR/TTS、多语言语音处理、多说话人分离、大语言模型、少样本语音学习、文本转语音、时频域重构、有国际期刊/会议论文发表、有留学背景、混合语音分离、缺失信号恢复、背景噪声消除、自动语音识别、自然语言语音输出、自适应降噪、英文读写能力良好、计算机相关专业、话语到文字转换、语言大模型、语音、语音保真增强、语音信号分析、语音信号变换、语音信号建模、语音分离、语音清晰度增强、语音生成、语音识别工作经验、语音质量提升、语音转文本、语音重建、资源受限语音建模、跨语言语音建模、通信/信号处理相关专业