千问事业部-大模型TTS和音频生成算法专家-杭州/上海
Company Quark
Focus Tech · Algorithm
Location 杭州, 上海
Published June 30, 2026
岗位职责
1、负责大模型TTS和大模型音频生成技术构建。为语音助手超级智能体提供音频技术支持,包括但不限于TTS、端到端语音大模型、音频AIGC等; 2、负责关键场景的语音交互大模型算法优化,构建高质量低延迟的TTS和音频生成系统,提升业务效果; 3、跟进业界前沿的语音生成大模型技术,如语音端到端大模型和全模态模型等,提升语音助手场景的智能化并落地产品。
任职要求
1、计算机、人工智能、模式识别等相关专业硕士及以上学历; 2、熟悉Linux系统和常用的数据结构,熟练使用Python/C++等至少一种编程语言,熟练使用TensorFlow/PyTorch等至少一种深度学习框架; 3、深入理解端到端语音大模型的原理和架构,熟悉常见的语音和全模态大模型,如qwen-TTS、qwen-omni、Whisper等,对语音识别、合成、对话理解等技术有扎实的理论基础;有tactron、vits、fastspeech等传统TTS技术亦可 4、在语音、人工智能领域的会议和期刊,如ICASSP、Interspeech、NIPS、ICML、ICLR等发表过论文,或在相关竞赛中取得优异成绩者优先; 5、优秀的分析和解决问题的能力,对解决具有挑战性的问题充满激情,良好的沟通和团队合作能力。