光子 AI-高级研究员-语音合成与多模态大模型

Company Tencent

Focus Tech · Algorithm

Location 深圳

Published July 16, 2026

岗位职责

  1. 基于大语言模型(LLM)及多模态/全模态大模型,研究和开发前沿语音合成与生成算法(如 TTS、语音转换、声音/音乐生成等);
  2. 开发和优化面向线上应用的语音及音频合成系统,提升效果、效率和可扩展性;
  3. 探索并推进全双工/流式多模态大模型在语音理解、语音生成及实时语音交互方面的能力;
  4. 与研究和工程团队跨职能协作,推动项目从原型验证到生产落地。

任职要求

  1. 计算机科学、电子工程、信号处理或相关领域博士学位;
  2. 具备扎实的语音/音频处理基础,熟悉现代生成模型(如扩散模型、流匹配、自回归模型、基于编解码器的方法等);
  3. 具有将大语言模型扩展至语音/音频模态的实际经验(如语音分词器、多模态适配器、语音-文本联合训练等);有全双工或流式语音对话系统及实时交互建模经验者优先;
  4. 熟练使用 Python 及深度学习框架(如 PyTorch);有分布式训练经验者优先;
  5. 在顶级学术会议发表过论文(如 ICML、NeurIPS、ICLR、ACL、ICASSP、Interspeech 等)。

产品/项目

预算专用-光子技术发展部公共产品

工作年限

一年以上工作经验