语音生成大模型算法工程师(TTS) (J251127015)

Company Didi

Focus Tech · Algorithm

Location 北京

Published July 21, 2026

岗位职责

  1. 负责团队自研语音生成基模的预训练 & 后训练;
  2. 优化基模zero-shot、多语种、长文本长上下文稳定性;
  3. 持续提升团队内部voice-desgin & voice-style-control & voice-remix等技术上线等。

任职要求

  1. 专业背景:计算机/语音算法/AI 等相关专业硕士及以上,毕业年限2-5年最佳;
  2. 熟悉常见TTS框架(如:CoSyVoice、F5、 index-tts 、 Qwen3-tts、 VoxCPM、 DiTAR) 具备模型改动、调优经验;
  3. 熟悉常见音频表征技术、包含encodes、soundstream、DAC、wavTokenzier、VAE;
  4. voice desgin & voice-style-control 等技术研发落地优先;
  5. 在 ICASSP、Interspeech、NeurIPS 等顶会发表过相关论文,或参与过开源语音项目贡献优先。

部门

L Lab