语音生成大模型算法工程师(TTS) (J251127015)
Company Didi
Focus Tech · Algorithm
Location 北京
Published July 21, 2026
岗位职责
- 负责团队自研语音生成基模的预训练 & 后训练;
- 优化基模zero-shot、多语种、长文本长上下文稳定性;
- 持续提升团队内部voice-desgin & voice-style-control & voice-remix等技术上线等。
任职要求
- 专业背景:计算机/语音算法/AI 等相关专业硕士及以上,毕业年限2-5年最佳;
- 熟悉常见TTS框架(如:CoSyVoice、F5、 index-tts 、 Qwen3-tts、 VoxCPM、 DiTAR) 具备模型改动、调优经验;
- 熟悉常见音频表征技术、包含encodes、soundstream、DAC、wavTokenzier、VAE;
- voice desgin & voice-style-control 等技术研发落地优先;
- 在 ICASSP、Interspeech、NeurIPS 等顶会发表过相关论文,或参与过开源语音项目贡献优先。
部门
L Lab