语音生成大模型算法工程师(TTS) (J251127015)
Company Didi
Focus Tech · Algorithm
Location 北京
Published July 21, 2026
岗位职责
1、负责团队自研语音生成基模的预训练 & 后训练; 2、优化基模zero-shot、多语种、长文本长上下文稳定性; 3、持续提升团队内部voice-desgin & voice-style-control & voice-remix等技术上线等。
任职要求
1、 专业背景:计算机/语音算法/AI 等相关专业硕士及以上,毕业年限2-5年最佳; 2、熟悉常见TTS框架(如:CoSyVoice、F5、 index-tts 、 Qwen3-tts、 VoxCPM、 DiTAR) 具备模型改动、调优经验; 3、熟悉常见音频表征技术、包含encodes、soundstream、DAC、wavTokenzier、VAE; 4、voice desgin & voice-style-control 等技术研发落地优先; 5、在 ICASSP、Interspeech、NeurIPS 等顶会发表过相关论文,或参与过开源语音项目贡献优先。
部门
L Lab