腾讯游戏-语音大模型-高级研究员
Company Tencent
Focus Tech · Algorithm
Location 上海
Published September 28, 2026
岗位职责
- 负责智能NPC对话(语音合成TTS)方向的前沿研究,研发新一代语音合成底座模型,驱动游戏中的智能NPC像真实人物一样与玩家实时交互;
- 研究最新的大模型后训练、蒸馏技术,深入神经音频编解码、语音token化、零样本音色克隆、情感与韵律控制、流式低时延合成等方向,让大模型学会扮演各类游戏NPC角色,拥有高度拟人化的性格、情绪、音色及语言风格,并与玩家实时交互,优化模型线上推理效果;
- 构建NPC语音生成专用数据集,训练和微调大模型,提升生成语音的听觉自然度、音色一致性、可懂度、情绪与韵律表现力,减少人工后期调整,探索多奖励强化学习(RL)、可验证奖励(RLVR)、小模型蒸馏(OPD)等技术,优化生成结果与NPC人物设定的匹配度;
- 与游戏引擎团队协作,确保生成内容可直接在主流引擎(如Unreal)中运行,监控模型在真实场景中的表现,持续迭代优化生成效果和稳定性;
- 与游戏策划、美术、程序团队紧密合作,理解业务需求,将技术方案转化为实际生产力,输出技术文档、专利或论文,推动行业技术标准建设;
- 跟踪语音合成与游戏AI领域最新进展,主动探索新技术在智能NPC场景的落地可能,赋能生态二方游戏项目。
任职要求
- 硕士及以上学历,人工智能、语音合成、语音信号处理、机器学习或相关领域毕业,在语音合成大模型方向有深入理解与丰富实践经验;
- 精通Python与PyTorch生态,熟悉DeepSpeed / Megatron-Core / FSDP等训练框架与vLLM / SGLang等推理框架,深入理解神经音频编解码器(EnCodec / DAC、RVQ分层token)、语义token与声学token建模、声码器(HiFi-GAN / Vocos等);
- 具备TTS大模型训练与微调经验,掌握分布式训练、混合精度、梯度检查点等工程能力,有实际使用、评测或二次开发业界前沿语音大模型(如CosyVoice、MiniMax Speech、Seed-TTS等)的经验;
- 系统掌握TTS大模型后训练技术栈:SFT、偏好对齐(DPO / IPO / KTO)、强化学习(GRPO / PPO / REINFORCE++),熟悉多奖励强化学习并围绕音色相似度、可懂度、情感表现、韵律等维度构造奖励,能运用ASR / 评测模型作为可验证奖励(RLVR)进行训练与对齐;
- 深入理解模型蒸馏技术:策略蒸馏(OPD)、多教师蒸馏、自蒸馏,能将强教师模型的能力迁移到线上服务的小模型;
- 熟悉TTS数据管线构造:源分离与VAD切分、音质过滤、富转写标注、合成数据生成、数据清洗去重与质量过滤,能围绕音色一致性 / 情绪 / 韵律 / 语言风格设计数据方案并搭建数据飞轮;
- 熟悉TTS评测管线构造:自然度(MOS)、可懂度(CER / WER)、音色相似度(SIM)、韵律与情绪一致性等主客观指标及实时性指标(RTF / 首包时延),能建立端到端评测体系与在线A/B反馈闭环;
- 具备端到端TTS大模型后训练落地经验:完整跑通「数据 → 训练 → 评测 → 上线」全链路,能在实时性与成本约束下最大化语音生成效果;
- 熟悉语音生成线上推理优化:流式合成与低时延推理、KV Cache、量化、多说话人并发服务及零样本音色克隆的高效部署等;
- 具备良好的跨团队沟通能力和技术文档撰写能力,能高效推动技术方案在游戏业务中的落地。
产品/项目
生态二方赋能-其他(IEG)-跳珠(逍遥游)
工作年限
两年以上工作经验