语音对话大模型算法实习生(J106084)

Intern

Company Baidu

Focus Tech · Algorithm

Location 北京

Published September 20, 2026

岗位职责

  • 参与语音对话大模型研发,包括Speech-to-Text、Speech-to-Speech、流式语音理解与生成等方向
  • 参与端到端语音对话模型的训练、微调、推理优化与效果评测
  • 研究语音情感理解、角色人设、音色控制、语音克隆、自然打断和轮次管理等能力
  • 参与语音对话数据的构建、清洗、标注、合成及质量分析
  • 探索 SFT、偏好优化和强化学习等后训练方法,提升模型的指令遵循、对话策略和角色一致性
  • 搭建语音评测体系,覆盖内容质量、语音自然度、端到端时延、打断响应及复杂环境鲁棒性
  • 跟进并复现 Speech LLM 领域前沿工作,推动研究成果在互动数字人场景落地

任职要求

  • 本科及以上学历,计算机、人工智能、电子信息、自动化、数学等相关专业
  • 熟悉 Python 和 PyTorch,具备良好的工程实现与实验分析能力
  • 理解 Transformer、注意力机制、LLM 训练与自回归生成等基本原理
  • 熟悉至少一个相关方向:ASR、TTS、音频编解码器、Speech LLM、对话系统、角色扮演
  • 能够阅读英文论文,并独立完成论文复现、实验设计和结果分析
  • 具备良好的沟通能力、问题拆解能力和研究主动性