语音对话大模型算法实习生(J106084)
Intern
Company Baidu
Focus Tech · Algorithm
Location 北京
Published September 20, 2026
岗位职责
- 参与语音对话大模型研发,包括Speech-to-Text、Speech-to-Speech、流式语音理解与生成等方向
- 参与端到端语音对话模型的训练、微调、推理优化与效果评测
- 研究语音情感理解、角色人设、音色控制、语音克隆、自然打断和轮次管理等能力
- 参与语音对话数据的构建、清洗、标注、合成及质量分析
- 探索 SFT、偏好优化和强化学习等后训练方法,提升模型的指令遵循、对话策略和角色一致性
- 搭建语音评测体系,覆盖内容质量、语音自然度、端到端时延、打断响应及复杂环境鲁棒性
- 跟进并复现 Speech LLM 领域前沿工作,推动研究成果在互动数字人场景落地
任职要求
- 本科及以上学历,计算机、人工智能、电子信息、自动化、数学等相关专业
- 熟悉 Python 和 PyTorch,具备良好的工程实现与实验分析能力
- 理解 Transformer、注意力机制、LLM 训练与自回归生成等基本原理
- 熟悉至少一个相关方向:ASR、TTS、音频编解码器、Speech LLM、对话系统、角色扮演
- 能够阅读英文论文,并独立完成论文复现、实验设计和结果分析
- 具备良好的沟通能力、问题拆解能力和研究主动性