岗位职责
- 负责全双工语音交互系统的核心算法研发,包括但不限于3A算法、流式语音端点检测(VAD)、说话人分离(Diarization)、话语权决策/轮次检测(Turn-taking)等模块的设计与优化;
- 探索并落地统一的音频理解前端,实现复杂场景下的多人对话理解与交互,解决复杂场景下的端到端语音识别与对话理解问题;
- 跟踪业界前沿的语音/音频技术发展(如最新深度学习架构在音频领域的应用),持续提升现有算法系统的性能与鲁棒性,解决实际业务中的长尾问题
任职要求
- 计算机、电子信息、自动化、声学或相关专业,统招本科及以上学历(硕士/博士优先);
- 具备扎实的音频信号处理或机器学习基础,有智能硬件/IoT设备等场景的音频算法落地与性能优化经验;
- 深入理解语音识别或音频理解系统,对基于大语言模型(LLM)的端到端语音识别与理解有深入研究和实践优化经验;
- 编程功底扎实,精通 Python 和 C/C++,熟练使用 PyTorch/TensorFlow 等至少一种主流深度学习框架;
【加分项】
- 在国内外知名语音/音频挑战赛(如 CHiME、DNS Challenge、Kaggle等)中获得过国际领先名次者优先;
- 在 ICASSP、Interspeech 等语音/音频领域顶级会议或期刊发表过高质量论文者优先。
特色标签
ASR、ASR+NLU联合建模、C/C++、CNN/RNN、DNN架构、Python、TensorFlow/PyTorch、云计算、交互时机判断、人机对话相关经验、前端语音理解、变压器架构、噪声抑制、回声消除、声学相关专业、声纹区分、多人语音上下文建模、多人说话人分割、大模型、大语言模型、实时语音切分、对话轮转预测、智能交互、智能终端、有国际期刊/会议论文发表、深度神经网络、物联网、物联网音频设备、统一语音理解、自动增益控制、自动语音识别、英文读写能力良好、计算机相关专业、话轮切换检测、语言大模型、语音、语音到意图识别、语音活动检测、语音识别工作经验、语音转文本、说话人辨识、边缘语音设备、通信/信号处理相关专业、金融、音频语义解析