Token Foundry-AI交互模型算法专家-北京/杭州
Company 通义实验室
Focus 技术 · 算法
北京, 杭州
July 30, 2026
岗位职责
- 负责面向AI手机等ToB场景的多模态交互模型研发,包括语音基础模型、视觉-语言模型(VLM)、全模态大模型的后训练(CPT/SFT/RL)与推理优化。
- 研发基于神经网络、扩散模型或大模型的端侧音频信号处理算法(如语音增强、降噪、去混响),提升复杂声学环境下的语音交互质量。
- 构建支持自然打断、精准判停、上下文感知的实时双工交互模型,实现低延迟、高鲁棒性的流式对话体验。
- 针对端侧资源约束,开展模型压缩、量化、蒸馏及高效部署,确保算法在DSP/NPU等嵌入式平台稳定运行。
- 与系统、产品团队紧密协作,推动算法从原型验证到大规模商用落地。
任职要求
- 计算机、人工智能、电子工程等相关专业硕士及以上学历,3年以上AI模型或音频算法研发经验。
- 在以下至少两个方向有扎实实践: ①基于神经网络/Diffusion/LLM的语音信号处理(增强、降噪、语音修复等) ; ②语音大模型、视觉-语言模型(VLM)或全模态(Omni)大模型的后训练(CPT/SFT/RL) ; ③双工交互核心技术:VAD、打断检测(Barge-in)、语义判停、流式响应。
- 熟练掌握PyTorch,具备大模型训练、调优及端侧部署经验。
- 有AI手机、IoT等智能终端项目落地经验,熟悉ARM/DSP/NPU架构者加分。
- 具备良好的工程能力、产品意识和跨团队协作精神,能平衡性能、延迟与功耗。
岗位标签
NEW