Token Foundary事业部-音频算法专家/高级专家-未来生活实验室

Company Tongyi

Focus Tech · Algorithm

Location 北京, 杭州

Published September 20, 2026

岗位职责

  1. 研发前沿的音频大模型 (Audio-LLM),实现语音识别 (ASR)、语音合成 (TTS) 与音频理解的端到端融合。
  2. 优化多语种、情感化及高表现力的语音生成,提升在复杂环境(噪声、多人交谈)下的语义提取鲁棒性。
  3. 设计并优化多模态音乐生成模型,涵盖风格、韵律、和声、节奏等多维度生成任务。
  4. 探索音频 Tokenizer 优化,实现音频与 LLM 符号空间的对齐。

任职要求

  1. 熟悉主流音频架构(如 Whisper, VITS, AudioLM, Vall-E,CosyVoice);
  2. 精通音频信号处理及神经编解码器(Neural Codec);
  3. 有全双工、超低延迟流式语音交互系统(Real-time Interactive Voice)的落地经验者优先。

岗位标签

NEW