jdwatch
  • Home
  • CLI
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

Token Foundary事业部-多模态通用音频大模型算法工程师/专家-未来生活实验室

Company 通义实验室

Focus 技术 · 算法

北京, 杭州

July 30, 2026

岗位职责

  1. 负责音频生成大模型研发(文生音频、音频编辑、音色克隆、音效合成等),产出高保真、可控的生成方案并推动落地;

  2. 研发音频理解大模型,构建跨模态(文本、图像、视频与音频联合)的细粒度音频内容描述体系;

  3. 搭建大规模多源通用音频数据集(音乐、语音、环境声等),支撑模型持续迭代;

  4. 推动音频大模型在业务场景中落地,解决推理效率、可控性、实时性等工程问题;

  5. 跟进行业前沿,保持团队在通用音频大模型领域的技术领先。

任职要求

1、学历经验:硕士及以上,1年以上音频/语音/音乐生成大模型研发经验。

2、核心技术:精通音频生成算法,对DiT、Flow Matching、MLLM、vocoder等技术有自己的理解和实操经验。

3、底层技术:熟悉音频表征(HuBERT/WavLM等)及高音质编解码方案(EnCodec/DAC等),对音质敏感。

4、多模态能力:有 AudioLDM、MusicGen、Qwen-Audio 等多模态音频大模型开发经验者优先。

5、工程与科研:Python/C++ 基础扎实,熟练使用 PyTorch/DeepSpeed;有 ICASSP/Interspeech 顶会论文或乐理/声学背景者加分。

(注:满足以上任意3项即可)

岗位标签

NEW

Apply now

You'll be redirected to the official careers page. You can also sign in to save jobs and search more roles.