jdwatch
  • Home
  • CLI
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

Token Foundry-语音多模态大模型算法工程师-Qwen Audio

Company 通义实验室

Focus 技术 · 算法

北京, 杭州

July 29, 2026

岗位职责

  1. 语音多模态大模型算法创新:面向下一代语音多模态通用大模型,探索并定义统一的技术范式,开展文本、语音等多模态的联合建模与协同推理研究,系统性解决多模态对齐、跨模态推理、Agentic 能力等核心挑战,持续推动模型能力与泛化上限。
  2. 场景驱动的算法创新:紧密结合真实业务场景(如智能交互、内容生成、跨模态检索等),设计并优化多模态大模型架构与训练策略,在保证效果领先的同时,持续提升模型效率、稳定性与鲁棒性,推动技术在复杂场景中的规模化落地。
  3. 前沿应用技术探索:跟踪并深度参与 LLM、多模态模型、Diffusion Models、强化学习等方向的前沿研究,快速完成技术验证与实验迭代,探索新建模范式与训练范式,持续刷新相关任务的 SOTA。"

任职要求

  1. 硕士及以上学历,计算机、人工智能等相关专业,3年以上语音大模型/多模态/跨模态相关的算法经验。
  2. 深入掌握深度学习、强化学习、表示学习等建模方法,在多模态建模和跨模态对齐等方面有深入研究。
  3. 在国际顶级计算机会议/期刊(如NeurIPS、ICLR、ICML、CVPR、ECCV、InterSpeech、ACL等)以一作身份发表过多篇论文;或在开源社区、竞赛中展示出引领性的研究成果。
  4. 良好的工程与实验思维:熟悉PyTorch/TensorFlow等主流框架,具备大规模语言/视觉模型调优经验,能高效实现定制化训练流程;重视代码质量与实验结果,追求“不仅work,而且高效优雅”。
  5. 技术热情与好奇心:有志于将AI从实验室推向真实业务场景,构建“可解释、可控制、可落地”的行业智能系统,善于从复杂的行业需求中提炼出核心AI建模问题,并设计创新性的解决方案。
  6. 善于跨团队协作:能与产品、基础研究团队高效沟通,平衡技术理想与落地实现。

岗位标签

NEW

Apply now

You'll be redirected to the official careers page. You can also sign in to save jobs and search more roles.