【LongCat大模型人才校招】语音大模型算法研究员

Campus

Company Meituan

Focus Tech · Algorithm

Location 北京, 上海

Published June 3, 2026

岗位职责

LongCat 是美团基础研发自主研发的大模型,覆盖语言、视觉、语音、具身全栈。LongCat 相继推出 LongCat-Flash、LongCat-Flash-Thinking、LongCat-Flash-Omni 等系列模型,正在构建支撑 LongCat全场景的语音大模型。加入团队你将参与如下工作:

  1. LLM-ASR 模型演进,研究端到端语音识别大模型的架构与训练范式,攻克复杂声学、多说话人、专业术语热词等核心场景。

  2. 下一代 TTS 模型探索,研发上下文感知的语音合成大模型,攻克音色 / 情绪 / 语速 / 方言多属性可控、首包延时与自然度的平衡,逼近真人级表达力。

  3. 声纹与说话人建模,研究大规模声纹基座模型与多说话人分离算法,构建早期注入、多场景泛化的声纹能力底座。

  4. 语音与多模态融合探索,研究语音表征与 LLM、视觉模态的统一建模范式,作为 Omni 模型的语音底座,支撑下一代多模态实时交互。 【为什么是我们】

  5. 全栈顶配算力支持,依托美团大规模算力集群,提供千卡至万卡级算力支持,具备成熟的分布式训练与低延迟推理优化栈,保障 世界动作模型与 VLA 大规模训练。

  6. 与优秀人才同行,你将与行业顶尖的大模型研究员及机器人领域专家并肩作战,共同攻克具身智能的技术难点。

任职要求

  1. 计算机、电子工程、声学、人工智能等相关专业硕士/博士学位,具备扎实的语音信号处理或语音机器学习理论功底;
  2. 在 ICASSP / Interspeech / NeurIPS / ICLR / ACL 等顶级会议发表过高水平论文者优先;
  3. 深入理解 ASR / TTS / Speaker Verification / Speech LM / Audio Tokenization 等至少一项前沿技术;
  4. 精通 PyTorch,具备大规模分布式训练(千卡及以上集群)或大规模语音数据管线构建经验;