岗位职责
深入参与 Alibaba Token Hub 事业群 MaaS 业务(Model as a Service)的核心算法研发,以前沿的技术驱动顶层业务创新,定义下一代 AI-Native 交互范式。结合阿里云真实业务场景,基于语音与全模态大模型(Omni),打造行业领先的全双工语音交互能力,并将核心能力反哺至基座模型。具体工作内容包括但不限于:
- 全双工对话管理:构建"边听边说"场景下的对话决策能力,包括开口时机判断、话轮承接与打断策略、静默与让步控制等,实现自然流畅的人机对话体验。
- 语音端到端对话质量攻关:在多模态融合架构下保持并提升大模型的对话智商与情商,解决流式语音生成、模态对齐与业务能力落地等核心问题。
- 对话策略能力构建:通过强化学习(RLHF / RLVR / AgenticRL 等)提升模型在复杂对话场景中的策略能力,包括谈判博弈、施压引导、情绪感知与回应等,使模型在不同业务场景中具备"会说话"的能力。
- 训练和推理框架的深度使用:掌握vLLM/vLLM-Omni/SGLang/TensorRT/Triton 等推理引擎的使用与优化,基于 Megatron/DeepSpeed/veRL/ROLL 等框架,结合语音与 Omni 模型特点定制化改造与优化。
- 训练数据与模型迭代:参与训练数据构建、模型微调(SFT / RLHF / RLVR / AgenticRL 等)及线上效果的持续迭代,形成数据飞轮驱动的模型持续进化能力。
任职要求
- 计算机、人工智能、语音信号处理等相关专业硕士/博士学位,在对话系统、语音交互等领域具备扎实的理论基础。
- 实战经验与工程能力:
- 掌握Megatron-LM/DeepSpeed等训练框架,具有大模型分布式训练经验;掌握 vLLM/vLLM-Omni/SGLang/TensorRT/Triton等推理框架,了解 KV Cache 管理、Continuous Batching、量化、投机解码等技术。
- 具有丰富的对话系统/语音对话/全双工交互方向算法经验。
- 扎实的大模型基础,熟悉LLM的训练与微调全流程,在 SFT/RL/OPD 等方向有深入的实践经验。
- 熟悉主流语音端到端模型如Moshi及全模态大模型(如 Qwen-Omni等)架构。
- 有对话策略(谈判、共情、施压等)或强化学习对齐(RLHF / RLVR / AgenticRL)的实战经验。
- 对 AI 云产品和行业智能化升级有强烈兴趣,能将算法创新与客户业务痛点紧密结合,具备优秀的跨团队协作与项目推进能力。
- 加分项:
- 有全双工/流式语音对话系统的实际项目经验,熟悉WebSocket/WebRTC等通信协议。
- 在语音多模态端到端模型方向有论文或工程产出,在相关顶会发表论文(NeurIPS / ICLR / ACL / ICASSP / Interspeech)。
- 在LLM/TTS/Omni等模型的训练和推理上,能结合模型特点做定制化改造与性能调优。