岗位职责
深入参与 Alibaba Token Hub 事业群 MaaS 业务(Model as a Service)的核心算法研发,以前沿的技术驱动顶层业务创新,定义下一代 AI-Native 交互范式。面向真实应用场景,依托阿里强大的基座模型,打造行业SOTA的智能座舱解决方案。具体工作内容包括但不限于:
- 智能座舱 Agent 决策与任务编排:构建座舱场景下的 Agent 决策能力,包括工具/功能调用(导航、媒体、空调、车窗等)、多步任务规划与分解、基于行车上下文的服务主动触发、多 Agent 协同与仲裁等,实现"懂你、主动、能办事"的座舱智能交互范式。
- 智能座舱 Omni 大模型研发与落地:面向智能座舱场景构建端到端多模态多语言大模型能力,攻克流式语音交互、模态对齐、长时程上下文管理等核心问题,在 Omni 架构下保持并提升模型的对话智商与情商,支撑"边听边说边办事"的座舱交互体验。
- Agentic Search 与座舱知识推理能力建设:利用 Query Planning、大模型 Reasoning 和 Deep Search等技术,提升模型对车辆手册、本地生活、百科新闻等信息的检索、理解、推理与总结能力;重点攻克复杂知识问答、跨源信息整合、长链路任务查询及不确定信息处理场景,保障回复的准确性、可溯源性与可控性。
- 训练、推理框架与端云部署优化:掌握 vLLM / SGLang 等推理引擎的使用与优化,基于 Megatron / DeepSpeed 等框架,结合座舱 Omni 模型与端云协同部署特点进行定制化改造,探索端侧小模型与云端大模型协同推理,满足座舱对时延、成本与隐私的严苛要求。
- 训练数据、评测体系与模型持续迭代:参与座舱 Agent 训练数据、轨迹数据、工具调用数据、偏好数据及安全数据的构建,开展 SFT、RLHF、RLVR、Agentic RL 等模型迭代;建设覆盖意图理解、规划质量、工具调用成功率、任务完成率、回复准确性、时延、幻觉率与安全性的评测体系,基于线上反馈形成数据飞轮,持续推动 Agent 能力进化。
任职要求
- 技术积淀:计算机、人工智能、数学等相关专业硕士/博士学位,在机器学习、信息检索、自然语言处理、语音处理等领域具备深厚的基础理论;
- 实战经验和工程能力:具备深入理解主流对话系统架构及优化经验;掌握大模型后训练技术(如监督微调、强化学习对齐);有语音识别、TTS、声纹、唤醒词、VAD、视觉语言模型或端侧多模态模型经验;熟悉PyTorch等主流深度学习框架,对分布式训练(如DeepSpeed、Megatron)及模型推理加速有实战积累。
- 业务洞察:对 AI 云产品有热情,能够将复杂的算法逻辑转化为解决实际商业问题的能力,具备良好的沟通协作与项目管理能力。
- 加分项:
- 深入参与过端到端语音大模型或 Omni 多模态大模型的预训练 / 后训练全流程,熟悉语音编解码、流式生成、模态对齐等关键技术环节者优先;
- 熟悉智能体框架,在 Agentic RL、Agentic RAG、Deep Research 等有落地经验;
- 在NeurIPS/ICLR/ACL/Interspeech等顶会发表搜索、推荐、NLP、语音、大模型相关论文,在知名开源项目、相关领域竞赛中取得优异成绩。