ATH事业群-语音/音视频大模型算法工程师-北京/杭州Company AliyunFocus Tech · AlgorithmLocation 北京, 杭州Published August 28, 2026岗位职责 语音/音视频大模型业务交付:负责 ASR/TTS/Omni 等语音及音视频多模态大模型在 ToB 商业化场景中的适配、调优与上线,围绕客户可感知的效果指标(识别准确率、合成自然度、响应延迟等)完成从评测到生产的全链路闭环。 业务问题定位与解决:深入真实业务场景,诊断模型在复杂条件下的效果退化问题(噪声、口音、领域术语、实时性约束等),设计并落地针对性优化方案。 客户需求转化:作为算法侧接口人参与客户技术对接,将业务诉求翻译为可执行的算法方案,管理效果预期与交付节奏。 数据迭代闭环:建设业务数据回流、清洗、标注、训练、评测的飞轮机制,驱动模型在垂直场景中持续进化。 工程协同:与工程团队协作完成流式推理、模型压缩、A/B 实验等能力建设,确保方案可规模化部署。 任职要求 计算机、人工智能、信号处理等相关专业硕士及以上,3 年以上语音、音视频多模态算法工程经验。 扎实的语音、音视频算法和落地经验,熟悉主流模型架构,有微调(SFT/RL)及线上效果调优的完整项目经历。 有将模型能力转化为客户可量化收益的经验,善于在效果、工程约束、交付时间之间做取舍。 扎实的工程实现能力,能独立完成从数据处理、模型训练到评测分析的全流程;熟悉主流深度学习训练框架及分布式训练方案。 优秀的跨团队沟通能力,能适应多项目并行推进的节奏。 加分项: 有 ToB 语音多模态产品(客服、外呼、会议、教育等)的算法交付经验。 有大模型后训练(RL/GRPO/DPO)或端到端多模态模型的落地经验。 有多模态音视频理解、agent相关经验(如语音、音频、视频内容的联合理解与分析、音画对齐、跨模态对齐等),熟悉多模态大模型者优先。 岗位标签 NEW