jdwatch
  • Home
  • CLI
  • Skills
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

ATH事业群-语音/音视频大模型算法工程师-北京/杭州

Company Aliyun

Focus Tech · Algorithm

Location 北京, 杭州

Published August 28, 2026

岗位职责

  1. 语音/音视频大模型业务交付:负责 ASR/TTS/Omni 等语音及音视频多模态大模型在 ToB 商业化场景中的适配、调优与上线,围绕客户可感知的效果指标(识别准确率、合成自然度、响应延迟等)完成从评测到生产的全链路闭环。
  2. 业务问题定位与解决:深入真实业务场景,诊断模型在复杂条件下的效果退化问题(噪声、口音、领域术语、实时性约束等),设计并落地针对性优化方案。
  3. 客户需求转化:作为算法侧接口人参与客户技术对接,将业务诉求翻译为可执行的算法方案,管理效果预期与交付节奏。
  4. 数据迭代闭环:建设业务数据回流、清洗、标注、训练、评测的飞轮机制,驱动模型在垂直场景中持续进化。
  5. 工程协同:与工程团队协作完成流式推理、模型压缩、A/B 实验等能力建设,确保方案可规模化部署。

任职要求

  1. 计算机、人工智能、信号处理等相关专业硕士及以上,3 年以上语音、音视频多模态算法工程经验。
  2. 扎实的语音、音视频算法和落地经验,熟悉主流模型架构,有微调(SFT/RL)及线上效果调优的完整项目经历。
  3. 有将模型能力转化为客户可量化收益的经验,善于在效果、工程约束、交付时间之间做取舍。
  4. 扎实的工程实现能力,能独立完成从数据处理、模型训练到评测分析的全流程;熟悉主流深度学习训练框架及分布式训练方案。
  5. 优秀的跨团队沟通能力,能适应多项目并行推进的节奏。

加分项:

  1. 有 ToB 语音多模态产品(客服、外呼、会议、教育等)的算法交付经验。
  2. 有大模型后训练(RL/GRPO/DPO)或端到端多模态模型的落地经验。
  3. 有多模态音视频理解、agent相关经验(如语音、音频、视频内容的联合理解与分析、音画对齐、跨模态对齐等),熟悉多模态大模型者优先。

岗位标签

NEW