jdwatch
  • Home
  • CLI
  • Skills
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

数据技术及产品部-语音数据Agent算法专家-杭州/北京

Company Alibaba

Focus Tech · Algorithm

Location 北京, 杭州

Published August 18, 2026

岗位职责

  1. 设计和实现面向语音数据生产的 Agent/Agentic Workflow 模块,将大模型、Speech/Audio 模型、Prompt、规则和工具组合成可验证、可回归、可监控的自动化生产能力。
  2. 根据个人主责模块,承接自动/辅助标注、AI 质检、LLM/Model Judge、置信度校准、风险分层、abstention 或人机路由中的部分能力;不要求单人同时亲自实现全部模块。
  3. 建立所负责模块与人工 Gold 对齐的质量评估、误差分析和生产决策阈值,在给定质量约束下提高可信自动化覆盖率。
  4. 建设开发集、回归集和长尾 challenge set,完成离线实验、badcase taxonomy、版本回归、漂移监控和持续优化;向独立验证团队提出冻结测试覆盖需求,但不自行审批上线。
  5. 通过 Shadow Test、小流量试产、A/B Test 或其他可审计实验,证明方案在质量、覆盖率、人效和单位成本上的实际收益,并设计 stop/rollback 条件。
  6. 与语音模型算法、数据处理、生产质量、数据策略和平台工程合作,把 Agent 接入真实生产链路。

任职要求

  1. 5 年及以上算法、机器学习或大模型相关经验。
  2. 至少具备一类真实生产系统经验:Agent/Workflow、自动化模型评测、LLM-as-Judge、数据质量算法、自动/辅助标注、AI 质检或 Human-in-the-loop 决策系统。
  3. 能使用 Python 独立完成算法原型、评测 pipeline 和生产接入所需核心代码,具备结构化输出、tool calling、retry/fallback、trace/replay 和版本化意识。
  4. 理解监督学习、分类/排序、统计评测、概率与不确定性,能够把模型 score 转换成生产决策阈值。
  5. 理解 Judge 偏差、人工 Gold、inter-rater agreement、置信度校准、precision-at-auto-accept、false-accept、coverage-risk、selective prediction 和 abstention。
  6. 能设计 Shadow、小流量或 A/B 实验,理解质量、coverage、人工返工、成本、延迟、fallback 和分群长尾之间的关系。

优先级加分:

  1. 理解语音生产中的噪声、远场、重叠说话、diarization、VAD、方言/口音、LID/code-switch、长音频、TN/ITN、ASR hallucination、TTS 音质/韵律/音色和 turn-taking 等问题。