阿里控股-大模型评测-音视频 Caption 评测专家
Company Alibaba
Focus Tech · Algorithm
Location 北京, 杭州
Published September 16, 2026
岗位职责
- 负责音视频 Caption 中音频内容的评测体系建设,覆盖语音、环境声、声音事件、音乐、复杂声景及声画关系。
- 主导评测数据集建设,包括任务定义、场景设计、样本采集、标注规范、质量控制和难例补充。
- 建立 Caption 评测标准,重点评估内容正确性、信息完整性、描述粒度、时间与声源定位、声画一致性,以及幻觉、遗漏和错误归因等问题。
- 设计人工评测与自动评测相结合的方案,建设自动化评测链路,并持续验证自动评分与人工判断的一致性。
- 开展模型对比、版本回归和典型案例分析,识别模型能力边界,输出清晰、专业、可执行的评测报告。
- 与模型研发、数据和产品团队协作,将评测结论转化为数据补强、模型训练及产品体验优化建议。
任职要求
- 本科及以上学历,声学、语言学、计算机、多媒体等相关专业优先。
- 具备音频、多模态或大模型评测相关经验,有评测体系、评测数据集或规模化评测项目经验。
- 具备扎实的音频内容理解能力,熟悉语音、环境声、声音事件、音乐或复杂声景中的至少两个方向。
- 熟悉 Audio Caption、音频理解或多模态理解任务,了解主流模型、公开数据集、评测基准和常见指标。
- 能够独立完成评测任务定义、数据分层、标注规范、质量控制、指标设计和结果分析。
- 具备良好的数据分析能力,能够进行模型对比、错误归因和典型案例分析。
- 熟悉 Python 及常用音频处理、数据分析工具,能够完成基础自动化评测链路建设。
- 具备良好的文档写作和跨团队沟通能力,能够输出专业评测结论并推动落地。
岗位标签
NEW