蚂蚁集团-AI评测专家-杭州/重庆

Company Antgroup

Focus Tech · Backend

Location 杭州, 重庆

Published October 8, 2026

岗位职责

  1. 评测体系构建: 设计并开发全面、客观、可量化的AI模型评测方案,涵盖能力、性能、安全、伦理等多个维度。
  2. 基准测试与执行:
  • 熟练运用和改造现有的主流评测基准(如 MMLU, GSM8K, HumanEval, BIG-Bench, MT-Bench, HELM 等)。
  • 针对具体业务场景,设计并构建定制化的评测数据集(包括指令编写、数据清洗、质量评估)。
  • 执行自动化与人工评测,确保评测过程的高效与准确。
  1. 深度分析与洞察:
  • 对评测结果进行深度分析,定位模型的能力强项、缺陷与失败模式。
  • 探究模型在不同任务、领域和提示词下的表现差异。
  • 撰写详尽的评测报告,清晰地呈现结论,并提出模型改进或应用策略建议。
  1. 工具与平台建设: 参与或主导内部评测工具、平台和流程的建设,提升评测的自动化水平与规模化能力。
  2. 前沿追踪: 紧密跟踪业界最新的模型动态、评测方法学与研究进展,并快速应用到实际工作中。

任职要求

  1. 学历与经验: 计算机科学、人工智能相关专业本科及以上学历.

  2. 技术理解: 对机器学习、深度学习,特别是大语言模型的基本原理有一定的了解。

  3. 编程能力: 熟练掌握 Python,进行数据处理和分析。具备良好的脚本编写能力以自动化评测流程。

  4. 评测方法论: 了解主流的AI评测基准和方法,具备设计评测实验和控制变量的科学思维。

  5. 数据分析能力: 具备强大的数据分析能力,能够从复杂数据中提炼核心洞察,并熟练使用图表进行可视化呈现。

  6. 沟通协作: 出色的书面和口头沟通能力,能够清晰地撰写报告并与研发、产品等团队高效协作。 优先考虑:

  7. 具备构建评测数据集的经验。

  8. 对模型的安全性、偏见、鲁棒性等领域有深入理解和评测经验。

  9. 具备Prompt Engineering的丰富经验,能够设计复杂的提示词来激发和检验模型能力。

岗位标签

NEW

特色标签

API测试、Golang、Java、Java开发、Java编程、Jira、Linux、Linux环境、Linux系统、Postman、Python、Python开发、Python脚本、SDK测试经验、Shell、SQL、TestNG、Web测试经验、代码测试、功能测试、大型模型、大规模模型、客户端开发经验、接口验证、数据建模、智能学习、测试专家、测试场景、测试工程师、测试方案、测试案例、测试策略、结构测试、自动化测试、自动化测试经验、计算机相关专业