蚂蚁集团-AI评测专家-杭州/重庆
Company Antgroup
Focus Tech · Backend
Location 杭州, 重庆
Published October 8, 2026
岗位职责
- 评测体系构建: 设计并开发全面、客观、可量化的AI模型评测方案,涵盖能力、性能、安全、伦理等多个维度。
- 基准测试与执行:
- 熟练运用和改造现有的主流评测基准(如 MMLU, GSM8K, HumanEval, BIG-Bench, MT-Bench, HELM 等)。
- 针对具体业务场景,设计并构建定制化的评测数据集(包括指令编写、数据清洗、质量评估)。
- 执行自动化与人工评测,确保评测过程的高效与准确。
- 深度分析与洞察:
- 对评测结果进行深度分析,定位模型的能力强项、缺陷与失败模式。
- 探究模型在不同任务、领域和提示词下的表现差异。
- 撰写详尽的评测报告,清晰地呈现结论,并提出模型改进或应用策略建议。
- 工具与平台建设: 参与或主导内部评测工具、平台和流程的建设,提升评测的自动化水平与规模化能力。
- 前沿追踪: 紧密跟踪业界最新的模型动态、评测方法学与研究进展,并快速应用到实际工作中。
任职要求
-
学历与经验: 计算机科学、人工智能相关专业本科及以上学历.
-
技术理解: 对机器学习、深度学习,特别是大语言模型的基本原理有一定的了解。
-
编程能力: 熟练掌握 Python,进行数据处理和分析。具备良好的脚本编写能力以自动化评测流程。
-
评测方法论: 了解主流的AI评测基准和方法,具备设计评测实验和控制变量的科学思维。
-
数据分析能力: 具备强大的数据分析能力,能够从复杂数据中提炼核心洞察,并熟练使用图表进行可视化呈现。
-
沟通协作: 出色的书面和口头沟通能力,能够清晰地撰写报告并与研发、产品等团队高效协作。 优先考虑:
-
具备构建评测数据集的经验。
-
对模型的安全性、偏见、鲁棒性等领域有深入理解和评测经验。
-
具备Prompt Engineering的丰富经验,能够设计复杂的提示词来激发和检验模型能力。
岗位标签
NEW
特色标签
API测试、Golang、Java、Java开发、Java编程、Jira、Linux、Linux环境、Linux系统、Postman、Python、Python开发、Python脚本、SDK测试经验、Shell、SQL、TestNG、Web测试经验、代码测试、功能测试、大型模型、大规模模型、客户端开发经验、接口验证、数据建模、智能学习、测试专家、测试场景、测试工程师、测试方案、测试案例、测试策略、结构测试、自动化测试、自动化测试经验、计算机相关专业