蚂蚁集团-AI算法评测工程师-支付宝技术

Company Antgroup

Focus Tech · Testing

Location 杭州

Published September 16, 2026

岗位职责

  1. 评测体系建设:面向大模型、智能体及多智能体协作场景,设计客观、可量化的评测方案,建立覆盖任务完成质量、推理规划、工具调用、稳定性、执行效率与成本等维度的评价标准;
  2. 评测数据与基准建设:结合真实业务需求,构建具有代表性和区分度的评测任务、数据集及运行环境;制定标注规范和评分标准,持续积累典型问题、复杂任务与边界案例,完善评测覆盖;
  3. 自动化评测方法研发:结合规则校验、可执行验证、模型评分与人工评价,研发适用于不同任务的评测方法;探索大模型作为评判器(LLM-as-a-Judge)的应用,校准评价偏差,提升评测准确性、一致性和效率;
  4. 效果分析与优化反馈:深入分析评测结果和智能体执行过程,定位模型能力、任务规划、工具使用及协作环节中的问题,形成清晰的评测报告与改进建议,并与算法、产品及工程团队协作验证优化效果;
  5. 评测工具与流程建设:参与评测平台和自动化流程建设,支持批量评测、版本对比、回归验证及结果追踪;将评测数据、方法和工具沉淀为可复用的团队资产,推动评测与算法迭代流程衔接;
  6. 前沿方法探索:持续关注大模型与智能体评测研究,结合实际业务验证新方法的适用性,提升评测对真实用户体验与任务效果的解释能力。

任职要求

  1. 专业基础:计算机、人工智能、数学、统计学等相关专业本科及以上学历,具备扎实的算法、机器学习与统计分析基础;

  2. 技术理解:理解大语言模型的基本原理,熟悉提示词、检索增强生成、工具调用及智能体工作流程,能够从算法视角分析效果差异与失败原因;

  3. 编程能力:熟练掌握 Python,具备良好的数据处理、实验开发和工程实现能力,能够独立完成数据分析与自动化评测流程开发;

  4. 评测方法:具备科学的实验设计能力,能够围绕业务目标定义评价指标,合理控制变量,关注样本代表性、结果可复现性及评价偏差;

  5. 实践能力:具备算法研发、模型效果分析或相关评测经验,能够结合具体案例说明问题定位、实验验证与效果改进过程;欢迎具有搜索、推荐、自然语言处理等算法背景,并有意深入评测方向的候选人;

  6. 综合素质:具备独立思考、清晰表达和跨团队协作能力,坚持客观评价;对大模型与智能体有持续探索兴趣,学习主动,愿意深入真实场景并动手解决问题; 加分项

  7. 具有大模型或智能体评测项目经验,参与过评测体系、评测数据集或自动化评测平台建设;

  8. 具有模型评分、人工评价一致性校准、偏好数据构建、鲁棒性评测等相关研究或实践经验;

  9. 具有复杂工具调用、多轮交互、多智能体协作等场景的开发或评测经验,能够结合执行过程分析端到端任务效果。

岗位标签

NEW

特色标签

AI Agent、AI代理、API调用、LLM、Python、Shell、函数调用、合规、回归测试、基准数据、外部工具集成、大模型算法、大模型评判器、大规模预训练模型、大语言模型、强化学习、性能分析、批量测评、推荐、推荐算法、搜索算法、支付、效果评估、数据安全、无人值守评测、智能体、有留学背景、机器学习、标注指南、标注标准、模型即裁判、测评体系、测试集、深度学习、版本对比测试、算法工程化经验、结果诊断、聊天机器人、自主代理、自动评估、自然语言处理算法、自评模型、评价指标系统、评估框架、评估语料、评分准则、迭代验证、金融