蚂蚁集团-AI算法评测工程师-支付宝技术
Company Antgroup
Focus Tech · Testing
Location 杭州
Published September 16, 2026
岗位职责
- 评测体系建设:面向大模型、智能体及多智能体协作场景,设计客观、可量化的评测方案,建立覆盖任务完成质量、推理规划、工具调用、稳定性、执行效率与成本等维度的评价标准;
- 评测数据与基准建设:结合真实业务需求,构建具有代表性和区分度的评测任务、数据集及运行环境;制定标注规范和评分标准,持续积累典型问题、复杂任务与边界案例,完善评测覆盖;
- 自动化评测方法研发:结合规则校验、可执行验证、模型评分与人工评价,研发适用于不同任务的评测方法;探索大模型作为评判器(LLM-as-a-Judge)的应用,校准评价偏差,提升评测准确性、一致性和效率;
- 效果分析与优化反馈:深入分析评测结果和智能体执行过程,定位模型能力、任务规划、工具使用及协作环节中的问题,形成清晰的评测报告与改进建议,并与算法、产品及工程团队协作验证优化效果;
- 评测工具与流程建设:参与评测平台和自动化流程建设,支持批量评测、版本对比、回归验证及结果追踪;将评测数据、方法和工具沉淀为可复用的团队资产,推动评测与算法迭代流程衔接;
- 前沿方法探索:持续关注大模型与智能体评测研究,结合实际业务验证新方法的适用性,提升评测对真实用户体验与任务效果的解释能力。
任职要求
-
专业基础:计算机、人工智能、数学、统计学等相关专业本科及以上学历,具备扎实的算法、机器学习与统计分析基础;
-
技术理解:理解大语言模型的基本原理,熟悉提示词、检索增强生成、工具调用及智能体工作流程,能够从算法视角分析效果差异与失败原因;
-
编程能力:熟练掌握 Python,具备良好的数据处理、实验开发和工程实现能力,能够独立完成数据分析与自动化评测流程开发;
-
评测方法:具备科学的实验设计能力,能够围绕业务目标定义评价指标,合理控制变量,关注样本代表性、结果可复现性及评价偏差;
-
实践能力:具备算法研发、模型效果分析或相关评测经验,能够结合具体案例说明问题定位、实验验证与效果改进过程;欢迎具有搜索、推荐、自然语言处理等算法背景,并有意深入评测方向的候选人;
-
综合素质:具备独立思考、清晰表达和跨团队协作能力,坚持客观评价;对大模型与智能体有持续探索兴趣,学习主动,愿意深入真实场景并动手解决问题; 加分项
-
具有大模型或智能体评测项目经验,参与过评测体系、评测数据集或自动化评测平台建设;
-
具有模型评分、人工评价一致性校准、偏好数据构建、鲁棒性评测等相关研究或实践经验;
-
具有复杂工具调用、多轮交互、多智能体协作等场景的开发或评测经验,能够结合执行过程分析端到端任务效果。
岗位标签
NEW
特色标签
AI Agent、AI代理、API调用、LLM、Python、Shell、函数调用、合规、回归测试、基准数据、外部工具集成、大模型算法、大模型评判器、大规模预训练模型、大语言模型、强化学习、性能分析、批量测评、推荐、推荐算法、搜索算法、支付、效果评估、数据安全、无人值守评测、智能体、有留学背景、机器学习、标注指南、标注标准、模型即裁判、测评体系、测试集、深度学习、版本对比测试、算法工程化经验、结果诊断、聊天机器人、自主代理、自动评估、自然语言处理算法、自评模型、评价指标系统、评估框架、评估语料、评分准则、迭代验证、金融