蚂蚁集团-AI算法评测工程师-端智能
Company Antgroup
Focus Tech · Testing
Location 杭州
Published August 5, 2026
岗位职责
- 评测体系与标准构建:负责AI Agent、LLM(大语言模型)及VLM(视觉语言模型)的效果与性能评测体系建设。协同算法与产品团队,拆解业务场景,定义科学、客观且可量化的评测指标(Metrics),构建覆盖多场景、多难度等级的Benchmark。
- 评测数据集建设与管理:设计并构建高质量、多样化的评测数据集(包括指令微调数据、偏好对齐数据等)。建立数据清洗、去重、质量校验的标准流程(SOP),确保评测数据的准确性与代表性,解决数据污染问题。
- 自动化评测平台开发:搭建高效、可扩展的自动化评测流水线(Evaluation Pipeline),实现从数据输入到报告生成的全流程自动化。研发基于LLM的自动化打分模型(Judge Model/Reward Model),通过Prompt Engineering或SFT提升自动评测与人工评测的一致性(Correlation)。
- 深度分析与算法迭代驱动:对评测结果进行多维度统计分析与Bad Case归因,输出可视化的深度评测报告。基于数据洞察发现模型短板,为算法优化、Prompt改进及数据合成提供明确方向,形成“评测-反馈-优化”的研发闭环,持续提升模型线上表现。
任职要求
- 计算机科学、人工智能、数学或相关专业本科及以上学历。
- 技术栈:精通Python编程,熟悉PyTorch/TensorFlow等深度学习框架;熟练掌握SQL,具备扎实的数据处理能力。
- 领域知识:深入理解LLM/VLM原理,熟悉主流开源模型(如Llama, Qwen等)及其生态。熟悉常见的LLM/VLM评测基准(如MMLU, GSM8K, HumanEval, MT-Bench, AlpacaEval等)及评测方法论。
- 模型能力:具备模型微调(SFT/RLHF)实战经验,能够训练或优化Judge Model用于自动化评估;具备优秀的Prompt Engineering能力。
- 综合素质:具备极强的逻辑思维与数据分析能力,对数据敏感,善于从复杂数据中发现规律;具备良好的沟通协作能力,能推动跨团队项目落地。
岗位标签
NEW
特色标签
Python、SQL、人工智能代理、判分模型、基准测试集、多模态大模型、多模态算法、大模型、大模型算法、大语言模型、奖励模型、强化学习、指令工程、提示工程、智能体、机器学习、模型加速/性能优化、测试数据集、深度学习、监督式微调、监督微调、算法工程化经验、自然语言处理算法、视觉语言模型、评估数据集、评估流水线、评测基准、评测流水线