jdwatch
  • Home
  • CLI
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

蚂蚁集团-大模型评测工程师-蚂蚁保

Company Antgroup

Focus Tech · Algorithm

Location 北京, 杭州

Published August 6, 2026

岗位职责

  1. 负责蚂蚁保险“蚁小保”相关业务的功能测试,包括接口、服务端、端到端及回归测试,保障核心业务链路质量;
  2. 参与大模型、Agent、RAG 等 AI 能力评测,完成评测指标设计、评测集构建、自动化评测及结果分析;
  3. 负责评测数据的采集、清洗、标注和难例沉淀,持续提升数据质量和评测覆盖度;
  4. 开发测试脚本、自动化工具及评测能力,提升测试和评测效率;
  5. 分析并定位模型效果、系统功能及数据链路问题,协同产品、研发和算法团队推动问题闭环。

任职要求

  1. 具备软件测试基础,熟悉功能测试、接口测试、回归测试及常见用例设计方法;
  2. 具备一定研发能力,熟悉 Python、Java 等至少一种编程语言,能够独立编写测试或数据处理工具;
  3. 熟悉 Linux、SQL、日志分析和接口调试,具备基本的问题排查能力;
  4. 对大模型、Agent、RAG、Prompt 和 AI 评测有兴趣,愿意深入参与相关能力建设;
  5. 具备良好的业务理解、问题分析和跨团队协作能力。 加分项:
  6. 有大模型评测、AI 测试、自动化测试或测试平台建设经验;
  7. 有数据清洗、评测集构建、LLM-as-a-Judge 或难例分析经验;
  8. 有保险、金融、支付等复杂业务系统测试经验。

岗位标签

NEW

特色标签

AI智能体、API测试、API验证、H5/小程序测试经验、Java、Jira、MySQL、Postman、Python、Shell、保险、功能测试、回归检查、回归验证、困难样本、基础模型、大模型打分、大模型评审、大模型评阅、大语言模型、对话代理、异常样例、接口验证、提示、提示工程、提示词、支付、数据净化、数据清理、数据预处理、智能体、检索增强、检索增强生成、测试工具、测试集、知识增强生成、自动化测试、自动化测试经验、评价集合、评估数据集、边界样例、迭代回归、金融、预训练模型

You'll be redirected to the official careers page. You can also sign in to save jobs and search more roles.