蚂蚁集团-AI评测算法工程师-成都
Company Antgroup
Focus Tech · Algorithm
Location 成都
Published September 20, 2026
岗位职责
- 按照产品架构和业务要求,设计覆盖功能与非功能需求的评测策略,负责 AI/算法类产品的效果符合设计预期,保障系统稳定性;
- 面向复杂推理、Agentic Workflows 等前沿能力构建高难度评测集;开发支持万级并发、对接训练集群的评测流水线,实现 Checkpoint 边训边评与分钟级反馈;规模化落地LLM-as-a-Judge,解决开放式生成量化难题;对 Bad Case 做算法级归因,将洞察反馈 AI Research 团队,指导数据配比与合成数据生成;
- 研究评测相关新技术方法,攻克评测复杂技术/算法问题;
- 能结合AI行业发展趋势,制定合适的评测技术发展规划,提升团队技术视野和技术影响力。
任职要求
- 3 年以上互联网或传统行业算法/开发/测试经验,具备 1 年以上 AI/算法类产品评测经验(大模型 / 推荐 / 搜索 / NLP);有基座模型评测工程经验者优先;
- 熟悉算法服务测试场景(精度验证、AB 实验评估等),熟悉常用评测指标(准确率 / 召回率 / F1-score 等),掌握 Bad Case 归因与评测数据集构建方法;
- 熟悉主流算法框架,熟练使用 Python/Java 等编程语言,有评测流水线 / 工具平台开发经验优先;
- 对新质技术敏锐度高,能快速理解 AI 产品特性,具备技术攻关与团队协作能力。
岗位标签
NEW
特色标签
A/B测试、Bad Case分析、Benchmark、F1值、F1度量、F1指标、Java、Python、Recall、人工智能产品、保险、信贷、基础模型评估、大模型算法、大模型自评、大模型裁判、大模型评估器、大模型评测、实验评估、对照实验、异常样本归因、推荐算法、搜索算法、支付、智能体产品、机器学习、检回率、模型评估、测试集、深度学习、理财、算法产品、算法工程化经验、算法效果评测、自动评测流程、自然语言处理算法、评估工具链、评估数据集、评估流水线、评估算法、金融、错误原因分析、预训练模型验证