蚂蚁集团-AI质量评测工程师-芝麻企业信用
Company Antgroup
Focus Tech · Backend
Location 杭州
Published August 4, 2026
岗位职责
● 负责AI产品、大模型(LLM)、智能Agent等系统的质量评测体系建设。 ● 设计并执行模型效果评估方案,包括准确率、稳定性、安全性、鲁棒性、幻觉率等指标。 ● 建立Prompt评测、RAG评测、Agent任务评测及自动化Benchmark体系。 ● 构建AI评测数据集,包括测试集、对抗样本、红队数据、安全样本等。 ● 负责模型输出质量分析,定位问题并推动算法、数据、Prompt优化。 ● 开发自动化评测工具与平台,提高AI测试效率与覆盖率。 ● 与算法、数据、产品、研发团队协作,推动AI产品质量持续提升。 ● 跟踪行业评测标准与前沿Benchmark体系。 ● 建立AI上线前后的质量监控与回归测试机制。
任职要求
本科及以上学历,计算机、人工智能、数学、统计学等相关专业。 1年以上算法评测或AI相关经验。 熟练掌握Python,具备自动化测试或数据分析能力。 理解大模型(LLM)基本原理与常见问题,如幻觉、提示词注入、 上下文污染 了解AI评测和常见评测指标 熟悉Prompt测试与对抗测试方法。 能独立构建测试Case与Benchmark数据集。 熟悉自动化测试框架与评测流水线。
岗位标签
NEW
特色标签
Agent系统、AI安全性、Prompt测试、Python、RAG测试、人工智能、功能测试、合规、大模型、大语言模型、安全、幻觉检测、抗干扰能力、推理稳定性、提示词评测、攻防对抗经验、数据安全、智能体、检索增强生成评测、模型准确率、模型安全性、模型稳定性、模型鲁棒性、生成幻觉、自动化测试、自动化测试经验、计算机相关专业、金融、风控