蚂蚁集团-垂类模型评测科学家-北京/杭州/上海【AGI专项】
Company 蚂蚁集团
Focus 技术 · 算法
北京, 上海, 杭州
July 29, 2026
岗位职责
- 定义垂类行业大模型的“黄金标准”,构建涵盖合规性、事实性、逻辑推理及安全性的多维度评测体系。
- 负责搭建自动化评测平台与 Model-based Evaluation(以模评模)流水线,针对如金融研报分析、投资决策、风险控制等复杂场景建设高难度测试集(Hard Case)。
- 设计针对Agentic AI的动态评估框架,量化智能体在工具调用、多步决策及环境交互中的成功率与鲁棒性,通过精准的评测反馈驱动预训练与后训练的数据/策略迭代,形成“训练-评测-优化”的高效闭环。
任职要求
● 计算机科学、统计学、金融或相关专业背景,具备 NLP 或大模型评测系统搭建经验。 ● 熟悉主流评测框架及指标设计,掌握 Model-based Eval、众包评估质量控制及自动化测试技术。 ● 具备构建 Agent 动态评测环境(Sandbox/Simulation)的能力,能够设计针对工具调用(Tool Use)与长链路推理的量化评估方案。 ● 具备扎实的工程实现能力,熟悉 Python 及主流深度学习框架,能够处理大规模评测数据的清洗与分析。 ● 具备良好的数据敏感度,能够通过 Bad Case 分析反推模型缺陷,具备优秀的工程素养。 ● 具备较强的团队合作和沟通能力,能够与算法团队紧密配合,提供客观、可执行的优化建议。
加分项 ● Curiosity-driven(极强的好奇心,热衷于挖掘 Corner Case 与探索模型能力边界) ● Following the First Principle(坚持第一性原理解决问题) ● Interdisciplinary background(金融+计算机/数学的复合背景,既深入理解业务逻辑,又能将其转化为可量化的算法评测指标) ● Strong Algorithm & System Co-design capability(算法与系统协同设计的全局视野,能通过架构优化提升评测效率) ● High data sensitivity & Problem discovery(极强的数据敏锐度与问题洞察力) ● Full-stack coding skills(全栈工程能力)
岗位标签
NEW
特色标签
Python、Tool Use、人工智能、代理式人工智能、以模评模、功能调用、合规、多阶段推理、大模型算法、大语言模型、强化学习、智能体、智能评估平台、极限场景案例、模型驱动评估、测试工具、深度学习、算法工程化经验、缺陷归因分析、自动测试系统、自然语言处理算法、评价系统、评估框架、评测反馈闭环、迭代优化循环、金融、错误案例分析、长链路推理、风控、高难度测试集