【蚂蚁星】AI工程师-大模型评测(实习)
Campus/Intern
Company Antgroup
Focus Tech · Backend
Location 杭州
Published March 26, 2026
岗位职责
- 评测体系设计与平台化落地:主导设计数据驱动的LLM/多模态/Agent评测体系,建设自动化评测分析能力,支持在平台上完成评测任务的适配、调度与规模化分析;
- 评测洞察与缺陷定位:基于对抗性分析、错误归因、能力边界挖掘等方法,系统定位模型在金融、医疗、小程序/APP等场景的核心短板,推动形成“评测-反馈-优化”的技术闭环;
- Benchmark与数据资产建设:负责评测数据采集、清洗、标注、版本管理与标准制定,构建高质量、多样化的Benchmark资产;
- 前沿评测范式探索:追踪全球前沿Benchmark与评估技术,研究RLHF/DPO等对齐数据驱动的新评估范式,探索仿真环境、Agent链路评测等新方法,保持技术领先。
任职要求
- 核心参与过业界知名的开源评测项目或 Benchmark 建设;
- 在 NeurIPS、ICML、ACL、EMNLP 等相关顶会发表过高质量论文;
- 优秀的数据敏感度与逻辑分析能力,能从复杂数据中定位关键问题并给出可落地方案;
- 深入理解大模型全链路:训练、推理、微调、评估与对齐。
特色标签
Agent系统、AI Agent、Alignment数据、Direct Preference Optimization、LLM评估、Python、Reinforcement Learning from Human Feedback、Shell、SQL、人反馈对齐、人类偏好数据、人类反馈强化学习、偏好优化、偏好对齐、偏好数据、分布式训练、医疗、发表算法相关优秀论文、图文模型、基准数据集、基准测试、多模态大模型、多模态模型、多模态算法、大数据处理工具(Spark/Hadoop/Hive)、大模型测评、大模型算法、大模型能力评测、大模型评估、对齐数据集、小程序/APP、强化学习、数据收集、数据构建、数据采集流程、智能体、有留学背景、机器学习、标准数据集、模型短板分析、深度学习、直接偏好优化、缺陷定位、能力缺陷识别、自主智能体、自动化评测平台、自然语言处理算法、评估平台、评测基准、评测工具链、评测数据获取、评测系统、跨模态、边界检测、金融