【蚂蚁星】AI工程师-大模型评测-27届
Campus/Intern
Company Antgroup
Focus Tech · Backend
Location 杭州
Published May 14, 2026
岗位职责
- 评测体系设计与平台化落地:主导设计数据驱动的LLM/多模态/Agent评测体系,建设自动化评测分析能力,支持在平台上完成评测任务的适配、调度与规模化分析;
- 评测洞察与缺陷定位:基于对抗性分析、错误归因、能力边界挖掘等方法,系统定位模型在金融、医疗、小程序/APP等场景的核心短板,推动形成“评测-反馈-优化”的技术闭环;
- Benchmark与数据资产建设:负责评测数据采集、清洗、标注、版本管理与标准制定,构建高质量、多样化的Benchmark资产;
- 前沿评测范式探索:追踪全球前沿Benchmark与评估技术,研究RLHF/DPO等对齐数据驱动的新评估范式,探索仿真环境、Agent链路评测等新方法,保持技术领先。
任职要求
- 核心参与过业界知名的开源评测项目或 Benchmark 建设;
- 在 NeurIPS、ICML、ACL、EMNLP 等相关顶会发表过高质量论文;
- 优秀的数据敏感度与逻辑分析能力,能从复杂数据中定位关键问题并给出可落地方案;
- 深入理解大模型全链路:训练、推理、微调、评估与对齐。
特色标签
AI代理、DPO、ETL设计/开发经验、LLMs、Python、RLHF、Shell、SQL、人类对齐、保险、信贷、分布式系统开发经验、分布式训练、医疗、医疗垂类、医疗应用、医疗领域、发表算法相关优秀论文、基准、基准数据集、多模态大模型、多模态模型、多模态算法、大型语言模型、大数据处理工具(Spark/Hadoop/Hive)、大数据处理经验、大数据开发经验、大模型、大模型算法、大语言模型、强化学习、支付、数据分析/挖掘经验、数据安全、数据挖掘、智能代理、智能体、有留学背景、机器学习建模经验、根因分析、测评、测试、深度学习、熟悉Linux环境、理财、电商、缺陷定位、聊天机器人、自然语言处理算法、自然语言处理经验、英美留学生、计算机相关专业、评估、评测基准、超大规模模型、跨模态、金融、金融垂类、金融应用、金融行业数据相关经验、金融领域、错误诊断