大模型评测研究实习生

Intern

Company Antgroup

Focus Tech · Algorithm

Location 杭州

Published July 15, 2025

岗位职责

  1. 设计与开发评测方案: 围绕大语言模型和多模态大模型的各项能力,设计科学、公正、全面的评测(Benchmark)方案和对应的数据集。
  2. 搭建评测平台: 参与或负责自动化评测系统的开发、部署和维护,提升模型迭代和评测效率。
  3. 执行与分析: 对主流的开源及闭源大模型进行系统性评测,并对自研模型进行深度分析,撰写评测报告,为模型的优化方向提供数据支持。
  4. 追踪前沿动态: 持续关注业界最新的大模型评测方法、基准和技术,并将其应用到实际工作中。

任职要求

  1. 教育背景: 计算机科学、人工智能、机器学习、数学或相关专业的本科及以上学历。
  2. 编程能力: 熟练掌握 Python、PyTorch。
  3. 技术理解: 对大语言模型(LLM)有基本的认识,了解其工作原理和主要应用场景。
  4. 逻辑分析: 具备优秀的数据分析能力和逻辑思维,能够从评测结果中发现问题并提出见解。
  5. 加分项(非必需): ꔷ 有大模型使用、微调或评测相关经验者优先。 ꔷ 有数据科学、NLP 项目或相关研究经验者优先。 ꔷ 熟悉常用的模型评测数据集者优先。有良好英文文献阅读能力者优先。

特色标签

Benchmark、Python、Python开发、主流开源数据集、多模态大模型、多模态算法、大模型算法、大语言模型、数据分析、数据分析能力、数据挖掘、数据科学、方法研究、深度学习框架、研究经验、神经网络框架、编程语言、自动化评测、自然语言处理、自然语言处理算法、英文学术文献、英文阅读、评测数据集、评测方案、语言模型