大模型评测研究实习生
Campus/Intern
Company Antgroup
Focus Tech · Algorithm
Location 杭州
Published July 15, 2025
岗位职责
- 设计与开发评测方案: 围绕大语言模型和多模态大模型的各项能力,设计科学、公正、全面的评测(Benchmark)方案和对应的数据集。
- 搭建评测平台: 参与或负责自动化评测系统的开发、部署和维护,提升模型迭代和评测效率。
- 执行与分析: 对主流的开源及闭源大模型进行系统性评测,并对自研模型进行深度分析,撰写评测报告,为模型的优化方向提供数据支持。
- 追踪前沿动态: 持续关注业界最新的大模型评测方法、基准和技术,并将其应用到实际工作中。
任职要求
- 教育背景: 计算机科学、人工智能、机器学习、数学或相关专业的本科及以上学历。
- 编程能力: 熟练掌握 Python、PyTorch。
- 技术理解: 对大语言模型(LLM)有基本的认识,了解其工作原理和主要应用场景。
- 逻辑分析: 具备优秀的数据分析能力和逻辑思维,能够从评测结果中发现问题并提出见解。
- 加分项(非必需): ꔷ 有大模型使用、微调或评测相关经验者优先。 ꔷ 有数据科学、NLP 项目或相关研究经验者优先。 ꔷ 熟悉常用的模型评测数据集者优先。有良好英文文献阅读能力者优先。
特色标签
Benchmark、Python、Python开发、主流开源数据集、多模态大模型、多模态算法、大模型算法、大语言模型、数据分析、数据分析能力、数据挖掘、数据科学、方法研究、深度学习框架、研究经验、神经网络框架、编程语言、自动化评测、自然语言处理、自然语言处理算法、英文学术文献、英文阅读、评测数据集、评测方案、语言模型