预训练评测算法工程师

Company Mihoyo

Focus Tech · Algorithm

Location 上海, 北京

Published January 7, 2026

岗位职责

我们希望你参与

  • 建设可持续演进的大模型评测体系;
  • 提升评测自动化程度与评测效率;
  • 推动评测数据、评测框架与评测方法持续迭代;
  • 用系统化评测驱动模型能力提升。
  1. 负责大语言模型(LLM)评测体系建设,包括评测方案设计、评测指标定义、评测流程标准化等,建立可持续演进的评测能力体系;
  2. 负责 Public Benchmark 与 In-house Benchmark 的建设与维护,包括评测集构建、数据清洗、版本管理、持续迭代与优化;
  3. 根据模型迭代重点与业务需求,持续补充评测维度,动态优化评测集结构,提升评测集有效性与区分度;
  4. 深入分析模型能力边界与问题分布,识别模型优势、短板与退化风险,建立问题发现与质量拦截机制;
  5. 跟踪行业模型发展趋势,对主流模型进行横向评测与能力分析,量化模型能力变化与行业水平;
  6. 参与模型训练与迭代过程中的评测建设,支撑模型研发闭环。

任职要求

职位要求

  1. 本科及以上学历;
  2. 熟练掌握 Python,了解 Pytorch, Megatron, vLLM;
  3. 具备较强的问题分析能力、实验设计能力、自主探索能力;
  4. 有大模型评测相关经验,包括但不限于Benchmark 构建、数据集建设、模型能力分析等;
  5. 有 LLM Eval 相关经验,对模型训练与迭代过程中的评测方法有一定理解;
  6. 熟悉开源 Benchmark、评测框架或评测方法论,对评测集构建、优化与质量分析有实践经验;
  7. 熟悉 lm-evaluation-harness 等大模型开源评测框架。