AI 模型评测专家 - 星布谷地
Company Mihoyo
Focus Tech · Backend
Location 上海, 北京
Published January 7, 2026
岗位职责
1)评测体系搭建:负责游戏体验与角色扮演场景下大模型的全链路评测体系建设,设计覆盖多维度的评测指标体系(如角色一致性、对话连贯性、情感表现力、安全性、创意性等),建立从数据构建→评测执行→结果分析→问题定位→模型迭代的完整评测流水线 2)自动化评测方案:设计并落地多层级自动化评测方案,包括但不限于:基于规则/脚本的自动化测试、训练专用评测小模型(Reward Model/Classifier)、基于大语言模型的 LLM-as-Judge 评估、基于 Rubric 的生成式评分方案,持续提升评测效率与覆盖度 3)人工评估与标注管理:设计人工评估方案与标注规范,管理标注团队与标注流程,建立人工评估与自动化评估的校准机制,确保评测结果的可靠性与一致性 4)数据飞轮与持续迭代:构建"评测—发现问题—数据积累—模型优化—再评测"的数据飞轮闭环,系统性沉淀 Bad Case 库、评测集、评测基准,支撑模型团队快速实验迭代 5)深度分析与问题定位:深入分析评测结果,挖掘模型在开放域对话中的能力短板(如记忆遗忘、共情差、逻辑冲突等),输出可执行的优化建议,与算法、产品团队协作推动模型持续改进 6)前沿跟踪与方法创新:跟踪业界对话/角色扮演评测的前沿方法(如 Agent 评估框架、多轮对话评估基准、主观开放域评估方法论),引入并适配适合游戏场景的评测工具与方法
任职要求
1)本科及以上学历,计算机科学、人工智能、NLP、数据科学等相关专业 2)2年以上AI/NLP领域相关经验,有大模型评测体系搭建、模型质量保障、或对话系统评估的实际项目经验 3)有开放域对话、角色扮演、或聊天产品相关的评测或业务经验,深刻理解无标准答案场景下的评估难点与方法论 4)具备模型训练经验(SFT/RLHF/DPO),能够训练或微调评测用小模型(如 Reward Model、分类器等),了解 LLM 基本原理与 Agent 构建 5)熟悉人工评估流程设计与标注管理,有过标注方案设计、标注质量控制、标注数据管理的经验 6)熟悉 LLM-as-Judge、基于 Rubric 的生成式评估等自动化评测方法,有实际落地经验 7)掌握 Python 等编程语言,具备自动化评测脚本开发与评测平台搭建能力,熟悉 CI/CD 集成流程 8)具备优秀的数据分析能力,善于从大量对话数据中发现问题模式、定位 Bad Case、提炼优化方向