岗位职责
- 负责大模型 Agent 系统的全流程评测工作,涵盖功能评测、性能评测、效果评测及稳定性评测,重点关注评测过程的稳定性保障与评测效率提升,搭建完善的评测体系与标准,确保 Agent 输出质量符合业务预期。
- 设计并执行大模型 Agent 的评测方案,包括评测数据集构建、评测指标定义、评测流程规划,重点针对长程任务场景开展专项评测,熟悉 SWE Bench、Terminal Bench、GAIA 等主流 Agent 评测 benchmark,能基于 benchmark 完成评测落地、结果分析与优化,同时覆盖 Agent 的任务完成率、响应准确性、逻辑连贯性、工具调用合理性等核心维度评测。
- 进行 Agent 运行轨迹分析与问题归因,梳理 Agent 在任务执行过程中的决策链路、工具调用流程、上下文交互等关键环节,定位输出异常、性能瓶颈、逻辑漏洞等问题,形成详细的归因报告并推动优化。
- 结合算法能力,对大模型 Agent 的核心算法模块(如意图识别、决策规划、工具调用、知识检索等)进行评测与分析,评估算法效果,提出针对性的优化建议,协同算法团队迭代提升。
- 负责评测工具的开发与维护,基于工程能力搭建自动化评测框架,优化评测流程与工具性能,保障评测过程的稳定性,提升评测用例执行效率、结果统计与分析效率,支撑 Agent 版本的快速迭代验证。
- 跟踪大模型及 Agent 评测领域的前沿技术,引入先进的评测方法、工具与指标,持续优化评测体系,提升评测工作的专业性与前瞻性。
- 协同产品、算法、开发团队,同步评测结果与问题归因,推动问题整改与功能优化,保障 Agent 系统的稳定性、可靠性与业务适配性。
任职要求
- 计算机/数学/统计/AI 相关专业本科及以上,硕士/博士优先。
- 扎实的算法与工程能力:熟练 Python,能独立完成评测框架开发、数据处理与分析。
- 深刻理解 LLM/Transformer 及后训练范式:SFT、RLHF/DPO/Reward Modeling 等;理解 Agent/RAG 的典型失败模式与评测要点。
- 有大模型评测/后训练经验:大模型评测、后训练、A/B 实验、统计推断等方向有实战沉淀。
- 熟悉或有经验构建/使用主流评测集与框架者优先:C-Eval、CMMLU、HumanEval、AGIEval,或 HELM、lm-evaluation-harness 等。
- 有医疗/合规/安全相关经验加分;有大厂大模型算法/评测/平台化经验加分;发表过顶会论文(ICLR/NeurIPS/ACL等)优先。
岗位标签
NEW
特色标签
AI、C++、CI/CD、Golang、Java、Jira、LLM、MySQL、PHP、Python、Selenium、TestNG、人工智能、医疗、医疗业务、医疗场景、可靠性、多模态交互、多模态处理、大语言模型、定制化、持续交付、数据分析、智能体、测试工具、特征工程、用户定制、算法工程、算法链路、计算机相关专业、质量保障、高品质稳定性