Agent 评测工程师
Company Manus
Focus Tech · Backend
Location 北京
Published October 6, 2026
岗位概述
从产品和用户任务出发,结合 AI 与智能体的技术机制设计评测方法。通过指标设计、实验分析和失败案例研究,判断能力变化,探索现有指标难以覆盖的评测问题,为系统迭代、模型后训练及模型选型提供依据。
岗位职责
设计线上与离线指标,将用户任务、交付质量和使用价值转化为可衡量、可检验的评价标准。 结合智能体规划、工具调用、上下文与反馈机制设计评测任务和实验,对比系统改动前后的表现,定位影响结果的因素。 支持模型后训练评测及第三方模型质量比较,明确评估场景、指标口径和结果的适用范围。 针对现有评测难以反映的能力与用户体验问题,提出新的任务、指标或实验方法,检验其有效性、偏差和可复现性。 分析评测结果和失败案例,区分分数变化与真实能力变化,与产品、工程及模型团队验证改进效果并完善评测方法。
任职要求
具备智能体产品或模型后训练评测实践经历,能够通过具体工作说明指标设计与验证能力。 深入理解 AI 模型与智能体的技术机制,熟悉任务规划、工具调用、上下文管理及反馈过程,能够据此分析系统表现。 具备数据分析、工程和研究能力,能够设计实验、处理评测数据,并分析结果的不确定性。 能够深入分析开放问题,提出有依据的新型评测方案,检查实验偏差、样本与结论之间的关系,并通过实验验证判断。 对 AI 生成质量和真实用户价值有独立判断,能够清晰表达研究结论、适用条件和局限。 熟悉用户访谈、观察或可用性测试等用户调研方法,能够将用户研究转化为评测任务和标准者更佳。