岗位职责
- 设计智能体评测任务,覆盖工具调用、计算机操作、多智能体协作、长周期任务执行、事实准确性、指令遵循和复杂推理等方向;
- 将抽象的模型行为问题转化为可验证的评测实验,完成假设定义、数据构建、模型运行、结果分析和迭代决策;
- 研究模型行为的自动化探索方法,持续发现模型在复杂任务、长尾场景和真实业务流程中的能力边界与失败模式;
- 建设可靠、可复现、可扩展的评测流水线,支持不同模型、模型版本、Prompt、智能体框架和工具配置的批量实验;
- 建设持续评测与模型健康监控体系,包括:标准测试集和 Golden Dataset 建设、回归与性能漂移监控、模型版本对比、评测结果可视化、失败案例分析、自动化反馈和改进闭环;
- 分析评测方法的可靠性、可扩展性、方差、统计显著性和评分一致性,持续提升评测结果的可信度;
- 设计并维护评测相关的后端服务、数据管道和 API,将内部数据转换为适合模型、智能体和下游 AI 工作流使用的结构化格式;
- 将评测结果反馈到数据集、Prompt、评分器、智能体架构和产品方案中,推动模型与产品效果持续优化;
- 负责评测系统从原型设计、工程实现、上线运行到长期维护的完整生命周期,在快速实验的同时保证系统稳定性、扩展性和可维护性。
任职要求
- 具备扎实的软件工程、计算机系统、机器学习、统计学或相关领域基础;
- 熟练掌握 Python、Go、Node.js 或其他至少一种编程语言,具备良好的工程开发、系统设计和问题排查能力;
- 熟悉大语言模型及智能体技术,具备以下一个或多个方向的实际经验:大模型评测与 Benchmark、LLM-as-a-Judge 或自动评分器、评测数据集或合成数据构建、工具调用型智能体、多智能体工作流、长上下文或长周期任务、模型效果监控与回归评测;
- 能够将模糊、开放的模型行为问题拆解成具体、可执行、可复现的评测实验,并根据数据得出结论;
- 具备分布式系统、API、数据处理流水线或后端平台的设计与开发经验;
- 熟悉模型评测的基本方法,能够独立设计测试集、评分标准、评测指标和回归验证方案;
- 重视评测结果的可靠性和可解释性,能够识别数据污染、评分偏差、统计噪声和评测集饱和等问题;
- 既关注 Benchmark 指标,也关注模型在真实场景中的实用性、可靠性、诚实性和交互体验;
- 具备较强的自主性,能够在目标或实现路径尚不明确的情况下推进项目落地;
- 具备良好的分析、沟通和文档表达能力,能够清晰说明评测方法、实验结果和优化建议。
加分项
- 独立构建过大模型 Benchmark、评测集或自动评分系统;
- 开发过智能体任务环境、评测 Harness 或沙箱执行系统;
- 具备大规模评测平台、实验平台或模型监控系统建设经验;
- 熟悉 Prompt、Sampling 和 Agent Scaffolding 对评测结果的影响;
- 熟悉统计实验设计、方差分析、置信区间和显著性检验;
- 有可观测性、回归检测或实验追踪系统经验;
- 有大规模数据集构建、清洗、标注和质量控制经验;
- 对工具调用、计算机操作、多智能体或长周期智能体有深入实践。
典型项目
- 从零构建一套复杂智能体能力评测,包括任务环境、数据集、评分器和分析看板。
- 建设持续评测平台,在模型、Prompt 或智能体版本发生变化时自动执行回归测试。
- 定位评测指标异常,判断问题来自模型、数据、评分器还是评测基础设施。
- 构建工具调用或复杂任务的沙箱环境,验证评测结果的稳定性和可复现性。
- 建设 Golden Dataset、漂移监控和失败案例库,持续推动模型与产品迭代。
特色标签
Agent评估、AI Agent Benchmark、AI下游链路、AI任务管线、Golang、Golang服务端开发经验、Hadoop、Hive、Linux开发/部署经验、LLM、Prompt工程、Python、P值校验、Shell、Spark、SQL、SRE、中大型项目开发经验、云原生、云服务、云计算、会员账户、保险、信贷、内容、内容安全、分布式经验、分布式计算、分布式训练、反洗钱、合规、商业化、图像、图计算、多模态算法、大模型、大模型算法、安全、实际业务流、广告、强化学习、微服务经验、提示工程、提示词、支付、数据安全、数据库、数据挖掘、显著性检验、智能交互、智能体、智能体测试、智能研发、有前端经验/技能、有留学背景、服务端开发经验、机器学习、机器学习经验、模型应用流程、模型自动测试、测试工具、测试流水线、深度学习、特征计算、理财、生产业务流、直播、真值基准、知识图谱、短视频、研发效能、算法工程化经验、系统架构设计经验、线上业务场景、统计置信度、聊天机器人、自动化评测管线、自动探查、自我探索、自然语言处理算法、英语读写能力良好、营销、视频、计算机相关专业、评估流程、语音、金标数据集、金融、银行、长时序任务、长期任务执行、长程任务、隐私、隐私计算、预训练大模型、风控、黄金测试集