jdwatch
  • Home
  • CLI
  • Skills
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

Agent稳定性测试工程师

Company Meituan

Focus Tech · Testing

Location 北京, 成都

Published August 20, 2026

岗位职责

负责 CatPaw Agent 稳定性测试和评测体系建设,设计并实现覆盖 Skill/Plugin、工具调用、端到端任务完成度的评测框架与自动化测试基建,支撑模型与策略选型决策,以及持续量化并提升开发者体验。 面向 CatPaw 多智能体集群构建运行时评测能力,针对路由调度、会话管理、记忆系统等模块设计场景化用例集与回归基线,识别多轮长链路下的能力衰减与稳定性风险。 主导长程任务 harness 效果评估工作,围绕Prompt 工程、tool Calling 、上下文管理、以及memory能力建立指标体系,评测驱动Agent持续优化。 主导CatPaw Agent产品需求交付质量保障、AI自动化测试开发,保障Agent产品的高质量高效上线。 覆盖 IM/社交/办公等多端渠道及浏览器自动化场景的真实链路验收,badcase分析,沉淀可复用的场景数据集与自动化巡检能力,推动线上质量可观测,以及数据飞轮建设。 参与安全与合规评测,针对多租户权限隔离、数据沙箱、越权与提示注入等风险构建红队用例与对抗性评测方案,保障系统安全性与稳定性。

任职要求

大学本科及以上学历,3 年以上研发或质量工程经验,精通 TypeScript/Node.js 或 Python,具备较强的工程实现能力。 重度 AI Coding 用户,熟练使用 CatPaw/NoCode/Cursor/CC/CodeX 等 AI 编程工具完成日常开发与评测脚本建设。 深入理解 LLM 应用开发,掌握 Prompt 设计、Tool Use、RAG 等核心技术,理解其常见失效模式与对应的评估手段。 熟悉大模型评测方法论,包括自动化评测、LLM-as-a-Judge、人工标注与抽样、A/B 实验与统计显著性判断,能设计出可复现、低噪声的评测流程。 具备平台或框架级系统设计能力,能独立完成评测平台核心模块的架构与实现,并推动数据驱动的质量改进落地。 具备自驱力,善于与 AI 协作,主动探索技术边界并推动结论转化为产品迭代。