千问办公-AI 测试工程师-杭州

Company Dingtalk

Focus Tech · Testing

Location 杭州

Published September 27, 2026

岗位职责

  1. 负责 AI 工作台产品的端到端功能测试,覆盖多租户管控、权限模型、配额计费、模型准入、Agent 编排与工具调用等核心业务链路,确保功能正确性与业务一致性。
  2. 主导 AI 应用与 Agent 运行链路的效果测试体系建设,围绕模型输出质量、意图识别准确率、工具调用成功率、端到端任务完成率等维度,设计可量化的评测方案与基准集。
  3. 构建自动化测试框架,覆盖接口测试、集成测试、回归测试与性能基线验证,支撑持续集成流水线中的质量门禁。
  4. 设计 AI 场景专项测试策略,包括 Prompt 鲁棒性测试、对抗样本注入、幻觉检测、内容安全护栏验证、多轮对话一致性校验等。
  5. 参与可观测性与质量度量体系建设,定义测试覆盖率、缺陷逃逸率、效果评测回归趋势等核心质量指标,驱动产品质量持续改进。
  6. 与研发、算法团队紧密协作,参与需求评审与技术方案评审,前置识别质量风险并推动测试左移。

任职要求

  1. 扎实的软件测试工程能力,熟练使用 Python / Java / Go 中至少一门语言编写自动化测试脚本,具备复杂分布式系统的测试设计与执行经验。

  2. 熟悉 AI/LLM 应用测试方法论,理解 Prompt Engineering、Function Calling、Agent 执行链路、Context Window 等核心概念,具备 AI 输出质量评估的实战经验。

  3. 具备端到端测试框架设计能力,熟悉 Pytest / JUnit / TestNG 等主流框架,有接口自动化、契约测试或混沌测试落地经验。

  4. 熟悉 CI/CD 流程与质量门禁集成,能独立搭建自动化回归体系并嵌入持续交付流水线。

  5. 良好的数据分析能力,能基于测试结果进行效果评测数据统计、趋势分析与归因定位。

  6. 持续关注 AI 测试与评测领域前沿,能独立消化英文一手资料并转化为测试实践;习惯使用 AI 工具辅助测试用例生成与缺陷分析。加分项

  7. 有 LLM 评测 / AI 效果测试平台建设经验,熟悉 RAGAS、DeepEval、Promptfoo 等评测框架或自建评测体系。

  8. 有 Agent 端到端测试经验,包括多步骤任务链路验证、工具调用结果校验、异常恢复路径测试。

  9. 有性能测试与稳定性保障经验,能设计高并发场景下的 AI 推理服务压测方案。

  10. 有安全测试或红队测试经验,如 Prompt 注入攻防、越权检测、数据泄露验证等