jdwatch
  • Home
  • CLI
  • Skills
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

集团安全部-Agent Infra研发工程师-AI基础平台

Company Alibaba

Focus Tech · Backend

Location 杭州

Published August 25, 2026

岗位职责

  • 负责上下文管理&Memory系统研发,覆盖上下文抽取、存储、检索、更新(冲突处理和遗忘机制),持续优化召回质量和任务效果
  • 负责Benchmark建设与评测体系搭建,结合业界开源Benchmark与业务深度协作,沉淀网络安全、内容安全、行为安全等多场景下真实业务的端到端评测方案,看清能力水位;同时支撑大规模复杂并发任务,保障工具调用的稳定性
  • 负责Harness持续优化,以评测数据驱动归因分析与问题修复,建立"归因—修复—验证"闭环,提升业务效果,并在保障效果的同时持续降低Token成本

任职要求

  • 扎实的工程能力:熟练掌握 Python、Java、C++ 等至少一种编程语言,具备良好的系统设计和工程化能力;熟悉分布式任务调度及 Docker、Kubernetes 等容器化技术
  • LLM 与 Agent 领域经验:深入理解大语言模型的工作原理与能力边界,有 Agent 框架(如 ReAct、Tool-use、Multi-Agent 编排)的实际使用或开发经验
  • 评测与数据分析能力:具备 Benchmark 和评测指标设计经验,理解任务完成率、pass@k、评测一致性、区分度及数据质量控制, 能够完成根因分析并推动优化方案落地; 熟悉主流 Agent 评测方法论(如 τ-bench、SWE-bench、过程评测与结果评测对比)
  • 上下文&Memory:熟悉 RAG、Embedding、向量数据库及检索重排,理解记忆生成、召回、更新、去重、冲突处理和遗忘等完整生命周期;能够量化评估 Memory 对业务效果、时延及成本的影响。
  • 具备良好的跨团队沟通能力,能与算法、工程、产品团队协作推动评测结果落地;对 Agent 能力评测有持续好奇心,关注行业最新进展(代码 Agent、安全 Agent、通用推理 Agent),能主动发现评测体系中的盲区并驱动改进

加分项

  • 有 Token 成本优化经验,能够量化 Prompt 压缩、缓存、模型路由等策略的效果与成本权衡
  • 有开源评测框架或者Memory贡献作为加分项

岗位标签

NEW