集团安全部-Agent Infra研发工程师-AI基础平台Company AlibabaFocus Tech · BackendLocation 杭州Published August 25, 2026岗位职责 负责上下文管理&Memory系统研发,覆盖上下文抽取、存储、检索、更新(冲突处理和遗忘机制),持续优化召回质量和任务效果 负责Benchmark建设与评测体系搭建,结合业界开源Benchmark与业务深度协作,沉淀网络安全、内容安全、行为安全等多场景下真实业务的端到端评测方案,看清能力水位;同时支撑大规模复杂并发任务,保障工具调用的稳定性 负责Harness持续优化,以评测数据驱动归因分析与问题修复,建立"归因—修复—验证"闭环,提升业务效果,并在保障效果的同时持续降低Token成本 任职要求 扎实的工程能力:熟练掌握 Python、Java、C++ 等至少一种编程语言,具备良好的系统设计和工程化能力;熟悉分布式任务调度及 Docker、Kubernetes 等容器化技术 LLM 与 Agent 领域经验:深入理解大语言模型的工作原理与能力边界,有 Agent 框架(如 ReAct、Tool-use、Multi-Agent 编排)的实际使用或开发经验 评测与数据分析能力:具备 Benchmark 和评测指标设计经验,理解任务完成率、pass@k、评测一致性、区分度及数据质量控制, 能够完成根因分析并推动优化方案落地; 熟悉主流 Agent 评测方法论(如 τ-bench、SWE-bench、过程评测与结果评测对比) 上下文&Memory:熟悉 RAG、Embedding、向量数据库及检索重排,理解记忆生成、召回、更新、去重、冲突处理和遗忘等完整生命周期;能够量化评估 Memory 对业务效果、时延及成本的影响。 具备良好的跨团队沟通能力,能与算法、工程、产品团队协作推动评测结果落地;对 Agent 能力评测有持续好奇心,关注行业最新进展(代码 Agent、安全 Agent、通用推理 Agent),能主动发现评测体系中的盲区并驱动改进 加分项 有 Token 成本优化经验,能够量化 Prompt 压缩、缓存、模型路由等策略的效果与成本权衡 有开源评测框架或者Memory贡献作为加分项 岗位标签 NEW