Company Aliyun
Focus Tech · Backend
Location 杭州
Published August 28, 2026
负责 AI Agent以及平台的可用性、性能与容量保障,设计并落地 SLO/SLI/Error Budget 体系,建设全链路可观测性与限流熔断、灰度发布、快速回滚等容灾能力
负责 Agent 执行基础设施的可靠性保障:代码执行沙箱、工具调用网关、会话与状态存储等的资源隔离、弹性伸缩、性能优化与容量规划
负责云资源运维(K8s 集群、存储、网络等),保障弹性伸缩与配额安全,建设资源利用率与成本可观测体系,推动 FinOps 实践
建设 Agentic 运维体系:基于 LLM + 工具调用(Tool Use / MCP)构建自主运维 Agent,实现告警聚合、根因分析、故障自愈的闭环;设计工具权限边界、审批流、人工兜底(Human-in-the-Loop)机制与动作评测体系
保障云上资源访问安全与审计合规(IAM、密钥管理、网络隔离),确保 Agent 自动化操作安全可控
3 年以上 SRE / 平台工程 / 基础架构经验,扎实的 Linux、网络、存储基础;精通至少一门编程语言(Go / Python / Java),有运维平台或自动化工具开发经验
熟悉 Kubernetes 与容器化部署,有大规模集群运维经验;熟悉至少一个主流云平台(阿里云 / AWS / GCP)的核心产品与 IAM 体系
具备可观测性体系设计经验(Prometheus、Grafana、OpenTelemetry 或同类),具备良好的故障排查直觉与系统性思维,能够冷静决策
有 LLM / AI 应用相关系统经验者优先:熟悉推理服务、RAG 检索、Function Calling 等链路特点;有 LLM 基础设施运维经验(推理框架、GPU 调度、向量数据库等)者优先
熟悉 AI Agent 应用架构特点:工具调用 / MCP、会话编排、流式响应(SSE / WebSocket)等,有相关系统的高可用保障经验者优先
有沙箱 / 隔离执行环境的 SRE 经验者优先:熟悉容器安全隔离、gVisor、Firecracker microVM 或类似代码执行沙箱方案,了解资源配额、安全边界与高密度调度场景
有工具调用网关、函数执行平台(Serverless / FaaS)或多租户资源隔离、配额与计量体系的运维建设经验者优先
有 AIOps / 智能运维系统建设经验,了解 Agent 评测(Eval)方法者加分;有 FinOps / 云成本治理实践经验者加分
NEW