jdwatch
  • Home
  • CLI
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

基础设施与稳定性工程-Agent Infra 工程师-AIOps&AI可观测

Company 阿里巴巴

Focus 技术 · 后端

杭州

July 30, 2026

岗位职责

作为技术负责人,主导集团 AI 基础设施与稳定性领域核心系统的设计与开发。围绕两大方向展开工作:AIOps 智能运维——建设风险左移、故障事前检测及智能诊断恢复能力;AI 可观测——设计面向 AI 全栈(大模型推理、Agent 编排、RAG 管线、工具调用链路)的可观测体系,让 AI 系统本身"可监控、可调试、可度量"。

  1. AI 全栈 Tracing:设计并落地覆盖 LLM 推理、Agent 编排、Tool-use 调用的端到端 Trace 体系,兼容社区开放标准并参与 OpenTelemetry 标准的设计;
  2. 质量与安全度量:建设 AI 系统的核心度量体系,包括但不限于 Agent 性能和任务完成率等,驱动 AI 系统的持续质量改进,并建设 AI 场景专属的异常检测与根因归因能力;
  3. AIOps 智能运维:基于大模型和 AI Agent 技术,建设覆盖风险左移(存量风险扫描、代码变更结构化分析、依赖拓扑治理)、事前检测(历史故障模式匹配、SOP 完备性推理)、故障诊断与快恢的全链路智能运维能力,打通变更上下文、服务拓扑、容量基线、SOP 知识图谱等多源数据底座,降低 MTTR。

任职要求

● 2 年以上复杂系统开发经验,具备技术路线规划能力,能主导从需求分析、方案设计到工程落地的全流程;具备良好的系统架构思维,关注性能、质量、扩展性与前瞻性。 ● 编程基础扎实,精通 Python / Go / Java / Rust 中至少一门语言;熟悉分布式系统设计,包括缓存、消息队列、微服务治理等。 ● 具备大模型(LLM)或 AI Agent 在复杂系统中的实际落地经验,能评估 LLM 在生产场景中的可靠性边界(如幻觉、误报/漏报),并通过评估指标与反馈闭环持续优化效果。 ● 熟悉可观测领域(Metrics / Tracing / Logging)的核心概念与技术栈,了解 OpenTelemetry、Prometheus、Jaeger 等开源体系;或有丰富的运维和稳定性领域经验,理解微服务、云原生场景痛点。 ● 强烈的结果导向,能够通过数据驱动的方式验证技术方案的业务价值。优秀的跨团队沟通能力,能将复杂技术问题转化为可落地方案。 ● 学习能力强,乐于接受新技术,对 AI 基础设施方向有强烈热情。 优先条件(符合其一即可) ● 有 AI 可观测相关项目经验(如 LLM Gateway / AI Gateway、LLMOps 平台、Agent 链路追踪系统等的设计或开发经验)。 ● 有开源 AIOps 或可观测项目贡献经验(如 SkyWalking、OpenTelemetry、Langfuse、Arize 等)。 ● 发表过 AI / 可观测 / 运维相关顶会论文(如 KDD、NSDI、ICML、SoCC 等)。

岗位标签

NEW

Apply now

You'll be redirected to the official careers page. You can also sign in to save jobs and search more roles.