蚂蚁集团-AI SRE架构师-杭州

Company Antgroup

Focus Tech · Backend

Location 杭州

Published September 23, 2026

岗位职责

  1. 面向底盘业务构建连续性策略,围绕业务持续安全、可用目标,构建多端智能预警、根因定位、动线分析、资金安全保障、自愈、降级、限流、智能运维能力,协同&推动全局架构演进,为业务持续稳定运行负责;
  2. 面向AI业务构建端到端对话链路稳定性体系:多模型接入与路由架构、流式服务 SLO、治理(TTFT/TPOT/超时/断流)、会话上下文与存储链路容灾、三方模型依赖的熔断/降级与治理,保障业务告诉增长过程中核心对话链路连续可用;
  3. 识别业务发展过程中的效能&成本问题,重点治理 AI 推理侧成本:大小模型分流调度、推理服务弹性伸缩、GPU 容量规划与 Token 成本模型,改进工程交付效率与质量;
  4. 围绕各业务大促活动,提供高性能、高可用、资金安全的常态活动保障方案,构建灵活弹性的容量调度策略,覆盖营销活动(打卡挑战、返现高峰、领奖瓜分)带动的对话洪峰与 Agent调用激增的混合流量场景,提供峰值秒杀技术能力与容量服务;
  5. 同时在面向业务快速增长的过程中,能够从纷杂的业务信息中识别真实稳定性问题、抽象成可落地的架构方案(容量、弹性、成本、稳定性、资金安全等),设计并推动架构方案落地。

任职要求

  1. 知名互联网企业专注系统稳定性工作三年以上,或从事系统架构师/资深研发工程师五年以上,Java 研发功底扎实,有大规模在线服务系统架构设计和稳定性保障经验;
  2. 深度参与过 AI 原生产品或大模型服务平台(如豆包、元宝、Kimi、DeepSeek、通义等)的 SRE / 稳定性 /基础架构工作两年以上,对高成本、高突发性对话流量的稳定性保障有实战方法论;
  3. 具备在目标模糊、边界不清、无先例可循的业务场景中独立工作的能力:能快速从现象中定义核心问题、抽象成结构化的技术命题、设计方案并推动落地;
  4. 喜欢做系统连续性、稳定性相关工作,具备较强的抗压性,愿意在技术风险 × AI Infra 交叉领域长期发展,跟随技术趋势持续探索,全力以赴拿结果。

【加分项】 有健康医疗/智能硬件领域 AI 产品稳定性经验;有“营销资金安全 + 对话 AI 混合场景”保障经验。

岗位标签

NEW

特色标签

AIOps、AI告警、AI模型服务、Docker、Java、Kubernetes、MongoDB、Prometheus、Python、Redis、Shell、不限、业务连续性保障、交易安全保障、动态伸缩、医疗、基座业务、大数据运维经验、大模型推理、容灾策略、容量分配、容量管理、平台型业务、异常检测、弹性调度、支付、故障根因分析、智能体、智能化运维、智能告警、核心业务系统、根因追踪、模型推理、熟悉Linux/Unix系统、稳定性治理、系统稳定性、系统运维、网络安全相关经验、聊天机器人、自动化运维、自动扩缩容、营销、资源调度、资金安全风控、运维开发/DevOps、运维开发经验、金融、金融级安全、问题定位、高可用保障、高可用策略