蚂蚁集团-基础设施高可用架构师-杭州
Company Antgroup
Focus Tech · Backend
Location 杭州
Published August 4, 2026
岗位职责
- 稳定性架构设计:面向蚂蚁全站基础设施,设计端到端的稳定性保障架构,包括 SLA/SLO体系、容灾架构(同城/异地多活、单元化)、容量管理、故障自愈、变更安全等顶层模型,推动各基础设施域按统一标准落地。
- 风险识别与架构评审:建立体系化的风险识别机制,主导重大架构变更、新平台接入、大促/容灾演练的稳定性评审,识别单点、依赖链路、爆炸半径、容量瓶颈等系统性风险,给出架构级改进方案并推动闭环。
- 故障应急与根因治理:作为重大故障的架构级应急owner,主导定位与恢复;牵头根因分析,推动架构、流程、防护能力的长期治理,持续收敛基础设施稳定性风险。
- 高可用能力建设:设计并落地监控告警、链路追踪、混沌工程、故障演练、自愈容灾等平台化能力,构建覆盖发现—定位—恢复—复盘的全生命周期稳定性工具链。
- 大规模场景落地:围绕 ServiceMesh、Serverless、FaaS、混合云等在数百万容器场景下的接入、部署、升级与容灾方案,输出可复制的基础设施稳定性架构范式。
- 智能化演进:结合大模型与 AI Agents,探索智能监控、智能应急、智能容量预测等方向的架构设计与落地,引领稳定性保障向智能化、数字化演进。
- 跨团队协同与标准沉淀:与中间件、容器、网络、存储、安全等团队协同制定稳定性标准与架构基线,沉淀方法论,赋能业务应用在可用性、成本、效率上做出合理的架构选型。
任职要求
1.基本要求:
- 计算机或相关专业本科及以上学历,5 年及以上大规模分布式系统研发或 SRE 架构经验,有过完整的高可用架构设计与落地案例。
- 扎实的编程基础,熟练掌握 Java / Golang / Python 中至少一种,能独立完成稳定性工具与平台的设计开发。
- 深入理解 Linux 操作系统、网络协议、存储、Docker 与 Kubernetes,熟悉大规模容器化与云原生架构。
- 熟悉主流开源中间件(Kafka、RabbitMQ、Redis、Dubbo 等)及其实现机制,理解其在超大规模下的稳定性边界与失效模式。
2.架构与稳定性能力:
- 熟练掌握 SLO/SLI 体系、容量管理、容灾多活、混沌工程、故障演练等方法论,并具备体系化落地经验。
- 具备跨域复杂系统的故障定位与应急能力,主导过 P0/P1 级故障的定位、恢复与治理闭环。
- 能从架构层面抽象稳定性问题,输出可复用的架构模式与风险治理方案,而非依赖堆人力运维。
- 加分项:
- 有百万级容器/千万级 QPS 规模基础设施的稳定性架构或 SRE 经验。
- 有同城/异地多活、单元化部署、混合云容灾的大规模落地经验。
- 有 Service Mesh、Serverless、FaaS 等云原生架构在大规模场景下的接入与稳定性保障经验。
- 有 IaC 实践经验(Terraform / Ansible 等),熟悉运维自动化与基础设施即代码。
- 有开源社区贡献,或在中间件、云原生、可观测性等领域的开源项目中有深度参与。
- 有 AI Agents、大模型在运维/稳定性场景的落地经验。
岗位标签
NEW
特色标签
AI模型、AI运维机器人、Ansible、Docker、FaaS、Golang、IaC、Istio、Java、K8s、Kubernetes、LLM、Python、Redis、SRE、Terraform、事件驱动架构、云原生、云原生调度、云服务、云计算、会员账户、保险、信贷、内容安全、函数即服务、分布式计算、区块链、单元化、反洗钱、可用性指标、可靠性验证、合规、同城双活、商业化、图计算、基础设施、大语言模型、安全、容器编排、容器集群、密码、广告、异地多活、微服务通信、指标观测、支付、故障演练、故障转移、数据安全、数据库、无服务器计算、日志分析、智能代理、智能体、智能研发、智能运维助手、有留学背景、服务等级协议、服务等级目标、服务网格、测试工具、混沌实验、灾备、熟悉Linux/Unix系统、特征计算、理财、电商、监控告警、知识图谱、研发效能、结算、网络安全、网络运维经验、自动化部署、营销、虚拟机、调度、财务、边车代理、运维开发/DevOps、运维开发经验、金融、银行、链路追踪、隐私计算、韧性测试、风控