云基础设施工程师(可灵AI)

Company Kuaishou

Focus Tech · Backend

Location 北京

Published September 23, 2026

岗位职责

  1. 作为云基础设施团队成员,你将参与以下工作。具体职责将根据个人经验、技术特长和团队分工确定,重点承担其中一个或多个方向;
  2. 基础设施与容器方向:负责计算、容器、网络、存储及负载均衡等基础设施的交付和运维;负责 Kubernetes 集群及基础组件的升级、容量管理、故障排查、变更发布和容灾演练;
  3. 稳定性与可观测方向:建设和完善指标、日志、链路、告警及 SLO 体系;参与线上故障应急响应,完成影响评估、止损恢复、根因分析和改进项落地;推进风险治理、故障预防、自动恢复和稳定性专项建设;
  4. 自动化与平台工程方向:使用 Terraform、GitOps 等技术推动基础设施即代码和自动化交付;参与变更平台、自助交付平台及运维工具的设计与开发;优化基础设施交付流程,减少人工操作并提升研发团队的使用体验;
  5. 资源与架构治理方向:参与资源清单、配置基线、生命周期、容量和成本治理;参与跨地域网络、容灾架构和基础设施标准化建设;与研发、安全、网络及业务团队协作,推动基础设施问题的端到端解决;
  6. 流量接入方向:负责域名、DNS、CDN、WAF、负载均衡、API 网关及 Kubernetes Gateway/Ingress 等流量接入基础设施的建设和运维;负责流量路由、灰度发布、限流熔断、跨地域调度及故障切流能力建设,保障业务流量接入的稳定性和可扩展性;参与流量链路的性能优化、安全防护、容量规划和故障排查,推动接入标准化与自动化。

任职要求

  1. 计算机或相关专业本科及以上学历,具备 3 年以上 SRE、云平台运维、DevOps 或运维开发经验;

  2. 熟悉 Linux 操作系统和计算机网络基础,具备生产环境问题分析和故障排查能力;

  3. 掌握 Go、Python 或 Shell 中至少一种,能够通过程序或脚本解决重复性运维问题;

  4. 具备良好的生产风险意识,理解变更、回滚、应急响应和事故复盘等基本方法;

  5. 具备良好的文档能力、沟通能力和跨团队协作能力。 加分项:

  6. 熟悉 Kubernetes,具备容器平台建设或生产运维经验;

  7. 熟悉主流公有云或私有云平台,具备计算、网络、存储或负载均衡等资源的运维经验;

  8. 具备监控告警、容量管理、故障应急、容灾演练或 SLO 建设经验;

  9. 熟悉 Prometheus、Grafana、OpenTelemetry 或同类可观测技术;

  10. 熟悉 Terraform/OpenTofu、GitOps 等自动化技术;

  11. 有变更平台、自助交付平台、CI/CD 或运维工具开发经验;

  12. 有多账号、多地域、混合云或多云环境的规划与治理经验;

  13. 有容量规划、成本优化、配置基线、资源生命周期或跨地域容灾经验;

  14. 在容器、网络、可观测、运维开发或资源治理中的某一领域具备较强技术深度;

  15. 有 0-1 公有云搭建和运维经验。