运维开发工程师
Company Manus
Focus Tech · Backend
Location 北京
Published October 6, 2026
岗位概述
负责公司多云基础设施与容器集群的运维和平台建设,包括 E2B(AI Agent 沙箱)自建集群,通过自动化和平台化保障生产服务的高可用、可扩展与成本效率。
岗位职责
集群运维与管理
跨多个业务单元管理和维护容器集群(Kubernetes、Docker)及开源中间件集群(Kafka、Redis、Elasticsearch);
负责 E2B(AI Agent 沙箱)自建集群的管理和维护,包括 Nomad / Consul 编排层及 Firecracker microVM 运行时;
确保分布式系统的性能、可扩展性和可靠性。
Linux 与云基础设施
负责 Linux 服务器的日常运维,包括系统加固、补丁管理、备份和性能调优;
管理 AWS、Azure、GCP 多云环境的云资源,确保可靠性、安全性和成本效率。
基础设施平台开发
设计、构建并持续完善基础设施运营平台;
开发和维护基础设施管理、CI/CD GitOps 流水线(Jenkins / Argo CD)、监控告警(Prometheus / Grafana)及集中式日志(ELK)系统;
推动平台标准化和自动化建设。
高可用性与可靠性
通过主动监控和故障响应,确保生产服务的最高可用性;
参与 7×24 小时 on-call 轮值,主导故障响应、根因分析和复盘;
实施并维护 SLA/SLO 框架和可靠性工程实践。
自动化与流程改进
打造自助化工具和工作流,提升团队生产力;
建立基础设施即代码(Terraform / Ansible)和配置管理的最佳实践;
维护完善的文档、SOP 和运维手册(Runbook)。
任职要求
3–4 年以上 Linux 系统运维、DevOps 或 SRE 实战经验(学历不限,能力优先);
扎实的 Linux 系统功底,熟悉网络基础和系统安全最佳实践;
精通容器化技术(Kubernetes、Docker),有生产级集群运维经验;
有 CI/CD 流水线(Jenkins、GitHub Actions / Argo CD)的搭建和管理经验;
熟悉常用基础设施组件:Nginx、MySQL、Redis、Kafka、Elasticsearch;
熟练使用 Shell 和 Python 进行脚本编写和自动化;
有 AWS、Azure、GCP 中至少两个公有云平台的实际运维经验;
熟悉基础设施监控、日志和可观测性工具(Prometheus、Grafana、ELK);
有 Terraform 实战经验;
能够使用中文开展深入技术协作,并使用英文阅读、撰写和参与日常技术沟通。
加分项
了解或接触过 E2B / AI Agent 沙箱基础设施(Firecracker microVM、Nomad、Consul)者优先;
有 Service Mesh 架构(Istio)和 eBPF 技术经验;
持有 CKA/CKAD、AWS/Azure/GCP 专业认证者优先。