运维开发工程师

Company Manus

Focus Tech · Backend

Location 北京

Published October 6, 2026

岗位概述

负责公司多云基础设施与容器集群的运维和平台建设,包括 E2B(AI Agent 沙箱)自建集群,通过自动化和平台化保障生产服务的高可用、可扩展与成本效率。

岗位职责

集群运维与管理

跨多个业务单元管理和维护容器集群(Kubernetes、Docker)及开源中间件集群(Kafka、Redis、Elasticsearch);

负责 E2B(AI Agent 沙箱)自建集群的管理和维护,包括 Nomad / Consul 编排层及 Firecracker microVM 运行时;

确保分布式系统的性能、可扩展性和可靠性。

Linux 与云基础设施

负责 Linux 服务器的日常运维,包括系统加固、补丁管理、备份和性能调优;

管理 AWS、Azure、GCP 多云环境的云资源,确保可靠性、安全性和成本效率。

基础设施平台开发

设计、构建并持续完善基础设施运营平台;

开发和维护基础设施管理、CI/CD GitOps 流水线(Jenkins / Argo CD)、监控告警(Prometheus / Grafana)及集中式日志(ELK)系统;

推动平台标准化和自动化建设。

高可用性与可靠性

通过主动监控和故障响应,确保生产服务的最高可用性;

参与 7×24 小时 on-call 轮值,主导故障响应、根因分析和复盘;

实施并维护 SLA/SLO 框架和可靠性工程实践。

自动化与流程改进

打造自助化工具和工作流,提升团队生产力;

建立基础设施即代码(Terraform / Ansible)和配置管理的最佳实践;

维护完善的文档、SOP 和运维手册(Runbook)。

任职要求

3–4 年以上 Linux 系统运维、DevOps 或 SRE 实战经验(学历不限,能力优先);

扎实的 Linux 系统功底,熟悉网络基础和系统安全最佳实践;

精通容器化技术(Kubernetes、Docker),有生产级集群运维经验;

有 CI/CD 流水线(Jenkins、GitHub Actions / Argo CD)的搭建和管理经验;

熟悉常用基础设施组件:Nginx、MySQL、Redis、Kafka、Elasticsearch;

熟练使用 Shell 和 Python 进行脚本编写和自动化;

有 AWS、Azure、GCP 中至少两个公有云平台的实际运维经验;

熟悉基础设施监控、日志和可观测性工具(Prometheus、Grafana、ELK);

有 Terraform 实战经验;

能够使用中文开展深入技术协作,并使用英文阅读、撰写和参与日常技术沟通。

加分项

了解或接触过 E2B / AI Agent 沙箱基础设施(Firecracker microVM、Nomad、Consul)者优先;

有 Service Mesh 架构(Istio)和 eBPF 技术经验;

持有 CKA/CKAD、AWS/Azure/GCP 专业认证者优先。