Company Didi
Focus Tech · Backend
Location 北京
Published August 17, 2026
岗位职责: 核心系统设计:负责参与自动驾驶 OTA 云端系统的整体架构设计、核心代码实现与线上运维,涵盖升级包的安全存储、加密分发、完整性校验、版本追溯及全生命周期以及策略和任务的管控。 稳定性第一:主导 OTA 云端各业务模块的高可用治理,持续优化系统性能与数据质量,确保服务 SLA 指标(可用性 ≥ 99.99%、请求成功率、P99 延迟等)全面达标,对任何异常波动零容忍。 可观测性与主动防御:构建完善的监控报警体系(指标、日志、链路),实现故障的秒级发现、分钟级定位;同时设计主动巡检与异常预测机制,将隐患消灭在用户感知之前。 安全纵深防护:负责系统访问控制、数据加密传输、防篡改校验、防重放攻击等安全机制的设计与落地,定期进行安全漏洞扫描与渗透测试演练,确保升级包从生成到落地的全链路安全闭环。 应急响应与混沌验证:深度参与线上故障应急,定期组织故障演练与混沌工程实验,验证系统在极端场景(网络分区、节点宕机、流量突增)下的自愈能力,持续迭代应急预案。
技术栈扎实: 熟练掌握 Spring Boot / Spring Cloud 等主流 Web 开发框架,有微服务治理实际经验。 熟练使用 MySQL(具备 SQL 调优、索引优化能力)、Redis(缓存设计与高可用)、Kafka(消息队列,理解分区与消费机制)。 熟悉 ELK 日志体系,能基于日志数据进行问题根因分析。 云原生与 DevOps:熟悉 Docker 容器化、Kubernetes 编排,具备基于 GitLab CI / Jenkins 的 CI/CD 流水线搭建和运维能力。 监控体系:精通至少一种主流监控系统(如 Prometheus + Grafana、Zabbix),能独立设计告警规则、配置 SLO 大盘,并有过告警风暴治理或降噪经验。
稳定性深度经验: 具备应用系统稳定性建设的完整项目经历,对高可用架构(多活、容灾、降级、熔断、超时控制、重试风暴防范)有深入理解。 熟悉混沌工程工具(如 Chaos Mesh、ChaosBlade)并有实战演练经验。 具备容量规划与压测能力,能提前识别系统瓶颈。
软素质:具备出色的沟通表达能力和团队协作精神,善于跨部门协调;对技术有热情,乐于分享,能通过 Code Review 和技术文档传递经验。良好的英语沟通能力。
Voyager