jdwatch
  • Home
  • CLI
  • Skills
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

计算SRE - AI算力基础设施

Campus

Company 字节跳动

Focus Tech · Backend

Location 北京, 杭州, 上海

Published July 27, 2026

岗位职责

团队介绍:字节跳动基础设施部门,负责字节跳动的全栈算力基础设施,从芯片服务器产研、到超大规模数据中心,到传统云平台和如今的AI Native Cloud,全方位为抖音、豆包、今日头条、飞书、火山引擎等各类产品提供领先、稳定的百万量级大规模算力基础设施服务。我们的领域涵盖数据中心建设、内核操作系统开发、服务器集群管理、高速网络通信、EB级数据存储体系、搜索型数据库探索、基于LLM的AI基础设施的研发调度与治理等,致力于打造业界领先的、面向LLM的AI云原生基础设施架构与产品矩阵。

  1. 参与大规模计算集群(物理机、容器、GPU)的稳定性建设:容量规划、容灾演练、故障定位与根因治理,保障业务与大模型训推的SLO;
  2. 参与算力资源效率经营:CPU、GPU利用率提升、在离线混部、资源池化与弹性调度、成本优化,用数据驱动资源的“存—调—取”闭环;
  3. 面向AI Infra建设系统化运维解决方案:训练、推理集群的交付、压测、GPU故障自愈与稳定性守护;
  4. 参与设计并实现支撑大规模集群的自动化运营平台与工具链,把重复运维沉淀为可复用的平台能力;
  5. 探索AIOps/运维Agent:用LLM与智能体能力做告警降噪、变更观测、无人值守与智能盯屏,降低人力投入、提升响应速度。

任职要求

  1. 2027届获得本科及以上学历,计算机、软件工程、通信等相关专业优先;
  2. 扎实的计算机基础(操作系统、网络、数据结构),熟悉Linux负载模型、资源模型、网络IO模型等;
  3. 熟悉至少1门开发语言(Go/C、C++/Java/Python/JavaScript等),有独立编码与工程落地能力;
  4. 善于从系统全局思考问题,面对复杂、模糊的场景敢于挑战、能拿结果;自驱学习、乐于协作。

加分项(满足其一即可,非硬性)

  1. 有分布式系统、云计算(K8s/容器/虚拟化)、或GPU/AI训练推理相关的项目、实习或研究经历;
  2. 熟悉调度、资源管理、性能调优,或有可观测性/稳定性方向的实践;
  3. 有用AI/LLM/Agent解决实际工程问题的经历,或对AIOps方向有热情;
  4. 有开源贡献、ACM/竞赛、顶会论文,或独立完成过有一定复杂度的系统。