岗位职责
团队介绍:字节跳动基础设施部门,负责字节跳动的全栈算力基础设施,从芯片服务器产研、到超大规模数据中心,到传统云平台和如今的AI Native Cloud,全方位为抖音、豆包、今日头条、飞书、火山引擎等各类产品提供领先、稳定的百万量级大规模算力基础设施服务。我们的领域涵盖数据中心建设、内核操作系统开发、服务器集群管理、高速网络通信、EB级数据存储体系、搜索型数据库探索、基于LLM的AI基础设施的研发调度与治理等,致力于打造业界领先的、面向LLM的AI云原生基础设施架构与产品矩阵。
- 参与大规模计算集群(物理机、容器、GPU)的稳定性建设:容量规划、容灾演练、故障定位与根因治理,保障业务与大模型训推的SLO;
- 参与算力资源效率经营:CPU、GPU利用率提升、在离线混部、资源池化与弹性调度、成本优化,用数据驱动资源的“存—调—取”闭环;
- 面向AI Infra建设系统化运维解决方案:训练、推理集群的交付、压测、GPU故障自愈与稳定性守护;
- 参与设计并实现支撑大规模集群的自动化运营平台与工具链,把重复运维沉淀为可复用的平台能力;
- 探索AIOps/运维Agent:用LLM与智能体能力做告警降噪、变更观测、无人值守与智能盯屏,降低人力投入、提升响应速度。
任职要求
- 2027届获得本科及以上学历,计算机、软件工程、通信等相关专业优先;
- 扎实的计算机基础(操作系统、网络、数据结构),熟悉Linux负载模型、资源模型、网络IO模型等;
- 熟悉至少1门开发语言(Go/C、C++/Java/Python/JavaScript等),有独立编码与工程落地能力;
- 善于从系统全局思考问题,面对复杂、模糊的场景敢于挑战、能拿结果;自驱学习、乐于协作。
加分项(满足其一即可,非硬性)
- 有分布式系统、云计算(K8s/容器/虚拟化)、或GPU/AI训练推理相关的项目、实习或研究经历;
- 熟悉调度、资源管理、性能调优,或有可观测性/稳定性方向的实践;
- 有用AI/LLM/Agent解决实际工程问题的经历,或对AIOps方向有热情;
- 有开源贡献、ACM/竞赛、顶会论文,或独立完成过有一定复杂度的系统。