岗位职责
团队介绍:字节跳动基础设施部门,负责字节跳动的全栈算力基础设施,从芯片服务器产研、到超大规模数据中心,到传统云平台和如今的AI Native Cloud,全方位为抖音、豆包、今日头条、飞书、火山引擎等各类产品提供领先、稳定的百万量级大规模算力基础设施服务。我们的领域涵盖数据中心建设、内核操作系统开发、服务器集群管理、高速网络通信、EB级数据存储体系、搜索型数据库探索、基于LLM的AI基础设施的研发调度与治理等,致力于打造业界领先的、面向LLM的AI云原生基础设施架构与产品矩阵。
- 参与字节跳动AI算力基础设施建设,围绕大模型训练与推理、AI Agent运行时等核心场景,构建面向AI的算力调度、异构资源管理与云原生运行时体系;参与容器与Kubernetes平台的核心系统研发,覆盖容器管控、资源编排、弹性伸缩、服务治理等关键链路,保障大规模集群下的稳定交付;参与云服务器与镜像控制面的核心能力建设,包括实例生命周期、镜像构建与分发、Guest OS优化、权限与安全合规等,夯实AI计算场景的基础设施底座;
- 参与AI网关、Serverless AI、模型推理服务、AI云原生产品的架构设计与研发,把复杂AI能力封装为稳定、弹性、可观测的云上服务,直接支撑集团业务与企业级客户的智能化升级;
- 参与数十万台服务器规模集群的稳定性、可用性、性能与成本优化,建设故障迁移、全链路观测、依赖治理、变更管控、限流降级等稳定性体系,让AI应用从“能跑”进化到“可控、可信、可规模化交付”;
- 参与AI Infra关键链路(推理链路、任务编排、资源池化、可观测体系)的研发与线上运维闭环,与训推优化、Agent、算法团队深度协同。
任职要求
- 2027届获得本科及以上学历,计算机、软件工程、通信等相关专业优先;
- 扎实的计算机基础知识,深入理解数据结构、算法、操作系统、计算机网络与分布式系统原理;
- 熟练掌握至少一门主流编程语言,包括但不限于Go、C++、Java、Python、Rust等;
- 对AI与云原生的深度融合方向有强烈兴趣,了解大模型、AI Agent、推理服务、异构算力等相关基础机制,或有云计算、云原生(Kubernetes/容器)、Serverless、分布式系统、AI Infra、大模型推理服务、模型部署平台、云服务器/镜像/操作系统等相关项目经历者优先;
- 具备良好的抽象设计能力与工程落地能力,能够对复杂业务逻辑进行合理拆分与建模;
- 有强烈的求知欲、优秀的学习和沟通能力,热爱技术、乐于解决具有挑战性的问题。