岗位职责
团队介绍:Data AML是字节跳动的机器学习中台,为抖音/今日头条/西瓜视频等业务提供推荐/广告/CV/语音/NLP的训练和推理系统。为公司内业务部门提供强大的机器学习算力,并在这些业务的问题上研究一些具有通用性和创新性的算法。同时,也通过火山引擎将一些机器学习/推荐系统的核心能力提供给外部企业客户。
- ML PaaS方向--编排调度基础设施;
1)建设机器学习平台基础编排能力,包括Kubernetes交互层、控制面抽象、CRD/Operator,以及任务和服务生命周期管理;
2)建设多租户资源与Quota系统,支持优先级、抢占、公平共享、弹性资源和跨集群资源调度;
3)建设容器运行时和有状态服务编排能力,持续优化镜像、存储、网络、资源隔离、故障恢复、容灾与系统SLA;
- 训练编排方向--训练编排与可靠性;
1)对接预训练、SFT、RL等训练和后训练场景,建设任务、Workflow及多角色服务编排能力;
2)优化训练可靠性和ETTR,建设故障检测、慢节点诊断、Checkpoint、Failover和弹性恢复能力;
3)提升训练工程效能,并支持训练、Rollout、推理、Reward等角色间的资源协同、参数同步和训推共池;
- MaaS方向--GPU在线Serving编排;
1)建设大模型在线推理服务的全生命周期编排,支持部署、升级、回滚、弹性伸缩、多集群和容灾;
2)建设Prefill/Decode分离、多角色推理、拓扑感知、KV Cache亲和性、QoS/SLA和流量调度能力;
3)优化模型权重、镜像和KV Cache的分发与加载,并通过资源池化、多租户、弹性和FinOps提升GPU利用率。
任职要求
- 2027届获得本科及以上学历,计算机、软件工程、人工智能及相关专业优先;
- 熟练掌握Go、C++、Python中至少一种语言,具备扎实的数据结构、算法基础和良好的工程编码习惯;
- 熟悉Linux,理解操作系统、计算机网络、并发编程和分布式系统的基本原理;
- 具备较强的动手能力和探索精神,愿意深入代码和系统现场分析问题,而不止停留在框架使用或方案设计层面;
- 具备系统化和定量分析意识,能够通过指标、日志、Profiling、实验或模型定位问题并验证优化效果;
- 具备责任心、自驱力和良好的协作能力,愿意持续负责复杂系统从设计、开发到上线和稳定运行的完整过程。
加分项
- 满足以下任意一项即可;
- ML PaaS方向
1)有资源调度、Quota、基于容器的多租户系统或FinOps项目经验;
2)参与过Kubernetes、Volcano、Koordinator、Kruise等开源项目;
- 训练编排方向
1)有PyTorch Distributed、Megatron、DeepSpeed、Ray、Volcano等分布式训练实践,有对应训练框架的可靠性以及性能优化经验更好;
2)有训练平台、MLOps、RLHF/PPO/GRPO等强化学习或后训练系统实践;
3)有训练系统以及AI集群管理相关科研经历或开源贡献;
- MaaS方向
1)有vLLM、SGLang、Triton、KServe、Ray Serve等推理系统实践;
2)了解大模型推理中的KV Cache、Continuous Batching、Prefill/Decode分离、并行策略等概念;
3)有在线服务、网关、流量调度、弹性伸缩、性能优化或大规模高可用系统经验;
4)有GPU/NPU Serving、异构资源调度、模型分发或推理性能分析经验。