岗位职责
团队介绍:Data AML是字节跳动的机器学习中台,为抖音/今日头条/西瓜视频等业务提供推荐/广告/CV/语音/NLP的训练和推理系统。为公司内业务部门提供强大的机器学习算力,并在这些业务的问题上研究一些具有通用性和创新性的算法。同时,也通过火山引擎将一些机器学习/推荐系统的核心能力提供给外部企业客户。
- 负责分布式编排调度,解决服务/模型训练、推理任务的分布式部署;
1)使用/二次开发Kubernetes、Yarn、Mesos、Celery等分布式调度框架,结合业务场景合理选型,依据框架特点优化集群利用率与均匀性的调度策略;
2)对接/扩展各框架的水平/垂直扩展及AutoScaling工作;参与多集群混合调度适配,负责不同优先级服务的抢占/驱逐、不同集群资源拆借/混部对接,以及多机房、多地域、多云场景的调度/负载适配;
- 负责资源撮合层建设,解决多角色间的资源联合分配问题;从全局角度优化资源分配率与运营效率,协调匹配CPU/GPU等异构硬件、模型数据、样本数据及外部调用资源的容量;感知拓扑限制并进行微拓扑优化,提升网络带宽使用效率;联动海量资源与多租户的预算/交付,对接保障性资源、预算外资源及混部/超卖场景;
- 参与训练场景的流程与功能需求落地,包括阶段性编排、批流阶段封装;提升训练单副本服务稳定性,如Failover保护、备份点策略优化;优化服务的可观测性、可操作性、鲁棒性及用户体验;
- 参与离线到在线同步、数据一致性与更新时效性优化;负责在线服务多副本的异构资源调度与稳定性预案落地,以及模型与服务的动态在线编排和集群间坐落编排。
任职要求
- 2027届获得本科及以上学历,计算机、软件工程等相关专业优先;
- 熟练掌握Linux环境下的C++/Python编程语言的使用;
- 掌握分布式系统原理,参与过分布式系统的设计、开发、维护和持续优化,能够识别复杂分布式系统中的潜在问题;
- 参与过推荐/搜索/机器学习等分布式系统工作,涉及过诸如资源调度、任务编排、模型训练、模型推理、特征抽取、MLsys、AIOps等内容;
- 有优秀的逻辑分析能力,能够对业务逻辑进行合理的抽象和拆分,具备良好的团队合作精神;
- 具备工作责任心、学习能力、沟通能力、自驱力和执行力,有良好的工作文档习惯,及时按要求撰写更新工作流程及技术文档。
加分项
- 参与过类似ParameterServer系统优化,或者搜索系统的索引结构优化;
- 参与过KVCache类系统(如Mooncake等)开发或优化;
- 了解Redis、LevelDB/RocksDB、Mongo等开源存储类项目;或者有HDFS、Ceph等分布式存储系统使用/优化经历;
- 熟悉主流的机器学习框架(TensorFlow/PyTorch/MXNet);
- 有以下某一方向领域的经验:AI Infrastructure,HW/SW Co-Design,High Performance Computing,ML Hardware Architecture(GPU,Accelerators,Networking),Machine Learning Frameworks,ML for System,Distributed Storage。