jdwatch
  • Home
  • CLI
  • Skills
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

机器学习系统调度编排工程师 - Data AML

Campus

Company 字节跳动

Focus Tech · Algorithm

Location 杭州, 北京, 上海

Published August 3, 2026

岗位职责

团队介绍:Data AML是字节跳动的机器学习中台,为抖音/今日头条/西瓜视频等业务提供推荐/广告/CV/语音/NLP的训练和推理系统。为公司内业务部门提供强大的机器学习算力,并在这些业务的问题上研究一些具有通用性和创新性的算法。同时,也通过火山引擎将一些机器学习/推荐系统的核心能力提供给外部企业客户。

  1. 负责分布式编排调度,解决服务/模型训练、推理任务的分布式部署; 1)使用/二次开发Kubernetes、Yarn、Mesos、Celery等分布式调度框架,结合业务场景合理选型,依据框架特点优化集群利用率与均匀性的调度策略; 2)对接/扩展各框架的水平/垂直扩展及AutoScaling工作;参与多集群混合调度适配,负责不同优先级服务的抢占/驱逐、不同集群资源拆借/混部对接,以及多机房、多地域、多云场景的调度/负载适配;
  2. 负责资源撮合层建设,解决多角色间的资源联合分配问题;从全局角度优化资源分配率与运营效率,协调匹配CPU/GPU等异构硬件、模型数据、样本数据及外部调用资源的容量;感知拓扑限制并进行微拓扑优化,提升网络带宽使用效率;联动海量资源与多租户的预算/交付,对接保障性资源、预算外资源及混部/超卖场景;
  3. 参与训练场景的流程与功能需求落地,包括阶段性编排、批流阶段封装;提升训练单副本服务稳定性,如Failover保护、备份点策略优化;优化服务的可观测性、可操作性、鲁棒性及用户体验;
  4. 参与离线到在线同步、数据一致性与更新时效性优化;负责在线服务多副本的异构资源调度与稳定性预案落地,以及模型与服务的动态在线编排和集群间坐落编排。

任职要求

  1. 2027届获得本科及以上学历,计算机、软件工程等相关专业优先;
  2. 熟练掌握Linux环境下的C++/Python编程语言的使用;
  3. 掌握分布式系统原理,参与过分布式系统的设计、开发、维护和持续优化,能够识别复杂分布式系统中的潜在问题;
  4. 参与过推荐/搜索/机器学习等分布式系统工作,涉及过诸如资源调度、任务编排、模型训练、模型推理、特征抽取、MLsys、AIOps等内容;
  5. 有优秀的逻辑分析能力,能够对业务逻辑进行合理的抽象和拆分,具备良好的团队合作精神;
  6. 具备工作责任心、学习能力、沟通能力、自驱力和执行力,有良好的工作文档习惯,及时按要求撰写更新工作流程及技术文档。

加分项

  1. 参与过类似ParameterServer系统优化,或者搜索系统的索引结构优化;
  2. 参与过KVCache类系统(如Mooncake等)开发或优化;
  3. 了解Redis、LevelDB/RocksDB、Mongo等开源存储类项目;或者有HDFS、Ceph等分布式存储系统使用/优化经历;
  4. 熟悉主流的机器学习框架(TensorFlow/PyTorch/MXNet);
  5. 有以下某一方向领域的经验:AI Infrastructure,HW/SW Co-Design,High Performance Computing,ML Hardware Architecture(GPU,Accelerators,Networking),Machine Learning Frameworks,ML for System,Distributed Storage。