岗位职责
团队介绍:Data AML是字节跳动的机器学习中台,为抖音/今日头条/西瓜视频等业务提供推荐/广告/CV/语音/NLP的训练和推理系统。为公司内业务部门提供强大的机器学习算力,并在这些业务的问题上研究一些具有通用性和创新性的算法。同时,也通过火山引擎将一些机器学习/推荐系统的核心能力提供给外部企业客户。
- 负责超大规模机器学习系统中数据链路的构建,解决系统高并发、高可靠性、高可扩展性等技术难关;
- 面向深度学习模型的数据存储引擎:针对深度学习模型特性,突破传统行存/列存格式限制,设计并实现适配深度学习场景的专用存储结构,追求性能与成本的极致优势;
- 面向深度学习模型的数据读取和缓存体系:针对深度学习模型的数据访问IO Pattern,构建多层的缓存体系,在CPU和GPU侧构建近计算的缓存和数据预读取方案,显著提高数据访问吞吐,降低延迟;
- 高效的数据预处理引擎:通过解耦数据预处理与模型计算,设计兼容多数据格式的高效预处理引擎,集成算子下推能力,大幅提升预处理效率;
- 前瞻技术探索落地:跟踪机器学习数据链路前沿技术(如新型存储结构、异构计算系统、硬件创新、编译优化技术等),推动技术调研与工程落地;
- 算法-系统联合优化:与算法团队深度协同,推进算法与系统的联合优化,持续提升系统对业务的支撑能力。
任职要求
- 2027届获得本科及以上学历,计算机、软件工程等相关专业优先;
- 熟练掌握Linux环境下的C/C++、Python语言;
- 具备扎实的计算机科学功底和编程能力,熟悉常见算法和数据结构,具有良好的编程习惯;
- 掌握分布式系统原理,参与过分布式系统的设计、开发和维护;
- 熟悉分布式存储的一致性、可靠性、高性能、成本优化等方向;
- 有强烈的工作责任心,较好的学习能力、沟通能力和自驱力,能够快速的响应和行动。
加分项
- 熟悉至少一种主流的机器学习框架(PyTorch/TensorFlow);
- 有以下某一方向领域的经验:AI Infrastructure,HW/SW Co-Design,High Performance Computing,ML Hardware Architecture(GPU,Accelerators,Networking);
- 在大模型或推荐模型领域,参与过大影响力的项目或论文。