AI数据基建工程师
Company 哔哩哔哩
Focus 技术 · 数据
上海
May 22, 2026
岗位职责
岗位详情
工作职责: 1.负责下一代 AI 多模态数据湖的架构设计与开发,基于 Lance 格式构建高性能、支持零拷贝与版本控制的统一存储底座,解决海量非结构化数据(图像、音视频、点云等)的存储与检索瓶颈。 2.基于 Ray 分布式计算框架,设计并开发大规模数据预处理、ETL 及特征工程流水线,实现 CPU/GPU 异构资源的高效调度与弹性伸缩,支撑 PB 级数据的并行处理。 3.深度优化 Lance 数据集的读写性能与索引机制(如标量索引、向量索引 IVF_PQ 等),结合 Ray 实现分布式的数据维护任务(如小文件合并 compact、索引重建 reindex),显著降低训练与推理场景下的 IO 放大与延迟。 4.推动 Daft + Ray + Lance 等现代数据技术栈的落地,打通从原始多模态数据采集、Embedding 向量化、索引构建到 Agent 记忆湖(Memory Lake)的全链路。 5.与算法及模型团队紧密配合,提供高效的数据版本回溯、Schema 演进(Zero-Cost Data Evolution)及高性能随机访问能力,提升 GPU 集群在模型训练与微调时的利用率。 工作要求: 1.计算机科学、软件工程或相关专业本科及以上学历,3年以上大数据基础架构或 AI 系统工程开发经验。 2.精通 Python 编程,具备优秀的代码工程能力;熟悉 Linux 开发环境及对象存储(如 OSS、S3)的高性能对接。 3.深入理解 Ray 分布式计算框架,熟悉 Ray Core(Actor, Task, Object Store)及 Ray Data 的运行机制,有大规模集群下的任务调度与资源隔离优化经验。 4.熟悉 Lance / LanceDB 数据格式及其底层原理(如 Manifest 元数据管理、零拷贝读取、向量检索),有基于 Lance 构建多模态数据湖或向量检索系统的实战经验。 5.了解现代多模态数据处理引擎(如 Daft、Spark 等),对 AI 场景下的数据流水线(Data Pipeline)性能优化有深刻认知。
任职要求
(暂无)