多模态数据平台研发工程师
Company 哔哩哔哩
Focus 技术 · 算法
上海
July 23, 2026
岗位职责
岗位详情
工作职责:
- 面向多模态模型全生命周期,构建面向文本、图像、视频、音频、结构化数据等多模态数据的统一数据平台,支撑海量异构数据的高效采集、存储、处理与分发,支持 PB 级数据管理,保障大规模数据训练任务的高吞吐与低延迟。
- 建设多模态数据处理管线,实现跨模态数据的清洗、标注、增强、特征提取、向量化与可视化;探索跨模态数据的对齐、融合与联合分析技术。
- 主导平台架构演进,构建面向 AI-Native 的 Data Agent 基础设施,探索智能调度、自动修复、自适应优化等能力,推动数据平台从"工具化"向"智能化"演进,重新定义数据平台的交互与运维范式。
- 关注平台研发效能与开发者体验,设计标准化的 API/SDK、可观测性体系及自动化运维工具,降低业务接入成本,提升平台易用性。 工作要求: 职位要求
- 精通 Python、Java、Go 等至少一种编程语言,具备扎实的分布式系统基础。
- 深入理解以下至少一种技术体系,并具备线上平台化实践经验:
- 计算引擎(Ray)及其平台化封装;
- 数据湖/湖仓一体方案(Iceberg/Paimon/Lance)及元数据管理;
- 分布式调度系统、资源管理(YARN/K8s)或工作流编排平台。
- 理解大模型训练与推理全链路中的数据流转机制,熟悉数据从采集、清洗、标注、增强到训练样本构造的全生命周期管理。
- 对业务敏感,能快速理解业务背景,具备优秀的技术与业务结合能力、需求抽象能力和架构能力;学习能力强,能够快速学习新技术并应用于工程实践。
加分项
- 有大厂或 AI 公司内部数据平台、评估平台的建设经验;有数据平台(如数据开发平台、任务调度平台、标注平台)的完整设计或核心开发经验。
- 参与过大规模多模态数据预处理、清洗、合成等流水线平台的建设,服务于大模型 Pretra
任职要求
(暂无)