岗位职责
- 负责 RLake 数据湖存储引擎的核心模块研发,包括但不限于文件格式、元数据管理、读写优化、Schema Evolution 等;
- 参与构建面向 AI 场景的统一存储服务,支持结构化(表数据)与非结构化(向量、文件、多模态)数据的统一存储与高效访问;
- 深入 Flink / Spark 等计算引擎,优化数据湖在流式写入、批量读取、联邦查询等场景下的性能表现;
- 参与跨语言 SDK(Python / C++ / Rust)的设计与开发,为上层 AI 和数据科学场景提供高性能访问接口;
- 参与开源社区(Apache Paimon 等)的技术共建,跟进前沿数据湖技术趋势,将创新成果沉淀到产品中;
- 负责线上稳定性保障,定位和解决生产环境中的性能瓶颈与疑难问题。
任职要求
- 计算机基础知识扎实,精通引擎性能优化和问题定位;
- 熟悉 Paimon / Hudi / Iceberg 其中一项引擎,对数据存储技术有深入的理解;
- 熟悉 Flink / Spark / Ray 其中一项引擎,具备研发计算引擎源码的能力;
- 熟练掌握 AI 的编程方式;
- 自驱、结果导向,具备良好的协作和沟通能力,能够将技术方案落地为稳定、可维护的工程产物。
加分项
- 有 Apache Paimon / Hudi / Iceberg 等数据湖开源社区贡献经验者优先;
- 有 AI Infra、向量数据库、多模态数据存储相关经验者优先;
- 熟悉C++,有跨语言系统编程经验者优先;
- 有大规模数据生产环境(PB 级以上)调优和稳定性保障经验者优先。
岗位标签
NEW
特色标签
Apache Flink、C/C++、Catalog管理、Embedding数据、Hadoop、Java、Kafka、Lakehouse、Linux开发/部署经验、Paimon数据湖、Paimon表格式、Python、PyTorch、Spark、TensorFlow、中大型项目开发经验、元数据服务、分布式经验、分布式计算、动态Schema、向量存储、向量文件、增量写入、多模态内容、多模态文件、大数据、字段变更、存储层、存储服务、存储系统、实时入湖、微服务经验、数据库、数据湖仓、有留学背景、机器学习经验、流处理引擎、流式入库、混合模态数据、湖仓一体、系统架构设计经验、统一查询、联邦计算、英美留学生、英语读写能力良好、表元数据、表结构演进、跨源查询