阿里控股-Fluss高级研发工程师/专家-多模态数据湖
Company 阿里巴巴
Focus 技术 · 算法
杭州
July 30, 2026
岗位职责
负责阿里巴巴多模态数据湖 ALake 体系中 Fluss 流式存储引擎的研发,构建面向实时数仓与流批一体场景的下一代存储底座。
- Fluss 引擎研发:参与 Fluss 流式存储核心模块的设计与开发,包括行存/列存引擎、数据 Compaction、Checkpoint、故障恢复等
- 湖仓联动:设计和实现 Fluss 与 Paimon 的数据联动机制,支撑 CDC 数据实时入湖、流批一体消费等场景
- 引擎集成:推进 Fluss 与 Flink、Spark、StarRocks 等计算引擎的 Connector 开发与性能优化
- 性能调优:端到端优化数据写入延迟、吞吐、小文件治理,解决线上大规模场景下的稳定性问题
- 技术方案设计:参与 Fluss 架构演进,输出技术设计文档,推动开源社区建设
任职要求
- Fluss 相关:
- 熟悉 Fluss 架构设计,理解其行存(KV)+ 列存(Log)双引擎模型
- 了解 Fluss 的 Primary Key 表、Append 表的数据模型与使用场景
- 有 Fluss 源码阅读或实际开发经验者优先
- Paimon 相关:
- 熟悉 Apache Paimon 的核心概念:表类型(主键表/Append表)、Compaction 机制、Snapshot 管理、Manifest 文件结构
- 了解 Paimon 与 Hive Metastore / DLF 的元数据对接方式
- 有 Paimon 生产环境调优经验者优先
- 基础能力:
- 精通 Java,熟悉分布式系统设计,了解一致性协议(Raft/Paxos)
- 熟悉 Apache Flink internals,了解 Checkpoint/State Backend/Connector SPI
- 熟悉 HDFS/OSS/盘古 等分布式文件系统的读写机制
- 加分项:
- 有 Apache 开源项目 Committer/PMC 经历
- 熟悉 Kafka、Pulsar 等消息队列的底层实现
- 了解 StarRocks/Doris 等 OLAP 引擎的 Catalog 集成机制
岗位标签
NEW