智能引擎-多模态大模型数据工程师-北京

Company Alibaba

Focus Tech · Algorithm

Location 北京

Published September 14, 2026

岗位职责

团队负责阿里巴巴多模态基础模型的数据体系建设,支撑行业领先的视频生成模型训练,处理百亿级图像、视频及图文数据。 本岗位聚焦复杂多模态数据管线建设,持续提升大规模数据处理的吞吐、正确性与数据质量,为 Pretrain、SFT、RL 提供高效、可靠的数据供给。 职位描述

  1. 设计和建设百亿级多模态数据处理管线,覆盖数据清洗、解码、转换、过滤、标注及训练加载等环节。
  2. 深入分析 CPU、内存、网络、存储、编解码及任务调度瓶颈,提升端到端吞吐、资源利用率和系统稳定性。
  3. 建设数据校验与质量评估体系,保障数据完整、一致、可追溯,持续提升数据的准确性、多样性和有效性。
  4. 基于 Ray、FFmpeg、PyTorch、vLLM 等技术建设高性能数据处理与模型推理组件,优化任务切分、批量推理、资源调度、数据传输及容错恢复。
  5. 面向 Pretrain、SFT、RL 等训练阶段,协同设计数据格式、分片策略、存储布局和读取链路,提升训练数据供给效率。
  6. 建立数据管线可观测体系,持续监控吞吐、延迟、资源利用率、失败率及数据质量,并分析数据特征与模型效果的关联。
  7. 与算法、训练框架及基础设施团队协作,完成复杂数据链路的架构设计、性能优化和规模化落地。

任职要求

  1. 计算机基础扎实,熟练使用 Python,具备良好的 Linux 系统开发能力。
  2. 熟悉 PyTorch、FFmpeg、vLLM 等技术,具备多媒体数据处理或模型推理经验。
  3. 熟悉 Ray 或其他分布式计算框架,理解任务调度、数据传输、容错和资源管理机制。
  4. 具备系统性能分析与调优能力,能够定位 CPU、网络、存储、I/O 及编解码瓶颈。
  5. 了解多模态大模型及不同训练阶段的数据需求,重视数据质量,具备良好的跨团队协作能力。