jdwatch
  • Home
  • CLI
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

数据技术及产品部-AI数据工程师-LLM/VL方向

Company 阿里巴巴

Focus 技术 · 算法

北京, 杭州

July 30, 2026

岗位职责

1、参与集团级 AI 数据引擎:负责文本、图像、视频、音频等全模态数据的采集、清洗、处理、治理与资产化管理,打造可复用、可观测、可解释的 EB 级数据体系,支撑大模型预训练与后训练的高质量数据供给; 2、多模态数据智能化处理:主导文本、图文、视频、文档、语音等模态的自动理解、标签体系构建、语义特征抽取、质量建模与自动化治理; 设计并训练分类、识别、caption、质量打分、预测等模型; 3、AI Native 数据 Pipeline 建设:使用 LLM + VLM + Agent 框架构建智能数据 Pipeline,实现分渠道采集、过滤、去重、质量诊断、标注/改写生成、调度编排与异常告警等环节的自动化,显著降低人力成本; 4、稀缺与高价值数据挖掘:面向网页/PDF/百科/私域/query 等文本场景,以及 real world(巡店/巡检/巡仓)、医疗、教育、OCR、GUI/多模态轨迹等视觉场景,通过"真实采集 + 人工标注 + 模型蒸馏 + 数据合成"四源策略,产出稀缺、高价值、差异化的数据集; 5、数据 & 模型闭环迭代:基于评测反馈的短板,设计对应的专项数据集与合成方案,在训练过程中构建可观测指标,量化数据对模型能力提升的贡献,动态更新数据集,实现"数据—模型—评测—数据"的循环优化; 6、算法与工程一体化协作:与模型团队协作,参与训练数据构造、数据反哺、短板挖掘与评测闭环建设,通过数据驱动模型能力提升,成为 AI 模型训练的数据核心驱动力。

任职要求

1、AI + 数据双栈能力:精通 Python,熟悉 SQL/Shell;理解 LLM、音频/视频模型、多模态模型等基础原理;具有大模型数据构造、清洗、合成或质量评估相关实践经验; 2、多模态数据能力:熟悉文本,或图像/视频/音频中任一模态的特征工程、理解/分类/识别算法或质量建模方法;具备深度学习模型训练实践(PyTorch/TensorFlow); 3、数据工程基础扎实:熟悉主流大数据平台(Spark/Flink/MaxCompute/Hadoop/RAY);具备 ETL、数据建模、数据 Pipeline 或数据仓库建设经验;了解大规模文本/图像/视频数据处理者更佳; 4、AI Native 工作流思维:熟悉 Agent、LLM 工具链,对如何将 LLM 融入数据生产、数据分析、数据治理流程有实践经验或强烈兴趣; 5、工程落地能力强:具备良好的工程实现、问题拆解、项目协同能力,能推动数据与模型闭环高效落地。

加分项 1、在 ACL、EMNLP、NeurIPS、ICLR、AAAI、CVPR、ICCV、ECCV、ACM MM、ICASSP、Interspeech 等顶会有论文,或参与过 LLM、VL、语音、多模态等方向竞赛、开源贡献者优先; 2、有 LLM/VLM/多模态大模型预训练或后训练数据的实战经验; 3、有数据合成(文本合成、图文对合成、渲染/扩散生成)或多模态轨迹数据(GUI/搜索/文件操作)构造经验者优先; 4、熟悉主流评测基准(如 MMLU、MMBench、MM-BrowseComp 等),对数据反哺模型能力提升有实战经验者优先; 5、有小模型/算子训练与加速优化实践经验者优先。

岗位标签

NEW

Apply now

You'll be redirected to the official careers page. You can also sign in to save jobs and search more roles.