jdwatch
  • Home
  • CLI
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

阿里控股-数据算法-杭州/北京

Company 阿里巴巴

Focus 技术 · 算法

北京, 杭州

July 30, 2026

岗位职责

  1. 高质量数据挖掘:负责重点领域高质量网页挖掘算法的设计与优化,提升有价值数据的召回率与准确率。针对特定类型数据源(如专业知识库、代码仓库、学术论文、多模态内容等)研发定向挖掘策略,构建可持续扩展的数据获取能力。
  2. 多模态合成数据生成:设计并构建 LLM / VLM / Omni 等多种模态的 SFT(监督微调)与 RL(强化学习)合成数据生产链路。研究合成数据的可控生成、多样性增强、难度调度与分布对齐方法,提升合成数据对模型能力的增益。
  3. 数据处理算法研发:研发新一代数据处理算法,包括但不限于网页解析、质量评分模型、数据去重与去污染、图像预处理、跨模态对齐等。推动算子的工程化落地,形成标准化、可插拔的数据处理组件。
  4. 数据质检与配比优化:构建数据质量验证算法,覆盖完整性、准确性、安全性、知识密度等多维指标。研发数据改写、数据清洗、数据配比优化等方法,保障训练数据分布合理、质量稳定。

任职要求

  1. 具有 LLM、VLM 或多模态大模型数据处理、预训练或后训练相关项目经验。
  2. 熟悉至少一种深度学习框架(PyTorch / TensorFlow 等)。
  3. 具备良好的问题分析和团队协作能力,能够独立推进算法研究到业务落地。

加分项: 1.有大模型核心团队(如知名 AI lab、头部互联网公司大模型团队、顶尖高校研究组等)工作经历。 2.在 ACL、EMNLP、NeurIPS、ICML、CVPR、ICCV、MM 等顶级会议或期刊发表过数据挖掘、多模态学习、大模型训练相关论文。 3.对网页解析、数据去重、质量模型、跨模态对齐、合成数据生成等方向有深入研究和实践经验。

岗位标签

NEW

Apply now

You'll be redirected to the official careers page. You can also sign in to save jobs and search more roles.