jdwatch
  • Home
  • CLI
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

【快Star】多模态大模型数据策略算法工程师

Campus/Intern

Company 快手

Focus 技术 · 算法

北京

July 30, 2026

岗位职责

  1. 主导可灵生成式大模型的训练数据管线建设,涵盖寻源、采集、处理、实验与分析等环节,为基础模型提供多种模态( 视频/图片/文本) 的 稳定且高质量训练数据;
  2. 涵盖模型训练的各个阶段( 预训练/后训练/RL 等),针对模型的效果短板,探索基于MLLM的数据合成与增强技术,设计高效生成策略以补充数据缺口,并定义高价值与高质量数据标准,
  3. 建立Data-Model的自动化评估体系,并结合模型评测与数据分析反馈,反向迭代生产线与数据生成策略;
  4. 设计数据链路策略,建设端到端的数据质量、多样性体系及数据标签,与模型算法、数据产品高效协同,探索模型训练数据的最优配比。
  5. 搭建并优化大模型训练的数据工程基建,基于Harness 研发模式,快速开发自动化框架与工具链,并运用数据挖掘、统计分析、大模型工具等方法,提升数据策略的迭代与分析效率。

任职要求

  1. 计算机、人工智能、统计学、数学或相关专业硕士及以上学历,具备机器学习、模型训练及数据处理项目经验,拥有扎实的数据分析与建模基础;
  2. 具备AI数据开发经验,掌握大模型预训练基本原理,熟悉至少一类核心模态(视频/图片/文本)的数据特性; 具备扎实的编程基本功,精通python并至少掌握一种工程类编程语言( C++/Java/Go )。
  3. 在数据策略或工程领域,需精通以下任意方向的专业能力:数据策略:深入理解主流大模型架构及训练机制,熟悉各类数据评估算法与数据增强机制;数据工程:熟悉Ray/ Spark / Flink 等分布式计算框架,熟悉vLLM等推理加速框架者优先
  4. 具备数据质量指标设计能力,能够熟练使用机器学习算法优化数据筛选与评估效率,沟通高效,良好的合作精神。
  5. 加分项:对视频生成、计算机视觉或多模态生成技术有深入理解;在大模型相关领域(ACL、EMNLP、NeurIPS等)发表过高水平论文,或在GitHub开源项目(特别涉及合成数据、数据处理)有活跃贡献者优先。
Apply now

You'll be redirected to the official careers page. You can also sign in to save jobs and search more roles.