多模态大模型数据策略算法工程师-【可灵AI专项】
Company Kuaishou
Focus Tech · Algorithm
Location 北京
Published July 27, 2026
岗位职责
1、作为训练数据交付的 owner,承接预训练/后训练/RL 各阶段的数据需求,将模型数据策略落地为可执行的数据规格(数据源、处理策略、质量标准、量级与时效),端到端构建并交付训练就绪数据集; 2、研发与应用视频数据核心算子:多维质量过滤(清晰度/美学/构图/运动性)、镜头切分、大规模语义去重、水印字幕检测、Caption/Recaption 链路,并建立算子效果评估基线; 3、基于数据平台将算子编排为自动化数据管线,落实数据与处理算子版本化,让每一批交付数据可追溯、可复现; 4、探索基于 MLLM 的数据合成与增强技术,设计高效生成策略补充数据缺口;建设多样性覆盖度度量(主体/场景/动作/风格/运镜)与分布再平衡、训练配比实验; 5、建设数据↔模型的归因与消融实验能力,结合评测反馈持续迭代数据策略与交付质量,与模型算法、数据平台、数据产品高效协同。
任职要求
1、计算机、人工智能、统计学、数学或相关专业硕士及以上学历,具备机器学习、模型训练及数据处理项目经验,拥有扎实的数据分析与建模基础; 2、工程与算法双技能:精通 Python 并掌握至少一种工程语言(C++/Java/Go),熟悉 Ray/Spark 等分布式计算框架,具备将算法沉淀为生产级管线的工程能力;同时具备扎实的机器学习基础与数据建模能力; 3、具备大规模视频/图像数据处理实战经验,熟练应用以下至少两个方向:视频质量评估、视频表征与 embedding、镜头切分、语义去重、caption 数据工程、多模态数据合成;熟悉 vLLM 等推理加速框架者优先; 4、有端到端交付数据集的项目经历者优先——能独立承接需求、拆解执行、按时交付并对质量负责;沟通高效,能在算法/平台/标注多方之间高效协同; 5、善用 AI-coding 与大模型工具提升研发与分析效率。
加分项: 1、有视频/图像生成模型训练数据构建的一线经验; 2、训练或微调过质量打分/安全分类/水印检测类模型; 3、在 CVPR/ICCV/ECCV/NeurIPS 等发表过视频理解/生成方向论文; 4、在视频/图像数据集或数据处理开源项目有活跃贡献。