千问事业部-大模型语料数据研发专家-杭州/北京
Company Quark
Focus Tech · Algorithm
Location 北京, 杭州
Published July 1, 2026
岗位职责
- 负责语料数据工程架构建设,覆盖文本、图片、音视频等多模语料的清洗、处理与交付,支撑千问app toC业务场景的高质量语料供给;
- 基于模型训练要求和各模态语料特性,设计标准化的数据处理算子和pipeline,与基础调度及AI Infra团队协同,实现大规模语料数据处理的效率提升和成本优化;
- 构建语料数据管控、数据画像与数据资产管理能力,对语料数据的来源、结构、分布、质量、覆盖度及使用效果进行系统化刻画,实现可管理、可理解、可追溯,为模型训练与业务优化提供数据洞察与决策支持;
- 打造语料数据质量评估平台,支持多模态语料数据质量分析,沉淀高质量数据资产,并通过AI能力提升语料生产效率与质量;
- 构建语料数据分析与效果归因能力,打通“语料数据—模型训练—业务效果”的反馈链路,通过数据分析识别关键问题与数据缺口,指导采集、合成、处理与标注策略,形成持续优化的数据飞轮。
- 构建数据Agent能力,覆盖数据处理、问题排查、指标分析、效果归因等各环节,提升模型语料数据建设的效率与效果。
任职要求
- 具备大规模数据处理经验,熟悉网页、文档、文本、图片及音视频等多模态语料数据处理技术,对语料清洗、去重、过滤、结构化、对齐及质量评估等关键流程有深入理解;
- 熟悉分布式数据计算与存储技术,如 Ray、Spark、Flink、Paimon 等,具备大规模数据处理系统设计与性能优化经验,能够与AI Infra及基础数据平台团队协同推进能力落地;
- 熟悉数据分类与质量评价体系,具备语料数据治理与数据画像建设经验,能够通过数据分析与评估指导语料数据建设与优化;
- 熟悉主流Agent开发框架,如LangChain、OpenClaw等,能基于业务场景拆解和落地skill能力建设,具有Agent实际落地经验。