千问事业部-高级数据研发专家-大模型语料
Company Quark
Focus Tech · Algorithm
Location 北京, 杭州
Published July 1, 2026
岗位职责
- 负责语料数据处理工程架构的整体设计与演进,覆盖文本、图片、音视频等多模态语料的清洗、处理与交付,支撑千问app toC业务场景的高质量语料供给;
- 负责语料数据处理体系的架构设计与能力建设,基于对模型训练需求与语料特性的理解,设计标准化的数据处理算子与Pipeline体系(如清洗、去重、过滤、结构化、对齐、质量评估等),与基础调度及AI Infra团队协同,实现大规模语料数据处理的效率提升与成本优化;
- 构建语料数据管控、数据画像与数据资产管理能力,对语料数据的来源、结构、分布、质量、覆盖度及使用效果进行系统化刻画,实现语料数据的可管理、可理解、可追溯,为模型训练与业务优化提供数据洞察与决策支持;
- 打造语料数据质量评估平台,支持多模态语料数据质量分析,沉淀高质量语料数据资产,并通过AI能力显著提升语料生产效率与质量;
- 构建语料数据分析与效果归因能力,打通“语料数据—模型训练—业务效果”的反馈链路,通过数据分析识别关键数据问题与数据缺口,指导语料数据采集、处理与标注策略,形成持续优化的数据飞轮;
- 规划语料方向的Agent应用落地,覆盖数据处理、问题排查、指标分析、效果归因等各环节,提升模型语料数据建设的效率与效果;
- 作为工程架构负责人,统筹语料数据处理相关技术方向与系统演进,带领团队完成关键系统建设,并与算法、业务及AI基础平台团队协同,推动语料数据体系在各类AI场景中的落地。
任职要求
- 主导设计和落地过大规模AI语料数据处理平台或数据生产系统,具备从0到1或大规模演进语料数据体系的经验,能够从工程架构层面构建支撑语料数据全生命周期的系统能力;
- 具备大规模数据处理经验,熟悉网页、文档、文本、图片及音视频等多模态语料数据处理技术,对语料清洗、去重、过滤、结构化、对齐及质量评估等关键流程有深入理解;
- 熟悉分布式数据计算与存储技术,如 Ray、Spark、Flink、Paimon 等,具备大规模数据处理系统设计与性能优化经验,能够与AI Infra及基础数据平台团队协同推进能力落地;
- 熟悉数据分类与质量评价体系,具备语料数据治理与数据画像建设经验,能够通过数据分析与评估指导语料数据建设与优化;
- 深刻理解并熟练掌握 AI Agent 的核心技术范式,熟悉主流Agent开发框架,如LangChain、OpenClaw等,能基于业务场景拆解和落地skill能力建设;
- 具备卓越的跨团队沟通协调能力及技术领导能力,能够在算法、工程与业务之间建立高效协同机制,主导复杂项目顺利交付;
- 具备创新视野,关注大模型语料工程、数据生产与数据治理领域的前沿技术,并能够推动新技术在业务中的快速落地。