研究型实习生-面向基模后训练的高质数据筛选方案研究-2
Company Antgroup
Focus Tech · Other
Location 杭州
Published September 21, 2026
岗位职责
研究领域: 大数据 项目简介: 大语言模型的训练效果在很大程度上由训练数据的质量决定。随着模型规模与训练数据量的持续扩大,如何从海量原始数据中高效筛选出真正对模型能力提升有贡献的样本,已成为制约大模型研发效率的核心瓶颈之一。 当前业界主流的数据质量筛选范式,以 Bradley-Terry 类通用质量算子为主导:对所有文本统一打分、统一过滤。这一范式在工程效率上具备良好的规模化能力,但随着训练目标的复杂化与数据类型的多样化,已暴露出明显的结构性局限:通用算子擅长识别写得好的文本,却难以区分对特定能力真正有用的文本;单一标量质量分无法表达合成数据的错误类型与系统性缺陷;而对于包含思维链的后训练 SFT 数据,仅凭表面打分更无法判断模型是否真正利用了数据中的推理过程。 本研究的核心判断是:不同数据类型与训练阶段,应当匹配不同层次的筛选路径。具体而言,预训练真实数据需要从单一算子升级为分类型多算子与专家 Agent 混合体系;预训练合成数据需要引入数据集级归因与样本级诊断的两阶段 Agentic 筛选框架;后训练 SFT 数据则需要突破数据表面的质量判断范式,通过 Information-Mask 验证(即遮蔽 CoT 观察 Loss 变化)与 Reasoning-Focus Head 注意力追踪,直接探测模型内部对每条训练样本的依赖程度,从数据视角打分升级为模型视角验证。
任职要求
研究领域:
- 目前正在攻读计算机科学或相关STEM领域的学士,硕士或博士学位
- 具有一种或多种通用编程语言的经验,包括但不限于: Java,C/C ++ 、Python、JavaScript或Go
- 具有上述研究领域的相关经验,包括行业经验或作为参与实验室研究 优先录用:
- 对技术研究充满热情,具有产生新思想和创新的能力; 在自学,问题分析和解决方面表现出色
- 在国际会议上或核心期刊发表一份或多份出版物或论文
- 至少3个月的全职工作
特色标签
Agent-based Filtering、AI代理过滤、Attention Monitoring、Attention Tracing、C/C++、Chain-of-Thought、CoT、Ensemble Scorer、Golang、Instruction-Tuning数据、Java、LLM、Post-Training、Python、Quality Scorer、SFT、专家打分器、发表算法相关优秀论文、大数据、大模型、大模型算法、微调阶段、指令微调数据、推理链、数据优劣、数据挖掘、数据过滤、文本质量模型、智能体筛选、机器学习、样本筛选、模型加速/性能优化、注意力可视化、深度学习、混合质量模型、监督微调数据、算法工程化经验、自然语言处理算法、训练数据质量、语料清洗、语料质量、语言大模型、质量评分器