研究型实习生-面向大模型语料和RAG搜索数据的全网理解和特征研究

Intern

Company Antgroup

Focus Tech · Algorithm

Location 杭州

Published September 24, 2026

岗位职责

研究领域: 数据挖掘 项目简介: 全网数据是大模型训练语料最大的数据来源,互联网是最重要的世界知识来源之一。但全网数百万亿的网页规模,也会带来很大的挑战,下面围绕几个关键层次展开说明下:

  1. 全网高价值内容稀疏性 — Common Crawl等采集数据中仅不到5%满足LLM/RAG质量要求,数据转化率是核心瓶颈。进一步扩展到全网范围,这个转化率会更低。
  2. 传统PageRank失效 — 由于互联网的持续扩展,链接结构稀释、SEO操纵、AIGC冲击、语义价值维度缺失等导致互联网早期的PageRank等策略很难有效过滤高价值内容。
  3. 数据价值定义的范式转变 — 从"点击满意度+链接权威性"转向"知识密度+信息增益+事实准确性+语义多样性",对于内容价值的评估也有很大的不同。
  4. 业界进展分析 — 引用了2024-2025年的一些关键工作:
  • DataComp-LM(斯坦福/苹果等23所机构,2024)— 首个系统验证"数据筛选策略决定模型性能"的基准
  • Ultra-FineWeb(清华等,2025.5)— 高效数据过滤流水线,构建1万亿英文+1200亿中文高质量语料
  • CNCC 2025 LLM数据处理Tutorial — 领域权威会议将数据质量列为核心研究方向 因此构建全网理解和特征研究对于建设大模型语料和RAG索引数据都是非常重要的研究工作。

任职要求

研究领域:

  • 目前正在攻读计算机科学或相关STEM领域的学士,硕士或博士学位
  • 具有一种或多种通用编程语言的经验,包括但不限于: Java,C/C ++ 、Python、JavaScript或Go
  • 具有上述研究领域的相关经验,包括行业经验或作为参与实验室研究 优先录用:
  • 对技术研究充满热情,具有产生新思想和创新的能力; 在自学,问题分析和解决方面表现出色
  • 在国际会议上或核心期刊发表一份或多份出版物或论文
  • 至少3个月的全职工作

特色标签

C/C++、Golang、Java、Python、RAG检索数据、互联网内容理解、信息增益度量、公共爬取数据、内容、内容价值评估、分布式系统开发经验、发表算法相关优秀论文、大数据、大数据处理经验、大数据开发经验、大模型算法、大模型训练数据、大规模内容分析、开源网络爬虫数据、搜索、搜索算法、数据分析/挖掘经验、数据处理经验、数据安全、数据挖掘、有留学背景、机器学习、机器学习建模经验、检索增强生成数据、深度学习、熟悉Linux环境、爬虫开发经验、知识图谱、算法工程化经验、网络数据挖掘、网页权威性评分、网页级语义解析、自然语言处理算法、自然语言处理经验、英美留学生、计算机相关专业、语料过滤方法、链接排名算法、预训练语料、高质量数据选择