AI数据与检索基础设施工程

Campus

Company Antgroup

Focus Tech · Other

Location 北京, 上海, 杭州

Published July 22, 2026

岗位职责

负责建设面向 AGI 的核心数据与检索引擎,支撑全域大模型的训练及 Agent 应用闭环。

具体的职责包括以下相关方向的一项或多项:

  1. 高密度语料熔炉与预训练基建。建设面向海量多模态数据的极速流水线。研发高效和高准入门槛的分布式去重、质量打分与退火期数据动态配比调度统。通过提升预训练数据的纯度与信息熵,直接为底座模型节省海量 GPU 算力,拉升模型的基础逻辑推理天花板;
  2. 数据合成与后训练飞轮。结合强模型蒸馏与大模型评测,构建自动化的 SFT 与 RLHF 数据合成与清洗流水线。打造从真实线上 Agent 复杂轨迹捕获、清洗到模型自动微调对齐的数据反馈飞轮,实现模型能力的高效自我进化;
  3. 认知记忆与智能检索基建。建设高吞吐的向量/图数据库索引。探索并落地结构化知识图谱与大模型底层的深度融合,根除模型多跳推理幻觉。研发支持亿级用户的 Agent 长周期记忆系统,实现对话上下文的高能压缩与合规流转,提升个性化推理效果。

任职要求

  1. 扎实的工程底色: 计算机、数学或相关专业应届毕业生。精通Python,并熟练掌握C++、Java,Go或Rust中的至少一种语言。对数据结构、算法及高并发系统设计有深刻理解;
  2. 熟练的大数据技能:熟悉分布式计算与存储原理。了解 Spark、Flink 等传统框架,同时对 Ray 等面向 AI 计算调度的现代分布式框架有强烈的探索欲或实践经验;
  3. 核心的 AI Native 思维: 不仅将数据视为报表或资产,更将其视为模型的表征与燃料。理解Transformer底层原理,熟悉Tokenization、Embedding机制,深刻认知数据分布、多样性及噪声对生成式AI效果的决定性影响;
  4. 敏锐的技术视野:关注开源 AI 社区,了解 LangChain、LlamaIndex 或各类主流向量/图数据库。对 GPU 显存机制、推理延迟(TTFT)或 Token 成本有基本概念者佳。

加分项(非必须但高度优先):

  1. 有在核心搜索、推荐系统或商业化广告引擎的数据架构实习经验;
  2. 曾亲自动手微调过开源大模型,或深度参与过高质量Instruction-tuning数据集的构建与清洗;
  3. 在顶会(如 KDD, ACL, NeurIPS, OSDI, SOSP)发表过数据挖掘、NLP 或分布式系统相关论文;
  4. 活跃的开源贡献者,曾向 vLLM, Ray, Megatron-LM 等知名 AI Infra 项目提交过 PR。

特色标签

AI智能体、C/C++、Flink、Golang、Java、Kafka、LLM、Python、Redis、Scala、Shell、Spark、Storm、云服务、云计算、人类反馈强化学习、内容、分布式系统开发经验、分布式计算、分布式训练、发表算法相关优秀论文、合成数据、向量引擎、向量检索库、图像、图存储、图引擎、基础模型、多模态算法、多模态语料、大数据、大数据处理工具(Spark/Hadoop/Hive)、大数据处理经验、大数据开发经验、大模型算法、大语言模型、对齐训练、并行计算、广告、底座模型、强人工智能、强化学习、指令微调、推荐、搜索、搜索算法、数学/统计相关专业、数据分析/挖掘经验、数据处理经验、数据安全、数据挖掘、数据生成、智能体、有留学背景、机器学习建模经验、模型加速/性能优化、模型预训练、深度学习、熟悉Linux环境、电商、监督微调、直播、知识图谱、算法工程化经验、自然语言处理算法、自然语言处理经验、英美留学生、视频、计算机相关专业、跨模态数据、通用人工智能、预训练阶段