研究型实习生-面向模型的 RSI 后训练数据生成 Harness 研究1

Intern

Company Antgroup

Focus Tech · Other

Location 杭州

Published October 8, 2026

岗位职责

研究领域: 数据合成与标注 项目简介: 随着大模型进入 Reasoning 与 Agentic 阶段,后训练数据建设的核心问题正在从“如何获得更多数据”转向“如何持续获得对当前模型真正有效的数据”。尤其在 RL 训练中,数据价值与模型当前能力高度相关:过于简单的数据训练收益有限,过难的数据又缺乏有效探索信号,真正高价值的数据往往集中在模型当前的能力边界附近。 现有数据生产通常依赖固定任务池、人工配比或 Teacher 模型批量合成,数据分布与自研模型实际能力演进相互割裂。同时,SWE、Terminal 等 Agentic 数据天然依赖可执行 Environment、模型 Rollout 和 Verifier,传统静态数据流水线难以持续产生高质量的交互轨迹与可验证 Reward。 本研究拟构建一套面向自研模型的 RSI RL Data Generation Harness。以当前模型的真实 Rollout 为起点,持续识别模型的能力短板与 Learning Frontier,定向进行任务筛选、扩源、生成与难度调整;通过 Environment 和 Verifier 自动产生并验证 Success、Failure、Recovery 等轨迹,形成可用于 SFT、DPO、GRPO/RLVR 等后训练的数据,并通过训练效果反向优化下一轮数据生产策略,形成: Model → Rollout → 能力诊断 → 数据生成 → Training → Evaluation → 新一轮数据生成 的递归数据生产闭环。

任职要求

研究领域:

  • 目前正在攻读计算机科学或相关STEM领域的学士,硕士或博士学位
  • 具有一种或多种通用编程语言的经验,包括但不限于: Java,C/C ++ 、Python、JavaScript或Go
  • 具有上述研究领域的相关经验,包括行业经验或作为参与实验室研究 优先录用:
  • 对技术研究充满热情,具有产生新思想和创新的能力; 在自学,问题分析和解决方面表现出色
  • 在国际会议上或核心期刊发表一份或多份出版物或论文
  • 至少3个月的全职工作

特色标签

C/C++、Golang、Java、Python、发表算法相关优秀论文、后段训练数据、增量微调数据、增量训练数据、大模型算法、学习前沿、强化学习、强化学习训练、强化学习调优、数据合成、数据标注、数据生成、数据管道、数据链路、智能体、标注、模型交互轨迹、模型推演、模型采样、深度学习、瓶颈区间、监督微调、直接偏好优化、研发效能、算法工程化经验、能力短板、递归自改进、验证器、验证模块