研究型实习生-面向in-house的Agentic数据合成方法研究-1

Intern

Company Antgroup

Focus Tech · Other

Location 杭州

Published September 18, 2026

岗位职责

研究领域: 数据合成与标注 项目简介: 团队正在构建 In-House Data Quality Benchmark——一套面向内部 Cowork(人机协同)工作流的数据质量评估基准,覆盖 SFT 指令数据、RLHF 偏好数据、CoT 思维链数据三大场景,定义了事实准确性、逻辑连贯性、指令遵从度、表达多样性、安全合规、人机一致性等 10 个细粒度评估维度。 当前 Cowork 工作流("AI 预生成 → 人工审核/修订 → 质量校验 → 入库")在生产实践中面临四个核心问题:

  1. 质量无量化标准:数据质量依赖标注员主观判断,跨标注员、跨批次波动大,缺乏客观可复现的评估基准。
  2. 协作策略效果未知:工作流中 AI 预生成参数(模型、温度、n-shot)、人工修订深度、审核阈值等变量对最终数据质量的影响未经验证,配置依赖经验直觉。
  3. 质量瓶颈不可见:工作流是多环节串联,当终版数据质量不达标时,无法定位质量损失发生在预生成、人工修订还是审核环节。
  4. Benchmark 自身可信度未验证:benchmark 的 LLM-as-Judge 评估方法与人工判断的一致性、各维度的实际区分力、评估得分与下游模型训练效果的相关性均未经验证。 本课题以该 Benchmark 为评估基准,围绕"如何系统性评估和优化 Cowork 工作流的数据产出质量"展开研究。

任职要求

研究领域:

  • 目前正在攻读计算机科学或相关STEM领域的学士,硕士或博士学位
  • 具有一种或多种通用编程语言的经验,包括但不限于: Java,C/C ++ 、Python、JavaScript或Go
  • 具有上述研究领域的相关经验,包括行业经验或作为参与实验室研究 优先录用:
  • 对技术研究充满热情,具有产生新思想和创新的能力; 在自学,问题分析和解决方面表现出色
  • 在国际会议上或核心期刊发表一份或多份出版物或论文
  • 至少3个月的全职工作

特色标签

AI-人工协作、C/C++、Golang、Java、Python、人机协作、人类反馈强化学习数据、偏好学习数据、发表算法相关优秀论文、大模型算法、大模型评审、强化学习、思维链数据、指令调优数据、数据安全、数据完整性、数据打标、数据扩充、数据挖掘、数据标记、数据生成、标注、模型即裁判、监督微调指令数据、自然语言处理算法、评价标准、评估指标、质量检测、质量检验、链式推理数据