研究型实习生-面向in-house的Agentic数据合成方法研究-2

Intern

Company Antgroup

Focus Tech · Other

Location 杭州

Published September 18, 2026

岗位职责

研究领域: 数据合成与标注 项目简介: 团队正在构建 In-House Data Quality Benchmark——一套面向内部 Cowork(人机协同)工作流的数据质量评估基准,覆盖 SFT 指令数据、RLHF 偏好数据、CoT 思维链数据三大场景,定义了事实准确性、逻辑连贯性、指令遵从度、表达多样性、安全合规、人机一致性等 10 个细粒度评估维度。 当前 Cowork 工作流("AI 预生成 → 人工审核/修订 → 质量校验 → 入库")在生产实践中面临四个核心问题:

  1. 质量无量化标准:数据质量依赖标注员主观判断,跨标注员、跨批次波动大,缺乏客观可复现的评估基准。
  2. 协作策略效果未知:工作流中 AI 预生成参数(模型、温度、n-shot)、人工修订深度、审核阈值等变量对最终数据质量的影响未经验证,配置依赖经验直觉。
  3. 质量瓶颈不可见:工作流是多环节串联,当终版数据质量不达标时,无法定位质量损失发生在预生成、人工修订还是审核环节。
  4. Benchmark 自身可信度未验证:benchmark 的 LLM-as-Judge 评估方法与人工判断的一致性、各维度的实际区分力、评估得分与下游模型训练效果的相关性均未经验证。 本课题以该 Benchmark 为评估基准,围绕"如何系统性评估和优化 Cowork 工作流的数据产出质量"展开研究。

任职要求

研究领域:

  • 目前正在攻读计算机科学或相关STEM领域的学士,硕士或博士学位
  • 具有一种或多种通用编程语言的经验,包括但不限于: Java,C/C ++ 、Python、JavaScript或Go
  • 具有上述研究领域的相关经验,包括行业经验或作为参与实验室研究 优先录用:
  • 对技术研究充满热情,具有产生新思想和创新的能力; 在自学,问题分析和解决方面表现出色
  • 在国际会议上或核心期刊发表一份或多份出版物或论文
  • 至少3个月的全职工作

特色标签

Benchmark、C/C++、Chain-of-Thought 数据、Cowork、Java、LLM 评分方法、Python、RLHF 偏好样本、人机合作、人类反馈偏好数据、发表算法相关优秀论文、大数据、大模型做裁判、大模型算法、大模型评估、强化学习、强化学习与人类反馈数据、思维链数据、打标、数据扩增、数据挖掘、数据标注、数据生成、数据质量评价、标准参考、标注、标签生成、标记、样本合成、模型评分器、混合智能协作、研发效能、自然语言处理算法、评价基准、质量度量、质量检测、过程性推理数据