研究型实习生- 医疗大模型评测方案的研究和应用

Intern

Company Antgroup

Focus Tech · Algorithm

Location 上海, 杭州

Published June 8, 2026

岗位职责

研究领域: 大模型 项目简介: 随着阿福逐步从“文本问答”走向“多模态医疗服务”(如检验检查单解读、影像/皮肤照片辅助建议等),以及大模型推理能力、对齐方式(RLHF/RLAIF/自反馈等)快速演进,现有评测体系暴露出结构性不足,难以支撑“可信上线、可持续迭代、可对外对标”的要求,主要体现在:

  1. 评测范式缺乏科学性与可证性:当前评测多依赖静态题库+人工打分,指标定义与标注一致性缺乏可验证的统计学与因果支撑,导致“分数提升不等于真实风险下降/真实体验提升”。
  2. 多模态医疗场景评测缺位:医学多模态任务(图像/报告单/用药记录等)存在输入不确定性、信息缺失与噪声、跨模态推理链长等特性,沿用文本问答评测指标会系统性低估风险与高估能力。
  3. 缺少权威可复现的Benchmark:内部指标难以与业界(如DeepSeek-R1等推理模型、医疗多模态开源评测)建立可比性,也难以沉淀为可公开的研究成果与技术影响力。

任职要求

研究领域:

  • 目前正在攻读计算机科学或相关STEM领域的学士,硕士或博士学位
  • 具有一种或多种通用编程语言的经验,包括但不限于: Java,C/C ++ 、Python、JavaScript或Go
  • 具有上述研究领域的相关经验,包括行业经验或作为参与实验室研究 优先录用:
  • 对技术研究充满热情,具有产生新思想和创新的能力; 在自学,问题分析和解决方面表现出色
  • 在国际会议上或核心期刊发表一份或多份出版物或论文
  • 至少3个月的全职工作

特色标签

AI反馈强化学习、AI对齐、C/C++、Golang、Java、Python、人工智能对齐、人类反馈强化学习、医学影像辅助诊断、医学检验解读、医疗、医疗多模态、发表算法相关优秀论文、基于AI反馈的强化学习、基于人类反馈的强化学习、基准测试集、基础模型、多模态医学、多模态医疗、多模态算法、大型语言模型、大模型因果推理、大模型算法、大模型自我反思、大模型自我评估、大模型逻辑推理、大语言模型、强化学习、检查报告分析、检验报告解读、模型对齐、模型推理能力、模型自反馈、深度学习、皮肤影像分析、皮肤病图像辅助决策、算法工程化经验、评测基准、评测基准集