研究型实习生- 医疗大模型评测方案的研究和应用
Campus/Intern
Company Antgroup
Focus Tech · Algorithm
Location 上海, 杭州
Published June 8, 2026
岗位职责
研究领域: 大模型 项目简介: 随着阿福逐步从“文本问答”走向“多模态医疗服务”(如检验检查单解读、影像/皮肤照片辅助建议等),以及大模型推理能力、对齐方式(RLHF/RLAIF/自反馈等)快速演进,现有评测体系暴露出结构性不足,难以支撑“可信上线、可持续迭代、可对外对标”的要求,主要体现在:
- 评测范式缺乏科学性与可证性:当前评测多依赖静态题库+人工打分,指标定义与标注一致性缺乏可验证的统计学与因果支撑,导致“分数提升不等于真实风险下降/真实体验提升”。
- 多模态医疗场景评测缺位:医学多模态任务(图像/报告单/用药记录等)存在输入不确定性、信息缺失与噪声、跨模态推理链长等特性,沿用文本问答评测指标会系统性低估风险与高估能力。
- 缺少权威可复现的Benchmark:内部指标难以与业界(如DeepSeek-R1等推理模型、医疗多模态开源评测)建立可比性,也难以沉淀为可公开的研究成果与技术影响力。
任职要求
研究领域: -目前正在攻读计算机科学或相关STEM领域的学士,硕士或博士学位 -具有一种或多种通用编程语言的经验,包括但不限于: Java,C/C ++ 、Python、JavaScript或Go -具有上述研究领域的相关经验,包括行业经验或作为参与实验室研究 优先录用: -对技术研究充满热情,具有产生新思想和创新的能力; 在自学,问题分析和解决方面表现出色 -在国际会议上或核心期刊发表一份或多份出版物或论文 -至少3个月的全职工作
特色标签
AI反馈强化学习、AI对齐、C/C++、Golang、Java、Python、人工智能对齐、人类反馈强化学习、医学影像辅助诊断、医学检验解读、医疗、医疗多模态、发表算法相关优秀论文、基于AI反馈的强化学习、基于人类反馈的强化学习、基准测试集、基础模型、多模态医学、多模态医疗、多模态算法、大型语言模型、大模型因果推理、大模型算法、大模型自我反思、大模型自我评估、大模型逻辑推理、大语言模型、强化学习、检查报告分析、检验报告解读、模型对齐、模型推理能力、模型自反馈、深度学习、皮肤影像分析、皮肤病图像辅助决策、算法工程化经验、评测基准、评测基准集