【蚂蚁星】AI工程师-医疗大模型数据科学家
Campus
Company Antgroup
Focus Tech · Backend
Location 杭州
Published September 14, 2026
岗位职责
- 围绕医疗场景(电子病历、处方、检验报告、医学影像、基因测序、医学知识图谱等),构建医疗多模态非结构化数据的结构化、标准化处理能力,打造涵盖解析、召回、去重、去毒、脱敏合规等多环节的高质量医疗数据处理算子,参与医疗大模型数据处理工程平台建设,推动医疗业务与数据技术的融合落地;
- 熟练应用 prompt 工程、SFT、RLHF 等技术,追踪业界医疗数据合成与优化前沿方法(如基于医学知识图谱的合成数据生成、病历增强、影像-报告对齐、罕见病/长尾数据合成等),建立针对医疗大模型的数据质量与效果评估方法,持续提升医疗数据的准确性、多样性、安全性、有用性与合规性;
- 跟进医疗大模型与通用大模型发布进展,引入医学权威 benchmark(如 MedQA、MedMCQA、MMLU-clinical、CMExam 等),为医疗模型的 scaling & alignment 提供鲁棒的实验观测指标,深度参与医疗 LLM 效果优化,加速数据系统迭代流程;
- 作为医疗大模型的调教师推进数据构建、评估与优化。根据医疗业务需求制定详实的标注、合成、采集标准,对医疗数据集进行质量检查与标准迭代,测评模型在临床辅助决策、辅助诊断、病历生成等场景的能力边界,并从数据视角提出优化方案。
任职要求
你将负责什么?
- 破解「医疗数据荒」: 真实医疗数据(电子病历、医学影像、基因测序)受隐私法规(个人信息保护法/HIPAA)与院内壁垒限制,获取成本高、标注昂贵,亟需通过合成数据在合规前提下补齐训练所需的海量「养料」。
- 补齐长尾与罕见病: 罕见病、少见体征、边缘病例在真实数据中样本极少,模型容易「看不见」,需要基于医学知识图谱与生成模型合成覆盖长尾分布的高质量样本。
- 跨模态对齐难题: 病历文本与医学影像(CT/病理/放射)的配对标注极度稀缺,需合成「影像-报告」对齐数据,支撑医疗多模态大模型的训练与评测。
- 质量与合规护城河: 医疗数据噪声大、术语不规范、含敏感 PHI(个人健康信息),亟需构建去毒、脱敏、术语标准化与质量评估体系,守住安全与合规底线。
- 评测体系缺失: 医疗模型缺乏权威、可复用、贴近临床的 benchmark,需要从数据视角引入并搭建 MedQA/MedMCQA/CMExam 等评测能力,为临床辅助决策、辅助诊断、病历生成等场景提供能力边界度量。
特色标签
Prompt设计、Python、Reinforcement Learning from Human Feedback、Shell、SQL、Supervised Fine-Tuning、人类反馈强化学习、分布式训练、医学大模型、医学本体、医学测评数据集、医学知识库、医疗、医疗LLM、医疗专用大模型、医疗场景大模型、医疗多模态信息、医疗异构数据、医疗数据生成、医疗模型评测指标、医疗知识图谱、医疗虚拟数据、医疗评测基准、医疗跨模态数据、合成医疗数据、图像算法、多模态算法、大数据、大数据处理工具(Spark/Hadoop/Hive)、大模型算法、少见病样本生成、强化学习、影像-文本匹配、影像报告对齐、影像文本配对、提示工程、提示语优化、摘要生成、数据安全、文本生成、有留学背景、机器学习、深度学习、监督式微调、监督微调、知识图谱、稀有疾病数据生成、算法工程化经验、自然语言处理算法、语义理解、长尾病例数据合成、隐私、隐私计算