【蚂蚁星】大模型数据算法工程师-蚂蚁健康(实习)
Campus/Intern
Company Antgroup
Focus Tech · Algorithm
Location 北京, 杭州
Published April 28, 2026
岗位职责
部门介绍: 数据是大模型能力的基石,尤其在医疗健康这一高专业门槛、强安全合规的复杂场景中,如何构建高质量数据体系、系统性诊断模型缺陷并通过数据驱动模型进化,是当前医疗AGI领域最核心的技术挑战之一。我们致力于打造行业领先的医疗垂直大模型数据科学体系,通过数据价值评估、缺陷归因诊断、高质量合成等技术手段,推动医疗AI突破智能上限。在这里,你将直接面对真实的医疗场景数据,你的研究成果更将决定服务数亿用户的医疗AI产品的能力底座。
除了前沿课题研究,你将参与到全链路的医疗AGI能力建设,包括:
- 数据理解和质量优化体系:构建行业领先的数据解析和理解能力,不断提升数据处理的深度和理解广度;
- 模型自我迭代闭环:基于大量的线上问题和医院内真实数据,规模化挖掘模型的难负样本,找到模型的提升空间,建设数据的自我迭代反馈闭环;
- 医疗数据合成:设计并落地针对各个能力的大模型的医疗数据合成,生成高质量、可控、多样化的训练样本(包括病例生成、对话模拟、推理链构造等),降低模型幻觉,提升泛化能力;
- 实验分析和归因能力:建立医疗数据的质量评估标准与自动化分析和归因能力,追溯模型输出的数据来源和推理路径,提升医疗AI的可解释性和可信度。
任职要求
- 学术背景:计算机科学、人工智能、数学、统计学、医学、生命科学等相关领域的顶尖博士(或具备同等科研能力的极优硕士),具备极强的代码落地能力(熟练使用Python及PyTorch等框架);
- 大模型底座认知:深刻理解LLM/Transformer底层架构及后训练范式(SFT, RLHF, DPO等),对数据在预训练、指令微调、对齐等阶段的作用机制有深入洞察;
- 顶尖学术成果:在国际顶级AI会议或期刊(如NeurIPS, ICML, ICLR, ACL, EMNLP等)一作或共一,或在Kaggle等顶级数据竞赛中获得TOP名次;
- 敏锐的研究嗅觉:对AI前沿技术充满狂热的好奇心,能深刻理解大模型在医疗场景的典型失败模式,并能独立提出基于数据的创新性解决方案;
- 严谨的科学能力:具备极强的数据分析与实验设计能力,能建立严谨的统计推断与因果分析框架,确保结论的可信与可解释性。
加分项:
- 医疗领域知识:具备医疗健康、生物信息学、临床医学相关背景,对医疗数据的特殊性(专业性、隐私性、合规性)有深刻理解;
- 大模型实战经验:有大厂大模型预训练、指令微调、RLHF等方向的实习或项目经验;或具备数据驱动的模型优化成功案例;
- 开源贡献:作为核心贡献者参与过知名开源数据集(如MedQA, PubMedQA等)或数据处理框架的建设。
特色标签
Python、事实性错误、人类反馈强化学习、优秀开源项目经历、偏好建模、健康AI、医疗、医疗人工智能、医疗大模型、参加算法相关竞赛/获奖、发表算法相关优秀论文、可信AI、可控数据生成、可追溯性、合成数据生成、垂直大模型、基于人类反馈的强化学习、大模型算法、大语言模型、幻觉问题、意图挖掘、指令微调、文本生成、智能医疗、模型可解释性、监督微调、直接偏好优化、算法工程化经验、编解码架构、自注意力模型、虚假生成、语义理解、高质量数据生成