【蚂蚁星】全模态大模型数据-蚂蚁健康-27届

Campus

Company Antgroup

Focus Tech · Algorithm

Location 北京, 上海, 杭州

Published May 14, 2026

岗位职责

面向医疗全模态大模型,建设AI-Native数据技术体系,推动高质量医疗数据从采集、理解、构造、评估到持续迭代的全流程建设,主要工作包括:

  1. 研究文本、影像、检验、病理、语音、结构化病历等多模态医疗数据的融合、对齐、标注与质量评估;
  2. 结合医学知识、临床流程、专家反馈和真实诊疗结果,建立医疗数据的可信度评估与正确性校验机制,降低模型幻觉;
  3. 构建“模型缺陷挖掘—数据筛选与增强—消融迭代”的数据飞轮,提升模型在医学理解、临床推理、科研分析和真实医疗工作流中的能力;
  4. 研究医疗数据合成、难例构造、价值挖掘与数据配比优化,持续释放高价值医疗数据的潜力;
  5. 与算法、产品、临床专家及数据工程团队协作,推动研究成果落地为可规模化的数据生产和评测能力。

任职要求

  1. 计算机科学、人工智能、数据科学、生物医学工程、医学信息学、医学或相关专业背景;具备计算机 / AI 与医疗交叉背景者优先;
  2. 对医疗 AI 有浓厚兴趣,有医学、临床、医疗信息化、医学影像、生物信息等相关学习、研究或项目经验者优先;
  3. 具备扎实的计算机基础和良好的编程能力,熟练使用 Python,熟悉常见数据结构、算法及 Linux 开发环境;
  4. 具有实际的大规模数据处理或数据算法经验,熟悉数据采集、清洗、去重、过滤、标注、质量评估、数据合成、数据挖掘、数据配比等一个或多个方向;有大模型 Pre-training / Post-training 数据经验者优先;
  5. 熟悉熟悉Agent相关技术,了解至少一种大规模分布式数据处理框架或计算系统,能够设计和实现高吞吐、可扩展的数据处理 Pipeline;有 TB / PB 级数据处理经验者优先。

特色标签

AI幻觉、Flink、Hbase、Hive、Java、Kafka、Python、Scala、Shell、Spark、SQL、云服务、云计算、分布式系统开发经验、分布式计算、分布式训练、医学人工智能、医学数据、医疗、医疗人工智能、医疗多模态数据、合成数据、后训练大模型、困难样本构造、图像、图像算法、多模态大模型、多模态算法、大数据、大数据处理工具(Spark/Hadoop/Hive)、大数据处理经验、大数据开发经验、大模型后训练、大模型算法、大模型预训练、数据分析/挖掘经验、数据处理经验、数据安全、数据挖掘、数据混合优化、数据生成、数据自循环、数据闭环、智能体、有留学背景、机器学习、机器学习建模经验、标注、样本比例优化、模型幻觉问题、深度学习、熟悉Linux环境、算法工程化经验、自然语言处理算法、自然语言处理经验、计算机相关专业、语音、语音算法、跨模态大模型、隐私、难样本挖掘、预训练大模型