【蚂蚁星】全模态大模型数据-蚂蚁健康(实习)
Intern
Company Antgroup
Focus Tech · Algorithm
Location 北京, 上海, 杭州
Published April 28, 2026
岗位职责
面向医疗全模态大模型,建设AI-Native数据技术体系,推动高质量医疗数据从采集、理解、构造、评估到持续迭代的全流程建设,主要工作包括:
- 研究文本、影像、检验、病理、语音、结构化病历等多模态医疗数据的融合、对齐、标注与质量评估;
- 结合医学知识、临床流程、专家反馈和真实诊疗结果,建立医疗数据的可信度评估与正确性校验机制,降低模型幻觉;
- 构建“模型缺陷挖掘—数据筛选与增强—消融迭代”的数据飞轮,提升模型在医学理解、临床推理、科研分析和真实医疗工作流中的能力;
- 研究医疗数据合成、难例构造、价值挖掘与数据配比优化,持续释放高价值医疗数据的潜力;
- 与算法、产品、临床专家及数据工程团队协作,推动研究成果落地为可规模化的数据生产和评测能力。
任职要求
- 计算机科学、人工智能、数据科学、生物医学工程、医学信息学、医学或相关专业背景;具备计算机 / AI 与医疗交叉背景者优先;
- 对医疗 AI 有浓厚兴趣,有医学、临床、医疗信息化、医学影像、生物信息等相关学习、研究或项目经验者优先;
- 具备扎实的计算机基础和良好的编程能力,熟练使用 Python,熟悉常见数据结构、算法及 Linux 开发环境;
- 具有实际的大规模数据处理或数据算法经验,熟悉数据采集、清洗、去重、过滤、标注、质量评估、数据合成、数据挖掘、数据配比等一个或多个方向;有大模型 Pre-training / Post-training 数据经验者优先;
- 熟悉熟悉Agent相关技术,了解至少一种大规模分布式数据处理框架或计算系统,能够设计和实现高吞吐、可扩展的数据处理 Pipeline;有 TB / PB 级数据处理经验者优先。
特色标签
AI幻觉、ETL链路、Flink、Hive、Kafka、Python、Shell、Spark、SQL、临床数据、云原生、云服务、云计算、人工数据生成、保险、健康数据、分布式系统开发经验、分布式计算、分布式训练、医学数据、医疗、医疗大模型、合成数据、图像、图像算法、图文音影、多模态大模型、多模态算法、多源异构、大数据、大数据处理工具(Spark/Hadoop/Hive)、大数据处理经验、大数据开发经验、大数据框架、大模型算法、对抗样本生成、并行数据处理、并行计算、数据分析/挖掘经验、数据处理管线、数据处理经验、数据安全、数据工作流、数据挖掘、数据权重调整、数据自循环、数据采样策略、数据闭环、数据驱动迭代、智能体、有留学背景、机器学习建模经验、标注、模型误判、模拟数据、熟悉Linux环境、知识图谱、算法工程化经验、自然语言处理算法、自然语言处理经验、虚假输出、计算机相关专业、训练数据均衡、语音、语音算法、跨模态、跨模态大模型、边缘案例构建、隐私计算、难样本挖掘