蚂蚁集团-数据研发工程师-杭州/北京

Company Antgroup

Focus Tech · Data

Location 北京, 杭州

Published September 7, 2026

岗位职责

  1. 负责医疗/金融行业线数据产品与智能体产品的架构设计与研发,覆盖数据采集、加工、建模、服务化到智能体应用的全链路;
  2. 负责行业高质量数据资产建设:面向大模型训练与业务应用,构建覆盖标注、清洗、过滤、合成、质量评估与版本管理的数据处理管线,持续挖掘高价值数据资源;
  3. 负责医疗AI多模态数据处理能力建设,包括但不限于医学影像、病历文本、检验结构化数据等多模态数据的融合处理与特征工程;
  4. 深入业务场景,支撑两核业务(核保/核赔)、医药真实世界研究、医疗算法等方向的算法研发与工程落地,建设垂类评测体系,驱动""数据—算法—业务""的迭代闭环;
  5. 与业务、产品团队紧密协作,将业务需求转化为可落地的数据/AI解决方案和产品,推动数据产品与智能体产品在业务线的规模化应用。

任职要求

  1. 计算机、数学、统计学、人工智能等相关专业本科及以上学历,3年以上机器学习算法或数据工程相关经验;
  2. 具备扎实的机器学习/深度学习功底,精通 Python,熟悉 PyTorch、Spark、Flink 等主流算法与数据技术栈,具备大规模数据治理、ETL、数据管线建设等工程化能力;
  3. 熟悉大模型与AI数据处理能力,包括 Prompt 工程、RAG、Agent/智能体架构、多模态数据处理、模型微调(SFT/RLHF)等,能将业务问题转化为可迭代的算法与数据方案;
  4. 具备良好的业务 sense 与业务理解能力,善于从业务场景中定义数据与算法问题,有医疗或金融行业经验(尤其保险两核、医药研发、真实世界研究等)者优先。

加分项:

  1. 在 ACL、EMNLP、NeurIPS、ICML、MICCAI、CVPR 等顶会或行业期刊发表过相关论文,或有医学/药学/公共卫生等交叉学科背景;
  2. 有高质量开源项目、技术专利

特色标签

AI Agent、API化、ETL设计/开发经验、Flink、Python、RWS、Scala、Shell、Spark、SQL、两核业务、保险、保险核保、保险理赔、分布式系统开发经验、医疗、发表算法相关优秀论文、图像算法、多媒体数据、多模态算法、多源异构数据、大数据、大数据处理工具(Spark/Hadoop/Hive)、大数据处理经验、大数据开发经验、大模型算法、大规模预训练模型、大语言模型、巨模型、强化学习、微服务化、数学/统计相关专业、数据分析/挖掘经验、数据处理经验、数据建模设计、数据抓取、数据挖掘、数据收集、数据模型构建、数据清洗、数据获取、数据转化、数据预处理、智能代理、智能体、服务封装、机器学习、机器学习建模经验、标注、模型化、深度学习、熟悉Linux环境、特征提取、特征构造、特征设计、真实世界数据研究、真实世界证据、自主智能体、自然语言处理算法、自然语言处理经验、英美留学生、计算机相关专业、跨模态数据、金融、金融行业数据相关经验