蚂蚁集团-数据模型算法工程师-杭州/上海

Company Antgroup

Focus Tech · Algorithm

Location 上海, 杭州

Published September 24, 2026

岗位职责

岗位描述 负责结构化数据基础大模型的前沿技术探索。你可以在以下一个或多个方向持续深入:

  1. 让模型看见更丰富的数据世界。建设大规模预训练数据体系,探索数据合成、真实数据引入、数据配比等方法,持续提升预训练数据的规模、质量、多样性及对真实世界数据机制的覆盖能力。
  2. 探索结构化数据基础模型应该“学什么、如何学”。研究面向结构化数据的预训练范式与建模方法,覆盖分类、回归、缺失值填补、基于Diffusion模型的生成式建模,以及检索增强、In-Context Learning和推理时计算扩展等方向,提升模型的通用建模与跨任务泛化能力。
  3. 推动模型能力与计算效率共同Scaling。负责模型架构、训练及推理优化,探索Model/Data Scaling、超大规模预训练和高效训练策略,推进分布式训练、混合精度、模型剪枝、量化及推理加速等技术研发。
  4. 用可信的评测推动真实进步。建设结构化数据大模型评测体系,在TabArena、TALENT、BCCO等公开基准及内部业务数据集上开展系统评估,分析模型能力边界,并从数据、架构和训练策略等维度指导模型持续优化。
  5. 让前沿研究进入真实世界。推动结构化数据大模型在金融、营销、风控、医疗等场景中的微调与落地,结合大语言模型与Agent技术,构建覆盖数据理解、分析建模、预测决策及任务执行的智能应用。

任职要求

岗位要求 我们不要求你覆盖所有方向,但期待你在其中至少一个方向具备扎实积累,并对未知问题保持好奇。

  1. 计算机、人工智能、机器学习、统计学、数学或相关专业,本科及以上学历。
  2. 具备扎实的机器学习、深度学习和统计建模基础,在分类、回归、生成式建模、缺失值处理或因果学习中的一个或多个方向具有研究或实践经验。
  3. 熟悉Transformer、Attention、In-Context Learning等技术;了解MoE、Scaling Law、Diffusion、检索增强或表格基础模型者优先。
  4. 熟练使用Python和PyTorch,具备良好的算法实现与工程开发能力,能够独立完成模型设计、训练、调试、评测及问题定位。
  5. 熟悉结构化数据建模流程,了解XGBoost、LightGBM、CatBoost、AutoGluon、TabPFN等方法或模型;具备大规模预训练、分布式训练或高性能推理经验者优先。
  6. 具备良好的实验设计、技术创新和沟通协作能力;拥有大模型或Agent开发经验、相关会议或期刊论文、高质量开源项目或算法竞赛成绩者优先。 我们期待的不只是已有问题的解法,也包括定义新问题的能力。希望你愿意从真实数据出发,和我们一起探索结构化数据基础模型尚未被充分打开的可能性。

岗位标签

NEW

特色标签

AI Agent、Python、Shell、SQL、上下文内学习、下游微调、任务适配微调、分布式训练、医疗、参加算法相关竞赛/获奖、参数量扩增、发表算法相关优秀论文、多机并行训练、大数据处理工具(Spark/Hadoop/Hive)、大模型算法、大规模预训练、并行计算、异构关系数据、情境学习、扩散生成模型、数据挖掘、有留学背景、机器学习、概率扩散网络、模型加速/性能优化、模型扩展、深度学习、稀疏化压缩、算法工程化经验、网络剪枝、自主代理系统、自监督预训练、英美留学生、营销、表格基准评测、表格数据、表格模型竞技场、金融、集群训练、风控、风控算法