【蚂蚁星】数据大模型算法工程师-大安全-27届

Campus

Company Antgroup

Focus Tech · Security

Location 上海, 杭州

Published September 24, 2026

岗位职责

真实世界中,大量重要问题并不存在于文本里,而是隐藏在表格、数据库和不断变化的业务数据中:变量之间如何相互作用,哪些规律能够跨越环境保持稳定,一个微小变化又会如何影响最终决策。 我们希望构建能够直接理解结构化数据的基础模型,让模型不只回答“结果是什么”,还能进一步理解数据背后的关系、机制与因果,从Prediction走向Relationship、Causality与Decision。 如果你希望从数据、模型到真实场景,重新探索结构化数据的智能边界,欢迎加入我们。

岗位描述 负责结构化数据基础大模型的前沿技术探索。你可以在以下一个或多个方向持续深入:

  1. 让模型看见更丰富的数据世界。建设大规模预训练数据体系,探索数据合成、真实数据引入、数据配比等方法,持续提升预训练数据的规模、质量、多样性及对真实世界数据机制的覆盖能力。
  2. 探索结构化数据基础模型应该“学什么、如何学”。研究面向结构化数据的预训练范式与建模方法,覆盖分类、回归、缺失值填补、基于Diffusion模型的生成式建模,以及检索增强、In-Context Learning和推理时计算扩展等方向,提升模型的通用建模与跨任务泛化能力。
  3. 推动模型能力与计算效率共同Scaling。负责模型架构、训练及推理优化,探索Model/Data Scaling、超大规模预训练和高效训练策略,推进分布式训练、混合精度、模型剪枝、量化及推理加速等技术研发。
  4. 用可信的评测推动真实进步。建设结构化数据大模型评测体系,在TabArena、TALENT、BCCO等公开基准及内部业务数据集上开展系统评估,分析模型能力边界,并从数据、架构和训练策略等维度指导模型持续优化。
  5. 让前沿研究进入真实世界。推动结构化数据大模型在金融、营销、风控、医疗等场景中的微调与落地,结合大语言模型与Agent技术,构建覆盖数据理解、分析建模、预测决策及任务执行的智能应用。

任职要求

我们不要求你覆盖所有方向,但期待你在其中至少一个方向具备扎实积累,并对未知问题保持好奇。

  1. 计算机、人工智能、机器学习、统计学、数学或相关专业,硕士及以上学历。
  2. 具备扎实的机器学习、深度学习和统计建模基础,在分类、回归、生成式建模、缺失值处理或因果学习中的一个或多个方向具有研究或实践经验。
  3. 熟悉Transformer、Attention、In-Context Learning等技术;了解MoE、Scaling Law、Diffusion、检索增强或表格基础模型者优先。
  4. 熟练使用Python和PyTorch,具备良好的算法实现与工程开发能力,能够独立完成模型设计、训练、调试、评测及问题定位。
  5. 熟悉结构化数据建模流程,了解XGBoost、LightGBM、CatBoost、AutoGluon、TabPFN等方法或模型;具备大规模预训练、分布式训练或高性能推理经验者优先。
  6. 具备良好的实验设计、技术创新和沟通协作能力;拥有大模型或Agent开发经验、相关会议或期刊论文、高质量开源项目或算法竞赛成绩者优先。 我们期待的不只是已有问题的解法,也包括定义新问题的能力。希望你愿意从真实数据出发,和我们一起探索结构化数据基础模型尚未被充分打开的可能性。

特色标签

Benchmark、Causal Inference、Contrastive Pre-training、Diffusion Model、Foundation Model、Imputation、Python、Shell、SQL、TabPFN、Tabular Foundation Model、低延迟推理、关系型数据、分布式训练、医疗、参加算法相关竞赛/获奖、发表算法相关优秀论文、因果发现、因果建模、因果推断、基准测试、基础模型、大数据处理工具(Spark/Hadoop/Hive)、大模型算法、大集群训练、并行计算、并行训练、异构数据、扩散模型、推理优化、数据并行、数据挖掘、数据补全、无监督预训练、时序表格、机器学习、模型加速/性能优化、模型压缩、模型并行、模型测评、深度学习、生成式扩散、空值填充、缺失值处理、能力评估、自监督学习、营销、表格数据、表格预训练模型、超大模型、量化加速、金融、预训练模型、风控、风控算法