【蚂蚁星】AI工程师(模型与系统架构)-金融垂类-27届

Campus

Company Antgroup

Focus Tech · Backend

Location 北京, 上海, 杭州

Published August 10, 2026

岗位职责

Ling Team 聚焦百灵模型家族的核心算法创新。我们不仅关注算法的理论上限,更关注:

  • 算法在工业界场景的稳定落地与高效实现;
  • 训练与推理系统的极致性能(吞吐与利用率);
  • 从数据处理到模型部署的全链路自动化与工程化;
  • 在万亿参数与百万上下文规模下的系统鲁棒性。 在1T参数与1M Context的规模下,即时模型的后训练是一项庞大的系统工程。本岗位将主导大规模训练Pipeline的构建、Agentic 能力的工程实现以及数据流转系统的开发。我们寻找的不仅是理解算法原理的工程师,更是能编写高质量代码、构建高效训练框架、解决实际算力与数据瓶颈的实战派。

主要职责包括:

  1. 大规模训练管线构建与优化 (Pipeline Engineering)
  • 训练系统开发:负责万亿参数级模型 SFT / RLHF / RLVR / Agentic RL 等全流程训练的搭建、维护与性能调优;
  • 效率与稳定性:解决分布式训练中的显存墙、通信瓶颈与稳定性问题,优化 GPU 利用率与训练吞吐量(Throughput);
  • 算法工程化落地:将前沿的强化学习算法(如复合奖励模型、过程监督)转化为高可用的工程代码,实现训推一体化框架的平滑流转;
  • 实验管理:构建标准化的实验管理平台,支持算法团队进行高效的超参搜索与模型迭代。
  1. 模型能力实现与评测体系 (Capability Implementation & Eval)
  • 能力专项建设:针对逻辑推理、长程规划及工具使用(Tool Use)等能力,实现具体的训练任务与数据配方加载,确保模型能力按预期对齐;
  • Agentic 工程集成:实现模型与外部环境(如代码解释器、API)的交互接口,开发高并发、高保真的 Agent 仿真训练环境;
  • 自动化评测:构建覆盖长上下文、多轮对话及复杂指令遵循的自动化评测系统(Eval Pipeline),快速反馈模型迭代效果。

任职要求

  1. 深入理解大模型训练框架和推理引擎的基本原理,熟悉底层框架基本架构和实现原理;
  2. 了解业界主流语言大模型相关基础结构和优化方法;
  3. 熟悉GPU,存储,分布式集群等相关基础知识;
  4. 熟悉大模型基本后训练流程以及相关算法原理;
  5. 能从第一性原理建模问题,有较好的动手能力;
  6. 有较好的团队协同能力,思路敏捷,沟通效率。

加分项:

  1. 有100B MOE模型以上的后训练时间经验;
  2. 有强化学习,SFT,OPD相关的顶会论文发表;
  3. 有训练,推理,评测效率优化以及与算法协同开发经验;
  4. 有agent Harness相关经验,超长上下文管理等能力的实践与优化经验;
  5. 有跨学科背景(数理化生 / 医疗 / 金融 / 法律等);
  6. 各类高水平竞赛金牌选手。

特色标签

1M上下文、1T参数规模、Agent强化训练、C/C++、Eval Pipeline、Python、Shell、SQL、人类反馈强化学习、分布式并行训练、分布式训练、千亿级参数、参加算法相关竞赛/获奖、发表算法相关优秀论文、多机多卡训练、大数据处理工具(Spark/Hadoop/Hive)、大模型算法、强化学习、强化学习从人类/验证器反馈、显卡利用率、智能体强化学习、有留学背景、样本吞吐、模型加速/性能优化、模型评测系统、灵雀大模型体系、百灵大模型家族、监督微调、研发效能、算力利用率、算法工程化经验、自主智能体学习、自动评估管道、自然语言处理算法、计算利用率、训推协同框架、训推链路统一、训练吞吐率、训练推理一体、训练速度、超大规模模型、超长上下文、金融、长窗口、集群训练