【蚂蚁星】AI工程师(模型与系统架构)-百灵-27届

Campus

Company Antgroup

Focus Tech · Backend

Location 北京, 上海, 杭州

Published May 14, 2026

岗位职责

Ling Team 聚焦百灵模型家族的核心算法创新。 我们不仅关注算法的理论上限,更关注:

  • 算法在工业界场景的稳定落地与高效实现
  • 训练与推理系统的极致性能(吞吐与利用率)
  • 从数据处理到模型部署的全链路自动化与工程化
  • 在万亿参数与百万上下文规模下的系统鲁棒性 在1T参数与1M Context的规模下,即时模型的后训练是一项庞大的系统工程。本岗位将主导大规模训练Pipeline的构建、Agentic 能力的工程实现以及数据流转系统的开发。我们寻找的不仅是理解算法原理的工程师,更是能编写高质量代码、构建高效训练框架、解决实际算力与数据瓶颈的实战派。

主要职责包括:

  1. 大规模训练管线构建与优化 (Pipeline Engineering)
  • 训练系统开发:负责万亿参数级模型 SFT / RLHF / RLVR / Agentic RL 等全流程训练的搭建、维护与性能调优;
  • 效率与稳定性:解决分布式训练中的显存墙、通信瓶颈与稳定性问题,优化 GPU 利用率与训练吞吐量(Throughput);
  • 算法工程化落地:将前沿的强化学习算法(如复合奖励模型、过程监督)转化为高可用的工程代码,实现训推一体化框架的平滑流转;
  • 实验管理:构建标准化的实验管理平台,支持算法团队进行高效的超参搜索与模型迭代。
  1. 模型能力实现与评测体系 (Capability Implementation & Eval)
  • 能力专项建设:针对逻辑推理、长程规划及工具使用(Tool Use)等能力,实现具体的训练任务与数据配方加载,确保模型能力按预期对齐;
  • Agentic 工程集成:实现模型与外部环境(如代码解释器、API)的交互接口,开发高并发、高保真的 Agent 仿真训练环境;
  • 自动化评测:构建覆盖长上下文、多轮对话及复杂指令遵循的自动化评测系统(Eval Pipeline),快速反馈模型迭代效果。

任职要求

  1. 深入理解大模型训练框架和推理引擎的基本原理,熟悉底层框架基本架构和实现原理;
  2. 了解业界主流语言大模型相关基础结构和优化方法;
  3. 熟悉GPU,存储,分布式集群等相关基础知识;
  4. 熟悉大模型基本后训练流程以及相关算法原理;
  5. 能从第一性原理建模问题,有较好的动手能力;
  6. 有较好的团队协同能力,思路敏捷,沟通效率。

加分项:

  1. 有100B MOE模型以上的后训练时间经验;
  2. 有强化学习,SFT,OPD相关的顶会论文发表;
  3. 有训练,推理,评测效率优化以及与算法协同开发经验;
  4. 有agent Harness相关经验,超长上下文管理等能力的实践与优化经验;
  5. 有跨学科背景(数理化生 / 医疗 / 金融 / 法律等);
  6. 各类高水平竞赛金牌选手。

特色标签

Agent能力、GPU使用率、Python、Reinforcement Learning、RL、Shell、Supervised Fine-Tuning、Training Throughput、万亿级参数规模、人类偏好强化学习、人类反馈强化学习、保险、信贷、分布式机器学习、分布式模型训练、分布式训练、参加算法相关竞赛/获奖、发表算法相关优秀论文、合规、图形处理器利用率、增强学习、大模型算法、并行计算、强化学习、支付、数据安全、智能代理、智能体、有留学背景、模型加速/性能优化、模型评估管线、理财、百万级上下文长度、监督微调、算力利用率、算法工程化经验、自动化评测系统、自然语言处理算法、训练吞吐、训练效率、评估流水线、超大规模参数、超长上下文、金融、长上下文、隐私计算、风控