【蚂蚁星】AI工程师(模型与系统架构)-百灵-27届
Campus
Company Antgroup
Focus Tech · Backend
Location 北京, 上海, 杭州
Published May 14, 2026
岗位职责
Ling Team 聚焦百灵模型家族的核心算法创新。 我们不仅关注算法的理论上限,更关注:
- 算法在工业界场景的稳定落地与高效实现
- 训练与推理系统的极致性能(吞吐与利用率)
- 从数据处理到模型部署的全链路自动化与工程化
- 在万亿参数与百万上下文规模下的系统鲁棒性 在1T参数与1M Context的规模下,即时模型的后训练是一项庞大的系统工程。本岗位将主导大规模训练Pipeline的构建、Agentic 能力的工程实现以及数据流转系统的开发。我们寻找的不仅是理解算法原理的工程师,更是能编写高质量代码、构建高效训练框架、解决实际算力与数据瓶颈的实战派。
主要职责包括:
- 大规模训练管线构建与优化 (Pipeline Engineering)
- 训练系统开发:负责万亿参数级模型 SFT / RLHF / RLVR / Agentic RL 等全流程训练的搭建、维护与性能调优;
- 效率与稳定性:解决分布式训练中的显存墙、通信瓶颈与稳定性问题,优化 GPU 利用率与训练吞吐量(Throughput);
- 算法工程化落地:将前沿的强化学习算法(如复合奖励模型、过程监督)转化为高可用的工程代码,实现训推一体化框架的平滑流转;
- 实验管理:构建标准化的实验管理平台,支持算法团队进行高效的超参搜索与模型迭代。
- 模型能力实现与评测体系 (Capability Implementation & Eval)
- 能力专项建设:针对逻辑推理、长程规划及工具使用(Tool Use)等能力,实现具体的训练任务与数据配方加载,确保模型能力按预期对齐;
- Agentic 工程集成:实现模型与外部环境(如代码解释器、API)的交互接口,开发高并发、高保真的 Agent 仿真训练环境;
- 自动化评测:构建覆盖长上下文、多轮对话及复杂指令遵循的自动化评测系统(Eval Pipeline),快速反馈模型迭代效果。
任职要求
- 深入理解大模型训练框架和推理引擎的基本原理,熟悉底层框架基本架构和实现原理;
- 了解业界主流语言大模型相关基础结构和优化方法;
- 熟悉GPU,存储,分布式集群等相关基础知识;
- 熟悉大模型基本后训练流程以及相关算法原理;
- 能从第一性原理建模问题,有较好的动手能力;
- 有较好的团队协同能力,思路敏捷,沟通效率。
加分项:
- 有100B MOE模型以上的后训练时间经验;
- 有强化学习,SFT,OPD相关的顶会论文发表;
- 有训练,推理,评测效率优化以及与算法协同开发经验;
- 有agent Harness相关经验,超长上下文管理等能力的实践与优化经验;
- 有跨学科背景(数理化生 / 医疗 / 金融 / 法律等);
- 各类高水平竞赛金牌选手。
特色标签
Agent能力、GPU使用率、Python、Reinforcement Learning、RL、Shell、Supervised Fine-Tuning、Training Throughput、万亿级参数规模、人类偏好强化学习、人类反馈强化学习、保险、信贷、分布式机器学习、分布式模型训练、分布式训练、参加算法相关竞赛/获奖、发表算法相关优秀论文、合规、图形处理器利用率、增强学习、大模型算法、并行计算、强化学习、支付、数据安全、智能代理、智能体、有留学背景、模型加速/性能优化、模型评估管线、理财、百万级上下文长度、监督微调、算力利用率、算法工程化经验、自动化评测系统、自然语言处理算法、训练吞吐、训练效率、评估流水线、超大规模参数、超长上下文、金融、长上下文、隐私计算、风控