【Plan A】AI工程师(模型与系统架构)-百灵-27届
Campus/Intern
Company Antgroup
Focus Tech · Backend
Location 北京, 上海, 杭州
Published May 14, 2026
岗位职责
Ling Team 聚焦百灵模型家族的核心算法创新。 我们不仅关注算法的理论上限,更关注:
- 算法在工业界场景的稳定落地与高效实现
- 训练与推理系统的极致性能(吞吐与利用率)
- 从数据处理到模型部署的全链路自动化与工程化
- 在万亿参数与百万上下文规模下的系统鲁棒性 在1T参数与1M Context的规模下,即时模型的后训练是一项庞大的系统工程。本岗位将主导大规模训练Pipeline的构建、Agentic 能力的工程实现以及数据流转系统的开发。我们寻找的不仅是理解算法原理的工程师,更是能编写高质量代码、构建高效训练框架、解决实际算力与数据瓶颈的实战派*
主要职责:
- 大规模训练管线构建与优化 (Pipeline Engineering)
- 训练系统开发:负责万亿参数级模型 SFT / RLHF / RLVR / Agentic RL 等全流程训练的搭建、维护与性能调优。
- 效率与稳定性:解决分布式训练中的显存墙、通信瓶颈与稳定性问题,优化 GPU 利用率与训练吞吐量(Throughput)。
- 算法工程化落地:将前沿的强化学习算法(如复合奖励模型、过程监督)转化为高可用的工程代码,实现训推一体化框架的平滑流转。
- 实验管理:构建标准化的实验管理平台,支持算法团队进行高效的超参搜索与模型迭代。
- 模型能力实现与评测体系 (Capability Implementation & Eval)
- 能力专项建设:针对逻辑推理、长程规划及工具使用(Tool Use)等能力,实现具体的训练任务与数据配方加载,确保模型能力按预期对齐。
- Agentic 工程集成:实现模型与外部环境(如代码解释器、API)的交互接口,开发高并发、高保真的 Agent 仿真训练环境。
- 自动化评测:构建覆盖长上下文、多轮对话及复杂指令遵循的自动化评测系统(Eval Pipeline),快速反馈模型迭代效果。
任职要求
- 编码与工程能力: 1)算法与数据结构功底极其扎实,曾获 NOI/IOI、ACM/ICPC 等顶尖算法竞赛奖牌者优先;能将竞赛级的代码实现能力用于 LLM 场景,极致优化核心算法(如Attention计算、KV Cache管理)的时空复杂度。 2)熟练掌握 Python/C++ 和 PyTorch,具备深度的分布式训练(多机多卡调优)经验;有高性能计算底层开发经验(如CUDA编程、Triton、SIMD指令优化)者更佳。 3)熟悉代码调试与性能分析工具(如 gdb/pdb, Nsight Systems, PyTorch Profiler),能快速定位显存死锁并攻克系统级性能瓶颈。
- 学历与算法基础: 计算机科学、人工智能、数学等相关专业硕士及以上学历(拥有优秀工程竞赛背景者可放宽);理解 Transformer 架构及 SFT / RLHF / DPO / PPO / GRPO 等核心算法;熟悉 AI Agent 关键技术(如复杂规划、工具调用、记忆机制、RAG及多智能体系统等)。
- 实践经验(加分项): 有头部科技公司或知名 AI 实验室大模型底层基建(Infra)实习经验者优先。
特色标签
C/C++、distributed computing、infrastructure、intelligent agent、Python、Transformer模型架构、人类反馈强化学习、代理、代理强化学习、分布式训练、参加算法相关竞赛/获奖、变压器架构、吞吐量、基于人类反馈的强化学习、基于视频反馈的强化学习、大模型算法、工具使用、工具调用、并行计算、强化学习、智能体、智能体强化学习、机器学习、模型加速/性能优化、深度学习、监督式微调、监督微调、算法工程化经验、自然语言处理算法、视频反馈强化学习、训练吞吐量、评估流水线、评测流水线、键值对缓存、键值缓存