【Plan A】AI工程师(模型系统架构)-百灵-27届
Campus/Intern
Company Antgroup
Focus Tech · Backend
Location 北京, 上海, 杭州
Published May 14, 2026
岗位职责
挑战 AGI 的物理极限,作为“模型系统架构师”,打破算法研究与系统工程的边界,在万亿级参数、全模态原生感知、长链 Agent执行等维度,构建具备系统思维的下一代智能底座。 核心工作
- 系统的深度优化,超越传统的分布式策略,基于硬件拓扑(NVLink,RDMA)重新设计全模态模型的计算流,针对全模态(文本、音视频、3D)差异化的计算密度,设计动态算子融合与异构调度机制,解决不同模态在统一架构下的长尾计算瓶颈;
- 万亿级全模态原生训练工程,解决极低容错率下的超大规模集群收敛难题,设计支持全模态原生对齐的高吞吐、低延迟数据加载系统;
- 全模态强化学习系统,针对全模态(尤其是视频、音频生成的实时反馈)设计高性能 RL 训练系统,优化多模型(Actor, Critic,Reward, Reference)协同时的内存管理。开发全模态下的 DPO/PPO 算法变体,实现跨模态生成内容的一致性与安全性;
- 面向 Agentic 的模型演进,设计支持长思维链(CoT)与复杂搜索(Search)的推理架构,在模型底层构建能够快速响应外部环境反馈(如代码运行结果、物理模拟器信号)的流式架构,提升Agentic 工作流的端到端吞吐量。
任职要求
- 拥有计算机体系结构、分布式系统或人工智能方向的博士/硕士学位;
- 对分布式并行策略(TP/PP/DP/EP/CP)有代码级的掌控力。精通 PyTorch/C++/CUDA,能够手写高性能算子,熟悉算力集群的互联架构与存储瓶颈分析;
- 具备复杂 Agentic 系统(如 Tool-use, Reasoning, Planning)的训练与全链路搭建经验,理解 Agent在复杂环境下的交互逻辑;
- 深入掌握 Transformer 及其变体架构,熟悉 MoE(混合专家模型)机制及主流 LLM 的底层实现细节。
加分项
- 在顶会 / 顶刊发表过相关论文(如 OSDI等);
- 有 ACM 金牌优先,开源社区有影响力的作品优先;
- 具备良好的执行力且目标导向,敢于担当,善于协同合作。
特色标签
Agent工作流、C/C++、GPU高速互联、Python、专家混合架构、分布式训练、参加算法相关竞赛/获奖、发表算法相关优秀论文、图像算法、多模态、多模态算法、大模型算法、并行计算、强化学习、思维链、推理链、智能体工作流、模型加速/性能优化、模型架构师、深度学习、混合专家模型、直接偏好优化、算法工程化经验、系统架构师、自然语言处理算法、英伟达高速互联、语音算法、超大参数模型、超大规模模型、跨模态、近端策略优化、远程直接内存访问、通用人工智能、长思维链Agent、高性能网络通信