【Plan A】大模型Agentic RL算法工程师-百灵-27届
Campus/Intern
Company Antgroup
Focus Tech · Algorithm
Location 上海, 杭州
Published May 14, 2026
岗位职责
团队主要负责百灵Agentic 核心能力 的研发与迭代,构建出端到端解决复杂生产任务的智能体技术。团队既要提升模型在复杂任务规划、工具调用上的端到端表现;又要深入底层,解决训练吞吐、推理延迟、以及 Agentic 交互环境(Sandboxing)背后的资源调度与性能瓶颈问题。 Ling Team 聚焦百灵模型家族的核心算法创新。在本岗位下,你将主导百灵大模型在特定 Agent应用场景下的效果优化,构建下一代具备高度Agentic能力的模型,使其从单纯的文本生成器进化为能够解决复杂现实问题的智能体。
主要职责包括:
- Agentic能力构建: 负责大模型在 Agent场景下的后训练(SFT/RLHF)算法研发,重点提升模型的复杂指令遵循、多步推理(Reasoning)、工具使用(Tool Use)及任务规划能力;
- 训练范式创新: 探索并设计针对 Agent 场景的高效训练范式(如 Process Reward Models, Self-Play,Iterative Refinement),解决长链路任务中的误差累积和鲁棒性问题;
- 数据策略与合成: 设计高质量的 Agentic 训练数据合成方案(Data Synthesis),通过构造复杂环境交互数据,驱动模型能力的Scaling;
- 模型评估与分析: 建立针对 Agent 能力的系统性评估体系,通过严谨的实验分析(AblationStudy)定位模型短板,指导算法迭代方向;
- 前沿技术落地: 紧密跟踪 MoE、Long Context 等前沿技术,并在复杂工程约束下,将算法创新转化为实际的模型性能提升。
任职要求
- 理论基础扎实: 拥有深厚的深度学习与非凸优化理论功底,具备从第一性原理(FirstPrinciples)对复杂问题进行数学建模和拆解的能力;
- 架构深度理解: 深入掌握 Transformer 及其变体架构,熟悉 MoE(混合专家模型)机制及主流 LLM 的底层实现细节;
- 后训练范式: 精通 SFT(监督微调)、RLHF(人类反馈强化学习)、DPO/PPO 等对齐算法,深刻理解Alignment(对齐)背后的数学原理与优化挑战;
- Agentic 实战经验: 具备复杂 Agentic 系统(如 Tool-use, Reasoning,Planning)的训练与全链路搭建经验,理解 Agent 在复杂环境下的交互逻辑;
- 科学实验素养: 具备独立设计实验、进行严谨消融实验(Ablation Study)及归因分析的能力,能在复杂工程约束下做出最优算法决策。
加分项
- 在顶会 / 顶刊发表过相关论文;
- 有 MoE 或新型 Attention 设计经验;
- 有 Agentic 模型或工具调用训练经验;
- 有长上下文(100K+)能力训练经验;
- 参与过 100B 以上参数规模的模型训练;
- 各类高水平竞赛金牌选手。
特色标签
Agent、LLM、Mixture of Experts、Python、Reinforcement Learning、Reinforcement Learning from Human Feedback、Shell、Supervised Fine-Tuning、人类反馈强化学习、任务规划、分布式训练、参加算法相关竞赛/获奖、发表算法相关优秀论文、多步推理、大模型算法、大语言模型、工具使用、工具调用、强化学习、推理、智能体、模型加速/性能优化、深度学习、混合专家模型、监督微调、自主智能体、自然语言处理算法、规划能力、长上下文、长文本