【Plan A】大模型后训练算法工程师-百灵-27届
Company Antgroup
Focus Tech · Algorithm
Location 北京, 上海, 杭州
Published May 14, 2026
岗位职责
Ling Team 聚焦百灵模型家族的核心算法创新。 我们关注的不只是 benchmark 指标,而是: 1.智能与效率的极致 Pareto 前沿 2.长程推理与规划能力 3.Agentic 执行与真实世界决策 4.在工业规模下可持续扩展的训练范式 在万亿参数(1T)与百万上下文(1M Context)的规模下,即时模型的后训练不仅是算法调优,更是对算力、数据与模型架构的系统性重构。 本岗位将主导大规模后训练范式、Agentic RL 以及数据演化策略的核心设计,打造兼具前沿思考能力与工业级Token效率的旗舰模型。 我们寻找的不是仅仅会跑 SFT/RL 流程的工程师,而是能从第一性原理出发,重构即时智能形态的架构师。
主要职责包括:
后训练范式与算法重构 1.主导万亿参数级模型的 SFT / RLHF / RLVR / Agentic RL 全流程算法演进; 2.构建“正确性 × 过程冗余”的复合奖励模型(Reward Modeling),探索 Token 效率与推理能力的平衡边界; 3.研发训推一体的大规模强化学习框架,提升分布式训练的稳定性与吞吐效率; 4.探索多目标优化与过程监督(Process Supervision)的前沿技术,实现模型价值对齐(Alignment)的精细化控制。
核心能力与 Agentic 智能演化 1.设计针对逻辑推理、长程规划及工具使用的专项训练策略; 2.提升模型在复杂指令遵循与创意写作上的表现; 3.构建高保真交互环境下的 Agentic RL 训练范式,适配主流智能体协议(如 Claude Code/OpenCode); 4.突破即时模型在长上下文(1M+)与多轮对话中的记忆与推理瓶颈。
细粒度数据工程与闭环 1.构建 Rubric-driven 的数据合成与演化策略,实现从数据质量评估到清洗的自动化闭环; 2.设计基于 Fine-grained Rubric 的质量引导课程学习(Data Curriculum),提升训练效率与模型能力上限; 3.探索数据 Scaling Laws,通过高质量合成数据突破传统语料的边际效应。
工业落地与学术影响力 1.紧跟 LLM/RL 领域最前沿学术进展,推动技术在工业场景的规模化落地; 2.参与百灵核心开源项目建设,在顶级会议(ICML/NeurIPS/ICLR等)发表具有行业影响力的研究成果。
任职要求
- 计算机科学、人工智能、数学等相关专业硕士及以上学历;深入理解 Transformer 架构及 SFT / RLHF /DPO / PPO / GRPO 等核心算法;熟悉 AI Agent 关键技术(如复杂规划、工具调用、记忆机制、RAG及多智能体系统等);
- 编码与工程能力: 1)熟练掌握 Python 和 PyTorch,具备分布式训练(多机多卡调优)经验;有高性能计算开发经验(如CUDA编程、SIMD指令优化)者更佳。 2)算法与数据结构功底扎实,能针对 LLM 场景优化核心算法(如Attention计算、KV Cache管理)的时空复杂度。 3)熟悉代码调试与性能分析工具(如 gdb/pdb,Nsight Systems, PyTorch Profiler);
- 学术与科研能力: 1)以第一作者在 NeurIPS, ICML, ICLR, ACL等顶会或顶刊(CCF-A类)发表过论文。2)获国际级学术或竞赛奖项者优先(如顶会Best Paper、ACM/ICPC金牌、Kaggle Master等);
- 实践经验(加分项): 有头部科技公司或知名 AI 实验室大模型或 Agent 算法相关实习经验者优先。
特色标签
Agent强化学习、AI对齐、Python、人类反馈强化学习、价值反馈强化学习、价值对齐、分布式计算、分布式训练、参加算法相关竞赛/获奖、发表算法相关优秀论文、基于人类反馈的强化学习、基于价值反馈的强化学习、基于智能体的强化学习、大型语言模型、大模型算法、奖励函数建模、奖励建模、并行计算、强化学习、指令微调、推理过程监督、智能交互、智能体、智能体强化学习、有监督微调、模型加速/性能优化、模型后训练、模型对齐、模型对齐训练、深度学习、算法工程化经验、自然语言处理算法、评估标准驱动、过程监督、量规驱动