大模型后训练优化

Campus

Company Antgroup

Focus Tech · Algorithm

Location 北京, 上海, 杭州

Published July 22, 2026

岗位职责

面向大模型负责后训练方向的核心研发与持续优化。该岗位分为基础模型后训练优化与应用场景后训练优化两个方向,候选人将根据研究背景、项目经验和团队需求匹配其中一个方向。 围绕数据飞轮、训练范式、评测体系与效果归因,持续提升模型在指令遵循、推理、可控性、工具使用、多模态理解与生成等方面的能力。

具体的职责包括以下相关方向的一项或多项:

  1. 基础模型后训练优化。围绕语言大模型或多模态大模型的通用能力提升,开展 SFT、偏好优化、强化学习等后训练工作,持续增强模型在指令遵循、推理深度、可控性、泛化能力与稳定性等方面的表现;
  2. 应用场景后训练优化。面向搜索问答、智能体、多模态理解、AIGC 等真实业务场景,设计并迭代应用导向的后训练方案,提升模型在复杂任务、多步执行、工具使用和内容生成等场景中的任务完成质量与落地效果;
  3. 数据飞轮与治理。建设高质量后训练数据体系,覆盖指令数据、偏好数据、轨迹数据、评测数据及多模态数据,持续优化数据构建、筛选、配比、标注与质量评估策略,推动数据与模型效果的闭环迭代;
  4. 评测与效果归因。搭建面向模型能力与业务目标的评测体系,结合自动化评测、离线基准、回归测试与实验分析,对训练效果进行量化评估、问题定位与归因,支撑训练策略和数据策略的持续优化;
  5. 工程落地与协同优化。与研究、系统、应用和产品团队协作,推动后训练方案在真实训练与业务环境中的高效落地,综合平衡效果、成本、稳定性与迭代效率。

任职要求

  1. 扎实的深度学习与优化理论基础;
  2. 深入理解 Transformer 与主流大模型架构;
  3. 有SFT、RLVR、Agentic RL、RLHF、reward model、distillation的训练经验;
  4. 能独立定义问题、设计实验并进行严谨验证;
  5. 能从第一性原理进行思考与建模;
  6. 能在复杂工程约束下做出算法决策。

加分项

  1. High contribution & low ego;
  2. 在顶会 / 顶刊发表过相关论文;
  3. 有构建新评测基准经验;
  4. 参与过 100B 以上参数规模的模型后训练;
  5. 精通 Agentic Coding;
  6. 熟悉 Verl、OpenRLHF、Slime 等开源RL框架,熟悉 Megatron、vLLM、SGLang 等训练推理引擎;
  7. 有交叉学科背景(数理化生、文史哲、金融、医疗等);
  8. 各类国际级竞赛(IMO、IPHO、ICHO、IOI、ICPC、Kaggle等)获奖。

特色标签

Agentic RL、Agent系统、AI智能体、Python、RLHF、RLVR、Shell、云服务、云计算、人类偏好对齐、偏好学习、具身智能、内容、分布式计算、分布式训练、医疗、参加算法相关竞赛/获奖、发表算法相关优秀论文、后训练优化、图像、基础设施、多模态大模型、多模态算法、大数据、大模型算法、大语言模型、安全可控、并行计算、强化学习、指令微调、推理能力、搜索、效果评估、数据自循环、数据闭环、数据驱动迭代、智能交互、智能代理、智能体、智能研发、有留学背景、有监督微调、机器人、标注、模型加速/性能优化、模型可控、模型微调、模型评估、模型迭代、测试工具、深度学习、深度推理、研发效能、算法工程化经验、聊天机器人、自然语言处理算法、英美留学生、视频、评测基准、语音、超级模型、输出可控、逻辑推理