研究型实习生-面向LLM自演化的Self-Taught RLVR框架研究:自蒸馏、近未来策略优化与协同策略蒸馏
Company Antgroup
Focus Tech · Algorithm
Location 上海
Published May 20, 2026
岗位职责
研究领域: 大模型 项目简介: 如何让大模型"自己教自己"实现持续进化,是后训练研究的核心命题。基于可验证奖励的强化学习(RLVR)已成为大模型推理能力提升的主流范式,但现有方法面临奖励信号稀疏、学习信号难以被模型有效吸收、多专家能力整合效率低等挑战。 本项目围绕"Self-Taught RLVR"这一前沿方向,从三个互补维度展开研究:利用特权信息增强的自身进行自蒸馏(informed self),利用训练过程中近未来的自身提供辅助学习信号(temporal self),以及让多个专家分支边训练边互教实现协同进化(parallel self)。核心目标是让模型为自己生成贴合当前能力、更易吸收的高质量学习信号。项目涉及RLVR、在策略蒸馏(OPD)、多专家融合等后训练核心技术,具有明确的学术前沿性和发表潜力。
任职要求
-在读硕士或博士研究生,计算机科学、人工智能、机器学习等相关专业 -熟悉大语言模型(LLM)的基本原理,了解Transformer架构与主流开源模型(如Qwen、LLaMA等) -具备扎实的Python编程能力和PyTorch深度学习框架使用经验 -对强化学习(尤其是RLHF/RLVR)、知识蒸馏、或大模型后训练方向有了解或研究兴趣 -具有良好的文献阅读能力和数学基础,能理解优化目标推导与理论分析 -逻辑思维清晰,具备独立设计和执行实验的能力 -实习期间每周可投入至少4天,持续5-6个月以上
加分项:
-有RLHF/RLVR/DPO等大模型后训练方法的实践经验 -有使用分布式训练框架(如veRL、DeepSpeed、FSDP等)的经验 -有强化学习、知识蒸馏、或LLM推理能力提升方向的论文发表 -熟悉GRPO、PPO等策略优化算法的原理与实现
特色标签
Python、RL、Transformer架构、Transformer模型、专家协同、分布式训练、发表算法相关优秀论文、可验证奖励的强化学习、基于可验证奖励的强化学习、多专家集成、大模型、大模型后训练、大模型算法、大语言模型、强化学习、强化学习策略优化、强化学习算法、机器学习、模型加速/性能优化、模型后训练、模型蒸馏、深度学习、策略优化算法、算法工程化经验、自然语言处理算法、自监督蒸馏、自身蒸馏、蒸馏、近端策略优化、近端策略优化算法