大模型研究实习生

Intern

Company Antgroup

Focus Tech · Algorithm

Location 北京, 上海, 杭州

Published September 20, 2026

岗位职责

岗位简介: 我们正在探索下一代大语言模型与通用人工智能的核心边界:不仅关注语言模型的规模化表达,更专注于模型训练的能力极限,并探索模型在复杂环境下的自我迭代、持续学习与自主进化。我们期待对 LLM 基础理论、强化学习、Self-Improvement 以及 Agent 感兴趣的同学加入,共同探索大模型在数据、训练算法与全链路的前沿研究与落地实践。

岗位职责: 参与大语言模型(LLM)与多模态大模型的深度研究,与资深研究员及工程师紧密协作,探索大模型Scaling、复杂 Agentic 场景的训练对齐、合成数据构建以及模型自我演化(Self-Improvement / Recursive Evolution)等核心技术方向。

任职要求

  1. 计算机 / 人工智能 / 自动化 / 数学 / 软件工程相关专业硕士或博士在读,每周可实习 4 天以上、持续 6 个月及以上;
  2. 精通 Python,具有扎实的算法、数据结构及数学基础;熟练掌握 PyTorch,熟悉 DeepSpeed、Megatron-LM、FSDP、vLLM、SGLang 中至少两项;
  3. 深刻理解大模型全链路机制:预训练 Transformer/Diffusion 架构、SFT 规范、RLHF/RLVR (PPO/GRPO) 理论与实践;
  4. 在以下至少一个方向有研究或项目经验:
  • 大模型预训练、模型架构、数据策略或训练优化;
  • 监督微调、偏好优化、强化学习或奖励建模;
  • 持续学习、迁移学习、知识更新或模型自我进化;
  • 复杂推理、工具使用、交互学习或模型能力评测。
  • 能够阅读并复现相关领域前沿论文,设计合理的对照与消融实验,根据实验结果提出并验证研究假设。
  • 具备主动探索与独立思考能力,能够将开放问题拆解为可验证的研究任务,清晰记录实验并与团队沟通。

有以下经验者优先:

  1. 在 NeurIPS、ICML、ICLR、ACL、EMNLP、COLM 等会议或相关期刊发表过论文,或有高质量开源研究成果;
  2. 参与过大模型预训练或规模化后训练,熟悉 DeepSpeed、Megatron-LM、FSDP 等分布式训练框架,有多机多卡训练与性能优化经验;
  3. 有大规模数据清洗、质量评估、合成数据生成或数据配比优化经验,能够通过实验分析数据对模型能力的影响;
  4. 有强化学习训练经验,熟悉 PPO、GRPO 等算法,研究过奖励设计、奖励投机、探索效率或长程任务中的信用分配问题;
  5. 在灾难性遗忘、持续学习、测试时适应、自博弈或环境反馈驱动的模型更新方面有深入研究;
  6. 有严谨的评测体系建设经验,能够区分基准表现提升、评测过拟合与真实泛化能力提升。

特色标签

ACL、DeepSpeed、EMNLP、FSDP、GRPO、ICLR、ICML、LLM、Megatron-LM、NeurIPS、PPO、Python、RL、RLHF、Self-Improvement、Shell、Transformer预训练、云服务、内容、分布式训练、发表算法相关优秀论文、合成数据生成、基准测试、多机多卡训练、多模态LLM、多模态模型、多模态算法、大模型、大模型算法、大规模预训练、大语言模型、奖励建模、强化学习、持续训练、数据构建、数据配比优化、智能体、机器学习、模型加速/性能优化、模型自进化、模型评测、模型预训练、测试时适应、深度学习、灾难性遗忘缓解、研发效能、终身学习、聊天机器人、能力评测、自我进化、自然语言处理算法、英美留学生、评测过拟合、跨模态大模型、递归演化、金融、顶会论文