研究型实习生-大模型后训练-Accio Work

Intern

Company Aidc

Focus Tech · Algorithm

Location 杭州

Published January 7, 2026

岗位职责

【项目介绍】 本项目旨在通过 RL 与其它后训练方法,提高Agent模型能力,解决包括但不限于 tool use,长程任务等问题。

岗位职责

  1. 大规模后训练实践: 参与构建大模型后训练/Agent模型训练数据及benchmark,利用分布式训练框架(如 Megatron-LM, verl)进行大规模模型调优;
  2. 算法研究与优化: 探索大模型、Agent相关的前沿算法,产出 Novelty 和实用性兼具的工作;
  3. 前沿追踪:Follow 最新的学术工作,逐步养成比较好的 taste。

任职要求

  1. 背景: 计算机、数学或相关专业在读(硕士/博士优先),熟悉大模型训练流程;
  2. 技术栈: 熟悉 PyTorch,对 Megatron,Deepspeed 等分布式框架和分布式并行策略(TP/PP/DP/CP)有实操经验;
  3. 良好的论文阅读与工程实现能力,希望在顶会(NeurIPS, ICLR, CVPR)发表高影响力工作。