研究型实习生-大模型后训练-Accio Work
Intern
Company Aidc
Focus Tech · Algorithm
Location 杭州
Published January 7, 2026
岗位职责
【项目介绍】 本项目旨在通过 RL 与其它后训练方法,提高Agent模型能力,解决包括但不限于 tool use,长程任务等问题。
岗位职责
- 大规模后训练实践: 参与构建大模型后训练/Agent模型训练数据及benchmark,利用分布式训练框架(如 Megatron-LM, verl)进行大规模模型调优;
- 算法研究与优化: 探索大模型、Agent相关的前沿算法,产出 Novelty 和实用性兼具的工作;
- 前沿追踪:Follow 最新的学术工作,逐步养成比较好的 taste。
任职要求
- 背景: 计算机、数学或相关专业在读(硕士/博士优先),熟悉大模型训练流程;
- 技术栈: 熟悉 PyTorch,对 Megatron,Deepspeed 等分布式框架和分布式并行策略(TP/PP/DP/CP)有实操经验;
- 良好的论文阅读与工程实现能力,希望在顶会(NeurIPS, ICLR, CVPR)发表高影响力工作。