研究型实习生-强化学习中的大模型推理加速技术
Campus/Intern
Company Antgroup
Focus Tech · Algorithm
Location 北京, 上海, 杭州
Published June 22, 2026
岗位职责
研究领域: 大模型 项目简介: 随着大语言模型(LLMs)和强化学习(RL)技术的深度融合,如何高效优化RL训练过程中的大模型推理成为关键挑战。RL任务(如游戏AI、机器人控制、自动化决策)通常依赖大模型进行状态表示、策略生成或价值估计,但其计算开销大、延迟高、泛化性不足等问题限制了实际应用。本课题面向强化学习中的大模型推理进行软硬协同、深入优化探索。
- 大模型推理需求:面向长序列、大规模模型和数据,结合并行计算、软硬结合优化等,提升模型推理性能,提升吞吐、降低延迟;
- 推理-训练协同优化:探索大模型推理结果如何反馈至RL训练过程,探索训推协同的推理优化。
任职要求
研究领域: -目前正在攻读计算机科学或相关STEM领域的学士,硕士或博士学位 -具有一种或多种通用编程语言的经验,包括但不限于: Java,C/C ++ 、Python、JavaScript或Go -具有上述研究领域的相关经验,包括行业经验或作为参与实验室研究 优先录用: -对技术研究充满热情,具有产生新思想和创新的能力; 在自学,问题分析和解决方面表现出色 -在国际会议上或核心期刊发表一份或多份出版物或论文 -至少3个月的全职工作
特色标签
AI推理加速、C/C++、Golang、Java、Python、RL、发表算法相关优秀论文、基础大模型、大模型算法、大规模语言模型、大语言模型、并行计算、强化学习、推理-训练联合优化、推理优化、智能体强化学习、机器学习、机器强化学习、模型加速/性能优化、模型推理加速、深度学习、硬件协同优化、算法工程化经验、训练与推理协同优化、训练推理协同、软硬一体化优化、软硬件协同