CTO-大模型强化学习框架研发
Campus
Company Antgroup
Focus Tech · Algorithm
Location 北京, 杭州
Published August 31, 2026
岗位职责
岗位核心目标是研发面向超大规模模型的强化学习训练系统,提升大模型在工具调用、多模态交互及复杂环境中的推理与决策能力,实现多轮“感知—推理—行动—反馈”闭环,推动 Agent 与 AGI 前沿技术落地。
你将参与:
- 参与大规模分布式强化学习框架的设计、开发与优化,提升训练吞吐、资源利用率、稳定性和可扩展性;
- 研究并实现 PPO、GRPO 等强化学习算法,探索奖励建模、采样策略及训练稳定性等关键问题;
- 支持大模型与搜索、代码执行、外部工具及多模态环境的高效交互,建设复杂任务下的训练与评测闭环;
- 跟进并复现大模型强化学习、Agent、推理增强等领域的前沿工作,推动有效方案落地。
任职要求
- 目前正在攻读计算机科学或相关STEM领域的学士,硕士或博士学位;
- 具有一种或多种通用编程语言的经验,包括但不限于: Java,C/C ++ 、Python、JavaScript或Go;
- 具有上述研究领域的相关经验,包括行业经验或作为参与实验室研究。
优先录用:
- 对技术研究充满热情,具有产生新思想和创新的能力; 在自学,问题分析和解决方面表现出色;
- 在国际会议上或核心期刊发表一份或多份出版物或论文;
- 至少3个月的全职工作。
特色标签
AI Agent、C/C++、Golang、Python、Reward Modeling、RL、云原生、云服务、云计算、分布式RL、分布式计算、分布式训练、发表算法相关优秀论文、基础设施、增强学习、多模态算法、多模态融合、大模型算法、大规模强化学习、大语言模型、奖励模型、并行计算、广义策略优化、强化学习、推理提升、推理能力增强、搜索、智能体、有留学背景、模型加速/性能优化、研发效能、算法工程化经验、自然语言处理算法、英美留学生、超大规模模型、近端策略优化、通用人工智能