腾讯游戏-大模型强化学习框架研发工程师/专家

Company Tencent

Focus Tech · Algorithm

Location 杭州

Published July 9, 2026

岗位职责

  1. 负责视频生成、世界模型模型与强化学习相结合的训练框架设计、开发与性能优化;
  2. 深入分析和优化视RL训练全链路流程,包括数据加载、显存管理、通信效率、并行优化等,显著提升训练效率;
  3. 与前沿算法团队紧密合作,追踪并引入业界最新进展,快速完成技术原型验证。

任职要求

  1. 计算机相关专业,具备较强的动手能力;熟悉 Python ,具备扎实的系统编程功底和优秀的复杂系统 Debug 能力;
  2. 深入理解大模型分布式训练原理,具备 Megatron-LM、DeepSpeed 或FSDP 等主流框架研发经验;
  3. 熟悉大模型后训练与对齐技术(PPO、GRPO、DPO等),熟悉 Verl、ROLL,AReal 等强化学习/分布式计算框架,可以理解并解决 RL过程中的工程痛点;
  4. 熟悉主流生成模型的原理,在AIGC相关领域具备实际项目经验;
  5. 具备极强的技术好奇心与自驱力,面对业界无先例的技术难题,能独立思考并推动解决。

产品/项目

公共

工作年限

两年以上工作经验