腾讯游戏-高级研究员-大模型后训练
Company Tencent
Focus Tech · Algorithm
Location 上海
Published September 28, 2026
岗位职责
- 负责智能NPC对话(文生文)方向的前沿研究,研发新一代对话底座模型,使游戏中的智能NPC能像真实人物一样与玩家实时交互;
- 跟踪并研究大模型后训练、知识蒸馏与智能体等最新技术,让大模型学会扮演各类游戏NPC角色,具备独特世界观、人设、记忆与语言风格,并持续优化线上推理效果与智能体harness决策能力;
- 构建游戏生成专用数据集,训练与微调大模型,提升生成内容逻辑性与人物一致性,探索RL、RLVR、OPD等技术优化与NPC设定的匹配度;
- 协同游戏引擎团队,保障生成内容可直接运行于Unreal等主流引擎,监控真实场景表现并持续迭代模型效果与稳定性;
- 与游戏策划、美术及程序团队紧密协作,理解业务需求并转化为实际生产力,输出技术文档、专利或论文以推动行业技术标准建设;
- 设计并搭建数据飞轮与评测闭环,利用合成数据与用户反馈不断提升模型在角色扮演场景下的综合表现。
任职要求
- 硕士及以上学历,人工智能、计算机科学、自然语言处理或相关领域专业背景;
- 精通Python与PyTorch生态,熟悉DeepSpeed、Megatron-Core、FSDP等训练框架及vLLM、SGLang等推理框架,具备大规模文生文模型训练与分布式训练工程能力;
- 系统掌握大模型后训练技术栈,包括SFT、GRPO、REINFORCE++、RLVR、RFT及reasoning模型训练范式(长思维链、test-time scaling、DAPO等);
- 深入理解模型蒸馏技术,如OPD、多教师蒸馏、自蒸馏,能将强教师模型能力迁移至线上小模型;
- 熟悉训练数据管线构造,能围绕人设一致性、世界观、记忆、语言风格设计数据方案并实现清洗去重与质量过滤;
- 熟悉评测管线构造,掌握自动化harness、LLM-as-a-Judge、在线A/B与用户反馈闭环,建立端到端评测体系;
- 具备端到端大模型后训练落地经验,完整跑通数据到上线全链路,在时延与成本约束下最大化模型效果;
- 具备优秀的问题分析与跨团队沟通能力,能独立推动技术项目在游戏业务中的落地。
产品/项目
生态二方赋能-其他(IEG)-跳珠(逍遥游)
工作年限
两年以上工作经验