企业微信-大模型算法工程师-Agent后训练(北京/广州)
Company Tencent
Focus Tech · Algorithm
Location 成都
Published September 2, 2026
岗位职责
- 参与 Agent 大模型的后训练工作,在 SFT、奖励模型、强化学习等方向进行方案设计、数据构建与训练落地,持续提升真实场景下的规划、推理、工具调用与指令遵循能力;
- 针对 Agent 任务执行中的能力短板(如多步规划、抗干扰与幻觉抑制等),设计定向的训练优化方案,并构建数据合成、清洗与质量评估管线;面向意图识别等特定场景模型进行训练与优化,结合业务需求完成定制化的能力构建;
- 持续跟踪并引入后训练领域的最新技术,推动技术在实际业务的创新落地。
任职要求
- 计算机、人工智能、机器学习、数学等相关专业,硕士及以上学历,具备扎实的计算机基础与算法基础,2 年以上相关领域工作经验;
- 深入理解大语言模型与 Agent 技术体系,熟练掌握主流后训练技术(SFT、RLHF、DPO、PPO/GRPO 等),具备完整的模型训练与优化项目经验,能独立定位并解决效果问题;
- 熟练掌握 Python,熟练使用主流深度学习与训练框架(如 PyTorch、DeepSpeed/Megatron、veRL/OpenRLHF 等),具备扎实的算法实现与大规模分布式训练调优能力;
- 熟悉数据构建与评估体系,有强化学习环境搭建、奖励模型训练或高质量指令/偏好数据合成经验者优先;
- 在 ICLR、NeurIPS、ICML、ACL、EMNLP 等顶尖会议发表过论文,或为优秀机器学习开源项目贡献者优先。
产品/项目
企业微信SaaS
工作年限
两年以上工作经验