Token Foundry-Reward System算法工程师-Qwen
Company 通义实验室
Focus 技术 · 算法
北京
July 29, 2026
岗位职责
负责 Qwen 基座模型 Agentic Reward System 的设计、训练与迭代,构建支撑大规模 Agentic RL 训练的奖励信号体系,持续提升模型在 Coding、Agent 等高价值场景下的对齐质量与 RL 训练上限。
- Coding Reward System:构建面向 Code Agent 的 Reward System,设计 Evolving Rubrics 与 Code Verifier,实现 Outcome & Process Level 的自动化 Rewarding,解决长程 Coding Trajectory 下的 Credit Assignment 与 Reward 稀疏性问题。
- Agentic User Experience Reward:研究面向 Agent 任务的用户体验建模与 Reward 优化,探索 User Model Rewarding 与 Behavioral Signal Mining,弥合 Benchmark指标与用户实际体验之间的鸿沟。
- Reward System Infra:以 Reward 信号为核心构建数据飞轮,驱动数据筛选、难例挖掘与合成迭代;建设统一的 Reward 评估与标注框架,与 CPT / SFT / RL训练流程深度耦合,端到端优化全链路传导效率。
任职要求
- 计算机、人工智能等相关专业硕士及以上学历, 具备相关领域的顶会论文发表优先。
- 扎实的工程能力,有工业界大语言模型SFT / RL 训练经验的优先(熟悉 PPO / GRPO 等完整流程)。
- 对 Reward System 有独立的技术判断,能分析不同技术路线(Scalar RM / Gen RM / Pair-wise RM 等)的适用边界。
- 有以下任一方向的深入经验者优先: (1)Reward Model Training(Agent RM / Coding RM / Agentic RM) (2)Coding / Agent Benchmark (3)Credit Assignment / Reward Shaping / Multi-turn RL
岗位标签
NEW