jdwatch
  • Home
  • CLI
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

Token Foundry-Reward System算法工程师-Qwen

Company 通义实验室

Focus 技术 · 算法

北京

July 29, 2026

岗位职责

负责 Qwen 基座模型 Agentic Reward System 的设计、训练与迭代,构建支撑大规模 Agentic RL 训练的奖励信号体系,持续提升模型在 Coding、Agent 等高价值场景下的对齐质量与 RL 训练上限。

  1. Coding Reward System:构建面向 Code Agent 的 Reward System,设计 Evolving Rubrics 与 Code Verifier,实现 Outcome & Process Level 的自动化 Rewarding,解决长程 Coding Trajectory 下的 Credit Assignment 与 Reward 稀疏性问题。
  2. Agentic User Experience Reward:研究面向 Agent 任务的用户体验建模与 Reward 优化,探索 User Model Rewarding 与 Behavioral Signal Mining,弥合 Benchmark指标与用户实际体验之间的鸿沟。
  3. Reward System Infra:以 Reward 信号为核心构建数据飞轮,驱动数据筛选、难例挖掘与合成迭代;建设统一的 Reward 评估与标注框架,与 CPT / SFT / RL训练流程深度耦合,端到端优化全链路传导效率。

任职要求

  1. 计算机、人工智能等相关专业硕士及以上学历, 具备相关领域的顶会论文发表优先。
  2. 扎实的工程能力,有工业界大语言模型SFT / RL 训练经验的优先(熟悉 PPO / GRPO 等完整流程)。
  3. 对 Reward System 有独立的技术判断,能分析不同技术路线(Scalar RM / Gen RM / Pair-wise RM 等)的适用边界。
  4. 有以下任一方向的深入经验者优先: (1)Reward Model Training(Agent RM / Coding RM / Agentic RM) (2)Coding / Agent Benchmark (3)Credit Assignment / Reward Shaping / Multi-turn RL

岗位标签

NEW

Apply now

You'll be redirected to the official careers page. You can also sign in to save jobs and search more roles.