千问事业部-大模型算法专家(agent方向)-北京

Company Quark

Focus Tech · Algorithm

Location 北京

Published September 10, 2026

岗位职责

  1. 评测体系驱动
  • 将业务需求转化为可执行、可评测的Agent任务,明确能力边界、风险和验收标准。
  • 建设离线与在线评测体系,包括任务分级、评测数据集、回归测试和真实轨迹分析;设计任务成功率、工具调用准确率、人工接管率、执行步数、延迟及Token成本等指标。
  • 建立失败归因机制,区分模型、规划、工具、上下文和系统问题,驱动Prompt、Skill、模型及Harness持续优化。
  1. 长程任务规划、决策与强化学习
  • 负责多步骤、多工具、跨系统任务的拆解、规划、执行与验证,设计Planner–Executor–Verifier、任务图及动态Replan机制。
  • 建设状态持久化、检查点、断点续跑、幂等执行和失败恢复能力,解决计划漂移、循环调用、上下文污染及长程任务信用分配问题。
  • 构建Agent RL训练闭环,包括轨迹采集、环境回放、奖励设计和策略评估;熟悉SFT、DPO、GRPO、PPO、DAPO及Rejection Sampling等方法。
  • 通过规则奖励、Reward Model或LLM Judge,优化任务分解、工具选择、Replan时机、错误恢复和停止策略,并防止奖励投机。
  1. Agent架构能力
  • 负责模型、规划、工具、记忆、执行、评测和安全等核心模块的架构设计。
  • 建设通用Agent Runtime,支持单Agent、多Agent、Workflow及Human-in-the-loop;建设模型路由、Tool Calling、MCP、Skill管理和Agent间任务交接机制。

任职要求

  1. 熟悉Agent规划决策、强化学习和模型后训练,能够独立完成数据构造、奖励设计、训练及效果评估。
  2. 熟悉LangGraph、AutoGen、OpenAI Agents SDK或类似框架,理解Tool Calling、MCP、RAG、Memory、Planning和Multi-Agent。
  3. 具备Agent项目生产落地经验,能够通过成功率、成本、延迟、恢复率和稳定性等数据证明实际效果。
  4. 加分项:在顶会(NeurIPS/ICML/CVPR/ACL等)发表过论文者优先;熟悉Agentic RL和harness的方法优先。