千问事业部-大模型算法专家(agent方向)-北京
Company Quark
Focus Tech · Algorithm
Location 北京
Published September 10, 2026
岗位职责
- 评测体系驱动
- 将业务需求转化为可执行、可评测的Agent任务,明确能力边界、风险和验收标准。
- 建设离线与在线评测体系,包括任务分级、评测数据集、回归测试和真实轨迹分析;设计任务成功率、工具调用准确率、人工接管率、执行步数、延迟及Token成本等指标。
- 建立失败归因机制,区分模型、规划、工具、上下文和系统问题,驱动Prompt、Skill、模型及Harness持续优化。
- 长程任务规划、决策与强化学习
- 负责多步骤、多工具、跨系统任务的拆解、规划、执行与验证,设计Planner–Executor–Verifier、任务图及动态Replan机制。
- 建设状态持久化、检查点、断点续跑、幂等执行和失败恢复能力,解决计划漂移、循环调用、上下文污染及长程任务信用分配问题。
- 构建Agent RL训练闭环,包括轨迹采集、环境回放、奖励设计和策略评估;熟悉SFT、DPO、GRPO、PPO、DAPO及Rejection Sampling等方法。
- 通过规则奖励、Reward Model或LLM Judge,优化任务分解、工具选择、Replan时机、错误恢复和停止策略,并防止奖励投机。
- Agent架构能力
- 负责模型、规划、工具、记忆、执行、评测和安全等核心模块的架构设计。
- 建设通用Agent Runtime,支持单Agent、多Agent、Workflow及Human-in-the-loop;建设模型路由、Tool Calling、MCP、Skill管理和Agent间任务交接机制。
任职要求
- 熟悉Agent规划决策、强化学习和模型后训练,能够独立完成数据构造、奖励设计、训练及效果评估。
- 熟悉LangGraph、AutoGen、OpenAI Agents SDK或类似框架,理解Tool Calling、MCP、RAG、Memory、Planning和Multi-Agent。
- 具备Agent项目生产落地经验,能够通过成功率、成本、延迟、恢复率和稳定性等数据证明实际效果。
- 加分项:在顶会(NeurIPS/ICML/CVPR/ACL等)发表过论文者优先;熟悉Agentic RL和harness的方法优先。