jdwatch
  • Home
  • CLI
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

Token Foundry-大模型算法专家-Qwen Agent

Company 通义实验室

Focus 技术 · 算法

北京, 杭州, 上海

July 29, 2026

岗位职责

  1. Agent模型后训练: 负责大模型在Agent场景下的后训练(Post-training)工作,提升模型在复杂Agent任务中的表现。
  2. 强化学习与RL探索: 设计并优化基于强化学习(RL)的Agent训练框架,提升模型的长期规划能力、试错反思能力及工具调用准确率。
  3. 核心能力构建: 针对Agent的核心能力进行专项模型训练与对齐优化。
  4. 行业解决方案落地: 深入理解具体行业的业务痛点,将Agent模型能力与行业Know-how结合,设计并落地端到端的行业Agent解决方案。
  5. 前沿技术追踪: 跟踪学术界和工业界在LLM Agent、RLHF、后训练领域的最新进展,将前沿技术转化为团队的工程与算法资产。

任职要求

【基础要求】

  1. 计算机科学、人工智能、数学或相关专业硕士及以上学历。
  2. 具备扎实的理论基础,熟悉Transformer架构及大模型底层原理。
  3. 具备优秀的编程习惯和工程实现能力,熟悉 PyTorch 等主流深度学习框架。 【核心技能与经验】
  4. 深入理解大模型后训练流程,有丰富的 SFT、RLHF、PPO、DPO 等算法的实操经验;熟悉强化学习理论,有将 RL 应用于 LLM 或 Agent 决策过程的实战经验。
  5. 熟悉主流 Agent 框架与范式,有针对 Agent 特定能力进行模型微调或训练的经验。
  6. 熟悉大模型分布式训练框架,有大规模集群上的模型训练与调优经验。 【加分项】
  7. 对 AI Agent 在真实行业场景中的应用有强烈的好奇心和探索欲,不局限于“刷榜”,更关注技术如何解决实际业务问题。
  8. 在知名大模型开源项目或 Agent 框架中有核心代码贡献。
  9. 有具体行业大模型或 Agent 落地经验者优先。 【软性素质】
  10. 具备极强的自驱力和解决复杂问题的能力,能够在模糊的业务场景中找到技术突破口。
  11. 优秀的沟通协作能力,能够与工程团队、产品团队及业务方高效协同,推动项目落地。

岗位标签

NEW

Apply now

You'll be redirected to the official careers page. You can also sign in to save jobs and search more roles.