jdwatch
  • Home
  • CLI
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

Token Foundry-基础大模型 Post-Training 算法专家-杭州/北京

Company 通义实验室

Focus 技术 · 算法

北京, 杭州

July 29, 2026

岗位职责

  1. 负责大模型 Post-Training 全链路算法建设,覆盖 Pre-SFT、SFT、RLHF、RLVR(PPO / DPO / GRPO 等)各阶段的算法调优与策略设计,提升模型在指令遵循、工具调用、安全合规、多轮交互、long horizon task 等核心维度的综合能力。
  2. 负责 Reward Model 的设计、训练与迭代优化,构建 Verifier、LLM as Judge、Rule 等多元 Reward System,优化多维度(安全性、准确性、有用性、逻辑性、拟人度等)的偏好数据采集策略与训练方案。
  3. 设计高质量 SFT / RL 数据采集、清洗与标注方案,建立数据质量评估标准;通过实验驱动数据配比方法论,探索高质量数据合成、Agentic RL 等前沿方法,持续提升数据质量与多样性。
  4. 参与模型合版工作,包括数据配比策略、多任务训练优化、灾难性遗忘缓解等核心技术,确保各业务线智能体能力与基座模型的高效融合;分析线上 Badcase,将 RL 信号融入模型训练全流程。
  5. 探索 LLM 及 VLM 场景下的 Post-Training 方案,解决跨模态对齐与幻觉问题;跟踪 Agentic RL 等前沿研究进展,推动技术创新在基座大模型及 APP 对话助手产品中的落地。

任职要求

  1. 计算机科学、人工智能、数学等相关专业硕士及以上学历,1 年以上 NLP / LLM 领域一线研发经验。
  2. 对大模型 Post-Training 阶段有全局视角的理解,曾作为核心骨干完整参与过百亿/千亿级别模型的 SFT 与 RLHF 迭代过程;熟练掌握主流对齐算法(SFT、DPO、GRPO、PPO 等)及其底层数学逻辑。
  3. 有 Reward Model 训练和评估经验,了解偏好学习的常见方法和挑战;对高质量数据有极高的敏锐度,能通过实验快速验证数据配比对模型能力的影响并总结为方法论。
  4. 熟练掌握 PyTorch,有大规模分布式训练经验,熟悉主流训练与推理框架,能快速定位并解决大规模训练中的工程问题。
  5. 对解决具有挑战性的技术问题充满热情,有开源社区贡献(如大模型相关项目)者优先。
  6. 关注领域前沿,有 NeurIPS / ICML / ICLR / ACL / CVPR 等顶会论文发表者优先。

岗位标签

NEW

Apply now

You'll be redirected to the official careers page. You can also sign in to save jobs and search more roles.