jdwatch
  • Home
  • CLI
  • Skills
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

后训练算法专家(J104317)

Company Baidu

Focus Tech · Algorithm

Location 北京

Published August 24, 2026

岗位职责

  • 负责大模型在文档、搜索、创作、研究分析和复杂办公等场景中的算法研发与效果优化,重点提升指令理解、复杂推理与规划、工具调用、长上下文理解、事实性及结构化生成等能力
  • 建设大模型后训练数据体系,包括线上难例挖掘、任务轨迹分析、数据清洗、合成数据生成、偏好数据构造和数据质量评估
  • 根据实际任务选择并落地 SFT、DPO、RLHF、GRPO、蒸馏等后训练与行为对齐方案,提升模型在目标场景中的效果、稳定性和泛化能力
  • 建设模型评测体系,包括离线评测集、自动评估器、LLM-as-Judge、回归测试和线上实验,定位模型在理解、推理、工具调用和结果生成等环节的问题
  • 分析真实用户任务中的模型失败案例,将线上问题转化为可训练的数据、可量化的指标和可验证的实验方案,形成持续迭代闭环
  • 参与模型选型、大小模型协同、模型路由和推理策略优化,在任务效果、响应延迟与资源成本之间取得合理平衡
  • 与产品和工程团队协作,推动模型能力稳定应用于线上产品

任职要求

  • 计算机、人工智能、数学、统计学、电子信息等相关专业硕士及以上学历
  • 具备 3 年以上大模型、自然语言处理、机器学习或相关方向研发经验
  • 熟悉 Transformer 和大语言模型基本原理,对预训练、指令微调、偏好对齐、强化学习和模型推理有系统理解
  • 具备大模型后训练、训练数据建设、模型评测或复杂业务场景模型优化经验,完整参与过至少一个从数据构建、训练实验到效果验证的大模型项目
  • 熟练使用 Python 和 PyTorch,具备良好的数据处理、模型训练、实验分析和问题定位能力
  • 能够将用户体验和业务效果问题转化为明确的模型问题、数据方案、评测指标和训练实验
  • 具备良好的工程意识,关注实验可复现性、数据版本管理、模型回归、线上稳定性和推理成本
  • 具备较强的自驱力、学习能力和结果意识,能够独立负责一个模型算法方向并推动落地
  • 加分项
  • 有 SFT、DPO、RLHF、GRPO、Reward Model 等后训练实践经验
  • 有 Tool-use、Agentic Model、推理模型或长上下文模型训练经验
  • 有合成数据、Preference Data、Trajectory Data、难例挖掘或数据飞轮建设经验
  • 有 Critic、Verifier、Process Reward、模型自检或结果验证相关经验
  • 有大模型自动评测、LLM-as-Judge、Grader 或线上模型效果归因经验
  • 熟悉 Qwen、DeepSeek、GLM、Llama 等开源模型,或熟悉 DeepSpeed、FSDP、Megatron-LM、vLLM、SGLang 等训练和推理框架
  • 有 AI 搜索、文档理解、内容创作、Deep Research、代码生成或办公智能化相关经验
  • 在大模型、自然语言处理或机器学习相关会议发表过论文,或有高质量开源项目贡献