jdwatch
  • Home
  • CLI
  • Skills
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

蚂蚁集团-大语言模型强化学习算法专家-北京/上海/杭州【AGI专项】

Company Antgroup

Focus Tech · Algorithm

Location 北京, 上海, 杭州

Published August 17, 2026

岗位职责

  1. 负责研发大语言模型强化学习算法,提升大模型在强化学习阶段的训练效率,以及提升大模型在数学、代码等自然科学领域的推理能力

  2. 负责研发奖励和评价模型,包括细粒度的过程监督和奖励建模,覆盖复杂推理、指令遵循等各种任务

  3. 参与后训练和推理阶段的Scaling Law研究,包括奖励模型训练、强化学习训练、推理阶段的Scaling Law

任职要求

  1. 硕士及以上学历,计算机科学或相关专业背景

  2. 有大模型相关的研究经历,在post-training方向具备一定的训练经验,熟悉奖励模型建模,PPO/REINFORCE/RLOO等主流强化学习算法

  3. 具备扎实的算法工程实现能力,熟悉Python编程语言和PyTorch深度学习框架,熟悉DeepSpeed/Megatron等主流分布式训练框架

  4. 具备良好的分析和问题解决能力、优秀的工程素养,能够独立思考和解决实际问题

  5. 具备较强的团队合作能力和沟通能力,能够与工程团队、业务团队、产品团队和其他技术团队紧密配合 加分项:

  6. 在语言大模型和机器学习领域有科研或实践经验,在国际顶级会议/期刊发表过高质量论文

  7. 在大数据处理、大规模分布式计算、分布式训练等领域有科研或实践经历

特色标签

DeepSpeed、Megatron、Python、PyTorch、RL、云计算、优化、分布式计算、发表算法相关优秀论文、多步推理、大数据、大模型、大模型算法、奖励函数、并行训练、强化学习、微调、扩展法则、指令执行、指令理解、推理性能、智能研发、深度强化学习、算法工程化经验、精细监督、缩放规律、自然语言处理、训练性能、评价模型、语言模型、高级推理