jdwatch
  • Home
  • CLI
  • Skills
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

蚂蚁集团-大模型强化学习算法专家-阿福

Company Antgroup

Focus Tech · Algorithm

Location 北京, 杭州

Published August 27, 2026

岗位职责

  1. 负责医疗基础模型的大规模强化学习算法研发、训练,通过RL scaling 提升医疗基模在复杂医疗诊断、循证、分析等场景的能力。
  2. 设计RL算法和奖励机制、提升学习效率、训练稳定性, 通过长周期、高效的学习,提升模型在复杂问题场景的推理能力。
  3. 通过与Infra团队co-design, 研发和扩展agentic RL环境,通过提升交互与反馈的质量和规模实现agentic能力的泛化。

任职要求

  1. 硕士及以上学历,计算机科学或相关专业背景

  2. 有大模型强化学习相关的研究经历,具备丰富的训练经验,深入理解PPO/GRPO/IcePop等主流强化学习算法

  3. 具备扎实的算法工程实现能力,熟悉Python编程语言和PyTorch深度学习框架,有开源框架Areal/verl/slime/openrlhf使用经验

  4. 熟悉AI coding,对常用工具如claude code/opencode熟练掌握

  5. 在大模型领域有科研或实践经验,在AI领域国际顶级会议/期刊发表过高质量论文优先

  6. 具备算法和infra co-design经验, 对sglang/vllm/megatron有开发优化经验优先

岗位标签

NEW

特色标签

Areal框架、LLM强化学习、Megatron-LM框架、OpenRLHF框架、Python、RL for agentic systems、SGLang框架、SLIME框架、VERL框架、vLLM推理框架、冰激凌优化(IcePop)、分布式训练、医疗、医疗大模型、医疗预训练模型、医疗领域基础模型、协同设计、发表算法相关优秀论文、基于智能体的强化学习、大模型算法、大语言模型强化学习、并行计算、强化学习、强化学习可扩展性、强化学习算法、强化学习规模化、强化学习规模扩展、智能体强化学习、模型加速/性能优化、深度学习、算法与系统协同设计、算法工程化经验、自然语言处理算法、软硬协同设计、近端策略优化、通用奖励策略优化