Company Antgroup
Focus Tech · Algorithm
Location 北京, 杭州
Published August 27, 2026
硕士及以上学历,计算机科学或相关专业背景
有大模型强化学习相关的研究经历,具备丰富的训练经验,深入理解PPO/GRPO/IcePop等主流强化学习算法
具备扎实的算法工程实现能力,熟悉Python编程语言和PyTorch深度学习框架,有开源框架Areal/verl/slime/openrlhf使用经验
熟悉AI coding,对常用工具如claude code/opencode熟练掌握
在大模型领域有科研或实践经验,在AI领域国际顶级会议/期刊发表过高质量论文优先
具备算法和infra co-design经验, 对sglang/vllm/megatron有开发优化经验优先
NEW
Areal框架、LLM强化学习、Megatron-LM框架、OpenRLHF框架、Python、RL for agentic systems、SGLang框架、SLIME框架、VERL框架、vLLM推理框架、冰激凌优化(IcePop)、分布式训练、医疗、医疗大模型、医疗预训练模型、医疗领域基础模型、协同设计、发表算法相关优秀论文、基于智能体的强化学习、大模型算法、大语言模型强化学习、并行计算、强化学习、强化学习可扩展性、强化学习算法、强化学习规模化、强化学习规模扩展、智能体强化学习、模型加速/性能优化、深度学习、算法与系统协同设计、算法工程化经验、自然语言处理算法、软硬协同设计、近端策略优化、通用奖励策略优化