Company Meituan
Focus Tech · Algorithm
Location 北京
Published August 17, 2026
计算机科学、自动化、数学、统计学等相关专业硕士或博士,扎实的数学基础和编程能力;
精通强化学习核心算法(Policy Gradient、PPO、DPO、GRPO等),理解Reward Modeling和RLHF/RLAIF对齐技术原理,有LLM对齐相关项目实践经验优先;
熟悉PyTorch,有大规模分布式训练经验(DeepSpeed/Megatron-LM/FSDP),能独立完成从数据处理到模型训练部署的全流程;
有以下经验者优先:大语言模型推理优化(vLLM/TensorRT-LLM)、Agent/工具调用场景RL训练、搜索推荐系统强化学习应用;
在ICML、NeurIPS、ICLR等顶级会议发表RL/LLM方向论文者优先;
良好的逻辑思维和沟通能力,自驱力强,乐于挑战开放性技术问题。 岗位亮点:
前沿技术深水区:直接参与千亿参数大模型的RL训练,每天面对业界最前沿的Scaling RL挑战;
端到端闭环落地:从算法研究到亿级用户场景验证,你的每一行代码都能产生真实业务价值,拒绝纸上谈兵;
技术驱动文化:团队鼓励顶会投稿、内部技术分享,你可以在工作中同步保持学术竞争力。