蚂蚁集团-大模型后训练算法工程师-阿福
Company Antgroup
Focus Tech · Algorithm
Location 北京, 杭州
Published October 9, 2026
岗位职责
- 参与训练医疗大模型,包括但不限于模型SFT、强化学习系统的算法实验设计、数据收集合成消融、infra 团队协作等;
- 探索高效的后训练范式,包括高效 SFT、Model Merge、On-policy Distill、 RL等后训练算法以及pipeline,提升发布效果和效率。
- 提升大模型在Reasoning、Agentic等任务上的能力上限,构建在医疗场景具备深度思考和自主行动能力的基座模型。
任职要求
-
硕士及以上学历,计算机科学或相关专业背景。
-
具备大模型研发经验,在 Post-Training(如SFT、RL、Model Merge、OPD等)某一方向上有深入积累。
-
算法与工程兼备,熟悉数据与训练策略,也了解主流训练和推理框架(如 Megatron、SGLang、vLLM等)。
-
具有良好的学习和沟通能力,有好奇心和责任心,具有钻研精神,能够与算法团队、工程团队及其他技术团队紧密配合。
-
在大模型领域有科研或实践经验,在AI领域国际顶级会议/期刊发表过高质量论文优先
-
具备算法和infra co-design经验, 对sglang/vllm/megatron有开发优化经验优先
特色标签
Post-Training、Python、RL、云原生、云计算、代理能力、分布式训练、医疗、医疗AI大模型、医疗领域大模型、发表算法相关优秀论文、在线策略蒸馏、基座模型、大模型算法、大语言模型、并行计算、强化学习、强化学习算法、推理、推理能力、智能体、智能研发、有监督微调、模型加速/性能优化、模型合并、模型后训练、模型融合、深度学习、监督微调、策略蒸馏、算法工程化经验、自主行动能力、自然语言处理算法、逻辑推理