蚂蚁健康-大模型后训练算法实习生
Campus/Intern
Company Antgroup
Focus Tech · Algorithm
Location 北京, 上海, 杭州, 成都
Published June 24, 2026
岗位职责
蚂蚁阿福医疗大模型团队,负责医疗大模型的研发以及在阿福业务场景的应用。
- 参与训练医疗大模型,包括但不限于模型SFT、强化学习系统的算法实验设计、数据收集合成消融、infra 团队协作等;
- 探索高效的后训练范式,包括高效 SFT、Model Merge、On-policy Distill、 RL等后训练算法以及pipeline,提升发布效果和效率。
- 提升大模型在Reasoning、Agentic等任务上的能力上限,构建在医疗场景具备深度思考和自主行动能力的基座模型。
- 密切关注业界 LLM 后训练算法领域的前沿论文,并整合新技术和算法到医疗大模型中,保持医疗大模型行业领先。
任职要求
- 博士/硕士生在读,计算机、自动化、数学或相关人工智能专业;
- 具备大模型研发经验,在 Post-Training(如SFT、RL、Model Merge、OPD等)某一方向上有研究成果或实战经验;
- 熟悉数据与训练策略,也了解主流训练和推理框架(如 Megatron、SGLang、vLLM等);
- 具有良好的学习和沟通能力,有好奇心和责任心,具有钻研精神,能够与算法团队、工程团队及其他技术团队紧密配合。
特色标签
Megatron-LM、OPD、Post-Training、Python、Reinforcement Learning、RL、RLHF、人类反馈强化学习、代理能力、再训练、分布式训练、分布式训练框架、医学大模型、医疗、医疗AI模型、医疗领域大模型、参数融合、后期训练、在线策略蒸馏、多模态算法、大型预训练语言模型、大模型算法、大模型训练框架、大规模语言模型、大语言模型、实时策略知识蒸馏、并行计算、强化学习、指令微调、推理能力、智能体能力、有留学背景、有监督微调、机器学习、模型加速/性能优化、模型合并、模型融合、深度学习、深度推理、监督微调、算法工程化经验、自主行动能力、自然语言处理算法、逻辑推理