大模型训练专家(MJ031051)
Company 携程
Focus 技术 · 算法
Shanghai
October 14, 2025
【岗位综述】:
将主导大规模预训练模型从架构设计、训练优化到业务落地的全流程工作。需要解决训练中的核心技术挑战(如分布式并行、显存优化、长文本建模等),并推动模型在智能客服、内容生成、企业决策等场景的应用。重点关注预训练、继续训练、有监督微调(SFT)、奖励模型训练(RM)和人类反馈强化学习(RLHF)等关键环节。
【核心职责】:
1、大模型训练与优化。
(1)主导百亿级以上参数的预训练模型全流程工作,包括数据清洗、架构设计、分布式训练策略制定(如Data/Pipeline/Tensor Parallelism)及训练稳定性优化;
(2)优化模型训练效率,解决显存瓶颈、长序列处理、多模态对齐等问题,降低训练成本并提升模型性能.
2、后训练技术落地。
(1)开展有监督微调(SFT)、奖励模型训练(RM)和RLHF/RLAIF,提升模型的指令遵循能力、安全性和业务场景适配性。
(2)构建自动化评估体系,针对模型效果、伦理合规性设计多维评测方案。
3、技术突破与工程化。
(1)研究MoE、高效注意力机制等前沿技术,推动模型压缩、量化及推理加速,支持云端或边缘设备部署.
(2)主导高可用训练平台建设,完善断点续训、故障恢复等机制,保障大规模训练的稳定性。
4、跨领域协同与赋能。
(1)与业务团队合作,将模型能力应用于智能客服、行业知识库、流程自动化等场景,通过LangChain等框架实现技术落地;
(2)指导团队成员,输出技术文档与专利,构建团队技术壁垒。
【任职要求】:
1、教育背景:计算机科学、人工智能、数学等相关专业硕士及以上学历;
2、 精通PyTorch/TensorFlow等框架,熟练掌握DeepSpeed、Megatron-LM等分布式训练工具;
3、具备70B+参数模型的预训练、继续训练、SFT、RLHF全流程实战经验,能独立解决训练中的工程问题(如显存溢出、收敛稳定性等);
4、深入理解Transformer架构、强化学习对齐技术(如PPO、DPO)及模型优化方法(量化、蒸馏);
5、有开源大模型(如LLaMA、Qwen、ChatGLM)改造或训练经验,熟悉高质量数据构建与治理策略;
6、在顶级会议(NeurIPS、ICML等)发表相关论文,或参与开源大模型项目者优先考虑。
7、有互联网垂直领域的大模型落地案例者优先考虑。