AI infra实习生-大安全
Intern
Company Antgroup
Focus Tech · Security
Location 上海
Published September 2, 2026
岗位职责
部门介绍: 我们正在建设面向大模型时代的 AI Infra,支撑万卡级算力集群和真实业务模型训练,覆盖 CPT、SFT、RL、MoE、多模态等场景。这里不是实验室里的小规模 Demo,而是真实的大模型训练负载和生产级复杂环境。你会接触分布式训练、通信优化、算子优化、容错恢复、精度保障、资源调度、异构芯片适配等核心问题,也有机会参与新模型、新架构与训练系统的 Algorithm-System Co-design。 我们希望吸引对 AI Infra 有兴趣、基础扎实、动手能力强的同学,在真实项目中一起解决有挑战的问题。
职位描述
- 参与大模型训练框架和训练基础设施研发,支持 CPT、SFT、RL、MoE、长上下文及多模态训练;
- 参与 PyTorch、Megatron、FSDP、verl 等训练体系的适配和优化,学习并实践 TP、PP、DP、EP 等分布式并行方案;
- 参与大规模训练中的性能分析和优化,包括计算、通信、显存、长尾及资源利用率等问题;
- 参与 Checkpoint、断点续训、故障恢复、精度比对、可观测等稳定性能力建设;
- 参与国产及异构 AI 芯片的训练适配与性能优化。
任职要求
职位要求:
- 熟悉 Python、C++ 中至少一种语言,具备良好的系统设计和工程实现能力;
- 熟悉 PyTorch 训练机制,对分布式训练、并行策略、显存优化或高性能计算有实践经验;
- 对 Megatron-LM、FSDP、verl 等框架中的一种或多种有深入理解;
- 熟悉 NCCL、RDMA、集合通信、GPU/NPU 算子优化者优先;
- 有大模型预训练、MoE、长序列、强化学习训练或千卡级集群实践经验者优先;
- 喜欢解决真正困难的问题,愿意从模型、框架、系统一直深入到芯片和网络。
特色标签
AI基础设施、C/C++、GPU/NPU混合、Linux开发/部署经验、Python、PyTorch、PyTorch框架、PyTorch生态、PyTorch训练系统、万卡集群算力、专家混合网络、中大型项目开发经验、云计算经验、人工智能基础设施、分布式机器学习、分布式深度学习、分布式经验、千卡级算力、协同优化、国产AI芯片、图文语音融合、多元AI芯片、多模态学习、大型模型、大模型基础设施、安全、巨量模型、并行训练、断点保存、机器学习经验、模型检查点、混合专家模型、稀疏专家模型、算法系统协同设计、英语读写能力良好、计算机相关专业、训练快照、超大模型、超大规模算力、跨模态、软硬协同