【Plan A】AI Infra系统研发-Asystem-27届
Company Antgroup
Focus Tech · Algorithm
Location 北京, 上海, 杭州
Published May 14, 2026
岗位职责
蚂蚁ASystem致力于打造下一代AI基础软件,并基于下一代的AI基础软件寻找通用智能的新方法,追求智能上限。 1.负责训推一体框架的设计与开发,服务蚂蚁内部的强化学习场景; 2.建设面向训推一体的显存管理体系和高性能数据存储方案; 3.负责实时高性能训推系统设计与开发,如分布式训练加速策略、算子融合、编译优化、模型量化、混合精度、异构硬件加速等; 4.负责整体性能优化与架构升级,持续提升训练/推理性能; 5.与算法工程师深度合作,为重点项目进行算法与系统的联合优化。
任职要求
1.精通至少一门 Python/Go/C++ 等编程语言,并有良好的代码风格;
2.了解分布式系统服务/并行计算系统设计与优化;
3.熟悉主流深度学习框架及扩展库的使用及算子开发,例如TensorFlow/PyTorch/Megatron/Deepspeed/vLLM/Sglang等;
4.好奇心强,热爱技术且对系统领域有深入钻研优先。
加分项:
- 熟悉至少一种主流的RLHF框架,如OpenRLHF/veRL/AReal/ChatLearn等;
- 熟悉Ray框架或其他强化学习相关计算框架;
- 在计算机系统网络顶会OSDI/SOSP/NSDI/ATC/EuroSys上有文章发表经验。
特色标签
AI加速存储、AI模型压缩、AI编译优化、C/C++、GPU显存管理、Linux开发/部署经验、Python、RL、TensorFlow/PyTorch、中大型项目开发经验、云计算、云计算经验、优秀开源项目经历、分布式模型训练、分布式深度学习训练、分布式经验、分布式计算、分布式训练、基础设施、多硬件协同加速、大模型算法、并行计算、异构计算加速、强化学习、强化学习算法、显存优化、智能研发、有国际期刊/会议论文发表、服务端开发经验、机器学习算法/工程化经验、机器学习经验、模型加速/性能优化、深度学习、深度学习算子融合、深度学习经验、深度学习编译器优化、混合精度计算、混合精度训练、神经网络算子融合、神经网络量化、算法工程化经验、系统架构设计经验、统一训练与推理框架、英文读写能力良好、训练推理一体化、高性能AI数据存储