【蚂蚁星】大模型系统工程师-百灵基模-27届
Company Antgroup
Focus Tech · Algorithm
Location 杭州
Published August 6, 2026
岗位职责
部门介绍: 团队面向百灵大模型研发、训练、后训练、评测和推理准出等关键链路,承担复杂系统问题攻坚和关键 Infra 能力建设;聚焦系统、网络、存储、调度、可观测性等方向,解决训练稳定性、推理效率、质量评测闭环和生产准出中的关键瓶颈,沉淀高效、可复用的大模型基础设施能力,支撑百灵模型持续加速迭代。
职位描述:
- 负责大模型训练、推理、评测等核心链路中的系统工程建设,提升系统稳定性、资源效率和问题定位效率;
- 参与计算、网络、存储等基础设施能力建设,支撑大规模模型训练、RL、SFT、推理准出等场景高效运行;
- 深入分析系统瓶颈和稳定性问题,包括性能抖动、任务失败、资源异常、网络通信异常、存储访问异常等,并推动根因定位和长期治理;
- 建设可观测、可诊断、可回归的系统问题分析体系,提升复杂问题的发现、定位、复现和闭环效率;
- 与模型、训练引擎、推理框架、调度、网络、存储等团队协同,推动端到端系统优化和工程能力沉淀。
任职要求
- 具备扎实的计算机系统基础,熟悉操作系统、Linux 内核、容器、调度、资源隔离、性能分析等相关技术;
- 熟悉网络基础原理和常见问题定位方法,了解 TCP/IP、RDMA、RoCE、NCCL、集合通信、网络拥塞、丢包、抖动等问题分析优先;
- 熟悉存储系统基础能力,了解本地盘、分布式文件系统、对象存储、缓存、I/O 性能分析、数据一致性和可用性等相关问题;
- 具备较强的复杂系统问题解决能力,能够从现象出发,结合日志、指标、trace、系统调用、内核状态、网络和存储链路进行端到端分析;
- 具备良好的工程能力,能够通过工具化、自动化、可观测性建设和机制设计,将单点问题沉淀为系统性能力;
- 具备良好的跨团队协作能力,能够和模型、算法、框架、平台、基础设施团队共同推进复杂问题闭环;
- 有大规模训练、推理服务、AI Infra、云原生基础设施、高性能计算、分布式系统稳定性建设经验者优先;
- 有 Linux 内核、eBPF、性能分析、网络通信、分布式存储,GPU/XPU 集群、Kubernetes、NCCL/RDMA 调优经验者优先。
特色标签
AI Infra、AI基础设施、C/C++、Docker、Golang、GPU/AI集群、I/O性能、K8s、Kubernetes、Linux开发/部署经验、NCCL、Python、PyTorch、RDMA、RoCE、Shell、SLAM、SRE、TensorFlow、中大型项目开发经验、云原生、云原生基础设施、云计算、云计算经验、交易、人力资源、会员账户、供应链、保险、信贷、具身智能、内容安全、出行、分布式文件系统、分布式经验、分布式计算、分布式训练、办公OA、医疗、反洗钱、合规、商户、国际化、图像、图计算、在线推理、基础模型、基础设施、大型语言模型、大数据、大规模训练、存储、安全、宠物、客服、容器编排、对象存储、广告、异构计算集群、强化学习、微服务经验、快消、性能监控、推理准出、推理服务、推荐、搜索、操作系统、支付、故障定位、教育、数据一致性、数据安全、数据库、文娱、文旅、新能源、日志追踪、智慧园区、智能交互、服务端开发经验、机器人、机器学习经验、模型加速/性能优化、模型推理、模型训练、汽车、测试工具、深度学习、游戏、点云处理、物流、特征计算、理财、生鲜、电商、电子/电气/通信、直播、知识图谱、短视频、研发效能、社交、算力池、算法工程化经验、系统可靠性、系统基建、系统架构设计经验、系统诊断、结算、网络、网络安全、网络拥塞、聊天机器人、自动驾驶、英美留学生、虚拟机、行政、视频、视频编码、计算机相关专业、训练稳定性、语音、调度、资源隔离、超大模型、酒旅、金融、隐私、隐私计算、集合通信、零售、餐饮、高性能GPU集群、高性能计算