jdwatch
  • Home
  • CLI
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

蚂蚁集团-系统工程师 / 大模型基础设施方向-百灵特种兵

Company 蚂蚁集团

Focus 技术 · 算法

杭州

July 29, 2026

岗位职责

  1. 负责大模型训练、推理、评测等核心链路中的系统工程建设,提升系统稳定性、资源效率和问题定位效率。
  2. 参与计算、网络、存储等基础设施能力建设,支撑大规模模型训练、RL、SFT、推理准出等场景高效运行。
  3. 深入分析系统瓶颈和稳定性问题,包括性能抖动、任务失败、资源异常、网络通信异常、存储访问异常等,并推动根因定位和长期治理。
  4. 建设可观测、可诊断、可回归的系统问题分析体系,提升复杂问题的发现、定位、复现和闭环效率。
  5. 与模型、训练引擎、推理框架、调度、网络、存储等团队协同,推动端到端系统优化和工程能力沉淀。

任职要求

  1. 具备扎实的计算机系统基础,熟悉操作系统、Linux 内核、容器、调度、资源隔离、性能分析等相关技术。
  2. 熟悉网络基础原理和常见问题定位方法,了解 TCP/IP、RDMA、RoCE、NCCL、集合通信、网络拥塞、丢包、抖动等问题分析优先。
  3. 熟悉存储系统基础能力,了解本地盘、分布式文件系统、对象存储、缓存、I/O 性能分析、数据一致性和可用性等相关问题。
  4. 具备较强的复杂系统问题解决能力,能够从现象出发,结合日志、指标、trace、系统调用、内核状态、网络和存储链路进行端到端分析。
  5. 具备良好的工程能力,能够通过工具化、自动化、可观测性建设和机制设计,将单点问题沉淀为系统性能力。
  6. 具备良好的跨团队协作能力,能够和模型、算法、框架、平台、基础设施团队共同推进复杂问题闭环。
  7. 有大规模训练、推理服务、AI Infra、云原生基础设施、高性能计算、分布式系统稳定性建设经验者优先。
  8. 有 Linux 内核、eBPF、性能分析、网络通信、分布式存储、GPU/XPU 集群、Kubernetes、NCCL/RDMA 调优经验者优先。

加分项

  1. 有大模型训练或推理系统问题定位经验,能够理解训练稳定性、推理性能、资源效率和任务成功率之间的关系。
  2. 有复杂线上故障处理经验,能够承担关键问题的 root cause 分析和长期治理。
  3. 有系统工具、诊断平台、压测平台、故障演练、自动化巡检等工程化建设经验。
  4. 具备系统性思考能力,能够从单点问题中抽象出问题类别,并推动机制化解决。

岗位标签

NEW

特色标签

C/C++、Docker、Elasticsearch、Golang、GPU集合通信、HPC、Java、K8s、Kafka、Kubernetes、Linux开发/部署经验、MySQL、Nginx、NVIDIA集合通信库、Python、PyTorch、RDMA网络、Reinforcement Learning、Shell、Supervised Fine-Tuning、TensorFlow、不限、中大型项目开发经验、云原生、云服务、云计算、云计算经验、内核可编程技术、分布式经验、分布式计算、分布式训练、可观测性、基础设施、大数据、大数据运维经验、大规模模型训练、容器编排平台、强化学习、微服务经验、扩展伯克利包过滤器、推理部署、数据库、有留学背景、服务推理、服务端开发经验、机器学习经验、模型推理、模型预训练、熟悉Linux/Unix系统、监控可观测、监督微调、系统架构设计经验、系统运维、网络建设/系统集成经验、英美留学生、英语读写能力良好、观测能力、计算机相关专业、超算、运维开发/DevOps、运维开发经验、远程直接内存访问、金融、高吞吐计算

Apply now

You'll be redirected to the official careers page. You can also sign in to save jobs and search more roles.