【蚂蚁星】算力调度研发-平台技术(实习)
Campus/Intern
Company Antgroup
Focus Tech · Other
Location 杭州
Published April 21, 2026
岗位职责
部门介绍: 蚂蚁算力调度团队负责蚂蚁通智算场景资源统一调度,帮助蚂蚁在线服务、大数据、AI等核心业务场景提升资源使用效率、优化工作负载性能、提高业务全局容错性和弹性资源保障。我们致力于打造高性能、规模化、有竞争力的算力调度系统,推动蚂蚁基础技术的不断创新与发展。
职位描述:
- 业务-资源调度-引擎框架-硬件 codesign 优化,结合业务场景和硬件进行资源调度和弹性的优化,把 GPU 利用率提升到业务先进水平;
- 异构硬件的调度和弹性:在满足上层业务 SLO 的情况下,动态去调整并行策略、异构硬件,根据业务负载自动化做资源弹性,最大化硬件的利用率;
- 异构资源的全局调度:结合网络(RDMA/VPC)、异构算力(CPU/GPU/ASIC/FPGA)、存储(SSD/OSS/CPFS)等多种异构资源,选择最优化的资源全局编排策略,让任务可以按需移动和弹性,不再受限于单个地域和集群;
- 新硬件的调度适配和性能优化:GPU 新硬件基本每年都有迭代,国内的加速器硬件也在引入超节点架构,在调度层面快速对新硬件进行适配和性能优化,让新硬件可以快速在蚂蚁内部落地使用。
任职要求
- 熟悉 AI 训练和推理框架(pytorch/vllm/sglang/megatron/deepspeed/areal/verl中的一个或者多个),对于分布式训练、RL、模型推理有代码级别的理解;
- 熟悉资源调度算法,包括启发式、线性规划、神经网络等不同策略的调度和预测算法,有大规模 kubernetes/spark/yarn 等分布式调度系统经验有限;
- 了解异构硬件架构,熟悉 GPU/HPU 等国内外加速器的工作机制和并行计算原理,有软硬件结合的优化经验4. 有开源 AI 项目经验优先。
特色标签
AI推理、Docker、K8s、Kubernetes、Linux开发/部署经验、Python、PyTorch、专用集成电路、中央处理器、云计算经验、人工智能训练、分布式机器学习训练、分布式经验、图形处理器、多机多卡训练、多类型加速器、大模型推理、容器编排系统、异构计算硬件、显卡计算单元、服务端开发经验、机器学习经验、机器学习训练、现场可编程门阵列、硬件感知软件优化、计算机相关专业、计算资源调度、资源调度、软硬协同、远程直接内存访问、高性能网络通信技术