jdwatch
  • Home
  • CLI
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

蚂蚁集团-AI infra工程师-杭州

Company Antgroup

Focus Tech · Algorithm

Location 杭州

Published August 4, 2026

岗位职责

  1. 负责大模型分布式训练与推理框架的研发和性能优化,持续提升训练效率、推理吞吐、资源利用率及系统稳定性。
  2. 深度参与蚂蚁自研RL框架的研发,推进基于 MoE 的模型架构与训推框架协同设计(co-design),实现千亿级模型的高效训练与推理。
  3. 熟悉分布式训练任务调度与资源编排,通过AI Infra全栈优化充分挖掘和利用空闲 GPU 资源,提升集群 GPU 利用率和整体训练产能。

任职要求

  1. 具备 2 年及以上 AI 系统、任务调度或高性能并行计算相关领域的研发经验,拥有良好的工程实践能力。
  2. 熟悉 Transformer、MoE 等大模型架构,以及分布式训推与调度、大模型 Agent 系统或高性能软硬件架构中的至少一个方向。
  3. 熟悉 SGLang、vLLM、Megatron-LM 等训推框架,或具备大规模模型训练、推理性能优化及 GPU 集群调度经验者优先。
  4. 熟悉 GRPO、PPO、DPO 等强化学习或偏好对齐算法,或了解 AReaL、veRL、Slime、OpenRLHF 等 RL 框架者优先。
  5. 对大模型及 AI 系统新技术保持热情,具备良好的逻辑思维、问题分析、沟通表达和团队协作能力。

岗位标签

NEW

特色标签

AI基础设施、AI系统架构、C/C++、Docker、GPU算力利用率、HPC、Kubernetes、Linux开发/部署经验、Python、PyTorch、Reinforcement Learning、RL、Sparse MoE、专家并行、云原生、云服务、云计算、云计算经验、人工智能基础平台、作业调度、偏好对齐、分布式并行训练、分布式经验、分布式计算、分布式训练、千亿参数模型、图计算、基础设施、多机多卡训练、大模型算法、大语言模型、巨型模型、并行计算、并行计算优化、强化学习、微服务经验、推理加速框架、推理引擎、推理系统、支付、数据库、显卡利用率、智能体、智能研发、有前端经验/技能、服务端开发经验、机器学习经验、模型加速/性能优化、混合专家模型、研发效能、算法工程化经验、系统架构设计经验、计算资源利用率、训推一体化框架、训练任务编排、训练推理引擎、训练推理框架、调度、资源调度、金融、集群训练、高性能计算

You'll be redirected to the official careers page. You can also sign in to save jobs and search more roles.