【蚂蚁星】大模型推理和性能优化-平台技术-27届

Campus

Company Antgroup

Focus Tech · Algorithm

Location 杭州

Published August 21, 2026

岗位职责

  1. 投身大模型推理引擎的研发和优化工作,包括但不限于万亿级别的自回归模型、omni / diffusion多模态模型等;
  2. 在推理引擎调度、算子研发、投机推理、全模态处理等方面具备科研/工作经验,致力于实现符合蚂蚁业务场景的推理技术;
  3. 参与打造分布式的推理系统,结合计算卡、通信、存储等技术实现成本和体验最优的推理服务。

任职要求

  1. 基于低算力N卡(H20等)及国产硬件(PPUe等)的推理算子和引擎开发,挖掘硬件潜力,实现低延迟、高吞吐的推理系统;
  2. 面对T级别的大尺寸模型和Agent工作负载,实现分布式推理系统的研发和打磨;
  3. 研究前沿投机采样算法、megakernel、低bit量化等技术,支撑「极低延迟」的推理场景。

特色标签

C/C++、CUDA算子、H20推理优化、INT8量化、Kernel开发、Kernel融合优化、PPUe推理、Python、Shell、Speculative Decoding、万亿模型推理、云计算、低功耗GPU推理、低比特量化、低算力GPU推理、低精度推理、分布式大模型推理、分布式推理框架、分布式计算、分布式训练、单Kernel推理、国产AI加速器、国产芯片推理、多模态算法、多级并行推理、大Kernel融合、大模型服务化、大模型算法、实时大模型推理、并行计算、投机解码、投机采样、推理框架、推理运行时、支付、智能体、极低延迟、模型加速/性能优化、毫秒级推理、深度学习、算子优化、算子加速、算法工程化经验、超大模型推理、金融、高性能推理系统