【蚂蚁星】大模型推理和性能优化-平台技术(实习)
Intern
Company Antgroup
Focus Tech · Algorithm
Location 杭州
Published August 21, 2026
岗位职责
- 投身大模型推理引擎的研发和优化工作,包括但不限于万亿级别的自回归模型、omni / diffusion多模态模型等;
- 在推理引擎调度、算子研发、投机推理、全模态处理等方面具备科研/工作经验,致力于实现符合蚂蚁业务场景的推理技术;
- 参与打造分布式的推理系统,结合计算卡、通信、存储等技术实现成本和体验最优的推理服务。
任职要求
- 基于低算力N卡(H20等)及国产硬件(PPUe等)的推理算子和引擎开发,挖掘硬件潜力,实现低延迟、高吞吐的推理系统;
- 面对T级别的大尺寸模型和Agent工作负载,实现分布式推理系统的研发和打磨;
- 研究前沿投机采样算法、megakernel、低bit量化等技术,支撑「极低延迟」的推理场景。
特色标签
diffusion模型、H20显卡、omni模型、PPUe芯片、万亿参数模型、低位宽量化、低算力GPU、全模态模型、分布式大模型推理架构、分布式推理服务、国产加速卡、多模态算法、大模型推理框架、大模型推理系统、大模型算法、投机采样推理、投机采样算法、模型加速/性能优化、模型量化压缩、毫秒级推理响应、算法工程化经验、融合大算子、超低时延推理、超大算子内核、超大规模自回归模型