研究型实习生-面向多模态异构模型的本地推理统一执行与优化方法研究
Company Antgroup
Focus Tech · Algorithm
Location 杭州
Published October 8, 2026
岗位职责
研究领域: 数据处理 项目简介: AI Data Pipeline 中越来越多的清洗、分类、打分、向量化、解析和内容理解任务需要调用模型推理。现有推理方式主要分为两类:一类通过 Theta 或Glink进行远程推理,具备接入简单、弹性伸缩等优势,但受到网络传输、服务限流、数据安全和调用成本约束;另一类是在 Ray、AFlow 等支持 GPU 调度的计算引擎中,或在 AIStudio GPU Pod 内,使用 vLLM、SGLang、ONNX Runtime、Transformers/PyTorch、PaddleOCR、FunASR 等运行时进行本地推理,能够获得更强的数据局部性、模型可控性和批量吞吐能力,但需要算子自行解决模型加载、数据预处理、批处理、并发、显存管理和故障恢复等问题。 本研究拟面向多模态异构模型构建统一的本地推理执行与自适应优化方法。首先建立与具体模型和引擎解耦的推理负载描述,统一表达模态、任务类型、输入 shape、批处理能力、模型资源、计算/显存特征、时延目标以及“数据获取—解码—预处理—推理—后处理—结果回写”阶段拓扑;其次设计可插拔的推理引擎适配层,首批覆盖 vLLM、Transformers/PyTorch 和 ONNX Runtime,并验证 PaddleOCR、FunASR 等专用运行时,为 SGLang 和定制引擎保留扩展接口;进一步研究基于输入长度、图片分辨率、音视频时长、显存压力、队列状态和运行时反馈的动态 batching、shape bucketing、并发控制、背压与 OOM 降级算法,并通过异步预取、CPU/GPU 流水线重叠、模型复用和资源隔离提高有效推理吞吐;最终形成能够适配 Ray、AFlow 和 AIStudio GPU Pod 的统一范式,以及“观测—诊断—调优—验证—反馈”的持续优化闭环。
任职要求
研究领域:
- 目前正在攻读计算机科学或相关STEM领域的学士,硕士或博士学位
- 具有一种或多种通用编程语言的经验,包括但不限于: Java,C/C ++ 、Python、JavaScript或Go
- 具有上述研究领域的相关经验,包括行业经验或作为参与实验室研究 优先录用:
- 对技术研究充满热情,具有产生新思想和创新的能力; 在自学,问题分析和解决方面表现出色
- 在国际会议上或核心期刊发表一份或多份出版物或论文
- 至少3个月的全职工作