岗位职责
- 参与大模型推理框架的设计与研发,支持业界开源、蚂蚁内部大模型以及多模态模型的高效推理。
- 开展端到端性能分析与优化,覆盖推理调度、并行策略、KV Cache、量化、算子优化等,持续改善吞吐、时延和资源利用率。
- 参与在线推理服务框架的设计与演进,建设模型部署、服务编排、流量治理和多模型、多模态服务能力。
- 设计并优化在线请求调度、RPC 通信和端到端数据通路,在高并发和强 SLA 场景下平衡吞吐、时延与资源隔离。
- 建设推理服务的可观测行和容错能力,完善监控、诊断、限流、降级与故障恢复机制,提高系统稳定性和工程质量。
- 跟进 SGLang、vLLM、TensorRT-LLM、FlashInfer、Triton Inference Server 等推理框架和基础组件,推动先进方案在内部系统及开源社区落地。
任职要求
- 计算机基础扎实,熟悉 Linux 环境下的系统开发、性能分析和问题定位。
- 熟练使用 Python,并掌握 C++/Rust 等高性能编程语言,能够完成生产级系统的设计、开发和维护。
- 在大模型推理框架或高性能在线服务至少一个方向具备扎实的实践经验:熟悉 SGLang、vLLM、TensorRT-LLM 等推理框架,或具备高并发服务端、异步编程、RPC、请求调度等系统开发经验;对另一个方向有基本理解,并愿意深入完整的推理系统链路。
- 理解大模型推理的基本机制,包括 Batching、KV Cache、并行策略、请求调度和分布式通信等,能够从端到端视角分析系统问题。
- 自驱、结果导向,具备良好的协作和沟通能力,能够将技术方案落地为稳定、可维护的工程产物。
加分项
- 有大规模在线推理系统的建设或优化经验,熟悉 Triton Inference Server、NVIDIA Dynamo、Ray Serve、Seldon 等推理服务或编排框架。
- 参与过 SGLang、vLLM、Triton Inference Server 等相关开源项目。
- 理解 GPU 或其他 AI 加速芯片架构,熟悉 CUDA、Triton、CUTLASS 、NCCL,或具备算子、图编译及代码生成相关经验。
- 有多机多卡推理、PD 分离、量化、投机采样或多模态推理的落地经验。
特色标签
C++、C/C++、CUDA算子、CUDA编程、Docker、GPU并行计算、INT8/FP16量化、KV缓存机制、Linux开发/部署经验、LLM推理平台、NVIDIA CUDA生态、NVIDIA Triton、Python、Shell、Triton Server、Triton推理服务、云原生、云服务、云计算、交易、低比特推理、保险、信贷、分布式经验、分布式计算、分布式训练、图文一体模型、在线调度器、多模态大模型、多模态算法、大模型推理引擎、大模型推理系统、大模型算法、并行计算、延迟目标、微服务经验、微服务通信、推理任务编排、支付、智能交互、智能体、服务等级协议、服务质量保障、架构设计经验、模型加速/性能优化、模型量化、注意力缓存、理财、算子加速、算法工程化经验、网络通信框架、英美留学生、计算图优化、请求调度、跨模态模型、远程过程调用、金融、键值缓存、风控