岗位职责
- 负责大模型推理服务的设计、开发、部署与稳定性建设。
- 围绕吞吐、时延、显存占用及服务并发能力开展推理性能优化,覆盖调度策略、算子优化、GPU访存、通信效率及并行执行等方向。
- 面向大规模分布式推理、多模态推理、模型量化与稀疏计算等方向,跟踪业界前沿技术并推进落地,持续打造 SOTA 推理性能。
任职要求
- 熟悉 Python、C++,具备扎实的工程开发和问题分析能力。具备 Triton 或 CUTLASS 研发经验者优先。
- 熟悉大模型推理引擎,如SGLang, vLLM, TensorRT-LLM等,有开源项目贡献、技术论文或性能优化成果优先。
- 具备 GPU 性能优化经验,理解 GPU 架构、算子执行、显存及访存机制。能够使用 Profiling 工具深入分析底层性能瓶颈,并针对性完成优化。
- 具备全模态或Diffusion推理优化经验,熟悉文本、图像、音频、视频等多模态输入输出链路,具备从模型结构分析、算子优化到推理服务落地的完整实践经验。
特色标签
C++、Diffusion推理优化、GPU性能分析、GPU显存优化、GPU算子优化、GPU通信优化、Linux开发/部署经验、LLM推理、Python、SGLang引擎、TensorRT-LLM加速库、Triton Inference Server、Triton推理服务、vLLM推理框架、保险、信贷、全模态推理、分布式经验、多模态大模型推理、大模型推理优化、大模型推理引擎、大模型推理服务、性能瓶颈分析、支付、有留学背景、架构设计经验、模型压缩、理财、稀疏化推理、稀疏矩阵优化、量化加速、量化推理、金融、风控