大模型推理优化工程师
Company 哔哩哔哩
Focus 技术 · 算法
上海
May 22, 2026
岗位职责
岗位详情
工作职责: 1.负责大语言模型及多模态模型的推理性能优化,包括但不限于首字延迟(TTFT)、吞吐量(Throughput)和显存占用的优化,确保模型在线上生产环境的高效稳定运行。 2.深入研究和落地主流推理加速框架(如 vLLM, TensorRT-LLM, TGI, SGLang, LightLLM 等),针对特定业务场景进行定制化开发与适配。 3.负责高性能算子开发与优化,熟练使用 CUDA、Triton、FlashAttention 等技术,针对 Transformer 结构进行底层计算加速。 4.探索并实现先进的推理优化算法,如 KV Cache 优化(PagedAttention, RadixAttention)、量化(INT8/INT4/FP8)、模型剪枝、投机采样(Speculative Decoding)、连续批处理(Continuous Batching)等 5.参与推理服务系统的架构设计与开发,优化分布式推理策略(如张量并行 TP、流水线并行 PP),提升大规模集群下的推理扩展性。 6.与算法团队紧密配合,打通从模型训练到推理部署的全链路,推动模型压缩与端侧/边缘侧部署的落地。 工作要求: 1.计算机科学、电子工程、数学或相关专业本科及以上学历,3年以上高性能计算或AI系统开发经验。 2.精通 C++ / Python 编程,具备优秀的代码实现能力和工程素养,熟悉 Linux 开发环境。 3.深刻理解 Transformer 模型架构及 LLM 推理原理,对自回归解码过程中的计算瓶颈有清晰的认知。 4.熟练掌握至少一种主流深度学习框架(PyTorch, TensorFlow)的底层机制,有 PyTorch 算子开发或模型导出(ONNX/TorchScript)经验者优先。 5.具备扎实的 GPU 编程基础,熟悉 CUDA 编程模型
任职要求
(暂无)