大模型推理工程师(LLM Inference)
Company Kuaishou
Focus Tech · Algorithm
Location 北京
Published May 19, 2026
岗位职责
【关于我们】 我们全面打造 AI Infra:大模型训练、推理引擎,为公司核心大模型(基模+MaaS)场景提供高速、稳定、可扩展、低成本的大模型训练与推理服务; 在这里,你将参与推动分布式训练、强化学习(RL)、微调(SFT)、算子优化、混合精度与量化加速、KV Cache 管理、推理调度与 Pipeline 优化等前沿技术落地,让训练更快、推理更省、交付更稳;
【职位描述】 1、负责大模型推理引擎的研发与优化,提升吞吐、降低时延与推理成本; 2、负责推理核心模块建设,包括 KV Cache 管理、Batching/Scheduling、Prefill/Decode Pipeline、PD 分离等; 3、负责推理性能优化,面向 TTFT/TPOT/TPS/RPM 等指标进行系统级优化(算子、显存、通信、调度); 4、负责推理侧算子研发与优化,包括算子融合、Kernel 优化、图优化、推理编译优化,以及 INT8/FP8/FP4 等量化推理加速方案落地; 5、负责推理稳定性与高可用建设,包括故障恢复、限流降级、容量评估、自动化诊断与 SLA 保障; 6、推动推理平台化能力建设,包括模型发布流程、灰度、监控、日志、Tracing 与自动化运维工具链。
任职要求
1、本科及以上学历,计算机/软件相关专业; 2、熟练掌握 C++/Python,具备高性能系统研发能力; 3、熟悉 Transformer 推理原理,理解 Attention、KV Cache、采样策略等机制; 4、熟悉主流推理框架或推理引擎(TensorRT/Sglang/vLLM 等); 5、熟悉 GPU/NPU 性能调优与 profiling,能定位性能瓶颈并推动优化落地; 6、熟悉推理侧算力优化技术,包括算子融合、图优化、Triton/CUDA Kernel、推理量化与推理编译加速等; 7、熟悉 Linux、网络与容器化(Docker/K8s),具备线上系统运维与稳定性经验优先。 加分项: 1、有大规模在线推理落地经验,熟悉高并发、长上下文、多租户调度等场景; 2、熟悉 KV Cache 压缩/复用、请求迁移恢复、跨实例调度等关键能力; 3、有通信优化经验(NCCL/HCCL/RDMA); 4、有推理量化落地经验(如GPTQ/AWQ 等)或推理加速相关经验; 5、有国产卡适配经验(昇腾/寒武纪/沐曦等)。