AI推理平台-大模型服务性能与可观测性技术专家-杭州/北京Company AlibabaFocus Tech · AlgorithmLocation 北京, 杭州Published August 26, 2026岗位职责 面向大模型在线服务系统,负责线上实时性能观测、端到端分析与优化,推动问题从业务指标定位到推理引擎和 GPU Kernel。 岗位职责如下: 建设面向生产环境的实时可观测与诊断能力,持续采集并关联 Metrics、Logs、Trace,在异常发生时按需触发 Profile;结合 OpenTelemetry、Nsight Systems/Compute、CUPTI 等工具,在线发现并定位计算、显存带宽、通信、调度、KV Cache 与排队瓶颈,下钻到代码路径或 GPU Kernel。 分析大模型模型服务系统的端到端性能,围绕 TTFT、TPOT、Throughput、Goodput、MFU/MBU 和资源成本,建立从业务请求、在线服务、推理引擎到 GPU 的分层指标体系。 协同引擎团队,推动性能优化,覆盖 Prefill/Decode、Continuous Batching、Scheduler、KV Cache、分布式通信和 GPU Kernel 等关键环节。 设计可复现的 Benchmark 与 A/B 实验,统一模型、硬件、请求形状、缓存和负载口径,量化优化对延迟、吞吐、稳定性与成本的影响,并沉淀自动化诊断工具。 任职要求 计算机或相关专业,基础扎实;熟练使用 Python、C++ 中至少一种语言,能够阅读和修改大型工程代码。 熟悉 Transformer 推理、Prefill/Decode、动态批处理和 KV Cache;使用过 vLLM、SGLang 或 TensorRT-LLM。 理解 CPU/GPU 执行、存储层次和分布式通信,能够使用性能分析工具定位计算、带宽或通信瓶颈。 具备性能工程和实验分析能力,能够定义指标、控制变量,并用多类数据验证结论。 具备问题拆解和跨团队协作能力;在推理引擎、GPU 性能或性能平台任一方向有深入经验。 能够使用 AI 编程工具提升效率,并独立验证结果。 具备 CUDA/Triton、RDMA、缓存优化或大规模在线推理经验者优先; 有顶会论文、竞赛或开源贡献者优先。