AI推理性能优化工程师

Company Mihoyo

Focus Tech · Backend

Location 上海

Published January 7, 2026

岗位职责

  1. 负责 LLM、CV、语音、多模态等模型在不同 GPU/NPU 硬件上的推理性能测试、调优和适配。
  2. 负责 NVIDIA、AMD、国产卡等多硬件平台的 Benchmark 测试,输出模型、硬件、推理引擎维度的性能对比和选型建议。
  3. 基于 TensorRT、vLLM、Triton、SGLang、TensorRT-LLM 等推理引擎,开展吞吐、时延、显存、Batch、KV Cache、并行策略等优化。
  4. 基于 FLOPs、显存、带宽、Batch Size、Sequence Length、计算/访存比等指标进行性能建模,定位推理瓶颈并输出优化方案。
  5. 与算法团队协作,理解模型结构、算子特性和精度约束,推动模型在目标硬件上的最优部署形态落地。

任职要求

  1. 有 2 年以上 AI 推理部署、模型性能优化、GPU/NPU 适配或高性能计算相关经验。
  2. 熟悉至少 2 种推理引擎或框架,如 TensorRT、vLLM、Triton、SGLang、TensorRT-LLM、ONNX Runtime 等。
  3. 熟悉 NVIDIA GPU 生态,包括 CUDA、cuDNN、TensorRT、NCCL,了解 A
  4. H
  5. B200 等架构差异。
  6. 了解 AMD ROCm 或国产 NPU/GPU 生态,如昇腾、寒武纪、燧原、摩尔线程等,有实际适配经验优先。
  7. 熟悉大模型、扩散模型、多模态模型的推理链路,有模型部署、量化、并行推理或性能调优经验。
  8. 熟练使用 nsight、nvprof、perf、bpf 等性能分析工具,能够定位计算、显存、带宽、通信等性能瓶颈。
  9. 具备良好的数据分析和文档输出能力,能沉淀 Benchmark 报告、性能分析报告和硬件选型建议。