腾讯专有云-大模型推理优化工程师-深圳/北京

Company Tencent

Focus Tech · Algorithm

Location 深圳

Published October 8, 2026

岗位职责

  1. 参与私有云MaaS 平台推理侧架构设计(调度、路由、多实例、多卡多机部署),支撑私有化项目 POC、压测、问题定位与交付;
  2. 负责私有云场景下的大模型推理引擎优化,持续提升吞吐、并发、TTFT / TPOT、显存利用率等关键性能指标;
  3. 负责主流开源大模型在私有云MaaS 平台上的推理适配、精度对齐与性能达标;
  4. 负责AI 加速卡的推理适配与深度优化,打通异构硬件后端与上层推理框架的对接;
  5. 针对私有化场景下客户「模型 × 硬件」组合众多、差异大的特点,设计并落地可复用的推理加速方案;
  6. 建设推理性能基线与回归体系,沉淀卡适配方法论与最佳实践。

任职要求

  1. 本科及以上学历,计算机、软件、电子、数学等相关专业,3 年及以上大模型推理 / 高性能计算 / 推理引擎相关工作经验;
  2. 深入使用过至少一款主流推理框架(vLLM / SGLang / TensorRT-LLM / MindIE / lmdeploy / TGI 等),参与过基于上述引擎的大模型推理系统定制化开发与性能调优;
  3. 熟悉大模型推理关键技术:Attention 变体、KV Cache、Continuous Batching、量化、投机采样、张量并行 / 流水并行等;
  4. 熟练掌握 Python 与 C++ / CUDA 中的至少两项,具备真实可量化的性能优化案例(吞吐、时延、显存等指标有明确提升数据);
  5. 具备良好的工程能力与问题定位能力,能独立承担推理加速方向的技术攻坚。

产品/项目

腾讯云

工作年限

五年以上工作经验