AI推理工程师(J105801)

Company Baidu

Focus Tech · Backend

Location 深圳, 新加坡

Published September 14, 2026

岗位职责

  • 跨平台模型部署:负责深度学习模型在 GPU(NVIDIA) 及 TPU 异构硬件平台上的推理部署、性能调优与持续迭代
  • 推理性能调优:深入理解 GPU(CUDA/core 架构)与 TPU(脉动阵列/MXU)的硬件特性,针对性地解决不同架构下的性能瓶颈(访存、算子效率、芯片利用率等),提升吞吐量并降低延迟
  • 技术落地与对比:参与设计和实现高效的模型推理方案,包括模型格式转换、量化(INT8/FP16/BF16)、算子融合、图优化等;能够横向对比 GPU 与 TPU 的推理性价比与适用场景
  • 跨团队协作:与算法研究团队紧密合作,推动模型结构与推理性能的协同设计(Co-design),实现算法效果与跨平台推理效率的平衡
  • 工具链建设:沉淀并完善 GPU/TPU 推理部署的最佳实践,探索构建统一的推理部署工具链或抽象层,降低业务侧适配成本

任职要求

  • 本科及以上学历,计算机、电子工程、自动化等相关专业优先,3年以上 AI 基础设施、推理引擎或高性能计算相关经验
  • 硬件理解:具备 GPU 或者 TPU 的体系架构知识,熟悉 NVIDIA GPU 的 CUDA 编程模型及底层运行机制,深入理解 TPU 或其他 AI 加速器的工作原理
  • 框架熟练度:精通至少一种主流深度学习框架(PyTorch、TensorFlow 或 JAX),熟悉从模型训练到推理上线的完整流程
  • 编程能力:熟练使用 C++ 和 Python,具备优秀的系统编程能力和性能调优意识
  • 生态工具:GPU 方向:熟悉 TensorRT、cuDNN、NCCL 或 Triton Inference Server 等推理/服务框架;TPU 方向:熟悉 XLA(Accelerated Linear Algebra)、PyTorch/XLA 或 JAX 等 TPU 编译与运行生态

部门/组织

国际化MediaGo算法组