jdwatch
  • Home
  • CLI
  • Skills
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

公有云模型训推加速工程师(J104555)

Company Baidu

Focus Tech · Backend

Location 北京, 上海

Published August 18, 2026

岗位职责

  • 负责大模型训练阶段(SFT&RL)的性能优化,包括数据并行、张量并行、流水线并行等分布式训练策略的设计与实现
  • 负责大模型推理阶段的加速优化,涵盖模型量化(INT8/INT4/FP8)、算子融合、KV Cache 优化、投机解码等技术落地
  • 掌握cuda/cutlass dsl等编程,发掘GPU硬件特性,完成常见算子flashattention/gemm等优化工作
  • 熟练使用Nsight Systems/Compute对算法的运行效率如速度、显存占用等进行优化,保证模型精度下提升模型的计算效率
  • 跟踪业界前主流框架(如 DeepSpeed、Megatron-LM、vLLM、SGLang 等),评估并引入最佳实践

任职要求

  • 计算机科学、电子信息或相关专业,本科及以上学历
  • 掌握 PyTorch 框架及底层机制,了解 autograd、dispatcher、CUDA graph 等原理
  • 掌握大模型分布式训练方案,理解 NCCL 通信原语、混合精度训练(BF16/FP8)原理
  • 掌握主流推理加速框架(vLLM / TensorRT-LLM / TGI / SGLang 等),有实际部署优化经验
  • 具备性能调优实战经验,能熟练使用 Nsight Systems / Compute、PyTorch Profiler 等工具
  • 良好的工程能力与团队协作意识,能推动优化方案从原型到生产落地