AI Infra 研发工程师(GPU 推理方向)(MJ034962)
Company 携程
Focus 技术 · 算法
Shanghai
June 17, 2026
岗位职责
职位描述
参与推荐系统 GPU 推理引擎的研发工作,支撑生成式推荐、排序、召回等业务场景的在线推理服务落地。
参与 CUDA 算子开发与优化,包括算子融合、量化(INT8/FP8)、Tensor Core 使用、显存与访存优化等方向,持续提升单卡吞吐与推理延迟表现。
参与推理图优化工作,基于 TensorRT / ONNX Runtime / TVM / Triton 等主流框架完成模型的图变换、算子替换、kernel 调优,协助推动模型高效上线。
针对推荐模型的特点(稀疏 Embedding、变长序列、多塔结构等),协助完成定制化推理方案的开发与调优,解决 Host-Device 传输、KV Cache 管理等性能瓶颈。
参与性能 profiling 与调优工作,熟练使用 Nsight、CUPTI 等工具完成性能分析,配合算法团队完成模型结构的性能评估。
关注 GPU 推理、LLM Serving、推荐系统 Infra 的业界前沿进展(vLLM、SGLang、FlashAttention 等),积极学习并参与新技术在团队内的落地。
任职资格
计算机及相关专业本科及以上学历,1 年以上 GPU / 高性能计算 / 深度学习推理相关研发经验。
熟悉 CUDA 编程基础,了解 GPU 体系架构(SM、Warp、Memory Hierarchy、Tensor Core),具备编写和优化 CUDA kernel 的实践经验。
熟悉至少一种主流深度学习推理框架(TensorRT / ONNX Runtime / TVM / Triton Inference Server),了解图优化、算子融合、量化等基本原理。
了解主流推荐模型(DLRM、DIN、生成式推荐等)或 Transformer 类模型的结构与推理特点,对模型性能瓶颈有一定认识。
熟练使用 c++/python/java等至少一种语言,熟悉 Linux 开发环境,代码规范、工程意识良好。
有一定的问题定位与性能分析能力,能使用 Nsight Systems / Nsight Compute / perf 等工具完成基本的性能调优。
学习能力强,具备良好的团队协作与沟通意识,能够与算法、业务、运维团队协作推进项目。
加分项
有推荐 / 搜索 / 广告系统 GPU 推理相关实习或项目经验者优先。
有 LLM 推理加速相关经验(PagedAttention、Continuous Batching、量化推理等)者优先。
有开源社区贡献经验(TensorRT-LLM、vLLM、FlashAttention、Triton、TVM 等)或在 MLSys 相关领域有论文 / 竞赛 / 技术博客产出者优先。
有良好的英文技术文档阅读能力,有海外学习或工作经验者优先。
任职要求
(暂无)