岗位职责
- 参与具身智能大模型基础设施建设,支持 VLA/VLM、机器人策略模型的训练、推理与部署;
- 协同算法团队适配 CT、SFT、RL 等训练任务,完善分布式训练、数据 IO、Checkpoint 及任务调度能力;
- 参与训练性能与稳定性优化,包括计算图、计算通信重叠、显存和资源利用率优化;
- 参与模型推理链路建设,包括模型导出、量化、TensorRT/TRT-LLM 编译、服务化部署及性能分析;
- 针对延迟、吞吐、显存占用和训练效率等指标开展端到端性能优化。
任职要求
- 计算机、自动化、电子、软件工程等相关专业,本科及以上在读;
- 具备良好的编程能力,熟悉 Python;掌握 C/C++ 或 CUDA 者优先;
- 熟悉 Linux,具备良好的数据结构、算法、操作系统和计算机体系结构基础;
- 对 LLM、VLM、VLA、Diffusion 或机器人学习有基本了解,并有相关训练或部署实践;
- 了解 PyTorch 及 FSDP、Megatron、VeRL 等至少一种分布式训练框架,或 TensorRT、TRT-LLM、Triton 等推理优化工具;
- 具备较强的问题定位、工程实现和团队协作能力。
加分项:
- 有 CUDA Kernel、TensorRT Plugin、Triton Kernel 或 NCCL 通信优化经验;
- 有模型量化、Attention、KV Cache、视觉编码器或动作头优化经验;
- 有大规模训练稳定性、GPU 性能分析、异构资源调度或内存优化经验;
- 有具身智能、机器人或多模态模型训练与部署经验;
- 有 ICPC、ASC、OI、MO 等竞赛经历或相关开源项目贡献。
特色标签
C/C++、CUDA、CUDA自定义算子、Docker、GPU推理引擎、GPU算子、Hive、Kubernetes、Linux开发/部署经验、LLM推理加速库、Python、PyTorch、Spark、中大型项目开发经验、低比特推理、具身人工智能、具身智能、具身智能体、分布式经验、分布式训练、参加算法相关竞赛/获奖、基础设施、多机多卡训练、多模态算法、大模型算法、并行计算、强化学习、推理吞吐量、推理延迟、数据并行、有留学背景、机器人、机器学习经验、模型加速/性能优化、模型压缩、模型并行、模型断点、深度学习、算法工程化经验、系统架构设计经验、缓存优化、英语读写能力良好、视觉-语言-动作模型、视觉语言模型、计算机图形学、计算机相关专业、训练快照、跨模态模型、键值缓存