jdwatch
  • Home
  • CLI
  • Skills
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

蚂蚁集团-训推系统研发专家-杭州/北京/上海

Company Antgroup

Focus Tech · Backend

Location 北京, 上海, 杭州

Published August 19, 2026

岗位职责

蚂蚁ASystem致力于打造下一代AI基础软件,并基于下一代的AI基础软件寻找通用智能的新方法,追求智能上限。

  1. 负责训推一体框架的设计与开发,服务蚂蚁内部的强化学习场景;
  2. 建设面向训推一体的显存管理体系和高性能数据存储方案;
  3. 负责实时高性能训推系统设计与开发,如分布式训练加速策略、算子融合、编译优化、模型量化、混合精度、异构硬件加速等;
  4. 负责整体性能优化与架构升级,持续提升训练/推理性能;
  5. 与算法工程师深度合作,为重点项目进行算法与系统的联合优化。

任职要求

  1. 精通至少一门 Python/Go/C++ 等编程语言,并有良好的代码风格;
  2. 具有分布式系统服务/并行计算系统设计与研发优化经验;
  3. 代码级精通主流深度学习框架及扩展库的使用及算子开发,例如TensorFlow/PyTorch/Megatron/Deepspeed/vLLM/Sglang等;
  4. 好奇心强,热爱技术且对强化学习领域有深入钻研优先;

加分项:

  1. 熟悉至少一种主流的RLHF框架,如OpenRLHF/veRL/AReal/ChatLearn等;
  2. 熟悉Ray框架或其他强化学习相关计算框架;
  3. 在计算机系统网络顶会OSDI/SOSP/NSDI/ATC/EuroSys上有文章发表经验

特色标签

algorithm_engineering_experience、C/C++、Docker、Golang、GPU/FPGA应用、Kubernetes、Numpy、Pandas、published_excellent_algorithm_paper、Python、PyTorch、RL算法、TensorFlow、云计算、人工智能、代码编译技术、全栈训推系统、分布式系统、分布式计算、分布式计算框架、分布式训练、参数压缩、多核加速、存储架构设计、并行计算、强化学习、强化学习工具链、效能提升、数据管理方案、智能体、智能研发、模型加速/性能优化、深度学习、深度强化学习、研发效能、精度缩减、系统调优、统一训练推理框架、自动化优化策略、隐私计算