蚂蚁数字科技-数科技术部-大模型强化学习研发专家
Company Antgroup
Focus Tech · Algorithm
Location 上海, 杭州
Published July 14, 2026
岗位职责
- 负责实时高性能强化学习框架的设计与开发,服务蚂蚁数科的模型训练场景,如分布式训练加速策略、显存管理、算子融合、编译优化、模型量化、混合精度、异构硬件加速等;
- 与算法工程师深度合作,针对大模型强化学习训练和推理场景,进行端到端性能分析和优化,包括分布式训练加速、显存优化、通信效率提升等,满足大规模 Agent 训练的性能要求。
任职要求
- 具备大模型训练框架或分布式推理框架开发经验,熟悉 Megatron-LM、DeepSpeed 等分布式训练框架,或具备 SGLang、vLLM 等大模型分布式推理与推理加速框架开发经验者优先;
- 具备大模型强化学习框架相关经验者优先,例如 AReaL、veRL、Slime 等, 对RL流程熟悉者优先;
- 具备良好的逻辑分析能力,对复杂框架的模块设计、抽象边界和工程实现有一定理解,热爱技术且对强化学习领域有深入钻研优先;
- 熟悉 Agent 工程或 AI Coding Agent 工具链者优先;
- 有大模型训练经验优先。
特色标签
C++、C/C++、LLM推理加速、Python、云原生、保险、信贷、分布式推理框架、分布式经验、分布式计算、分布式训练、分布式训练加速、分布式训练库、分布式训练框架、加强学习、区块链、反洗钱、合规、图计算、基础设施、大模型推理框架、大模型算法、大模型训练、大语言模型、安全、并行训练、强化学习、推理框架优化、支付、数据安全、智能体、有留学背景、架构设计经验、模型加速/性能优化、混合精度训练、特征计算、理财、知识图谱、研发效能、硬件加速、算法工程化经验、调度、金融、隐私计算、风控