jdwatch
  • Home
  • CLI
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

蚂蚁集团-垂类模型后训练科学家-北京/杭州/上海【AGI专项】

Company 蚂蚁集团

Focus 技术 · 算法

北京, 上海, 杭州

July 29, 2026

岗位职责

  1. 负责垂类大模型后训练(Post-training)阶段的算法研发工作。
  2. 设计并优化高质量的指令数据微调(SFT)与对齐(Alignment)工作,构建针对如金融事实性、合规性及逻辑推理的 Reward 模型系统,激发模型的专业对话、复杂逻辑推理及合规风控能力。
  3. 构建基于 Agentic-RL 的金融数据仿真环境及 API 对接体系,通过合成高质量多轮决策轨迹,打造具备极致专业性与安全性的垂类行业模型。

任职要求

● 计算机科学、人工智能或相关专业背景,具备大模型后训练实战经验。 ● 精通 SFT、RLHF(PPO/DPO/GRPO)及对齐算法,具备构建复杂奖励模型(Reward Model)的实战经验。 ● 理解Agentic技术栈,有仿真环境构建、工具调用(Tool Use)及多轮决策轨迹合成的相关研发经验。 ● 具备扎实的算法工程实现能力,熟悉 PyTorch、Megatron、vLLM 等主流训练推理框架,能够解决从数据合成到模型落地的全链路工程问题,有handson进行修改的能力 ● 具备良好的定义、分析和解决问题能力,具备敏锐的数据洞察力。 ● 具备较强的团队合作和沟通能力,能够与工程团队、产品团队或其他相关团队紧密配合。

加分项 ● Curiosity-driven(极强的好奇心) ● Following the First Principle(坚持第一性原理解决问题) ● Good research taste(卓越的研究品味) ● Good data taste(极佳的数据审美) ● Strong Algorithm & System Co-design capability(具备算法与系统协同设计的全局视野,能通过训练框架优化解决算法扩展性瓶颈) ● Performance optimization experience(具备训练或推理性能优化经验,熟悉 CUDA/Triton 算子开发、显存优化或通信加速技术,致力于极致压榨硬件算力以提升实验迭代效率) ● Full-stack coding skills(全栈工程能力) ● Interdisciplinary background(金融+计算机/数学的复合背景,弥合业务与算法的鸿沟)

岗位标签

NEW

特色标签

Agent-based RL、Alignment、CUDA优化、LLM、Post-training、Python、RM、Supervised Fine-tuning、代理强化学习、仿真系统、决策路径、合规、回报模型、多轮对话轨迹、大模型算法、大规模语言模型、奖励模型、强化学习、指令微调、推理加速、推理轨迹、数据合成环境、显存优化、智能体、智能体强化学习、模型加速/性能优化、模型对齐、模型微调、模拟环境、深度学习框架、深度学习模型、监督微调、神经网络框架、算法工程化经验、自然语言处理算法、训练加速、训练框架、金融、风控、风控算法

Apply now

You'll be redirected to the official careers page. You can also sign in to save jobs and search more roles.