【Plan A】大模型后训练-金融智能-27届

Campus

Company Antgroup

Focus Tech · Algorithm

Location 北京, 上海, 杭州

Published September 3, 2026

岗位职责

  1. 面向投研、估值和金融建模等真实工作流,将金融专家的分析过程表示为可执行、可审计的长程推理轨迹;
  2. 研究多源信息检索与交叉验证、时序一致性、数值推理、可信度控制、可验证奖励与长程信用分配,并通过 Agentic RL、Multi-Teacher On-Policy Distillation(MOPD)等方法,推动金融专项能力与通用推理能力协同演进。

任职要求

  1. 深入理解大模型训练框架和推理引擎的基本原理,熟悉底层框架基本架构和实现原理;
  2. 了解业界主流语言大模型相关基础结构和优化方法;
  3. 熟悉GPU,存储,分布式集群等相关基础知识;
  4. 熟悉大模型基本后训练流程以及相关算法原理;
  5. 能从第一性原理建模问题,有较好的动手能力;
  6. 有较好的团队协同能力,思路敏捷,沟通效率。

加分项:

  1. 有100B MOE模型以上的后训练时间经验;
  2. 有强化学习,SFT,OPD相关的顶会论文发表;
  3. 有训练,推理,评测效率优化以及与算法协同开发经验;
  4. 有agent Harness相关经验,超长上下文管理等能力的实践与优化经验;
  5. 有跨学科背景(数理化生 / 金融 / 法律等);
  6. 各类高水平竞赛金牌选手。

特色标签

Agent强化学习、C/C++、MOPD、Post-Training、Python、Shell、交叉信息检索、价值评估、分布式训练、参加算法相关竞赛/获奖、反洗钱、发表算法相关优秀论文、后训练算法、多教师策略蒸馏、多源检索、大模型算法、强化学习、投资分析、投资研究、数字推理、时间一致性、时间线一致性、智能体强化学习、模型加速/性能优化、模型微调、模型精调、算法工程化经验、自然语言处理算法、英美留学生、资产定价、量化建模、量化推理、金融、金融AI、金融人工智能、金融大模型、金融模型构建、银行