【Plan A】大模型后训练-金融智能-27届
Campus
Company Antgroup
Focus Tech · Algorithm
Location 北京, 上海, 杭州
Published September 3, 2026
岗位职责
- 面向投研、估值和金融建模等真实工作流,将金融专家的分析过程表示为可执行、可审计的长程推理轨迹;
- 研究多源信息检索与交叉验证、时序一致性、数值推理、可信度控制、可验证奖励与长程信用分配,并通过 Agentic RL、Multi-Teacher On-Policy Distillation(MOPD)等方法,推动金融专项能力与通用推理能力协同演进。
任职要求
- 深入理解大模型训练框架和推理引擎的基本原理,熟悉底层框架基本架构和实现原理;
- 了解业界主流语言大模型相关基础结构和优化方法;
- 熟悉GPU,存储,分布式集群等相关基础知识;
- 熟悉大模型基本后训练流程以及相关算法原理;
- 能从第一性原理建模问题,有较好的动手能力;
- 有较好的团队协同能力,思路敏捷,沟通效率。
加分项:
- 有100B MOE模型以上的后训练时间经验;
- 有强化学习,SFT,OPD相关的顶会论文发表;
- 有训练,推理,评测效率优化以及与算法协同开发经验;
- 有agent Harness相关经验,超长上下文管理等能力的实践与优化经验;
- 有跨学科背景(数理化生 / 金融 / 法律等);
- 各类高水平竞赛金牌选手。
特色标签
Agent强化学习、C/C++、MOPD、Post-Training、Python、Shell、交叉信息检索、价值评估、分布式训练、参加算法相关竞赛/获奖、反洗钱、发表算法相关优秀论文、后训练算法、多教师策略蒸馏、多源检索、大模型算法、强化学习、投资分析、投资研究、数字推理、时间一致性、时间线一致性、智能体强化学习、模型加速/性能优化、模型微调、模型精调、算法工程化经验、自然语言处理算法、英美留学生、资产定价、量化建模、量化推理、金融、金融AI、金融人工智能、金融大模型、金融模型构建、银行