【蚂蚁星】财富AI Lab-大模型Agent算法-27届
Company Antgroup
Focus Tech · Algorithm
Location 北京, 上海, 杭州
Published May 14, 2026
岗位职责
部门介绍: Fin-AI Lab / 财富 AI Lab 是面向金融场景打造的 AI Native 技术团队,聚焦大模型、Agentic Learning、Tool Use、复杂推理、金融数据理解与端到端 AGI 金融智能产品和系统建设。 团队的核心目标是围绕真实复杂金融场景,训练和构建能够完成长程、多步、可验证任务的大模型 Agent。我们关注大模型从“会回答”走向“会规划、会调用工具、会使用数据、会自我校验、会完成任务”的能力跃迁。 在金融场景下,Agent 面临更高的技术挑战:数据高度结构化与实时变化并存,任务链路长,工具体系复杂,事实性和严谨性要求高,推理过程需要可追踪、可验证、可控。因此,团队需要围绕 Agent 规划、工具调用、记忆、反思、执行环境、评测体系、强化学习与数据飞轮,系统性提升大模型在复杂金融任务中的能力上限。
职位描述
- 负责大模型 Agent 算法体系建设,包括规划、工具调用、记忆、反思、执行控制等核心模块;
- 构建 Agentic Learning 训练方案,包括 Agent 轨迹数据、过程监督、偏好数据、Reward Model 和强化学习目标设计;
- 探索 SFT、DPO、PPO、GRPO、Process Reward、Outcome Reward 等方法在 Tool Use 和长程任务中的应用;
- 设计金融 Agent Benchmark,建立评测驱动的模型和系统迭代机制;
- 优化多工具调用链路,包括工具路由、参数生成、结果解析、调用链规划和异常恢复;
- 建设金融任务执行环境,包括工具调用环境、模拟任务环境、自动评测环境和训练数据生成环境;
- 跟踪 Agentic Learning、Tool Use、RL for LLM、Long-horizon Reasoning 等前沿方向,并推动技术落地。
任职要求
-
扎实的大模型算法基础,理解 Transformer、LLM 训练、后训练、推理机制和对齐技术;
-
熟悉 Agent 技术范式,如 ReAct、Plan-and-Execute、Reflexion、Tree-of-Thought、Function Calling、Multi-Agent 等;
-
熟悉 Tool Use 相关技术,理解工具选择、参数生成、工具结果解析、多工具协同和失败恢复等问题;
-
熟悉 SFT、DPO、PPO、GRPO、RLHF/RLAIF、Reward Model、Preference Learning 等方法;
-
具备较强工程能力,熟练使用 Python,熟悉 PyTorch、Transformers、vLLM、Ray、DeepSpeed、Megatron-LM、FSDP、OpenRLHF、verl、slime 等框架中的一种或多种;
-
具备良好的任务抽象和实验分析能力,能够将复杂任务拆解为可执行、可评测、可训练的 Agent 任务;
-
对大模型 Agent 方向有持续热情,关注前沿研究,对 Agent 失败模式和真实系统落地挑战有深入思考。 【加分项(模型×Agent联合优化成果)】
-
在模型与Agent的交叉领域有过充分实践优先:
-
顶会论文:NeurIPS/ICML/ICLR/ACL等与Agent/对齐/RLHF相关论文;
-
开源项目:为知名开源社区项目贡献核心代码,或有高star自主项目;
-
线上系统:参与过真实上线的AI系统,有可量化的效果指标;
-
技术影响力:高质量博客/竞赛奖项/有用户的Side Project。
特色标签
AI智能体、DPO、Function Calling、GRPO、Long-horizon Reasoning、PPO、Python、PyTorch框架、RLAIF、RLHF、Shell、云原生、云计算、任务规划、保险、信贷、偏好模型、决策规划、分布式训练、分布式训练框架、区块链、反洗钱、发表算法相关优秀论文、合规、商业化、基准测试、复杂推理、多工具协同、大数据、大模型智能体、大模型算法、奖励模型、工具使用、广告、强化学习、持续学习、指令微调、推荐、支付、数据回流、数据安全、数据闭环、智能体、有监督微调、模型加速/性能优化、深度学习框架、理财、监督微调、知识图谱、算法工程化经验、结果奖励、自然语言处理算法、评估指标、评测体系、过程奖励、金融、金融智能体、银行、链式规划、长程推理、隐私计算、风控