【蚂蚁星】财富AI Lab-大模型Agent算法(实习)
Company Antgroup
Focus Tech · Algorithm
Location 北京, 上海, 杭州
Published April 28, 2026
岗位职责
部门介绍: Fin-AI Lab / 财富 AI Lab 是面向金融场景打造的 AI Native 技术团队,聚焦大模型、Agentic Learning、Tool Use、复杂推理、金融数据理解与端到端 AGI 金融智能产品和系统建设。 团队的核心目标不是简单构建一个金融问答助手,而是围绕真实复杂金融场景,训练和构建能够完成长程、多步、可验证任务的大模型 Agent。我们关注大模型从“会回答”走向“会规划、会调用工具、会使用数据、会自我校验、会完成任务”的能力跃迁。 在金融场景下,Agent 面临更高的技术挑战:数据高度结构化与实时变化并存,任务链路长,工具体系复杂,事实性和严谨性要求高,推理过程需要可追踪、可验证、可控。因此,团队需要围绕 Agent 规划、工具调用、记忆、反思、执行环境、评测体系、强化学习与数据飞轮,系统性提升大模型在复杂金融任务中的能力上限。 职位描述:
- 负责金融场景下大模型 Agent 算法体系建设,包括规划、工具调用、记忆、反思、执行控制等核心模块;
- 构建 Agentic Learning 训练方案,包括 Agent 轨迹数据、过程监督、偏好数据、Reward Model 和强化学习目标设计;
- 探索 SFT、DPO、PPO、GRPO、Process Reward、Outcome Reward 等方法在 Tool Use 和长程任务中的应用;
- 设计金融 Agent Benchmark,建立评测驱动的模型和系统迭代机制;
- 优化多工具调用链路,包括工具路由、参数生成、结果解析、调用链规划和异常恢复;
- 建设金融任务执行环境,包括工具调用环境、模拟任务环境、自动评测环境和训练数据生成环境;
- 跟踪 Agentic Learning、Tool Use、RL for LLM、Long-horizon Reasoning 等前沿方向,并推动技术落地。
任职要求
- 扎实的大模型算法基础,理解 Transformer、LLM 训练、后训练、推理机制和对齐技术;
- 熟悉 Agent 技术范式,如 ReAct、Plan-and-Execute、Reflexion、Tree-of-Thought、Function Calling、Multi-Agent 等;
- 熟悉 Tool Use 相关技术,理解工具选择、参数生成、工具结果解析、多工具协同和失败恢复等问题;
- 熟悉 SFT、DPO、PPO、GRPO、RLHF/RLAIF、Reward Model、Preference Learning 等方法;
- 具备较强工程能力,熟练使用 Python,熟悉 PyTorch、Transformers、vLLM、Ray、DeepSpeed、Megatron-LM、FSDP、OpenRLHF、verl、slime 等框架中的一种或多种;
- 具备良好的任务抽象和实验分析能力,能够将复杂任务拆解为可执行、可评测、可训练的 Agent 任务;
- 对大模型 Agent 方向有持续热情,关注前沿研究,对 Agent 失败模式和真实系统落地挑战有深入思考。 【加分项(模型×Agent联合优化成果)】 1.在模型与Agent的交叉领域有过充分实践优先: 2.顶会论文:NeurIPS/ICML/ICLR/ACL等与Agent/对齐/RLHF相关论文; 3.开源项目:为知名开源社区项目贡献核心代码,或有高star自主项目; 4.线上系统:参与过真实上线的AI系统,有可量化的效果指标; 5.技术影响力:高质量博客/竞赛奖项/有用户的Side Project。
特色标签
Agent学习范式、Benchmark、DPO、Function Calling、LLM Agent、Long-horizon Reasoning、Outcome Reward、Plan-and-Execute、PPO、Process Reward、Python、RLAIF、RLHF、Shell、Tool Use、任务规划、保险、信贷、偏好模型、分布式训练、区块链、参加算法相关竞赛/获奖、反洗钱、发表算法相关优秀论文、合规、复杂推理、大模型代理、大模型智能体、大模型算法、奖励模型、工具使用、强化学习、强化微调、支付、数据安全、智能体、智能体学习、有留学背景、模型加速/性能优化、理财、知识图谱、算法工程化经验、聊天机器人、自然语言处理算法、自迭代数据、训练数据闭环、评测驱动迭代、轨迹数据、金融、金融Agent测评、金融任务、金融应用、金融环境、银行、长程推理、长程规划、隐私计算、风控