研究型实习生-基于强化学习与熵驱动探索的大语言模型反洗钱智能系统研究

Intern

Company Antgroup

Focus Tech · Algorithm

Location 北京, 杭州

Published May 7, 2026

岗位职责

研究领域: 大模型 项目简介: 着金融交易复杂度和全球化程度的不断提升,洗钱行为日益隐蔽化、智能化,传统基于规则和统计模型的风险识别方法面临三大核心挑战:

  1. 已知风险识别效率低:大量告警为误报,人工复核成本高;
  2. 未知风险发现能力弱:现有系统难以主动挖掘新型、模式演化型洗钱路径;
  3. 风险报告撰写标准化不足:报告内容质量依赖分析师经验,存在主观性强、逻辑不一致、信息遗漏等问题。 近年来,大语言模型(Large Language Models, LLMs)在自然语言理解与生成方面展现出强大潜力,但其在高风险决策场景中仍面临可解释性差、推理稳定性不足、缺乏目标导向优化机制等问题。与此同时,强化学习(Reinforcement Learning, RL)提供了一种通过反馈不断优化策略的框架,特别适合用于构建具备持续进化能力的智能决策系统。 然而,在风控领域,如何设计有效的奖励函数(Reward Function)以引导 LLM 做出准确、合规且具有洞察力的风险判断,仍是关键难题。当前主流做法多依赖人工标注或简单规则打分,缺乏对“风险深度挖掘”与“探索-利用权衡”的建模能力。 此外,信息熵(Entropy)作为衡量不确定性的数学工具,在异常检测与主动探索中具有天然优势,但在金融风控中尚未被充分应用于指导模型对潜在未知风险的自主发现。 因此,亟需一个融合规则与模型双驱动奖励机制、引入熵驱动探索策略、并构建端到端反洗钱智能体(Agent)架构的前沿研究项目,推动AI在金融合规领域的可信落地。

任职要求

研究领域:

  • 目前正在攻读计算机科学或相关STEM领域的学士,硕士或博士学位
  • 具有一种或多种通用编程语言的经验,包括但不限于: Java,C/C ++ 、Python、JavaScript或Go
  • 具有上述研究领域的相关经验,包括行业经验或作为参与实验室研究 优先录用:
  • 对技术研究充满热情,具有产生新思想和创新的能力; 在自学,问题分析和解决方面表现出色
  • 在国际会议上或核心期刊发表一份或多份出版物或论文
  • 至少3个月的全职工作

特色标签

Agent、AI智能体、AML、LLM、Reward Function、RL、不确定性驱动探索、信息熵、反洗钱、反洗钱智能体、反洗钱智能系统、合规、大语言模型、奖励机制、强化学习算法、熵引导探索、策略优化、行业分析能力、规则与模型双驱动奖励、金融、金融合规、金融风控、银行、风控、风险控制、风险管理能力、风险识别