蚂蚁集团-风险管理AI工程师(反洗钱方向)-成都
Company Antgroup
Focus Tech · Backend
Location 成都
Published August 6, 2026
岗位职责
- 深入理解反洗钱业务逻辑与法规要求,将复杂风控规则转化为模型可理解的推理逻辑与辅助决策依据;推进 Agent、Self-Learning 等技术在风险监测、类罪取证中的深度应用,设计全流程自动化工作流,驱动业务效能跃升。
- 优化面向反洗钱场景的大模型数据体系(包括指令微调数据、偏好排序数据等),结合 SFT 及通用对齐技术持续迭代模型,建立“数据 - 算法 - 反馈”的良性迭代闭环,持续提升模型在垂直领域的性能表现。
- 主导基于强化学习的智能体技术研发与落地,负责构建高质量多轮决策轨迹数据集,设计兼顾事实准确性、合规性及逻辑严密性的奖励函数(Reward Function),优化模型的工具调用、动态规划、多步推理及多智能体协作能力,打造安全、可控且专业的垂类风控模型。
任职要求
- 本科及以上学历,计算机、人工智能、数学、数据科学、统计学等相关专业。具备 3 年以上算法研发经验,其中至少 2 年专注于大模型领域。
- 精通 PyTorch等主流深度学习框架;深入理解并实践过 SFT、RLHF(PPO/DPO 等主流算法)及模型对齐技术,具备构建复杂场景奖励模型(Reward Model)的实战经验。
- 熟悉 Agent 技术栈(如LangChain、AutoGen等),在仿真环境构建、工具调用(Tool Use)、多轮决策轨迹合成及多智能体协作方面有实际项目研发经验,能够独立解决长程推理中的稳定性问题。
- 具备较强的逻辑思维和沟通协作能力,能够快速理解复杂的业务场景,并将业务需求转化为技术解决方案。
岗位标签
NEW
特色标签
AI智能体、Python、RL、Tool Use、专项调查/考察、人类反馈强化学习、内部控制/内部审计、决策奖励机制、分布式智能体协作、制度制定及落地优化、反洗钱、反洗钱合规、反洗钱调查、反洗钱风控、合规、回报函数、垂类大模型、基于人类反馈的强化学习、外部工具集成、多Agent协同、多智能体系统、大模型算法、大规模语言模型、大语言模型、奖励函数、安全、工具使用、强化学习、强化学习算法、指令微调、支付、数据安全、智能体、有监督微调、机器学习、深度学习、深度强化学习、监督微调、算法工程化经验、自主学习、自主智能体、自学习、自然语言处理算法、自适应学习、财务风险合规管理、金融、金融业务合规管理、金融反欺诈、银行、风控、风控算法、风险管理体系组建