【蚂蚁星】算法工程师-持续学习方向-蚂蚁国际-27届
Company Antgroup
Focus Tech · Algorithm
Location 北京, 上海, 杭州
Published May 14, 2026
岗位职责
部门介绍: 我们是一支专注于国际支付领域核心技术攻坚的研究创新团队。在通用大模型快速发展的今天,我们回答两个关键问题:如何让 AI 真正懂国际支付,以及如何让智能系统持续进化、自主协同。围绕这两大命题,我们聚焦两个核心方向:领域知识增强:在通用基座模型之上,高效、稳定地融入跨境支付规则、多国合规政策、本地化业务逻辑,打造专业化的支付大模型能力多智能体与自进化:探索多 Agent 协作中的强化学习机制,研究模型在线学习与自我演进路径,构建可适应复杂国际环境的智能系统我们坚信,真正的技术壁垒来自研究与业务的深度耦合。团队与国际业务一线紧密配合,从真实场景中提炼技术命题,再将研究成果转化为可落地的解决方案——在跨境结算效率、合规风控能力、全球用户体验等维度持续创造突破。
职位描述: 面向下一代通用模型的持续演进与自主能力提升,围绕领域持续学习与智能体强化学习两大核心方向,探索基础模型在动态环境中的自适应学习机制、长期记忆构建、任务泛化与决策优化等关键问题,推动前沿技术在真实业务场景中的持续迭代与落地。具体职责: 1.领域持续学习研究,参与下一代持续学习(Continual Learning)架构设计与算法研发,解决模型在学习新知识时的灾难性遗忘问题; 2.探索动态知识更新、增量学习、任务序列学习等方向,提升模型在开放环境中的自适应能力• 研究跨领域知识迁移、领域自适应、少样本/零样本学习等方法,增强模型的泛化性与鲁棒性; 3.设计并实现高效的经验回放、参数隔离、正则化约束等持续学习策略智能体强化学习研究• 围绕智能体(Agent)的自主决策与任务执行能力,开展强化学习(RL)算法研究与创新; 4.探索大模型与强化学习的融合范式(如 RLHF、RLAIF、Agent RL),提升智能体在复杂任务中的规划、推理与执行能力• 研究多智能体协作、分层强化学习、离线强化学习、在线 lære 等方向,支撑智能体在真实场景中的落地; 5.设计奖励函数、价值估计、策略优化等核心模块,提升训练稳定性与样本效率研究协作与成果产出与研究、工程和产品团队协作,围绕持续学习与智能体决策中的关键问题开展研究沉淀可复用的方法、实验结论与技术成果,推动顶会论文发表与开源贡献。
任职要求
1.计算机、人工智能、数学、统计学、自动化等相关专业硕士/博士优先,优秀本科生不受限制; 2.有顶会论文(NeurIPS、ICLR、ICML、CoRL、AAMAS 等)、高影响项目或开源贡献者加分• 在持续学习、强化学习、智能体、元学习等方向有深入研究者优先专业能力; 3.具备扎实的深度学习、强化学习、概率论、最优化等理论基础,理解 MDP、策略梯度、值函数、Actor-Critic 等核心概念; 4.对持续学习(Continual Learning)有较深入理解,熟悉灾难性遗忘、知识蒸馏、经验回放等关键技术,有相关研究或实践经验者优先; 5.对强化学习(RL)有较深入理解,熟悉 DQN、PPO、SAC、TD3 等经典算法,有 LLM+RL 或 Agent RL 实践经验者优先; 6.熟悉大模型训练与实验流程,能够独立完成算法设计、实验分析、效果归因与迭代优化; 7.对多智能体协作、分层任务规划、工具使用、自主决策等前沿方向有研究兴趣或实践经验者优先; 8.熟练掌握 Python 与 PyTorch,具备较强的实验与工程实现能力,熟悉 RL 框架(如 Stable Baselines3、RLlib、TorchRL 等)者优先能力特质; 9.具备优秀的研究能力与学术判断,能够从实际问题中提炼研究命题并持续推进; 10.目标导向,敢于承担前沿探索中的不确定性,能在前沿问题上保持深入思考与执行力; 11.具备良好的协作能力,能够与研究、工程和应用团队共同推动技术突破与落地; 12.对技术有热情,对智能体的未来有想象力,愿意在长期主义的方向上持续投入。
特色标签
Agent RL、Python、RL算法、专业化大模型、人类反馈强化学习、价值估计、任务序列学习、分层强化学习、分布式智能体、分布式训练、动态知识更新、协作式强化学习、参数稳定性约束、反馈驱动学习、发表算法相关优秀论文、合规知识融合、回放机制、回放策略、在线学习、在线学习与更新、基于人类反馈的强化学习、基座模型、增量学习、多Agent协作、多智能体强化学习、多智能体系统、大模型算法、大语言模型、奖励函数设计、学习稳定性、对齐学习、少样本学习、工具调用智能体、并行计算、强化学习、强化学习(Reinforcement Learning)、持续学习(Continual Learning)、指令微调增强、支付大模型、智能体(Agent)、机器学习、模型在线学习、模型自演化、模型记忆能力、深度学习、灾难性遗忘缓解、知识保持、策略优化、算法工程化经验、经验重放缓冲区、自主决策智能体、自我演进路径、自然语言处理算法、记忆回放、跨领域知识迁移、遗忘抑制、长期记忆构建、零样本学习、领域大模型、领域自适应