【蚂蚁星】算法工程师-Agentic/多模强化学习-大安全-27届
Company Antgroup
Focus Tech · Algorithm
Location 上海, 杭州
Published May 14, 2026
岗位职责
部门介绍: 我们是蚂蚁大安全机器智能—AI数据认知团队,致力于以行业领先的专业数据能力,助力蚂蚁各场景模型达到业界顶尖水平。我们聚焦两大关键路径;从通识到专业,从显性知识到隐性思维:萃取STEM、医疗、安全、心理学等垂直领域专家的思维逻辑,构建高质量指令集与精准评估信号,赋予模型专家级认知与判断力。从静态到动态,从交互到反馈:围绕医疗、金融等数字世界复杂场景,构建多轮推理与环境交互数据,刻画智能体感知-规划-行动-反思的完整链路;并通过精细化奖励信号,推动模型实现“感知-认知-行动-进化”的能力跃迁。团队核心成员来自海内外顶尖高校与企业,包括Kaggle Grandmaster、顶会论文作者等,曾获KDD Cup、NeurIPS等国际顶赛冠军,及省部级科技奖项与WAIC SAIL之星等荣誉。在这里,你将拥有前沿算法落地的广阔平台与快速成长的学习生态。欢迎加入蚂蚁集团-大安全-机器智能团队!
职位描述: 在迈向AGI的进程中,仅依赖通用数据的规模化法则正逐渐触及效益拐点。进入大模型的“下半场”,AI需突破聊天对话的边界,发展为知行合一、深度理解意图、具备专业能力与强执行力的智能体。本质上,上半场大模型通过海量语料锻造“感知系统”,实现直觉式思考与通识构建;而下半场,则亟需依托高质量数据闭环,构建“认知与行动系统”,形成深度推理、专业认知及复杂任务执行与进化的能力。 智能体强化推理数据构建、rubric评测体系构建、reward model研究探索。多模态强化学习数据构建、多模态评测基准构建、多模场景rewardmodel研究探索。
任职要求
1.计算机科学、人工智能、自然语言处理、数据科学、机器学习等相关专业博士或优秀硕士。博士优先,尤其在强化学习,Multi-Agent,大模型等方向有深度研究者或相关项目经验优先; 2. 在国际顶级会议(如ACL、SIGIR、NeurIPS、AAAI、ICLR等)以第一作者发表论文者优先; 3. 强烈的技术热情,对AI搜索前沿技术有持续关注,拥有优秀的逻辑思维能力以及发现和解决问题的能力。
特色标签
AI安全、AI智能体、Python、RL、RLHF奖励建模、专家级评测标准、人工智能安全、分布式智能体、医疗、参加算法相关竞赛/获奖、发表算法相关优秀论文、基础大模型、多主体系统、多智能体、多模态RL、多模态强化学习、多模态强化学习算法、多模态算法、多模态评估基准、多模态评测标准、大模型安全、大模型算法、大语言模型、奖励模型、奖赏模型、安全、对话系统、强化学习、强化学习算法、强化推理数据集、意图挖掘、智能体、智能体推理数据构建、智能体数据闭环、有留学背景、机器学习、深度学习、深度强化学习、算法工程化经验、结构化评测体系、自主智能体、自然语言处理算法、语义理解、跨模态评测框架、量规评测体系、金融、预训练大模型、风控算法