【蚂蚁星】算法工程师-Agentic Learning-灵光(实习)
Company Antgroup
Focus Tech · Algorithm
Location 杭州
Published May 12, 2026
岗位职责
部门介绍: Agent团队致力于在解决大模型应用最后一公里的问题。通过训练模型在复杂、长程任务下的能力,提升AI产品的用户体验,构建训练的数据飞轮。
职位描述
智能体进化是人工智能领域的重要研究方向,旨在通过持续学习和自我改进机制,使AI智能体能够在复杂环境中不断提升其决策能力和执行效率。基于开源的AWorld框架,探索智能体在多样化环境中的自我演进机制。同时,执行环境构建是智能体训练和部署的关键基础设施,直接影响智能体的学习效果和实际应用能力。AWorld也构建了完整的分布式训练环境,支持大规模智能体的并行训练和评估。据此,本项目关注智能体和环境构建的双向强化机制的协同效应。智能体进化与环境构建之间存在相互促进的协同关系,形成了独特的双向强化机制:
-
智能体 to环境优化:智能体的学习需求驱动环境复杂度的提升;
-
环境 to智能体进化:丰富的环境提供更多学习机会和挑战;
-
协同效应实证:通过智能体和环境,研究和发现双向强化的可能性和理论基础。 据此,工作职责包括:
-
构建Agentic Learning的训练Infra,从cuda、megatron等底层,到RLRoll的策略,到训练目标的设计等等;需要全链路的人才加入;
-
构建Agent背景下的大模型评测新benchmark,做到基于评测驱动的大模型新迭代范式;
-
大模型和产品结合,依托灵光等产品,创建产品和模型之间的数据飞轮,构建产学研的轮转迭代。
任职要求
基础要求:
- 目前正在攻读计算机科学或相关STEM领域的学士,硕士或博士学位;
- 具有一种或多种通用编程语言的经验,包括但不限于: Java,C/C ++ 、Python、JavaScript或Go;
- 具有上述研究领域的相关经验,包括行业经验或作为参与实验室研究;
- 具有LLM、VLM、World Model等大模型训练经验。
加分项:
- 对技术研究充满热情,具有产生新思想和创新的能力; 在自学,问题分析和解决方面表现出色;
- 在国际顶尖会议(ICLR、ICML、NeurIPS)上或核心期刊发表一份或多份出版物或论文;
- 有计算机、数学等竞赛金奖;AI项目开源(1k+ stars);知名项目和顶尖研究院实习经验等。
特色标签
Agent学习范式、Agent测评标准、AI Agent、AI智能体、AWorld框架、C/C++、Golang、Java、Python、RL训练流程、Rollout策略、产学研迭代循环、分布式计算、分布式训练、分布式训练平台、分布式训练框架、协同进化、参加算法相关竞赛/获奖、双向增强机制、发表算法相关优秀论文、多模态算法、大模型算法、大模型训练系统、大模型评估体系、并行计算、开源智能体框架、强化学习、强化学习训练策略、数据闭环、智能体、智能体学习、智能体评测基准、模型-产品闭环、模型加速/性能优化、环境-智能体协同、研发效能、自主智能体、自主进化学习、自然语言处理算法、训练基础设施