研究型实习生-UI Agent一致性强化学习:Think-Action闭环奖励优化模型
Campus/Intern
Company Antgroup
Focus Tech · Algorithm
Location 北京, 上海, 杭州
Published June 10, 2026
岗位职责
研究领域: 多模态大模型 项目简介: UI Agent常因“思考路径”与“执行动作”不一致导致操作错误(如think中的动作为“提交表单”却在action选择“取消”)。现有rule-based RL奖励设计粗糙,无法有效约束“认知-行为”链条的可信性。需构建一致性感知奖励模型,从决策逻辑层面提升可靠性。
任职要求
研究领域: -目前正在攻读计算机科学或相关STEM领域的学士,硕士或博士学位 -具有一种或多种通用编程语言的经验,包括但不限于: Java,C/C ++ 、Python、JavaScript或Go -具有上述研究领域的相关经验,包括行业经验或作为参与实验室研究 优先录用: -对技术研究充满热情,具有产生新思想和创新的能力; 在自学,问题分析和解决方面表现出色 -在国际会议上或核心期刊发表一份或多份出版物或论文 -至少3个月的全职工作
特色标签
C/C++、Golang、Java、Python、UI智能体、一致性RL、一致性强化学习、发表算法相关优秀论文、可信奖励模型、可信强化学习、多模态基础模型、多模态大语言模型、多模态算法、大模型算法、奖励函数优化、奖励建模、强化学习、思考-动作闭环、推理-执行闭环、智能体、深度学习、用户界面智能体、界面代理、算法工程化经验、认知-行为闭环、跨模态大模型