数据技术及产品部-大模型评测算法-CUA方向
Company Alibaba
Focus Tech · Algorithm
Location 北京, 杭州
Published September 16, 2026
岗位职责
岗位描述:面向"电脑操作智能体"(自主操作 GUI、浏览器、桌面 / 移动端软件完成任务的大模型 Agent),独立负责其能力提升的完整闭环。
岗位职责
- 设计 CUA 评测任务与轨迹级评分体系(GUI grounding、任务规划、多步操作、长程任务成功率等),定位模型失败模式(误点击、幻觉操作、状态误判、循环卡死等)。对标并扩展业界 benchmark:OSWorld、WebArena / VisualWebArena、AndroidWorld、ScreenSpot-Pro等,并维护内部私有测试集防污染。
- 针对短板设计操作轨迹合成、环境(沙箱 OS / 浏览器 / 移动端 / 专业软件)合成、拒绝采样等方案,产出高质量训练数据。
- 主导 SFT / RL 训练消化数据,用评测复测验证短板是否被优化,推动闭环持续迭代。
任职要求
- 硕士及以上,计算机 / AI 相关专业;3 年以上大模型相关研发经验,或具备高质量论文 / 开源成果(不唯年限,重在深度)。
- 熟悉 Agent 训练、工具调用(tool use / function calling)、多模态(尤其视觉 - GUI 理解与 grounding),了解强化学习与奖励建模。
- 熟悉主流 Computer-Use / GUI Agent benchmark(OSWorld、WebArena / VisualWebArena、AndroidWorld、ScreenSpot-Pro 等)及其执行式评测方法与局限。
- 熟悉浏览器自动化(Playwright / Selenium)、虚拟化 / 容器化环境(Docker、虚拟机、Android 模拟器等),能支撑真实环境的评测与合成。
- 扎实的 Python / PyTorch 工程能力,熟悉分布式训练与大规模可复现实验管线。
- 能独立定义评测方案、拆解短板并推动"评测—数据—训练"闭环落地,具备跨团队协作与技术引领能力。
加分项
- 有 GUI / Computer-Use Agent 的评测、数据合成或训练闭环经验;参与过相关 benchmark 建设;相关顶会论文或有影响力的开源项目。
岗位标签
NEW