数据技术及产品部-大模型评测算法-CUA方向

Company Alibaba

Focus Tech · Algorithm

Location 北京, 杭州

Published September 16, 2026

岗位职责

岗位描述:面向"电脑操作智能体"(自主操作 GUI、浏览器、桌面 / 移动端软件完成任务的大模型 Agent),独立负责其能力提升的完整闭环。

岗位职责

  1. 设计 CUA 评测任务与轨迹级评分体系(GUI grounding、任务规划、多步操作、长程任务成功率等),定位模型失败模式(误点击、幻觉操作、状态误判、循环卡死等)。对标并扩展业界 benchmark:OSWorld、WebArena / VisualWebArena、AndroidWorld、ScreenSpot-Pro等,并维护内部私有测试集防污染。
  2. 针对短板设计操作轨迹合成、环境(沙箱 OS / 浏览器 / 移动端 / 专业软件)合成、拒绝采样等方案,产出高质量训练数据。
  3. 主导 SFT / RL 训练消化数据,用评测复测验证短板是否被优化,推动闭环持续迭代。

任职要求

  1. 硕士及以上,计算机 / AI 相关专业;3 年以上大模型相关研发经验,或具备高质量论文 / 开源成果(不唯年限,重在深度)。
  2. 熟悉 Agent 训练、工具调用(tool use / function calling)、多模态(尤其视觉 - GUI 理解与 grounding),了解强化学习与奖励建模。
  3. 熟悉主流 Computer-Use / GUI Agent benchmark(OSWorld、WebArena / VisualWebArena、AndroidWorld、ScreenSpot-Pro 等)及其执行式评测方法与局限。
  4. 熟悉浏览器自动化(Playwright / Selenium)、虚拟化 / 容器化环境(Docker、虚拟机、Android 模拟器等),能支撑真实环境的评测与合成。
  5. 扎实的 Python / PyTorch 工程能力,熟悉分布式训练与大规模可复现实验管线。
  6. 能独立定义评测方案、拆解短板并推动"评测—数据—训练"闭环落地,具备跨团队协作与技术引领能力。

加分项

  1. 有 GUI / Computer-Use Agent 的评测、数据合成或训练闭环经验;参与过相关 benchmark 建设;相关顶会论文或有影响力的开源项目。

岗位标签

NEW