数据技术及产品部-大模型RL Data工程师-Computer Use(桌面 + 浏览器)
Company Alibaba
Focus Tech · Algorithm
Location 杭州
Published September 22, 2026
岗位职责
主导大模型「计算机操作」(Computer Use)方向的数据体系建设,覆盖数据生产、模型评测与质量管控全链路,定义模型对浏览器与桌面原生软件界面的感知、理解与多步自主执行的能力边界,构建高质量训练与评测数据集。具体包括:
- 能力体系与标准制定:从 0 到 1 搭建 Computer Use 数据体系,完成能力维度拆解(界面感知与视觉定位、控件识别与操作、多步任务执行、错误恢复、长程规划)、任务难度分级、标注规范与评分标准制定,制定 rubric 与金标准;覆盖有 DOM/accessibility tree 的结构化场景,以及无结构信息、需纯截图视觉 grounding 的原生应用场景。
- 数据生产与标注:设计并产出高质量操作数据——组织多模态标注(截图、界面元素、操作轨迹、坐标级动作)、专家示范与金标准,覆盖浏览器任务(网页浏览、信息检索、表单填写)与桌面专业软件操作(办公文档/表格处理、CAD 绘图、Blender/3D 建模、图像与视频编辑、IDE 与终端命令、跨应用与 OS 级工作流),将真实使用经验转化为可用于 SFT、偏好与强化学习训练的数据。
- 模型评测建设:构建贴近真实工作流的评测任务与端到端 Agentic 评测方案,涵盖视觉界面理解、工具调用与编排、多轮交互、长程规划、异常恢复与安全边界判断;针对桌面软件任务设计基于结果态的验证机制(导出文件校验、几何/渲染检查、脚本回读状态等),解决「操作对不对」难以自动判分的问题,推动任务从「单步指令」向「复杂真实场景」演进。
- 质量管控与质检:建立任务查重与污染检测、难度标定校准、双标注一致性校验、资深抽检与一致性审核机制;对 bad case 做根因分析(数据 / rubric / verifier / 实例)并回流数据生产与评测标准,保证结果可信、可复现。
- 数据基础设施共建:与工程团队共建支撑大规模自动化标注与评测的基础设施(含桌面/容器化操作环境、数据管线、评测框架)。
- 行业跟踪与跨团队协同:持续关注浏览器操作、桌面自动化、专业软件 Agent 等 GUI Agent 方向动态;将评测洞察转化为模型改进方向(感知准确率、视觉定位精度、操作可靠性、安全性),并与研究、工程团队协作落地。
任职要求
- 对大模型计算机操作、GUI 界面理解方向有深入判断,能将真实计算机使用任务(含桌面专业软件)转化为可标注、可评测的数据。
- 具备人机交互、软件评测、UI/UX、计算机视觉或多模态大模型相关背景,或有 Agent 产品实测经验;熟悉至少一类专业桌面软件(CAD、Blender/Maya、Adobe 系列、Office、IDE 等)的实际操作者优先。
- 熟练掌握 Python,具备数据处理、统计分析与可视化能力;了解主流大模型推理服务,以及浏览器自动化(Playwright、Puppeteer)与桌面/坐标级自动化(如 pyautogui、操作系统级自动化、Computer Use API)、界面视觉 grounding(截图理解、OCR、UI 元素检测)的调用方式与工程约束。
- 了解 Agent 核心机制(ReAct、Tool Use、Planning、多步推理与反思),对计算机操作类 Agent 的能力边界(感知与视觉定位误差累积、长程任务失败模式、跨应用状态管理、安全风险)有认知或实践。
- 有 GUI Agent 开发经验者优先(界面元素解析、操作策略训练、自动化环境搭建、Agent 评测框架开发,尤其是原生桌面应用方向)。
- 优秀的技术写作与沟通能力,能向研究与工程团队清晰传达评测思路,并产出高质量的标注规范、评测方案与分析报告。
岗位标签
NEW