返回 AI 情报
产品精选 612026-09-07 00:00Berkeley RDI:Blog(AI 安全与评测)

Berkeley RDI 发布开源平台 CUA-Lite,面向计算机使用智能体

CUA-Lite: An Open Platform for Computer-Use Agents

精选理由

原文说明了平台的三项标准化抽象及覆盖规模,读者可以据此评估它在整合分散的计算机使用智能体资源上的可用性。

AI 摘要

Berkeley RDI 推出开源平台 CUA-Lite,为计算机使用智能体提供三个标准化抽象。其环境接口下运行 15+ 个覆盖桌面、浏览器和移动端的基准,并提供含 30k+ 可验证任务的免 VM 桌面沙箱;统一监督数据格式已转换 10+ 个公开 CUA 数据集;每模型一个 harness 在评测、SFT 和 RL 间共享,支持 14 个模型族。

正文 · AI 翻译

推出 CUA-Lite:一个用于开发计算机操作智能体的开放平台。 它围绕三个标准化抽象构建——Lite.Gym 用于环境,Lite.Sample 用于监督数据,以及每个模型在评测、SFT 和 RL 中共用的一套 harness。15+ 个基准、10+ 个数据集和 30k+ 个可验证任务 已接入其中。

代码 ↗ · 项目官网 ↗

为什么选择 CUA-Lite

计算机操作智能体操作桌面、浏览器和移动应用,开发这样的智能体需要带有可验证任务的环境、监督数据和模型,以及让模型在环境中运行的 harness。这三方面都已存在开源成果,但它们仍然彼此割裂:每个环境都有自己的接口和运行时;每个监督数据集都有自己的格式;每个模型都有自己的动作空间、提示词格式和 rollout 代码。

没有统一标准,将模型连接到环境就意味着重写同样的代码:动作映射、上下文窗口和 rollout 循环——因此资源无法汇集和扩展,评测、SFT 和 RL 也无法共享同一套基础设施。

数据集 Mind2Web GUIOdyssey 基准 OSWorld WebArena

智能体 GPT Claude Qwen Gemini

CUA-Lite 一举补齐了这三项短板,而且全部集中在一个地方:

Lite.Gym,统一的环境接口——涵盖 15+ 个评测基准,外加可选的免虚拟机桌面沙箱,内置 30k+ 个可验证的训练任务。

Lite.Sample,统一的监督数据格式——涵盖 10+ 个数据集与最新 rollout 数据,可在 Hugging Face 上免费获取。

模型适配框架在评测、SFT 与 RL 之间共享——每个模型对应一套框架,已为 14 个模型家族完成实现。

Lite.Gym:统一的环境接口

任何智能体都能通过同一个接口接入任何环境。 lite.gym 将环境封装为 Gym 风格的 reset / step / close 循环。该循环在各类环境间统一了一种观察格式——每次工具调用对应一张截图、一段文本,或两者兼有——并为每个平台统一了一种 GUI 动作空间,以工具调用的形式发出:桌面端与浏览器端使用 click 和 type,移动端使用 tap 和 swipe,此外每个环境还配有额外工具,例如我们桌面沙箱中的 bash。它封装了环境自身的运行时:虚拟机、浏览器或移动端模拟器。

环境 OSWorld · 桌面端 WebArena · 浏览器 AndroidWorld · 移动端 WebGym · 浏览器 你的下一个

lite.gym

智能体 GPT Claude Qwen Gemini 你的下一个

CUA-Lite 还提供可选、轻量级、无需 VM 的自带桌面沙箱: 即 Docker 容器,能以低得多的成本复现 OSWorld 的桌面环境,并承载 3 万多个可验证任务用于训练。它们不需要基于硬件虚拟化的 VM 基准测试所必需的 /dev/kvm,因此可在任何装有 Docker 的主机上运行——而 Lite.OSWorld(我们的方案)能原样运行 OSWorld 自身的任务和评估器,无需任何改动。

媒体内容 · 前往原文查看

OSWorld

Ubuntu.qcow2

QEMU · KVM

/dev/kvm

封装在 VM 中的桌面——每个任务都会启动 QEMU/KVM。

超越 OSWorld:可扩展的训练沙箱

免虚拟机容器不只用于 OSWorld——它是 CUA-Lite 沙箱家族的基石。 同一套基础已经能运行浏览器任务、桌面任务,以及真实的科学桌面:GMAT 操控航天器、PyMOL 翻转蛋白质。

媒体内容 · 前往原文查看

循环式 rollout 轨迹——点击一个磁贴即可查看完整 rollout。

诚邀沙箱贡献者。 沙箱只有在有人运行时才有意义。把你的沙箱加入 CUA-Lite,每一个智能体都会在它上面训练和评测——现在如此,将来亦然。一次集成,整个领域都能在此基础上构建。

Lite.* 环境 ↗ · 环境指南 ↗ · 排行榜 ↓

Lite.Sample:统一的监督数据格式

数据集只需转换一次,每个智能体都能在它上面训练。 LiteSample 是统一的 schema,在所有环境、智能体和任务类型间共享,在 Hugging Face 上免费开放。

无论数据来自何处,都统一为一种形态:消息中的工具调用即界面的动作,工具结果即其观测——从 GUI grounding 标签到完整的 rollout 皆如此。

数据集 Mind2Web · 浏览器 GUIOdyssey · 移动端 ScaleCUA · 全部 OpenCUA · 桌面端 你的

LiteSample{ }

智能体 Qwen UI-TARS MAI-UI Fara 你的

CUA-Lite 为每个模型提供一个 adapter,将统一的 LiteSample 打包成每个模型所需的确切训练格式。 上图展示了其中一个示例,并附带了用于构建你自己的适配器的基本组件。

Hugging Face 上已有 10 多个数据集:现有的 CUA 语料库 —— 基础定位 · 理解 · 使用 —— 已预处理为 Lite.Sample 格式,此外还有来自前沿 CUA 的最新 rollout 数据。浏览 语料库 和 rollout 数据;下方展示了其中之一,WebGym:

huggingface.co/datasets/cua-lite/ 打开 ↗

诚邀数据贡献者。 数据只有在模型能够基于其训练时才具有价值。将你的数据分享给 CUA-Lite,每个智能体都能基于它进行训练 —— 甚至包括尚不存在的模型。一次转换,整个社区都能基于它进行训练。

预处理指南 ↗ · 智能体框架 ↗ · SFT 指南 ↗

模型框架:在评测、SFT 与 RL 中共享

每个模型都有一个框架,即将其适配到接口和格式的代码。 通过该框架,模型可以在所有集成的环境中运行,评测和 RL 会消费它产生的 rollout;使用同一个框架,任何存储的 LiteSample 都会被渲染成模型自身的训练格式用于 SFT —— 这里以 Qwen3.5 为例:

步骤 1 指令 · 图片1动作1

步骤 2 指令 · 图片1动作1图片2动作2

步骤 3 指令 · 图片1动作1图片2动作2图片3动作3

第 4 步 指令 · 图片1动作1图片2动作2图片3动作3图片4动作4 1 次前向 · 损失 ×4

第 5 步 历史 ×4图片5动作5

第 6 步 历史 ×4图片5动作5图片6动作6 1 次前向 · 损失 ×2

评测:任意智能体,任意基准

为智能体设置 --model-id,为基准设置 --env-id:

evaluate.sh

python scripts/rollout.py

--model-id

--env-id

--splits

eval

--config-path

scripts/configs//default/.yaml

已集成 15+ 个基准测试 —— 我们自研的是免虚拟机运行时、接口与集成方式,而非任务集本身 —— 免虚拟机桌面沙箱是新增能力,而非替代方案:原版 OSWorld 虚拟机与 Lite.OSWorld 并列存在,移动端基准测试仍需要虚拟机或模拟器:

OSWorld-G:桌面 UI 定位 ScreenSpot-Pro:高分辨率专业应用

OSWorld:真实 Ubuntu 桌面应用 Lite.OSWorld:轻量级 OSWorld 任务 OSWorld-2:能力分级 · 部分得分 CUABench:计算机使用 · KiCad · 工作流

WebGym网页导航 WebVoyager真实生产环境网站 Online-Mind2Web300 项实时网页任务 MiniWoB微型网页交互 WebArena自托管商城 · 论坛 · GitLab VisualWebArena视觉网页任务

AndroidWorld真实 Android 应用 AndroidLab9 款离线 Android 应用 MobileWorld161 项移动端任务 MobileGym移动端导航

排行榜

OSWorld

README ↗

SFT 与 RL,支持任意开源智能体

在 CUA-Lite 的数据集上进行 SFT,然后在其环境中强化训练——GRPO 及更进一步的算法,基于 Slime 训练器。可在任意数据与任意环境中训练任意开源智能体:

Lite.Sample,针对每个模型进行适配——选择一个数据集和一个学生模型:

数据集:

模型:

run_sft.sh

# --- 主机 ---

# 1 · 下载语料库

python -m lite.data.hf.download

--out

.data/hf/cua-lite/

# 2 · 导出可直接用于模型训练的 SFT parquet 文件

python -m lite.train.export.export_sft

--model-id

--config

scripts/configs//recipes/sft/default.yaml

--data-paths

.data/hf/cua-lite/

--image-root

.data/hf

-o

.data/sft//.parquet

# --- Slime 容器(参见 docs/slime.md)---

# 3 · 监督微调

MODEL_ID=

PROMPT_DATA=

.data/sft//.parquet

bash scripts/train/run_sft.sh

在环境中评分的 Rollout 结果驱动 GRPO 更新——选择一个模型和环境:

run_grpo.sh

MODEL_ID=

ENV_ID=

CONFIG_PATH=

scripts/configs//default/.yaml

bash scripts/train/run_grpo.sh

带上一个数据集、一个环境或一个智能体——每一个都能产生叠加效应。 或者直接告诉我们缺什么——GitHub · Hugging Face · 邮箱。

原文

Original Title

CUA-Lite: An Open Platform for Computer-Use Agents

Source

Berkeley RDI:Blog(AI 安全与评测)

Site

rdi.berkeley.edu

Published

2026-09-07 00:00

阅读原文· rdi.berkeley.edu

继续阅读