Cua-Bench 任务体检:oracle 验证、评估器检查与手动演练

Cua-Bench 任务体检:oracle 验证、评估器检查与手动演练 Cua-Bench 任务体检oracle 验证、评估器检查与手动演练【免费下载链接】cuaScale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation.项目地址: https://gitcode.com/GitHub_Trending/cua/cua拿到一个现成的任务目录后在交给 agent 跑分或编入数据集之前你要先做两件事用任务自带的 oracle参考解跑一遍评估器确认参考答案确实能拿到成功奖励再不带 oracle 做一次手动演练确认环境和交互路径真的可用。整个过程只需要cb命令行工具和一个本地任务目录不需要改动任务里的任何文件。跑之前环境自检与最小依赖清单最小依赖只有两项Python 3.12 或 3.13以及包管理器 uv。安装 CLI 和模拟任务用到的浏览器支持uv tool install cua-bench[browser] uv tool run --from cua-bench[browser] playwright install chromium先确认 CLI 可用是因为后面每一步都依赖它。执行下面命令输出中应能看到run、interact、task、trace、dataset等命令组cb --help任务本体是一个包含main.py的本地目录main.py用装饰器声明 setup、solve、evaluate 等生命周期函数。仓库里自带了示例任务 example_tasks/basic_gui_env可直接拿来做演练它要展示的 HTML 放在同目录的gui/子目录里。后续命令中的task-path都指这个目录。静态核查不启动环境先看任务定义为什么先做静态检查因为发现生命周期函数缺失的成本在环境启动之前最低。加载任务定义cb task info task-path对照 run-a-task 指南 逐项核对provider环境提供方与操作系统类型是你预期的你要运行的 variant 确实存在setup和evaluate显示 check mark如果该任务应当包含参考解solve也应显示 check mark。variant 与生命周期函数的关系值得先弄懂cb.tasks_config返回一个cb.Task列表CLI 按零基索引选择每个 Task 携带自己的 description即 prompt、metadata 和 computer 配置而 setup / solve / evaluate 的具体逻辑是各 variant 共享的。同一组函数、不同的配置所以后面必须逐个 variant 验证。装饰器签名与字段含义见 任务定义参考。oracle 闭环怎么跑参考解验证评估器为什么这一步不能省评估器本身可能写错只有参考解能拿到成功奖励才说明评估逻辑是对的。对选定的 variant 运行 oracle评估完成后立即关闭环境cb interact task-path \ --variant-id 0 \ --oracle \ --no-wait执行时会弹出一个桌面窗口Cua-Bench 按 setup 准备状态、自动执行参考解、再调用 evaluate 检查最终状态。期望输出类似数值以你的任务奖励定义为准✓ Solution complete ✓ Evaluation result: [1.0] ✓ Task completed successfully!检查点是把报告的评估结果与任务定义的成功奖励值对比。oracle 未通过说明任务或环境本身有问题这是一个验证失败该结果不能作为 agent 的得分使用。手动演练不带参考解自己走一遍oracle 通过只说明参考解走得通你还需要确认人在可见环境里同样能完成任务。去掉--oracle再跑同一个 variantcb interact task-path --variant-id 0节奏是在任务窗口里手动把任务做完回到终端按 EnterCua-Bench 执行评估并关闭环境。两次用的是同一个评估器所以手动结果与 oracle 结果一致才说明交互路径和评估逻辑都按预期工作如果只对不上先回想操作顺序再怀疑评估器。多场景覆盖每个 variant 逐个验证只有一个 variant 的任务可以跳过本节。多个 variant 时每个 variant 复用同一组生命周期函数但 prompt、metadata 和 computer 配置各不相同必须单独验证只改索引即可cb interact task-path --variant-id variant --oracle --no-wait把variant替换为实际索引从 0 开始逐个跑。踩坑速查失败时去哪里查现象原因处理Playwright 报告缺少浏览器可执行文件当前环境没装 Chromiumuv tool run --from cua-bench[browser] playwright install chromiumcb task info中某个生命周期节点没有 check markmain.py中装饰器拼写或 split 不匹配回到main.py核对装饰器支持的签名见 任务定义参考评估分值与任务定义的成功奖励不一致reward 定义或判定条件写错检查 evaluate 函数里的奖励定义不要反复重跑 agent窗口打开但页面空白setup 引用的资源路径不对确认任务目录结构完整资源随task-path一起存在交付验收清单什么时候能交给 agentcb task info中 setup、evaluate含应有 oracle 时的 solve全部显示 check mark每个 variant 的 oracle 运行报告的评估结果与任务定义的成功奖励一致手动演练能走通操作 → 回车 → 评估并关闭的完整闭环运行结束后没有残留桌面窗口或进程。以上条件全部满足这个任务就可以放心交给 agent 跑分或编入数据集。【免费下载链接】cuaScale computer-use 2.0 with open-source drivers, cross-OS fleets, and benchmarks for training, evaluation, and data generation.项目地址: https://gitcode.com/GitHub_Trending/cua/cua创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考