不想写代码也想自动化?试试这款免费开源RPA工具,让浏览器自己干活

不想写代码也想自动化?试试这款免费开源RPA工具,让浏览器自己干活

不想写代码也想自动化?试试这款免费开源RPA工具,让浏览器自己干活

【免费下载链接】RPAUi.Vision Open-Source RPA Software with Computer Vision, OCR, Anthropic Computer Use/LLM. Selenium IDE import/export.项目地址: https://gitcode.com/gh_mirrors/rp/RPA

周一早晨的闹钟还没响,你就开始焦虑:又要打开后台系统、登录账号、把表格里的数据一条条粘进网页、核对结果、截图存档……一上午就这么报销了。如果有个"数字员工"能替你盯着屏幕、点按钮、填表单、认文字,甚至在你午休时批量跑完这些活,你会不会想立刻把它领回家?UI.Vision RPA 就是这样一个免费开源RPA工具:装进 Chrome、Edge 或 Firefox 浏览器,录一遍操作,之后它就能自己干。而且它不止会"按坐标点鼠标",还自带一双眼睛——视觉识别、OCR 文字识别,甚至能调用 AI 大模型来理解页面。这篇入门指南,我带你从零把它用起来。

第一个灵魂拷问:脚本为什么总是"说瞎话"?

用过传统自动化的人大多踩过同一个坑:脚本刚录好时一切正常,过两周网站改版,按钮挪了个位置,脚本立刻失灵——因为旧脚本靠的是 CSS 选择器和 XPath 这类"元素地址",页面结构一变,地址就作废了。改一次还好,三天两头改,维护脚本的时间比手动干活还长,自动化反而成了负担。

UI.Vision 的解法很朴素:与其死记"地址",不如让机器学会"认东西"。它内置了一套图像搜索引擎,你把目标元素的截图存成模板,它就像人眼在屏幕上扫一样去匹配;万一元素没有固定外观,OCR 还能把按钮上的文字读出来,靠文字锁定位置;再不行,把整块区域交给大模型,让它自己理解"那个蓝色 Accept 按钮到底在哪"。三种手段层层递进,这也是它敢叫"视觉自动化"的底气。

它的独门绝技:用"眼睛"代替"坐标"找元素

你可能会问:视觉识别听起来很玄,实际用起来稳吗?来看一个真实的自动化测试场景,下图是一个在线课程编辑后台,左侧是章节树,中间是内容编辑区,右侧是各类媒体组件:

如上图所示,这种动态页面最考验自动化工具的功力:菜单要展开、按钮要按顺序点、表单要填对。UI.Vision 用图像模板匹配时,会返回目标在屏幕上的精确位置,然后照常执行点击、输入、拖拽等动作。因为找的是"这张图长什么样",而不是"这个元素在哪个坐标",所以页面再怎么改版,只要按钮长得差不多,脚本就能继续用。

更有意思的是,它连搜索范围都能自定义。比如桌面应用里按钮很多、容易误匹配,你可以先用visionLimitSearchArea命令框出一块固定区域,只在这一亩三分地里找目标,又快又准:

上图就是搜索区域配置界面:绿色框里指定了要找的模板图和查找命令,找到之后的结果会输出到右侧的变量、日志面板,方便你调试。这套能力让 UI.Vision 不止能操作网页,连桌面软件也能一并自动化,跨系统的活儿它都接得住。

30 分钟跑通第一个自动化流程:录一遍,剩下交给它

理论说再多,不如动手跑一个。你的第一个实验可以从"登录某网站 + 抓取一行数据"开始,全程不需要写代码:

  1. 点开录制:点击浏览器工具栏上的 UI.Vision 图标,选择"录制新宏",它会开始记录你的一举一动。
  2. 正常操作一遍:打开目标网址、输入账号密码、点登录、把需要的数据复制出来。录制器会自动把这些动作翻译成一条条命令。
  3. 保存并回放:停止录制、保存宏,然后点"播放"。看着浏览器自己把刚才的动作重演一遍,那种"我居然能指挥浏览器"的感觉,第一次体验相当上瘾。

录制生成的是一张"命令表",每一行就是一条指令,结构长这样:

open | https://example.com/login type | id=username | admin type | id=password | 123456 click | id=submit verifyText | css=h1.title | 欢迎回来

每一列分别是"命令 / 目标 / 参数",意思直白得像个待办清单:打开网址、在用户框输入、在密码框输入、点提交、验证标题文字。想改哪里就改哪一行,比记一堆 API 友好多了。

💡小贴士:定位元素时优先用id=name=,其次是css=。自动生成的随机 id(比如ember123)每次刷新都变,千万别用,这是脚本"翻车"的头号原因。

从"能跑"到"会算":给脚本加上脑子

录制的宏只会"顺序执行",但真实世界的流程充满变数和循环。这时候就要给脚本加逻辑了,UI.Vision 的命令表原生支持if / while / times / forEach这些控制结构,写法非常接近自然语言:

store | 0 | counter while | ${counter} < 10 click | id=next_page pause | 1000 storeEval | ${counter} + 1 | counter end

如果觉得表格写起来不过瘾,它还提供了一整套uiv.*JavaScript API。用代码写自动化,直接访问页面元素、视觉模板和 OCR 结果,出错时会抛出真正的异常,能用try/catch兜底:

const buy = uiv.findImage('buy.png'); if (buy) uiv.browser.click(buy); // 看到"购买"按钮就点 const note = uiv.ocr.findText('库存不足'); // 用 OCR 读页面文字

比如上面这段:截图里有"购买"按钮就点它,再用 OCR 检查页面是不是提示"库存不足"。视觉识别、文字识别、页面操作在同一个脚本里自由组合,这种混搭能力在别的工具里可不多见。完整的命令映射可以参考仓库里的 uiv-commands.md,经典命令和 JS 写法一一对应。

进阶玩法:让 AI 大模型亲自下场操作

如果说视觉识别是"眼睛",那 AI 就是"大脑"。UI.Vision 把大模型接进了自动化流程,最直观的一条命令是aiComputerUse——你直接用一句话描述任务,AI 会看着屏幕截图自己决定点哪里、输什么:

aiComputerUse | 把购物车里的第一件商品结算,支付方式选微信 | result

这句指令的含义是:让 AI 操作浏览器完成下单流程,并把最终结果写进变量result。你不用精确告诉它按钮在哪,它自己会"看屏幕、做决策、动手点"。项目里还预置了 AI 玩井字棋、AI 填写表单等示例宏,装在扩展里就能直接跑,仓库源码中也能找到这些演示:src/config/preinstall_macros.js

更贴心的是侧边栏里的 AI 助手:你可以直接打字"帮我写一个宏,登录某网站并下载报表",它会把宏写好、放进编辑器、跑一遍、读日志、发现问题再改,全程你只需在旁边看戏。如果你在用 Claude Code 这类 AI 编程工具,还能通过 MCP 桥接让它们直接驱动浏览器里的 UI.Vision,搭建方法写在 mcp/README.md,一条npx uivision-mcp-bridge --setup就能完成配对。🤖

无人值守的秘密:命令行跑宏,一次管一批

自动化做到最后,追求的是"我不用在场"。UI.Vision 提供了命令行启动方式:通过一个本地 HTML 页面把宏塞给浏览器执行,跑完把日志写进文件。仓库的 command-line/ 目录里就准备了 Python、Node.js、VBS 和批处理脚本,例如用 Python 调用:

PlayAndWait('Demo/Core/DemoAutofill', path_downloaddir=r'C:\test\', path_autorun_html=r'c:\test\ui.vision.html', browser_path=r'C:\Program Files\Google\Chrome\Application\chrome.exe')

意思很简单:用指定浏览器跑某个宏,等它结束并读取状态。配上 Windows 任务计划程序,你就能让自动化脚本每天定时开工,比如凌晨自动汇总报表、上班前自动抓取行情数据。批量场景下还能配合 CSV 文件做"数据驱动":宏读一行数据、执行一轮、再读下一行,几百条记录一条条处理,这正是财务、客服、运营日常最需要的"重复劳动终结者"。

开源的底气:改不动就拆开看,缺功能就自己装

很多工具用着用着会碰到"想要的功能没有"的尴尬,UI.Vision 的答案是:代码全开放,扩展也开放。整个项目基于 AGPL-3.0 开源协议,个人和商用都免费,源码就在仓库里,界面、命令引擎、视觉服务都能找到对应模块,比如自动化命令定义在 src/actions/,视觉与 OCR 服务在 src/services/。

想扩展能力也很简单,它有一套 XModule 扩展模块机制。下图是安装原生文件访问模块时,需要把扩展 ID 填进四个 JSON 配置文件、再运行批处理脚本完成注册的流程:

![开源RPA工具扩展模块XModule的JSON配置安装示意图](https://raw.gitcode.com/gh_mirrors/rp/RPA/raw/06e44ecb5c1b72906789c2e1985ef7f3f611710e/xmodule install new ID in 4 json files.png?utm_source=gitcode_repo_files)

如上图所示,这套机制让"增强功能"变成了一件可配置的事:装完模块,自动化脚本就能读写本地文件、接管系统级输入,自动化边界一下子从网页扩到了整个操作系统。想自己改代码的开发者,也可以git clone https://gitcode.com/gh_mirrors/rp/RPA拉下源码,跑npm install && npm run build构建出属于自己的扩展版本。

最后一步:今天就做一个最小实验

说了这么多,其实你只需要一个下午就能上手。别一上来就想自动化整个业务流程,先从最小的实验开始:选一个你每周都会重复三次以上的操作,比如"登录某后台导出日报",用录制功能跑通第一版,再慢慢给它加变量、加判断、加 AI。

记住,自动化的意义不是炫技,而是把最无聊的那部分工作交给机器,让你把精力留给真正需要判断力的事。从今天这一个小小的宏开始,你会发现自己能省下的时间,远比想象中多。🎯

【免费下载链接】RPAUi.Vision Open-Source RPA Software with Computer Vision, OCR, Anthropic Computer Use/LLM. Selenium IDE import/export.项目地址: https://gitcode.com/gh_mirrors/rp/RPA

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考