UI-TARS 本地部署:从零跑通会自己点鼠标的 GUI Agent 📅 发布时间:2026/9/15 14:21:04 👁 浏览次数: UI-TARS 本地部署从零跑通会自己点鼠标的 GUI Agent【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS把截图丢给 UI-TARS它会替你点击、打字是一个能完成桌面系统、浏览器、手机任务的 GUI 智能体模型。这篇 UI-TARS 部署教程带你走三条路本地直接玩、云端起 API 服务、把模型输出变成可执行的鼠标键盘操作。先自检硬件选你的档位档位推荐配置占用 / 要求云端完整版单卡 48GBL40S7B 模型 64K 上下文官方推荐L4 / A100 也可云端经济版单卡 24GB 以上7B 模型把最大输入长度降到 16K–32K本地个人版普通 PC 即可用 UI-TARS-desktop 在自己机器上跑无需手动部署模型一句话有 48GB 显卡直接上云端完整版没有就选经济版或本地个人版别硬扛。三种跑法按你的场景挑本地直接跑UI-TARS-desktop 个人设备版只想体验、不碰服务器就用仓库附带的桌面版它直接在个人设备上运行git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS装好仓库里的 UI-TARS-desktop 后启动即可Windows / macOS 通用不用自己部署模型。如果你的目标只是网页自动化也可以关注浏览器自动化项目 Midscene它把 UI-TARS 的能力包了进去。起云端 API 服务HuggingFace Endpoint 一键部署想用自己的代码调它官方推荐在 HuggingFace Inference Endpoints 上拉起推理服务。关键配置见 README_deploy.md硬件选GPU L40S 1GPU 48G容器配置Max Input Length 65536、Max Batch Prefill Tokens 65536、Max Number of Tokens 65537环境变量CUDA_GRAPHS0避免部署失败、PAYLOAD_LIMIT8000000大图请求不被拦服务起来后把容器镜像更新为 TGI 3.2.1点 Update 生效拿到地址后用 OpenAI SDK 直接调仓库自带现成的对话样本data/test_messages.jsonfrom openai import OpenAI import json client OpenAI(base_url你的Endpoint地址, api_key你的Key) messages json.load(open(data/test_messages.json)) resp client.chat.completions.create( modeltgi, messagesmessages, temperature0.0, max_tokens400, streamFalse ) print(resp.choices[0].message.content)正常返回长这样Thought: 我看到 Preferences 窗口已经打开……点击 Color Management 看看里面的选项。 Action: click(start_box(177,549))低配跑法Grounding 轻量模板只要模型指出位置而不跑完整任务比如评测定位精度把 prompt 换成GROUNDING模板即可只输出Action、不输出Thoughttoken 和时延都明显下降。三套模板都在 codes/ui_tars/prompt.py 里COMPUTER_USE管桌面、MOBILE_USE管手机、GROUNDING管轻量定位按目标平台挑。把 Thought Action 变成真点击模型吐出来的是文本还得解析成可执行代码。ui-tars包干的就是这件事顺带处理坐标缩放pip install ui-tarsfrom ui_tars.action_parser import parse_action_to_structure_output, parsing_response_to_pyautogui_code text Thought: 点击按钮\nAction: click(start_box(100,200)) parsed parse_action_to_structure_output( text, factor1000, origin_resized_height1080, origin_resized_width1920, model_typeqwen25vl) print(parsing_response_to_pyautogui_code(parsed, 1080, 1920))输出是可执行的pyautogui.click(191.67, 107.67, buttonleft)片段。一个坑Qwen2.5-VL 系模型输出的是缩放后图片空间里的绝对坐标必须把原图宽高传回解析器换算回真实屏幕坐标否则点击位置会漂。坐标换算的完整推导看 README_coordinates.md。生成参数速查官方示例值偏保守temperature0.0GUI 任务讲究点对了就是对了低随机性是好事场景temperaturetop_pmax_tokens说明GUI 动作输出官方默认0.0不设置400输出稳定起步就用这组长多轮任务0.0不设置512–1000Thought 变长抬上限防截断Grounding 评测0.0不设置128只出 Action压低省 token 翻车急救包Endpoint 部署起不来现象服务构建报错部署中反复崩溃 原因TGI 的 CUDA Graph 编译在部分 GPU 组合上失败已知问题 解法环境变量加CUDA_GRAPHS0重新部署大截图请求直接失败现象传大图报请求体过大 / 413 原因服务默认请求体上限偏小装不下 base64 大图 解法环境变量加PAYLOAD_LIMIT8000000点击位置偏移现象模型说要点按钮实际点到了别处 原因模型输出的是缩放后的绝对坐标没换算回原图分辨率 解法origin_resized_width/height传真实截图宽高model_typeqwen25vlAction cant parse 异常现象解析器抛Action cant parse原因模型输出格式坏了不是标准的Action: click(...)形式 解法确认 prompt 模板选对桌面 / 手机 / grounding别手改 Action Space 段落最后说两句服务起起来、动作解析掉、坐标对齐好这套组合拳打完就能让 GUI Agent 真正动手了。再遇到问题先翻 README.md 和 codes/README.md仓库里的 OSWorld 推理脚本也能帮你复现官方结果。【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考