UI-TARS:把截图变成鼠标键盘操作的 7B 开源 GUI 自动化智能体
UI-TARS把截图变成鼠标键盘操作的 7B 开源 GUI 自动化智能体【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS打开文档、输入内容、保存这样一条流程人工手动跑一遍要半小时UI-TARS 几分钟内就能自动完成。UI-TARS 是一款 7B 量级的开源 GUI 多模态智能体输入一张屏幕截图它推理后直接输出可执行的鼠标键盘操作。适合想搭建 GUI 自动化操作或 UI 回归测试的同学读完本文可以从零跑到第一次出结果。 场景上线前的回归测试日回归测试日的日程很固定多分辨率、多设备把核心流程逐条跑一遍。脚本脆按 1080p 单一屏幕写好的自动化脚本换一套主题或分辨率元素坐标就漂移大量用例要人工重写。覆盖与时间的矛盾分辨率 × 设备 × 系统版本的组合按指数增长有限的发版窗口里没法穷举跑完。失败定位慢用例挂掉后要逐帧回看录屏才能确认问题发生在哪一屏操作记录缺乏结构复现成本高。UI-TARS 改变的是用例的表示方式模型每一轮自己看当前截图、决定下一步动作脚本退化成一自然语言的指令坐标不再由人维护。 它是怎么工作的从截图到真实点击的三段路UI-TARS-1.5 建立在视觉语言模型之上整体循环就是观察—推理—行动—再观察和人操作电脑的方式一致。UI-TARS GUI 智能体架构上方是与环境交互的观察—行动闭环下方是感知、行动、推理、经验学习四个能力模块读屏元素感知与定位类比新人上岗的第一课是认门——菜单在哪、按钮在哪不用问人。原理UI-TARS 把截图作为输入直接在界面里输出可交互元素的位置基准覆盖通用 UI 与专业软件 UI 两类场景。效果GUI 自动化测试不再依赖人工维护元素坐标表定位这一步由模型自己完成密集控件、小字号界面的可用性取决于定位精度具体分数见后文表格。先想后动推理放在操作之前类比熟练的 QA 不会盲点动手前会先说半句——我点提交接下来应该出现成功提示。原理输出被固定为 Thought Action 两段式Thought 里写计划与预期codes/ui_tars/prompt.py 中的 COMPUTER_USE、MOBILE_USE、GROUNDING 三套官方模板都按此格式设计。推理能力来自强化学习训练属于推理时扩展。效果Minecraft 200 任务平均成功率带 Thought 为 0.42、不带为 0.35推理直接折算成任务完成度。转译员坐标换算与代码生成类比模型说的是压缩图里的坐标操作系统听的是真实屏幕的坐标中间必须有一道翻译。原理为了控制视觉 token 数截图会先被 smart_resize 到 28 的倍数且落在像素区间下界 100×28×28上界 16384×28×28内响应回来后codes/ui_tars/action_parser.py 用 parse_action_to_structure_output 把坐标映射回原始分辨率——注意 qwen2vl 系是相对坐标、qwen25vl 系是绝对坐标model_type 参数要填对随后 parsing_response_to_pyautogui_code 把动作转成可直接执行的 pyautogui 代码。效果1920×1080 或任意分辨率都能复用同一条解析链路且整条链路可以离线用单测验证。UI-TARS 坐标可视化红点标出模型在原始截图中定位到的 GUI 元素位置 效果验证基准上能打到多少分数字取自官方 Performance 一节对照对象是 OpenAI CUA、Claude 3.7 两代通用智能体模型与各自当时的前 SOTA。任务类型基准UI-TARS-1.5OpenAI CUAClaude 3.7前 SOTA计算机操作OSWorld100 步42.536.42838.1200 步计算机操作Windows Agent Arena50 步42.1——29.8手机操作AndroidWorld64.2——59.5浏览器操作Online-Mind2Web75.87162.971元素定位ScreenSpot-V294.287.987.691.6元素定位ScreenSpotPro61.623.427.743.6游戏自动化侧Poki 平台 14 款网页游戏的平均表现如下Poki 网页游戏14 款UI-TARS-1.5OpenAI CUAClaude 3.7平均通过率可解 13 款均 100%约 40.0%约 24.5%cubinko 一款对三家模型均不可解未拉高任何一方均值。UI-TARS GUI 智能体相对前 SOTA 的多基准提升幅度以及 UI-TARS-72B / 7B 与 GPT-4o、Claude 的雷达图对比数据来源仓库 README 的 Performance 一节。OSWorld、ScreenSpot 系列与 Minecraft 数据为 UI-TARS-1.5 报告模型成绩开源的 UI-TARS-1.5-7B 为 OSWorld 27.5、ScreenSpotPro 49.6。Poki 数据按 14 款网页游戏平均通过率计。 上手实践从零到第一次出结果最短路径先离线验证解析链路再部署在线推理服务。第一步获取代码并安装后处理包。ui-tars 包只含解析链路不含模型权重。这条命令克隆仓库并装包git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS cd UI-TARS pip install ui-tars第二步离线验证坐标解析链路。这条命令跑官方单测覆盖动作字符串解析→结构化输出→生成 pyautogui 代码三段python codes/tests/action_parser_test.py第三步部署推理服务。按 README_deploy.md 走 HuggingFace Inference Endpoints 部署 UI-TARS-1.5 7BGPU 实例官方推荐 L40S 48GL4、A100 亦可Max Input Length 设为 65536并加环境变量 CUDA_GRAPHS0 与 PAYLOAD_LIMIT8000000 防止大图请求失败。第四步跑一个样例任务。把仓库里的 data/test_messages.json 发给端点响应再交给 parse_action_to_structure_output 和 parsing_response_to_pyautogui_code 处理用法示例在 README.md 的 Quick Start 一节。⚖ 适用边界它擅长什么、会在哪里翻车先看清官方写明的限制再决定部署范围决策会更稳。适合桌面与浏览器 GUI 操作自动化、UI 回归测试、元素定位评测GROUNDING 模板、网页游戏自动化。开源 7B 与报告模型有差距UI-TARS-1.5-7B 面向通用计算机使用优化OSWorld 上 27.5 对 42.5游戏场景差距更大报告模型 Minecraft 200 任务均分 0.42。幻觉问题不熟悉或歧义的界面里可能误认元素、做出错误动作关键流程需要人工复核。算力成本7B 加大尺寸截图官方部署建议单卡 48G长任务每轮都要一次推理调用成本随步数线性上升。安全边界模型能通过 CAPTCHA 类鉴权界面受保护内容的环境不建议未经评估就部署。参数敏感坐标换算链路区分 qwen2vl 相对坐标与 qwen25vl 绝对坐标model_type 填错点击位置会整体漂移。 快速参考环境、命令与关键文件项目路径或说明后处理包安装pip install ui-tars或uv pip install ui-tarsPython 3.9推理部署指南README_deploy.mdHF Endpoints7B 推荐 L40S 48G坐标处理指南README_coordinates.md提示模板桌面/移动/定位codes/ui_tars/prompt.py动作解析与坐标换算codes/ui_tars/action_parser.py单测与推理样例codes/tests/样例任务数据data/test_messages.json 下一步你可以先跑一遍上手实践里的单测确认坐标换算链路在本地可用。你可以按 README_deploy.md 拉起 7B 推理服务用 data/test_messages.json 跑通一个完整流程。面向移动端或特定桌面环境时你可以从替换 codes/ui_tars/prompt.py 中的三套模板开始写入自己的任务指令。数据口径除特别注明外文中数字取自官方 README 的 Performance 一节为 UI-TARS-1.5 报告模型成绩开源 UI-TARS-1.5-7B 的差距以效果验证表格下方注释为准。实际性能因硬件与环境而异。【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →