UI-TARS-desktop步骤详解:从docker run到打开WebUI,Qwen3-4B GUI Agent全链路启动图解
UI-TARS-desktop步骤详解:从docker run到打开WebUI,Qwen3-4B GUI Agent全链路启动图解
想快速体验一个能看懂屏幕、操作电脑的AI助手吗?今天,我们就来手把手带你启动UI-TARS-desktop。这是一个内置了Qwen3-4B大模型的轻量级AI应用,它能像人一样通过图形界面(GUI)与你交互,帮你完成搜索、浏览文件、执行命令等任务。
整个过程就像搭积木,从拉取镜像到打开网页界面,每一步都有清晰的指引。即使你之前没怎么接触过Docker或AI模型,跟着这篇图解教程,也能在十分钟内让你的AI助手跑起来。
1. 认识你的AI助手:UI-TARS-desktop
在开始动手之前,我们先简单了解一下我们要启动的这个“家伙”到底是什么。
UI-TARS-desktop 是一个开源的多模态AI智能体(Multimodal AI Agent)。你可以把它想象成一个住在你电脑里的、特别能干的数字助手。它的核心能力是“多模态”,这意味着它不仅能理解文字,还能“看”懂屏幕上的图像和界面(这就是GUI Agent的能力),并且能调用各种工具来干活。
它内置了哪些工具呢?基本上覆盖了日常电脑操作:
- 搜索(Search):帮你上网查资料。
- 浏览器(Browser):自动打开网页进行操作。
- 文件(File):帮你查找、读取、管理电脑里的文件。
- 命令(Command):在终端里执行你指定的命令。
更棒的是,它自带了一个“大脑”—— Qwen3-4B-Instruct-2507 模型。这是一个经过指令微调的大语言模型,专门用来理解和执行你的自然语言指令。整个模型服务通过高效的 vLLM 推理引擎来运行,确保响应速度够快。
这个项目提供了两种使用方式:CLI(命令行界面) 适合快速体验所有功能;SDK 则适合开发者,用来构建属于自己的定制化智能体。我们今天要启动的桌面版(desktop),就是基于CLI的、带有可视化Web界面的版本,对新手最友好。
2. 第一步:启动Docker容器
万事开头难,但这一步其实最简单。我们通过一条Docker命令,把包含了所有依赖和模型的“软件包”运行起来。
打开你的终端(Terminal),输入以下命令:
docker run -it --rm --gpus all \
-p 7860:7860 \
-p 8000:8000 \
-v /root/workspace:/app/workspace \
--name ui-tars-desktop \
registry.cn-hangzhou.aliyuncs.com/agent-tars/ui-tars-desktop:latest
我们来拆解一下这条命令,看看它都干了什么:
docker run:告诉Docker要运行一个新的容器。-it:以交互模式运行,并且分配一个伪终端,这样你可以看到日志输出。--rm:容器停止运行后自动删除它,避免留下无用的容器占空间。--gpus all:非常重要!这行命令让容器能够使用你电脑上的所有GPU。如果没有GPU或者想用CPU跑,可以去掉这个参数,但速度会慢很多。-p 7860:7860:进行端口映射。将容器内部的7860端口映射到你电脑的7860端口。这个端口就是待会儿Web界面的入口。-p 8000:8000:另一个端口映射。8000端口是内部vLLM模型服务的端口,方便我们后续检查。-v /root/workspace:/app/workspace:创建一个数据卷,把你本地机器的/root/workspace目录挂载到容器内的/app/workspace。这样,AI助手在工作时产生的文件(如下载的内容、生成的结果)都会保存在你本地,不会随着容器删除而丢失。--name ui-tars-desktop:给这个容器起个名字,方便管理。- 最后一行是镜像地址,指定了从哪个仓库拉取我们需要的“软件包”。
执行这条命令后,Docker会开始拉取镜像并启动容器。你会看到终端开始滚动输出日志,这意味着启动流程开始了。
3. 第二步:验证模型服务是否就绪
容器启动后,它会在后台默默地做很多事,其中最关键的就是启动那个Qwen3-4B模型的服务。我们需要确认它已经成功启动,才能进行下一步。
根据日志提示或等待几分钟后,我们可以通过查看日志文件来确认。
3.1 进入工作目录
首先,我们需要进入之前挂载的工作目录。在终端里执行:
cd /root/workspace
3.2 查看模型启动日志
工作目录下会生成一个名为 llm.log 的日志文件,它记录了模型服务的启动详情。我们用它来检查:
cat llm.log
如果一切顺利,你会在日志的末尾看到类似下面的关键信息:
Uvicorn running on http://0.0.0.0:8000 (Press CTRL+C to quit)
INFO: Started server process [1]
INFO: Waiting for application startup.
INFO: Application startup complete.
看到 Uvicorn running on http://0.0.0.0:8000 这一行,就说明内置的vLLM模型服务已经在8000端口成功启动了!这意味着AI助手的“大脑”已经激活,正在待命。
(上图展示了成功的日志输出,注意高亮的运行地址和启动完成信息)
如果没看到这些信息,或者日志中有明显的错误(ERROR)提示,可能需要多等待一会儿,或者检查网络和GPU驱动。
4. 第三步:访问WebUI并开始对话
最激动人心的时刻来了!模型服务已经就绪,现在我们可以打开AI助手的图形操作界面了。
4.1 打开浏览器
在你的电脑上,打开任何一个你常用的浏览器(Chrome、Firefox、Edge等)。
4.2 访问Web界面
在浏览器的地址栏里,输入以下地址:
http://localhost:7860
或者
http://127.0.0.1:7860
然后按下回车。如果前两步都成功了,你将会看到UI-TARS-desktop的Web用户界面。
4.3 界面功能初探
这个界面通常设计得很直观,主要分为几个区域:
- 对话区域:最大的区域,这里会显示你和AI助手的对话历史。
- 输入框:通常在底部,你可以在这里用自然语言给AI助手下达指令。
- 工具/设置侧边栏:可能有一个侧边栏,用于选择要使用的工具(如浏览器、文件管理)或进行一些设置。
4.4 进行第一次对话验证
让我们做个简单的测试,确保一切正常。在输入框里,尝试问它一个简单的问题,比如:
“你好,请介绍一下你自己。”
点击发送。如果看到AI助手开始思考(可能有动画提示),并很快生成一段关于它自己是Agent TARS的介绍文字,那么恭喜你,整个UI-TARS-desktop已经成功启动并运行了!
(上图展示了与AI助手的交互过程,以及它可能调用工具执行任务的界面反馈)
5. 总结与后续步骤
回顾一下,我们完成了从零启动UI-TARS-desktop的全过程:
- 一键启动容器:用一条Docker命令,拉取并运行了包含所有环境和模型的镜像。
- 验证核心服务:通过查看日志,确认了内置的Qwen3-4B模型服务已成功在后台运行。
- 开启可视化交互:在浏览器中打开本地端口,进入了AI助手的Web操作界面,并完成了首次对话。
现在,你的个人GUI AI助手已经准备就绪。你可以尝试让它完成更复杂的任务,例如:
- “请打开浏览器,搜索今天关于人工智能的最新新闻。”
- “帮我查看
/app/workspace目录下有哪些文件。” - “写一个简单的Python脚本来计算1到100的和,并保存到文件里。”
探索它如何理解你的指令,并协调不同的工具去完成任务,这个过程本身就充满了乐趣。
获取更多AI镜像
想探索更多AI镜像和应用场景?访问 CSDN星图镜像广场,提供丰富的预置镜像,覆盖大模型推理、图像生成、视频生成、模型微调等多个领域,支持一键部署。
更多推荐



所有评论(0)