UI-TARS-desktop步骤详解:从docker run到打开WebUI,Qwen3-4B GUI Agent全链路启动图解

想快速体验一个能看懂屏幕、操作电脑的AI助手吗?今天,我们就来手把手带你启动UI-TARS-desktop。这是一个内置了Qwen3-4B大模型的轻量级AI应用,它能像人一样通过图形界面(GUI)与你交互,帮你完成搜索、浏览文件、执行命令等任务。

整个过程就像搭积木,从拉取镜像到打开网页界面,每一步都有清晰的指引。即使你之前没怎么接触过Docker或AI模型,跟着这篇图解教程,也能在十分钟内让你的AI助手跑起来。

1. 认识你的AI助手:UI-TARS-desktop

在开始动手之前,我们先简单了解一下我们要启动的这个“家伙”到底是什么。

UI-TARS-desktop 是一个开源的多模态AI智能体(Multimodal AI Agent)。你可以把它想象成一个住在你电脑里的、特别能干的数字助手。它的核心能力是“多模态”,这意味着它不仅能理解文字,还能“看”懂屏幕上的图像和界面(这就是GUI Agent的能力),并且能调用各种工具来干活。

它内置了哪些工具呢?基本上覆盖了日常电脑操作:

  • 搜索(Search):帮你上网查资料。
  • 浏览器(Browser):自动打开网页进行操作。
  • 文件(File):帮你查找、读取、管理电脑里的文件。
  • 命令(Command):在终端里执行你指定的命令。

更棒的是,它自带了一个“大脑”—— Qwen3-4B-Instruct-2507 模型。这是一个经过指令微调的大语言模型,专门用来理解和执行你的自然语言指令。整个模型服务通过高效的 vLLM 推理引擎来运行,确保响应速度够快。

这个项目提供了两种使用方式:CLI(命令行界面) 适合快速体验所有功能;SDK 则适合开发者,用来构建属于自己的定制化智能体。我们今天要启动的桌面版(desktop),就是基于CLI的、带有可视化Web界面的版本,对新手最友好。

2. 第一步:启动Docker容器

万事开头难,但这一步其实最简单。我们通过一条Docker命令,把包含了所有依赖和模型的“软件包”运行起来。

打开你的终端(Terminal),输入以下命令:

docker run -it --rm --gpus all \
  -p 7860:7860 \
  -p 8000:8000 \
  -v /root/workspace:/app/workspace \
  --name ui-tars-desktop \
  registry.cn-hangzhou.aliyuncs.com/agent-tars/ui-tars-desktop:latest

我们来拆解一下这条命令,看看它都干了什么:

  • docker run:告诉Docker要运行一个新的容器。
  • -it:以交互模式运行,并且分配一个伪终端,这样你可以看到日志输出。
  • --rm:容器停止运行后自动删除它,避免留下无用的容器占空间。
  • --gpus all:非常重要!这行命令让容器能够使用你电脑上的所有GPU。如果没有GPU或者想用CPU跑,可以去掉这个参数,但速度会慢很多。
  • -p 7860:7860:进行端口映射。将容器内部的7860端口映射到你电脑的7860端口。这个端口就是待会儿Web界面的入口
  • -p 8000:8000:另一个端口映射。8000端口是内部vLLM模型服务的端口,方便我们后续检查。
  • -v /root/workspace:/app/workspace:创建一个数据卷,把你本地机器的/root/workspace目录挂载到容器内的/app/workspace。这样,AI助手在工作时产生的文件(如下载的内容、生成的结果)都会保存在你本地,不会随着容器删除而丢失。
  • --name ui-tars-desktop:给这个容器起个名字,方便管理。
  • 最后一行是镜像地址,指定了从哪个仓库拉取我们需要的“软件包”。

执行这条命令后,Docker会开始拉取镜像并启动容器。你会看到终端开始滚动输出日志,这意味着启动流程开始了。

3. 第二步:验证模型服务是否就绪

容器启动后,它会在后台默默地做很多事,其中最关键的就是启动那个Qwen3-4B模型的服务。我们需要确认它已经成功启动,才能进行下一步。

根据日志提示或等待几分钟后,我们可以通过查看日志文件来确认。

3.1 进入工作目录

首先,我们需要进入之前挂载的工作目录。在终端里执行:

cd /root/workspace

3.2 查看模型启动日志

工作目录下会生成一个名为 llm.log 的日志文件,它记录了模型服务的启动详情。我们用它来检查:

cat llm.log

如果一切顺利,你会在日志的末尾看到类似下面的关键信息:

Uvicorn running on http://0.0.0.0:8000 (Press CTRL+C to quit)
INFO:     Started server process [1]
INFO:     Waiting for application startup.
INFO:     Application startup complete.

看到 Uvicorn running on http://0.0.0.0:8000 这一行,就说明内置的vLLM模型服务已经在8000端口成功启动了!这意味着AI助手的“大脑”已经激活,正在待命。

模型服务启动成功日志

(上图展示了成功的日志输出,注意高亮的运行地址和启动完成信息)

如果没看到这些信息,或者日志中有明显的错误(ERROR)提示,可能需要多等待一会儿,或者检查网络和GPU驱动。

4. 第三步:访问WebUI并开始对话

最激动人心的时刻来了!模型服务已经就绪,现在我们可以打开AI助手的图形操作界面了。

4.1 打开浏览器

在你的电脑上,打开任何一个你常用的浏览器(Chrome、Firefox、Edge等)。

4.2 访问Web界面

在浏览器的地址栏里,输入以下地址:

http://localhost:7860

或者

http://127.0.0.1:7860

然后按下回车。如果前两步都成功了,你将会看到UI-TARS-desktop的Web用户界面。

UI-TARS-desktop Web界面

4.3 界面功能初探

这个界面通常设计得很直观,主要分为几个区域:

  1. 对话区域:最大的区域,这里会显示你和AI助手的对话历史。
  2. 输入框:通常在底部,你可以在这里用自然语言给AI助手下达指令。
  3. 工具/设置侧边栏:可能有一个侧边栏,用于选择要使用的工具(如浏览器、文件管理)或进行一些设置。

4.4 进行第一次对话验证

让我们做个简单的测试,确保一切正常。在输入框里,尝试问它一个简单的问题,比如:

“你好,请介绍一下你自己。”

点击发送。如果看到AI助手开始思考(可能有动画提示),并很快生成一段关于它自己是Agent TARS的介绍文字,那么恭喜你,整个UI-TARS-desktop已经成功启动并运行了!

与AI助手对话示例

AI助手调用工具示例

(上图展示了与AI助手的交互过程,以及它可能调用工具执行任务的界面反馈)

5. 总结与后续步骤

回顾一下,我们完成了从零启动UI-TARS-desktop的全过程:

  1. 一键启动容器:用一条Docker命令,拉取并运行了包含所有环境和模型的镜像。
  2. 验证核心服务:通过查看日志,确认了内置的Qwen3-4B模型服务已成功在后台运行。
  3. 开启可视化交互:在浏览器中打开本地端口,进入了AI助手的Web操作界面,并完成了首次对话。

现在,你的个人GUI AI助手已经准备就绪。你可以尝试让它完成更复杂的任务,例如:

  • “请打开浏览器,搜索今天关于人工智能的最新新闻。”
  • “帮我查看/app/workspace目录下有哪些文件。”
  • “写一个简单的Python脚本来计算1到100的和,并保存到文件里。”

探索它如何理解你的指令,并协调不同的工具去完成任务,这个过程本身就充满了乐趣。


获取更多AI镜像

想探索更多AI镜像和应用场景?访问 CSDN星图镜像广场,提供丰富的预置镜像,覆盖大模型推理、图像生成、视频生成、模型微调等多个领域,支持一键部署。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐