Qwen3-0.6B-FP8部署教程:WSL2环境下Windows用户零基础运行vLLM+Chainlit
Qwen3-0.6B-FP8部署教程:WSL2环境下Windows用户零基础运行vLLM+Chainlit
1. 开篇:为什么你需要这个教程?
如果你是Windows用户,想体验最新的AI大模型,但被复杂的Linux环境、命令行和模型部署搞得一头雾水,那么你来对地方了。
今天我要带你做的,是在你的Windows电脑上,用最简单的方式,跑起来一个叫Qwen3-0.6B-FP8的AI模型。这个模型虽然体积小(只有0.6B参数),但能力不弱,能帮你写文案、回答问题、写代码,而且因为用了FP8这种高效的格式,它在普通电脑上也能跑得挺快。
我们用的工具组合是vLLM和Chainlit。vLLM是个专门用来高效运行大模型的引擎,Chainlit则是一个特别适合AI对话的网页界面。把它们俩结合起来,你就能在浏览器里和一个AI聊天了,就像用ChatGPT一样,但完全在你的本地电脑上运行。
这个教程最大的特点就是“零基础”。你不需要懂Linux,不需要会复杂的命令,甚至不需要知道什么是Docker。我们全程在Windows自带的WSL2(一个Linux子系统)里操作,步骤清晰,照着做就行。
2. 准备工作:搭建你的Windows AI实验室
在开始安装模型之前,我们需要先把“实验室”搭好。这个实验室就是WSL2。
2.1 什么是WSL2?
你可以把WSL2理解成Windows系统里内置的一个“Linux小盒子”。在这个小盒子里,你可以运行Linux的软件和命令,但它又和你的Windows系统紧密连接,文件可以互相访问,用起来非常方便。对于我们运行AI模型来说,它提供了Linux环境,而很多AI工具在Linux上支持得最好。
2.2 启用WSL2并安装Ubuntu
- 以管理员身份打开Windows PowerShell:在开始菜单搜索“PowerShell”,右键点击它,选择“以管理员身份运行”。
- 输入启用命令:在打开的窗口里,粘贴下面这行命令,然后按回车。
这个命令会自动帮你安装WSL2和默认的Linux发行版(通常是Ubuntu)。wsl --install - 重启电脑:安装完成后,根据提示重启你的电脑。
- 设置Ubuntu:重启后,你可能会在开始菜单里看到一个叫“Ubuntu”的应用,点开它。第一次运行需要你设置一个用户名和密码(这个密码输入时不会显示字符,正常输入后回车即可)。记住这个密码,后续安装软件时会用到。
好了,现在你的“Linux小盒子”已经准备好了。接下来所有的操作,我们都会在这个Ubuntu的终端里进行。
3. 核心部署:让Qwen3-0.6B-FP8模型跑起来
我们的“实验室”建好了,现在要把主角——AI模型请进来。我们用vLLM这个高效的引擎来加载和运行模型。
3.1 安装必要的软件
首先,打开你的Ubuntu应用。你会看到一个黑色的命令行窗口。我们在这里输入命令。
- 更新软件包列表:这是Linux下的一个好习惯,确保我们安装的是最新版本的软件。
输入密码(就是你刚才设置的那个),然后等待它完成。sudo apt update && sudo apt upgrade -y - 安装Python和pip:Python是运行AI模型的基础,pip是安装Python包的工具。
sudo apt install python3 python3-pip -y - 安装vLLM:这是我们的模型推理引擎。
这个过程可能会下载一些依赖,稍等片刻。pip3 install vllm
3.2 下载并运行Qwen3-0.6B-FP8模型
模型已经以镜像的形式准备好了,我们直接使用vLLM命令来启动它。
-
在Ubuntu终端里,输入以下命令:
python3 -m vllm.entrypoints.openai.api_server \ --model Qwen/Qwen3-0.6B-Instruct-FP8 \ --served-model-name Qwen3-0.6B-FP8 \ --api-key token-abc123 \ --port 8000命令解释一下:
--model Qwen/Qwen3-0.6B-Instruct-FP8:告诉vLLM去下载并加载这个指定的模型。FP8表示模型是8位浮点数格式,更小更快。--served-model-name Qwen3-0.6B-FP8:给服务起个名字,方便我们后面调用。--api-key token-abc123:设置一个简单的API密钥,用于访问保护(我们这里用个简单的)。--port 8000:服务会运行在8000端口。
-
按下回车后,你会看到vLLM开始工作。它首先会从网上下载模型文件(大概几个GB,取决于你的网速),下载完成后会自动加载模型到内存。 关键提示:第一次运行需要下载模型,请保持网络通畅。下载完成后,终端会显示类似
Uvicorn running on http://0.0.0.0:8000的信息,这表示模型服务已经成功启动,在8000端口监听着我们的请求。
到这里,模型的“大脑”已经在后台运行起来了。你可以让这个终端窗口开着,我们接下来去给它装一个“聊天窗口”。
4. 打造聊天界面:用Chainlit创建Web对话前端
模型服务在后台跑着,但我们总不能一直在命令行里和它对话。Chainlit就是一个专门为AI对话应用设计的Python框架,能快速生成一个漂亮的网页聊天界面。
4.1 安装和配置Chainlit
- 打开一个新的Ubuntu终端窗口(或者新建一个标签页)。重要:不要关闭刚才运行模型的那个窗口。
- 在新终端里,安装Chainlit:
pip3 install chainlit - 创建一个专门的工作目录并进入:
mkdir ~/qwen3-chat && cd ~/qwen3-chat - 创建一个Chainlit的配置文件
chainlit.md,这会是聊天应用的介绍页面:echo "# Welcome to Qwen3-0.6B Chatbot This is a local chatbot powered by Qwen3-0.6B-FP8 model, deployed with vLLM. Feel free to ask it anything!" > chainlit.md
4.2 创建核心应用文件
现在,创建最重要的文件 app.py,这个文件定义了我们的聊天应用如何连接后台的模型。
# app.py
import chainlit as cl
from openai import OpenAI
# 配置连接到我们本地运行的vLLM服务
client = OpenAI(
base_url="http://localhost:8000/v1", # vLLM服务的地址
api_key="token-abc123" # 和启动vLLM时设置的api-key一致
)
@cl.on_message
async def main(message: cl.Message):
"""
每当用户在前端发送一条消息,这个函数就会被调用。
"""
# 创建一个Chainlit的响应对象,显示“思考中...”的动画
msg = cl.Message(content="")
await msg.send()
# 调用本地的vLLM服务(格式兼容OpenAI API)
response = client.chat.completions.create(
model="Qwen3-0.6B-FP8", # 模型名称,和vLLM启动时设置的served-model-name一致
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": message.content}
],
temperature=0.7, # 控制创造性的参数,0.0最确定,1.0最随机
stream=True # 启用流式输出,一个字一个字地显示,体验更好
)
# 处理流式响应,将回复内容实时显示到前端
for chunk in response:
if chunk.choices[0].delta.content is not None:
await msg.stream_token(chunk.choices[0].delta.content)
# 流式输出完成,更新消息状态
await msg.update()
代码很简单,它做了三件事:
- 设置好去连接我们本地
localhost:8000端口运行的vLLM服务。 - 定义了一个函数,每当用户发消息就触发。
- 把用户的问题包装一下,发给vLLM,再把vLLM的回复“流式”地推送到网页上。
5. 验证与使用:启动你的专属AI聊天室
所有部件都准备好了,现在让我们把它们组装起来,看看效果。
5.1 启动Chainlit网页应用
在你创建了 app.py 文件的目录下(~/qwen3-chat),运行以下命令:
chainlit run app.py
第一次运行,Chainlit可能会问你是否同意加入它的用户体验改进计划,输入 y 或 n 都可以,不影响使用。稍等片刻,你会看到类似下面的输出:
Your app is available at http://localhost:8001
太好了!你的聊天网页已经启动在8001端口了。
5.2 在浏览器中聊天
- 打开你Windows上的浏览器(比如Chrome、Edge)。
- 在地址栏输入:
http://localhost:8001 - 回车,你就能看到一个简洁现代的聊天界面了!页面上会显示我们之前在
chainlit.md里写的欢迎语。 - 在底部的输入框里,试着问它一些问题吧!比如:
- “用Python写一个计算斐波那契数列的函数”
- “给我写一段关于夏天的文案”
- “解释一下什么是机器学习”
你会发现,回复是一个字一个字出现的,这就是我们设置的“流式输出”,体验非常流畅。虽然Qwen3-0.6B是个小模型,但它的回答在逻辑、代码和创意写作上已经有不错的表现了。
5.3 如何确认一切正常?
有时候,我们想知道后台的服务是不是真的在干活。有两个简单的检查方法:
- 看Chainlit终端:运行
chainlit run app.py的那个终端窗口,会实时打印出所有的访问日志和错误信息(如果有的话)。 - 看vLLM终端:运行模型服务的那个终端窗口,当你提问时,它会显示接收到的请求和模型推理的进度。
如果页面能打开,能提问,能收到回复,那就说明整个系统——从WSL2到vLLM再到Chainlit——已经完美协同工作了。
6. 总结与后续探索
恭喜你!你已经成功在Windows电脑上,通过WSL2搭建了一个本地运行的AI对话系统。回顾一下我们做了什么:
- 启用WSL2:为Windows创造了Linux环境。
- 部署vLLM:用一行命令拉取并运行了高效的Qwen3-0.6B-FP8模型。
- 构建Chainlit前端:写了几十行Python代码,就得到了一个体验良好的Web聊天界面。
- 整合验证:在浏览器中完成了与本地AI模型的对话。
这个组合的优势非常明显:
- 隐私安全:所有对话数据都在本地,不会上传到任何服务器。
- 成本为零:除了电费,没有额外的使用成本。
- 可定制性强:你可以修改
app.py里的系统提示词(system角色的内容),让AI扮演不同的角色(如编程专家、文案助手、翻译官)。 - 学习平台:这是理解AI模型服务化、API调用和简单前端开发的绝佳实践。
如果你想更进一步:
- 尝试其他模型:vLLM支持很多模型,你可以把启动命令里的模型名称换成其他你感兴趣的模型(注意模型大小和你的电脑内存)。
- 美化前端:Chainlit支持自定义CSS,你可以调整聊天界面的外观。
- 探索高级功能:在
app.py的请求参数里,调整temperature(创造性)、max_tokens(回复最大长度)等,观察对话效果的变化。
希望这个教程能成为你探索AI世界的一个轻松起点。从本地运行一个小模型开始,逐步了解其原理和能力,未来无论是使用更强大的云端模型,还是深入AI应用开发,你都会更有底气。
获取更多AI镜像
想探索更多AI镜像和应用场景?访问 CSDN星图镜像广场,提供丰富的预置镜像,覆盖大模型推理、图像生成、视频生成、模型微调等多个领域,支持一键部署。
更多推荐


所有评论(0)