一条命令帮你找到最适合自己显卡的大模型,这个工具真的太懂开发者了。
摘要:whichllm 是一个开源命令行工具,能自动检测你的硬件配置,基于真实 benchmark 数据给出最适合你跑的本地大模型推荐。不是"能塞进去的最大模型",而是"真正跑得好的那个"。
你是不是也有过这种困惑
装好 Ollama,打开模型列表,一眼望去:7B、14B、32B、70B……
显卡 24GB,够跑 32B,但 32B 就一定比 27B 强吗?Q4_K_M 和 Q5_K_M 差多少?这个模型 benchmark 是去年的,还算数吗?
翻了半小时帖子,看了三篇对比文章,最后还是蒙着眼随手选了一个。
说实话,这个选择困难症困扰了我很久。直到我遇到了 whichllm。

whichllm 是什么
一句话:给你的硬件找最好的本地大模型,而不是最大的那个。
它是一个 Python 命令行工具,3800+ GitHub Star,MIT 开源。核心逻辑很简单:
-
自动检测你的 GPU/CPU/内存
-
从 HuggingFace 实时拉取模型数据
-
融合多个真实 benchmark(LiveBench、Artificial Analysis、Aider、Chatbot Arena ELO 等)
-
综合显存适配、推理速度、benchmark 质量打分排名
-
告诉你:就是这个,跑它。

一分钟上手
不需要安装,直接跑:
uvx whichllm@latest
就这一条命令。它会自动检测你的硬件,然后输出类似这样的结果:
#1 Qwen/Qwen3.6-27B 27.8B Q5_K_M score 92.8 27 t/s
#2 Qwen/Qwen3-32B 32.0B Q4_K_M score 83.0 31 t/s
#3 Qwen/Qwen3-30B-A3B 30.0B Q5_K_M score 82.7 102 t/s
注意看:RTX 4090(24GB 显存)上,32B 的模型装得下,但 27B 排第一。
这正是 whichllm 存在的意义——它不会因为 32B"比较大、看起来厉害"就推给你。它看的是真实 benchmark 分数和模型代际,Qwen3.6-27B 比 Qwen3-32B 更新、benchmark 更高,所以排第一。
一个只看显存能否塞下的工具会把 32B 推给你。whichllm 不会。
我最喜欢的几个功能
🎮 买显卡之前,先模拟一下
whichllm --gpu "RTX 4090"
whichllm --gpu "RTX 5090"
对,就是这么直接。打算买 RTX 5090?先模拟一下跑哪些模型、跑多快,再决定值不值得花那个钱。
各硬件的实测推荐(2026 年 5 月快照,实际结果跟随 HuggingFace 实时更新):
|
硬件 |
显存 |
最优推荐 |
速度 |
|---|---|---|---|
|
RTX 5090 |
32 GB |
Qwen3.6-27B · Q6_K |
~40 t/s |
|
RTX 4090 / 3090 |
24 GB |
Qwen3.6-27B · Q5_K_M |
~27 t/s |
|
RTX 4060 |
8 GB |
Qwen3-14B · Q3_K_M |
~22 t/s |
|
Apple M3 Max |
36 GB |
Qwen3.6-27B · Q5_K_M |
~9 t/s |
|
纯 CPU |
— |
gpt-oss-20b (MoE) · Q4_K_M |
~6 t/s |
🔍 反向查询:这个模型需要什么显卡
whichllm plan "qwen 72b"
whichllm plan "Qwen2.5-72B" --quant Q8_0
想跑某个特定模型,但不知道需要多少显存?反过来查,直接告诉你要什么硬件。买显卡前先做功课,比事后后悔强。

📈 升级规划:我换卡值不值
whichllm upgrade "RTX 4090" "RTX 5090" "H100"
当前机器 vs 目标显卡,列出 delta 分数和结论(worth it / meaningful / marginal / flat / downgrade)。这功能我太需要了,每次想换卡又拿不定主意的时候,跑一下,心里有底。
💬 一条命令直接跑模型对话
# 自动选最适合你硬件的模型,开聊
whichllm run
# 指定模型
whichllm run "qwen 2.5 1.5b gguf"
它会自动帮你创建隔离环境、安装依赖、下载模型,然后启动对话。不用手动 ollama pull,不用配环境,一条命令搞定。

🐍 生成可运行的 Python 代码
whichllm snippet "qwen 2.5 1.5b gguf"
输出结果:
from llama_cpp import Llama
llm = Llama.from_pretrained(
repo_id="Qwen/Qwen2.5-7B-Instruct-GGUF",
filename="qwen2.5-7b-instruct-q4_k_m.gguf",
n_ctx=4096,
n_gpu_layers=-1,
verbose=False,
)
output = llm.create_chat_completion(
messages=[{"role": "user", "content": "Hello!"}],
)
print(output["choices"][0]["message"]["content"])
复制粘贴,直接跑。不用查文档,不用折腾参数。

它的 benchmark 体系为什么值得信任
这里要多说几句,因为 "benchmark 排名" 这件事很容易被玩坏。
whichllm 对 benchmark 数据做了几层处理:
多源融合:合并 LiveBench、Artificial Analysis、Aider、Chatbot Arena ELO、Open LLM Leaderboard 等多个独立来源,加权平均,不依赖任何单一榜单。
时效惩罚:2024 年的榜单分数会沿模型谱系被降权,防止旧模型靠过时高分压过新一代模型。每次输出时还会打印 benchmark 快照日期,你一眼就能看出数据有多新。
置信度标注:每个分数都有来源标记——direct(直接匹配)、variant(变体匹配)、self_reported(上传者自报)……自报的数据直接打折,防止模型作者刷分。
跨家族继承拦截:小模型不能借用大家族基座的高分。一个 7B 的分叉版本不能用 70B 基座的 benchmark 冒充自己的能力。
这套体系不完美,但它比"看参数量大小"或者"看某一个榜单"要靠谱得多。
安装方式
# 最省事:无需安装,直接用
uvx whichllm@latest
# 常用的话,装好备用
uv tool install whichllm
# macOS Homebrew
brew install andyyyy64/whichllm/whichllm
# pip
pip install whichllm
Python 3.11+ 即可,NVIDIA/AMD/Apple Silicon 全支持,CPU-only 也能用。
适合哪些人用
-
本地部署玩家:不知道从 HuggingFace 几百个模型里选哪个的时候,跑一下
-
准备买显卡的人:用
--gpu模拟,先看结果再花钱 -
已经有硬件但想优化配置的人:
whichllm upgrade帮你判断换卡值不值 -
想写脚本自动选模型的人:
--json输出,配合jq随便搞
纯 CPU 用户也不是没有救:whichllm --cpu-only 会给你找 CPU 上跑得动的最优解,虽然速度注定慢,但至少不会给你推一个根本塞不下的模型。
一点小遗憾
HN 上有人提出了一个合理的批评:whichllm 的速度是估算的,不是实测的。它用的是显存带宽、量化效率等参数推算,并不会真的在你机器上跑一遍测速度。
这也是作者自己承认的:它是一个"买之前 / 下载之前"的决策工具,而不是实测 benchmark 工具。估算值故意做得保守,宁可低估不过度承诺。
如果你想要精确数字,可以配合实测工具(如 RapidMLX)使用。但对于大多数"我到底该下哪个模型"的场景,whichllm 的估算已经够用了。
最后说一句
本地跑大模型这件事,2026 年已经不是发烧友专属了。RTX 4090 跑 27B 模型 27 t/s,够用;8GB 显存的 4060 跑 14B 也有 22 t/s,凑合。
硬件不是问题,选哪个模型才是问题。
whichllm 就是那个帮你把问题缩短成一条命令的工具。
uvx whichllm@latest
跑一下,看看它给你推什么。
GitHub 地址:https://github.com/Andyyyy64/whichllm
目前 3800+ Star,MIT 开源,持续更新中。
你用什么显卡?它给你推了哪个模型?评论区聊聊。
我是顾北,关注我,获取更多好玩有趣的开源仓库!
谢谢你阅读我的文章~
我们下期再见!
PS:本文部分内容由AI辅助创作
更多推荐


所有评论(0)