摘要:whichllm 是一个开源命令行工具,能自动检测你的硬件配置,基于真实 benchmark 数据给出最适合你跑的本地大模型推荐。不是"能塞进去的最大模型",而是"真正跑得好的那个"。


你是不是也有过这种困惑

装好 Ollama,打开模型列表,一眼望去:7B、14B、32B、70B……

显卡 24GB,够跑 32B,但 32B 就一定比 27B 强吗?Q4_K_M 和 Q5_K_M 差多少?这个模型 benchmark 是去年的,还算数吗?

翻了半小时帖子,看了三篇对比文章,最后还是蒙着眼随手选了一个。

说实话,这个选择困难症困扰了我很久。直到我遇到了 whichllm


whichllm 是什么

一句话:给你的硬件找最好的本地大模型,而不是最大的那个。

它是一个 Python 命令行工具,3800+ GitHub Star,MIT 开源。核心逻辑很简单:

  1. 自动检测你的 GPU/CPU/内存

  2. 从 HuggingFace 实时拉取模型数据

  3. 融合多个真实 benchmark(LiveBench、Artificial Analysis、Aider、Chatbot Arena ELO 等)

  4. 综合显存适配、推理速度、benchmark 质量打分排名

  5. 告诉你:就是这个,跑它。


一分钟上手

不需要安装,直接跑:

uvx whichllm@latest

就这一条命令。它会自动检测你的硬件,然后输出类似这样的结果:

#1  Qwen/Qwen3.6-27B     27.8B  Q5_K_M   score 92.8    27 t/s
#2  Qwen/Qwen3-32B       32.0B  Q4_K_M   score 83.0    31 t/s
#3  Qwen/Qwen3-30B-A3B   30.0B  Q5_K_M   score 82.7   102 t/s

注意看:RTX 4090(24GB 显存)上,32B 的模型装得下,但 27B 排第一

这正是 whichllm 存在的意义——它不会因为 32B"比较大、看起来厉害"就推给你。它看的是真实 benchmark 分数和模型代际,Qwen3.6-27B 比 Qwen3-32B 更新、benchmark 更高,所以排第一。

一个只看显存能否塞下的工具会把 32B 推给你。whichllm 不会。


我最喜欢的几个功能

🎮 买显卡之前,先模拟一下

whichllm --gpu "RTX 4090"
whichllm --gpu "RTX 5090"

对,就是这么直接。打算买 RTX 5090?先模拟一下跑哪些模型、跑多快,再决定值不值得花那个钱。

各硬件的实测推荐(2026 年 5 月快照,实际结果跟随 HuggingFace 实时更新):

硬件

显存

最优推荐

速度

RTX 5090

32 GB

Qwen3.6-27B · Q6_K

~40 t/s

RTX 4090 / 3090

24 GB

Qwen3.6-27B · Q5_K_M

~27 t/s

RTX 4060

8 GB

Qwen3-14B · Q3_K_M

~22 t/s

Apple M3 Max

36 GB

Qwen3.6-27B · Q5_K_M

~9 t/s

纯 CPU

gpt-oss-20b (MoE) · Q4_K_M

~6 t/s

🔍 反向查询:这个模型需要什么显卡

whichllm plan "qwen 72b"
whichllm plan "Qwen2.5-72B" --quant Q8_0

想跑某个特定模型,但不知道需要多少显存?反过来查,直接告诉你要什么硬件。买显卡前先做功课,比事后后悔强。

📈 升级规划:我换卡值不值

whichllm upgrade "RTX 4090" "RTX 5090" "H100"

当前机器 vs 目标显卡,列出 delta 分数和结论(worth it / meaningful / marginal / flat / downgrade)。这功能我太需要了,每次想换卡又拿不定主意的时候,跑一下,心里有底。

💬 一条命令直接跑模型对话

# 自动选最适合你硬件的模型,开聊
whichllm run

# 指定模型
whichllm run "qwen 2.5 1.5b gguf"

它会自动帮你创建隔离环境、安装依赖、下载模型,然后启动对话。不用手动 ollama pull,不用配环境,一条命令搞定。

🐍 生成可运行的 Python 代码

whichllm snippet "qwen 2.5 1.5b gguf"

输出结果:

from llama_cpp import Llama

llm = Llama.from_pretrained(
    repo_id="Qwen/Qwen2.5-7B-Instruct-GGUF",
    filename="qwen2.5-7b-instruct-q4_k_m.gguf",
    n_ctx=4096,
    n_gpu_layers=-1,
    verbose=False,
)

output = llm.create_chat_completion(
    messages=[{"role""user""content""Hello!"}],
)
print(output["choices"][0]["message"]["content"])

复制粘贴,直接跑。不用查文档,不用折腾参数。


它的 benchmark 体系为什么值得信任

这里要多说几句,因为 "benchmark 排名" 这件事很容易被玩坏。

whichllm 对 benchmark 数据做了几层处理:

多源融合:合并 LiveBench、Artificial Analysis、Aider、Chatbot Arena ELO、Open LLM Leaderboard 等多个独立来源,加权平均,不依赖任何单一榜单。

时效惩罚:2024 年的榜单分数会沿模型谱系被降权,防止旧模型靠过时高分压过新一代模型。每次输出时还会打印 benchmark 快照日期,你一眼就能看出数据有多新。

置信度标注:每个分数都有来源标记——direct(直接匹配)、variant(变体匹配)、self_reported(上传者自报)……自报的数据直接打折,防止模型作者刷分。

跨家族继承拦截:小模型不能借用大家族基座的高分。一个 7B 的分叉版本不能用 70B 基座的 benchmark 冒充自己的能力。

这套体系不完美,但它比"看参数量大小"或者"看某一个榜单"要靠谱得多。


安装方式

# 最省事:无需安装,直接用
uvx whichllm@latest

# 常用的话,装好备用
uv tool install whichllm

# macOS Homebrew
brew install andyyyy64/whichllm/whichllm

# pip
pip install whichllm

Python 3.11+ 即可,NVIDIA/AMD/Apple Silicon 全支持,CPU-only 也能用。


适合哪些人用

  • 本地部署玩家:不知道从 HuggingFace 几百个模型里选哪个的时候,跑一下

  • 准备买显卡的人:用 --gpu 模拟,先看结果再花钱

  • 已经有硬件但想优化配置的人whichllm upgrade 帮你判断换卡值不值

  • 想写脚本自动选模型的人--json 输出,配合 jq 随便搞

纯 CPU 用户也不是没有救:whichllm --cpu-only 会给你找 CPU 上跑得动的最优解,虽然速度注定慢,但至少不会给你推一个根本塞不下的模型。


一点小遗憾

HN 上有人提出了一个合理的批评:whichllm 的速度是估算的,不是实测的。它用的是显存带宽、量化效率等参数推算,并不会真的在你机器上跑一遍测速度。

这也是作者自己承认的:它是一个"买之前 / 下载之前"的决策工具,而不是实测 benchmark 工具。估算值故意做得保守,宁可低估不过度承诺。

如果你想要精确数字,可以配合实测工具(如 RapidMLX)使用。但对于大多数"我到底该下哪个模型"的场景,whichllm 的估算已经够用了。


最后说一句

本地跑大模型这件事,2026 年已经不是发烧友专属了。RTX 4090 跑 27B 模型 27 t/s,够用;8GB 显存的 4060 跑 14B 也有 22 t/s,凑合。

硬件不是问题,选哪个模型才是问题。

whichllm 就是那个帮你把问题缩短成一条命令的工具。

uvx whichllm@latest

跑一下,看看它给你推什么。


GitHub 地址:https://github.com/Andyyyy64/whichllm 

目前 3800+ Star,MIT 开源,持续更新中。


你用什么显卡?它给你推了哪个模型?评论区聊聊。

我是顾北,关注我,获取更多好玩有趣的开源仓库!

谢谢你阅读我的文章~

我们下期再见!

PS:本文部分内容由AI辅助创作

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐