手把手教你用Cherry Studio搭建本地AI知识库:从Ollama部署到DeepSeek模型接入

最近和几位做技术咨询的朋友聊天,发现大家不约而同地开始关注同一个问题:如何在保证数据绝对私密的前提下,让AI真正成为团队的知识大脑?无论是处理客户敏感信息、内部技术文档,还是个人积累多年的研究笔记,把数据上传到云端总让人心里不踏实。这种对数据主权的需求,正在推动一场从“云上AI”到“本地AI”的迁移潮。

如果你也在寻找一个既能保护隐私,又能灵活调用强大模型的解决方案,那么今天要聊的这套组合拳——Ollama + DeepSeek + Cherry Studio——很可能就是你一直在找的答案。这不是简单的工具堆砌,而是一套经过实战验证的本地AI知识库搭建框架。我花了两个月时间,在自己的MacBook Pro和一台旧款NVIDIA显卡的台式机上反复折腾,踩遍了几乎所有能想到的坑,最终总结出了这条相对平滑的路径。

接下来的内容,我会完全从实际操作的角度出发,避开那些华而不实的理论,直接告诉你每一步该怎么做、可能会遇到什么问题、以及如何解决。无论你是独立开发者、小型团队的技术负责人,还是对数据隐私有严格要求的研究人员,这套方案都能让你在几个小时内,拥有一个完全受控于本地的智能知识助手。

1. 环境准备:从零搭建你的本地AI基础设施

搭建本地AI知识库的第一步,不是急着安装各种花哨的界面工具,而是先把底层的基础设施打牢。这就像盖房子,地基不稳,后面装修得再漂亮也白搭。我们的地基主要由两部分组成:Ollama负责模型的本地运行,DeepSeek则是我们选择的核心大脑。

1.1 硬件配置:你的电脑够用吗?

很多人一听到“本地大模型”就望而却步,觉得非得有顶级显卡才行。其实不然,经过实际测试,我发现不同配置的设备都能找到适合自己的方案。下面这个表格能帮你快速判断:

设备配置 推荐模型大小 可用场景 预期响应速度
入门级:8GB内存,无独立显卡(集成显卡) DeepSeek-Coder-V2-Lite-Instruct (1.5B) 基础代码补全、简单文本问答 较慢(5-10秒/回复)
主流级:16GB内存,RTX 3060 8GB DeepSeek-R1-Distill-Qwen-7B 文档总结、技术问答、中等复杂度代码生成 流畅(2-5秒/回复)
性能级:32GB内存,RTX 4070 12GB DeepSeek-V2.5 (16B) 多轮复杂对话、长文档分析、RAG检索增强 快速(1-3秒/回复)
工作站级:64GB+内存,RTX 4090 24GB DeepSeek-R1 (67B) 或更大模型 企业级知识库、批量文档处理、高精度推理 极速(<1秒/回复)

注意:如果你用的是苹果M系列芯片(M1/M2/M3),情况会有些特殊。得益于统一的ARM架构和高效的神经引擎,MacBook Pro的体验往往比同配置的Windows笔记本要好。我的M2 Max(32GB内存)运行7B模型时,速度甚至超过了朋友的RTX 4060台式机。

内存是关键瓶颈。模型加载到内存后,还需要额外的空间处理输入输出。一个简单的估算公式是:所需内存 ≈ 模型参数大小 × 2.5。比如7B模型,大概需要17-20GB的可用内存才能流畅运行。

1.2 Ollama安装:跨平台的模型运行引擎

Ollama的安装比想象中简单得多,官方提供了近乎一键式的安装包。但根据我的经验,有几个细节决定了后续使用的顺畅程度。

Windows用户最容易上手,直接下载.exe安装程序,双击运行即可。安装完成后,你会在系统托盘看到一个羊驼图标。右键点击它,选择“View Logs”,如果看到Listening on http://127.0.0.1:11434,说明服务已经正常启动。

macOS用户需要多一步终端操作。下载dmg安装包安装后,打开终端输入:

# 检查Ollama服务状态
ollama serve

# 如果提示命令不存在,可能需要手动添加到PATH
export PATH=$PATH:/usr/local/bin

Linux用户(包括WSL2)最灵活,但也最需要小心权限问题。官方的一键安装脚本确实方便,但我建议先看看脚本内容:

# 下载安装脚本但不立即执行
curl -fsSL https://ollama.com/install.sh -o install_ollama.sh

# 检查脚本内容(特别是sudo权限部分)
cat install_ollama.sh | head -50

# 确认无误后再执行
sudo bash install_ollama.sh

安装完成后,无论什么平台,都建议先跑一个简单的测试:

# 拉取一个微型模型测试
ollama pull tinyllama

# 运行测试
ollama run tinyllama "Hello, how are you?"

如果能看到正常的回复,说明Ollama基础环境已经就绪。这时候你可能会问:为什么不用DeepSeek直接测试?因为DeepSeek模型动辄几个GB,下载需要时间,先用小模型验证环境能节省大量等待时间。

1.3 模型存储优化:别让AI吃光你的C盘

默认情况下,Ollama会把所有模型下载到系统盘(通常是C盘)。对于动辄几十GB的大模型来说,这简直是灾难。我吃过一次亏——下载了三个模型后,系统盘直接红了。

解决方法很简单,在启动Ollama服务前设置环境变量:

  • Windows(PowerShell):
# 永久设置(需要管理员权限)
[System.Environment]::SetEnvironmentVariable("OLLAMA_MODELS", "D:\AI\Models", [System.EnvironmentVariableTarget]::Machine)

# 临时设置(当前会话有效)
$env:OLLAMA_MODELS="D:\AI\Models"
  • macOS/Linux
# 添加到shell配置文件(~/.zshrc或~/.bashrc)
echo 'export OLLAMA_MODELS="$HOME/AI_Models"' >> ~/.zshrc
source ~/.zshrc

设置完成后,重启Ollama服务,新下载的模型就会存储到指定目录。对于已经下载的模型,可以手动移动文件,然后修改Ollama的配置文件指向新位置。

2. DeepSeek模型部署:选择适合你的“数字大脑”

DeepSeek系列模型最近在开源社区火得不行,不是没有原因的。同等参数规模下,它的推理速度比Llama快20%,而成本只有1/20。但面对众多版本,该怎么选?我根据实际使用体验,给你一些接地气的建议。

2.1 模型选型:不是越大越好

很多人盲目追求参数规模,觉得67B肯定比7B强。但在本地部署的场景下,合适比强大更重要。下面是我测试过的几个DeepSeek版本的真实体验:

DeepSeek-R1-Distill-Qwen-7B:这是我的日常主力。在16GB内存的MacBook Pro上,它能流畅运行,响应速度在2-4秒之间。代码生成能力不错,技术文档理解准确率大约85%。最重要的是,它支持128K上下文,意味着你可以扔给它一整本技术手册进行问答。

DeepSeek-Coder-V2-Lite-Instruct (1.5B):如果设备配置真的很有限,这个版本是救星。虽然能力有限,但运行速度极快,适合简单的代码补全和语法检查。我把它装在了一台2019款的Intel MacBook Air上,还能勉强用用。

DeepSeek-V2.5 (16B):需要RTX 4070级别显卡才能流畅运行,但能力确实上一个台阶。复杂的逻辑推理、多步骤问题分解,它处理得游刃有余。如果你的使用场景涉及大量分析工作,这个投入是值得的。

DeepSeek-R1 (67B):我只在朋友的4090显卡机器上体验过。说实话,除非你是做AI研究或者有极其复杂的专业需求,否则这个版本对大多数人来说都是性能过剩。而且,67B模型光是加载到内存就需要130GB以上空间。

2.2 实战部署:一步步拉取和运行

选好模型后,部署其实就一行命令的事。但这一行命令背后,有很多可以优化的细节。

# 基础拉取命令
ollama pull deepseek-r1-distill-qwen:7b

# 但这样拉取的是默认版本,我更推荐指定量化版本
ollama pull deepseek-r1-distill-qwen:7b-q4_K_M

这里的q4_K_M是量化等级。简单解释一下:

  • q4:4位量化,模型大小缩小到原来的1/4,精度损失约1-2%
  • K:使用K-means量化算法
  • M:中等质量(还有S-small、L-large等选项)

对于7B模型,我强烈推荐q4_K_M这个配置。它在我的测试中,精度损失几乎感知不到,但内存占用从13GB降到了4GB,速度还快了30%。

拉取过程中,你会看到进度条。如果网络不好(特别是从国内访问),可能会很慢甚至失败。这时候可以尝试:

  1. 使用代理(如果合法合规且有必要)
  2. 更换下载源(有些社区镜像速度更快)
  3. 分时段下载(凌晨速度通常更好)

拉取完成后,用这个命令测试一下:

ollama run deepseek-r1-distill-qwen:7b "请用Python写一个快速排序函数,并添加详细注释"

如果模型能正确生成代码,说明部署成功。你可能会注意到第一次运行比较慢,因为模型需要加载到内存。后续对话会快很多。

2.3 性能调优:让模型跑得更快

默认配置下,Ollama会使用所有可用的CPU核心和尽可能多的GPU内存。但有时候,我们需要更精细的控制。

# 查看当前运行中的模型
ollama list

# 停止某个模型
ollama stop deepseek-r1-distill-qwen:7b

# 以自定义参数重新运行
OLLAMA_NUM_PARALLEL=4 OLLAMA_GPU_LAYERS=32 ollama run deepseek-r1-distill-qwen:7b

几个关键参数:

  • OLLAMA_NUM_PARALLEL:并行处理数,通常设置为CPU核心数的一半
  • OLLAMA_GPU_LAYERS:GPU加速层数,值越大GPU参与越多
  • OLLAMA_KEEP_ALIVE:模型在内存中保持的时间(默认5分钟)

对于有NVIDIA显卡的用户,还有一个隐藏技巧:安装CUDA版本的Ollama。虽然官方不直接提供,但社区有维护的版本,能提升30-50%的推理速度。不过这个操作有一定风险,新手不建议尝试。

3. Cherry Studio深度配置:打造你的私有知识库界面

Ollama和DeepSeek提供了底层能力,但要让它们真正好用,还需要一个友好的界面。这就是Cherry Studio的价值所在——它把复杂的模型调用、文档处理、对话管理,包装成了一个普通用户也能轻松上手的应用。

3.1 安装与基础配置:避开那些坑

Cherry Studio的安装过程看似简单,但我见过太多人在第一步就卡住了。问题往往出在权限和路径上。

Windows用户最容易遇到的问题是“无法创建配置文件”。这是因为Cherry Studio默认尝试在Program Files下写数据,而这个目录需要管理员权限。解决方法有两个:

  1. 安装时选择非系统盘(比如D:\CherryStudio)
  2. 安装后右键点击快捷方式,选择“以管理员身份运行”第一次启动

macOS用户可能会遇到Gatekeeper拦截。如果从非App Store渠道下载,需要:

# 解除应用限制
sudo xattr -rd com.apple.quarantine /Applications/Cherry\ Studio.app

Linux用户要注意依赖库。如果启动时报错缺少某个.so文件,可以尝试:

# Ubuntu/Debian
sudo apt-get install libfuse2 libgtk-3-0

# CentOS/RHEL
sudo yum install fuse-libs gtk3

安装完成后首次启动,Cherry Studio会引导你进行初始设置。这里有几个关键选择:

  1. 语言模型设置:选择“Ollama”作为后端
  2. API地址:填写http://localhost:11434(如果Ollama在其他机器,改为对应IP)
  3. 默认模型:选择刚才部署的DeepSeek模型

提示:如果连接Ollama失败,99%的情况是地址或端口不对。先在浏览器访问http://localhost:11434/api/tags,看看能否返回模型列表。如果不能,说明Ollama服务没启动或端口被占用。

3.2 知识库创建:文档处理的正确姿势

Cherry Studio的知识库功能是它的核心卖点,但很多人用不好,问题出在文档处理环节。我总结了一套“预处理-上传-优化”的三步法。

第一步:文档预处理 不要直接把原始PDF或Word文档扔进去。先做这些处理:

  • 将PDF转换为可编辑文本(用Adobe Acrobat或在线转换工具)
  • 移除无关的页眉页脚、水印
  • 如果文档有复杂表格,考虑先提取为CSV
  • 大文档拆分为逻辑章节(每章一个文件)

第二步:上传与分块配置 在Cherry Studio中创建新知识库时,分块设置直接影响检索质量:

  • 分块大小:技术文档建议512-768 tokens,普通文本可以1024
  • 重叠大小:设置分块大小的10-20%,确保上下文连贯
  • 分隔符:对于Markdown文档,用##作为分隔符效果很好

我的经验配置表格:

文档类型 分块大小 重叠大小 分隔符 适用场景
技术API文档 512 tokens 64 tokens \n\n 精准函数查询
产品说明书 768 tokens 128 tokens 概念解释
会议纪要 1024 tokens 256 tokens --- 整体回顾
代码仓库 256 tokens 32 tokens \n\n\n 代码片段查找

第三步:向量化与索引 上传文档后,Cherry Studio会在后台进行向量化处理。这个过程可能很耗时,特别是文档多的时候。几个加速技巧:

  1. 关闭其他占用CPU的应用
  2. 如果支持GPU加速,确保CUDA已正确配置
  3. 分批上传,不要一次性传太多

处理完成后,一定要测试检索效果。问几个你知道文档中肯定有的问题,看看返回的片段是否相关。

3.3 高级功能挖掘:超越基础对话

Cherry Studio有很多隐藏功能,用好了能大幅提升效率。

多模型对话:这是Cherry Studio的杀手级功能。你可以同时让DeepSeek和另一个模型(比如Qwen)回答同一个问题,然后对比结果。配置方法:

  1. 在设置中添加第二个模型端点
  2. 创建新对话时,选择“多模型”模式
  3. 提问后,两个模型会并行回答

自定义助手模板:如果你经常处理特定类型的问题,可以创建模板。比如我配置了一个“代码审查助手”:

name: "代码审查专家"
system_prompt: |
  你是一个资深代码审查专家,擅长发现代码中的安全隐患、性能问题和代码异味。
  请按照以下格式回复:
  1. 安全问题(高/中/低风险)
  2. 性能优化建议
  3. 代码规范问题
  4. 重构建议
  
  语言风格:直接、专业、给出具体行号
temperature: 0.3  # 较低的温度让输出更稳定

工作流自动化:通过Cherry Studio的API,可以集成到现有工作流。比如:

  • 自动处理客服邮件,从知识库中提取标准回复
  • 代码提交时自动审查
  • 日报自动生成和总结

4. 实战应用与优化技巧:让AI真正为你工作

工具搭好了,模型跑起来了,界面也配置好了。但这才刚刚开始。要让这套系统真正产生价值,需要把它融入到实际工作流中。我分享几个自己用得很顺手的场景。

4.1 技术文档问答系统

作为技术负责人,我经常需要回答团队成员的各种技术问题。很多问题其实在文档里都有答案,但大家要么找不到,要么懒得找。用Cherry Studio搭建的内部技术问答系统解决了这个问题。

实现步骤:

  1. 把所有技术文档(API文档、架构说明、部署指南)上传到知识库
  2. 创建一个专门的“技术支持”助手
  3. 设置系统提示词:“你是一个耐心的技术专家,根据提供的文档回答问题。如果文档中没有明确答案,就说‘文档中未找到相关信息,建议咨询某某同事’”
  4. 把链接分享给团队

效果:简单问题的回答时间从平均15分钟降到了30秒。更重要的是,答案标准统一,不会出现不同人给出不同解释的情况。

4.2 代码库智能搜索

程序员最痛苦的事情之一:在几万行代码中找一个特定的函数或逻辑。传统的文本搜索只能匹配关键字,而基于语义的搜索能理解“查找所有处理用户认证的函数”这样的自然语言查询。

配置方法:

# 这是一个示例的代码索引配置
{
  "code_repo_path": "/path/to/your/code",
  "exclude_patterns": ["*.min.js", "*.log", "node_modules/"],
  "language_specific": {
    "python": {
      "chunk_size": 200,
      "overlap": 20,
      "separators": ["\n\n", "\nclass ", "\ndef ", "\nasync def "]
    },
    "javascript": {
      "chunk_size": 300,
      "overlap": 30,
      "separators": ["\n\n", "\nfunction ", "\nconst ", "\nclass "]
    }
  }
}

使用体验:现在我要找一个“处理JWT令牌验证的中间件”,直接问Cherry Studio,它不仅能找到相关文件,还能高亮显示具体代码段,甚至解释这段代码的逻辑。

4.3 个性化学习助手

我最近在学习Rust,但官方文档太枯燥,网上的教程又质量参差不齐。于是我用Cherry Studio建了一个“Rust学习助手”。

知识库内容:

  • Rust官方文档(中英文)
  • 《Rust程序设计语言》电子书
  • 我收集的优质博客文章
  • Stack Overflow上的经典问答

助手配置:

系统指令:你是一个有耐心的Rust导师,擅长用比喻和例子解释复杂概念。
当用户提问时:
1. 先判断用户的知识水平(新手/中级/高级)
2. 从简单到复杂逐步解释
3. 每个概念都要提供代码示例
4. 指出常见的错误和陷阱

学习效果:比单纯看文档效率高了至少3倍。特别是遇到编译错误时,把错误信息贴进去,助手能直接指出问题所在,还给出修改建议。

4.4 性能监控与优化

本地AI系统运行一段时间后,可能会变慢。这时候需要一些监控和优化手段。

监控指标:

  • 响应时间:正常应在1-5秒,超过10秒需要优化
  • 内存使用:通过ollama ps查看
  • GPU利用率:如果有显卡,用nvidia-smi监控
  • 知识库检索准确率:定期用测试问题验证

常见问题及解决方案:

问题现象 可能原因 解决方案
响应越来越慢 内存碎片化 定期重启Ollama服务
检索结果不相关 向量索引过时 重新构建知识库索引
模型加载失败 磁盘空间不足 清理旧模型或扩展存储
对话上下文丢失 上下文长度超限 调整模型上下文参数或总结历史

一个实用的维护脚本:

#!/bin/bash
# 本地AI系统健康检查脚本

echo "=== Ollama状态检查 ==="
ollama ps

echo -e "\n=== 磁盘空间检查 ==="
df -h | grep -E "(Filesystem|/$)"

echo -e "\n=== 内存使用检查 ==="
free -h

echo -e "\n=== Cherry Studio进程检查 ==="
ps aux | grep -i cherry | grep -v grep

echo -e "\n=== 网络连接检查 ==="
curl -s http://localhost:11434/api/tags | jq '.models[].name' | head -5

设置一个定时任务,每周运行一次这个脚本,能提前发现很多潜在问题。

5. 故障排除与进阶玩法

即使按照最详细的教程,在实际部署中还是会遇到各种奇怪的问题。我整理了最常见的一些故障及其解决方法,希望能帮你少走弯路。

5.1 常见问题速查表

问题描述 错误信息/现象 可能原因 解决方案
Ollama服务无法启动 Error: listen tcp 127.0.0.1:11434: bind: address already in use 端口被占用 lsof -i :11434 查找占用进程并结束
模型下载失败 Error: pull model manifest: ... 网络问题或存储空间不足 换源或清理磁盘空间
Cherry Studio连接失败 Failed to connect to Ollama 防火墙阻止或地址错误 检查Ollama是否运行在0.0.0.0而非127.0.0.1
知识库检索无结果 搜索任何内容都返回空 文档未正确向量化 重新处理文档,检查分块设置
模型响应特别慢 简单问题也要10秒以上 GPU未启用或内存不足 检查ollama run时是否使用了--gpu参数
中文支持不好 中文问题回答质量差 模型未针对中文优化 尝试deepseek-r1-distill-qwen:7b等中文优化版本

5.2 网络问题的终极解决方案

如果你在拉取模型时遇到网络问题,除了常规的换源、重试,还有一个更根本的解决方案:使用模型镜像。

国内有一些社区维护的镜像站,速度会快很多。配置方法:

# 临时使用镜像
OLLAMA_HOST=https://mirror.example.com ollama pull deepseek-r1-distill-qwen:7b

# 或修改Ollama配置
# Linux/macOS: ~/.ollama/config.json
# Windows: C:\Users\<用户名>\.ollama\config.json
{
  "registry": {
    "mirrors": {
      "docker.io": "https://mirror.example.com"
    }
  }
}

注意:使用第三方镜像存在安全风险,确保来源可信。对于企业环境,建议自建镜像服务器。

5.3 安全加固:保护你的私有数据

本地部署的最大优势是数据安全,但如果配置不当,反而可能成为安全漏洞。几个必须做的安全措施:

1. 访问控制 默认情况下,Ollama的API是开放给本地所有应用的。如果你在多人使用的机器上部署,需要限制访问:

# 只允许本地回环访问
OLLAMA_HOST=127.0.0.1 ollama serve

# 或设置认证(需要Ollama 0.5+)
OLLAMA_AUTH=require ollama serve

2. 知识库加密 Cherry Studio的知识库默认以明文存储。对于敏感文档,建议:

  • 使用全盘加密(如macOS的FileVault)
  • 或单独加密存储文档的目录

3. 定期备份

# 备份Ollama模型
tar -czf ollama_backup_$(date +%Y%m%d).tar.gz ~/.ollama/models

# 备份Cherry Studio知识库
# 知识库位置:~/Library/Application Support/Cherry Studio/ (macOS)
# 或 C:\Users\<用户名>\AppData\Roaming\Cherry Studio\ (Windows)

5.4 成本控制:别让电费账单吓到你

运行本地大模型确实耗电,特别是长时间使用GPU的情况下。几个省电技巧:

1. 智能启停 不用的时候完全关闭Ollama服务。写一个简单的脚本:

#!/bin/bash
# 检测到30分钟无活动后自动关闭

LAST_ACTIVITY=$(date +%s)
while true; do
    # 检查是否有活跃的ollama进程
    if pgrep -f "ollama run" > /dev/null; then
        LAST_ACTIVITY=$(date +%s)
    fi
    
    CURRENT_TIME=$(date +%s)
    if [ $((CURRENT_TIME - LAST_ACTIVITY)) -gt 1800 ]; then
        echo "30分钟无活动,关闭Ollama..."
        pkill -f ollama
        break
    fi
    
    sleep 60
done

2. 模型选择策略

  • 日常轻量任务:用1.5B或3B的小模型
  • 复杂分析任务:临时加载7B或更大模型
  • 批量处理任务:安排在电费低的时段(如夜间)

3. 硬件优化

  • 笔记本用户:使用电源管理工具限制CPU频率
  • 台式机用户:考虑使用能效比更高的显卡(如RTX 4060比3080更省电)

5.5 扩展思考:这套方案的边界在哪里?

任何技术方案都有其适用边界。经过几个月的实际使用,我发现这个组合在以下场景表现最佳:

适合的场景:

  • 中小团队(10人以内)的内部知识管理
  • 个人学习与研究助手
  • 对数据隐私有严格要求的行业(法律、医疗、金融)
  • 需要7x24小时可用的离线AI服务

不太适合的场景:

  • 超大规模文档处理(百万级文档)
  • 需要实时响应的生产环境(延迟要求<100ms)
  • 多租户SaaS服务(Cherry Studio的权限管理相对简单)

未来的升级路径: 如果现有方案不够用了,可以考虑:

  1. 横向扩展:部署多台机器,用负载均衡分发请求
  2. 纵向升级:换更强的单机,上更大的模型
  3. 架构演进:迁移到更专业的知识库系统(如Milvus + LangChain)

最后的实践心得

折腾了这么一大圈,从最初的兴奋尝试,到中间的无数次踩坑,再到现在的稳定使用,我最大的体会是:技术本身不是目的,解决问题才是。Ollama、DeepSeek、Cherry Studio这套组合,最大的价值不是技术有多先进,而是它实实在在地解决了我工作中的痛点——数据隐私、响应速度、定制化需求。

记得有一次,我需要分析一份包含敏感客户信息的合同,既想用AI帮忙提炼要点,又担心数据泄露。用上这套本地方案后,心里踏实多了。文档不用出本地网络,模型在自己电脑上跑,所有的处理过程都在可控范围内。这种安全感,是任何云端服务都给不了的。

另一个没想到的好处是响应速度。虽然本地推理理论上比云端慢,但实际上,因为少了网络往返延迟,对于大多数日常问题,1-3秒的响应时间完全可接受。特别是写代码的时候,那种“想到就问,问了就有答案”的流畅感,确实提升了效率。

当然,这套方案也不是完美的。最大的挑战是硬件门槛。不是每个人都有高性能的电脑,而低配设备跑大模型确实吃力。我的建议是:先从最小的模型试起,1.5B的DeepSeek-Coder在很多编程任务上已经比以前的代码补全工具强多了。等真正感受到价值,再考虑硬件升级。

最后给想尝试的朋友一个实用建议:别想着一口吃成胖子。先选一个最痛的点(比如技术文档查找、代码审查、学习笔记整理),用最小的模型、最简单的配置跑起来。看到效果后,再逐步扩展。AI工具就像健身,重要的是持续使用,而不是一次性把装备买全。

我现在的日常是:早上打开电脑,Ollama自动启动,Cherry Studio常驻在菜单栏。写代码时用它查API,写文档时让它帮忙润色,读论文时让它总结要点。它已经从一个“新奇玩具”,变成了真正的“生产力伙伴”。如果你也受够了在隐私和效率之间做选择,不妨试试这条本地化的路。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐