AI编程工具的数据边界在哪里:从Claude Code访问限制事件说起
Claude Code本周对中国区用户实施访问限制,大量开发者登录后发现功能无法正常使用;工信部同期发布安全风险通报,点名部分AI编程工具在数据跨境传输和权限管理方面存在隐患。两件事几乎同时发生,把一个被效率红利掩盖了很久的问题重新推到了开发者面前。过去一年AI编程工具已经从代码补全走到了开发流程的核心,越来越多团队用它们写测试、做Code Review、分析日志、排查线上问题,甚至参与架构讨论,模型能力提升带来的效率几乎没有争议,但当越来越多代码交给AI处理之后,这些数据会经过哪里、由谁处理、存放在哪里,大多数开发者其实答不上来。
很多开发者第一次接触AI编程工具时,关注的通常都是生成效果,而不是它获取了哪些权限。以目前主流产品为例,为了理解项目上下文它们通常需要访问整个工作目录,不仅仅是当前正在编辑的文件,建立索引、分析仓库结构、读取配置文件、理解模块之间的关系,这些是实现高质量补全和代码生成的重要基础。工具能接触到的信息远比很多人想象得多。哦对了,.git目录里的提交历史和分支信息也在索引范围内,还有.env文件,数据库密码和云服务密钥全在里面,大部分工具默认不会跳过它。
对于个人项目来说这未必是问题。企业环境里一个仓库往往不只有业务代码,还会包含配置文件、部署脚本、历史提交记录以及各种运行环境信息,团队如果没有建立明确的使用规范,敏感信息进入AI上下文的可能性是真实存在的。近年来多家AI编程工具厂商都对数据处理方式进行了说明,包括哪些内容会发送到服务器、哪些内容不会用于模型训练、用户可以如何调整隐私设置,相比几年前透明度已经提高了不少。对于开发团队而言更现实的问题始终没变过,数据会不会离开本地环境,哪些代码会参与模型处理。
Claude Code这次访问限制之所以引发这么大反应,和依赖程度直接相关。社群里不少人的第一反应不是换工具而是工作流断了,用AI补全代码只是最基础的用法,code review、写测试、定位线上bug、讨论架构方案都在里面进行,服务一卡整个开发节奏就受影响。据我们了解,事件之后已经有团队在评估替代方案,国内服务、内网部署开源模型、本地推理几条路线都有人在试。很多互联网团队认为数据上云的风险可以接受,因为效率提升确实明显;金融、政务、制造、医疗等对数据安全要求更高的行业评估标准不一样,这些行业更关注数据是否跨境、是否能够审计、是否能够控制工具访问范围、是否符合内部安全规范,模型能力固然重要,但在很多场景下它甚至不是采购和部署时排在第一位的因素。
这也是近一年本地推理重新受到关注的原因。
过去本地模型最大的短板是性能,模型太大推理太慢,实际体验很难满足日常开发需求。模型规模在不断优化,端侧推理框架也在持续成熟,这个情况正在发生变化。我们在开发Mano-P的过程中对这一点有比较直观的感受。Mano-P是运行在macOS上的本地GUI Agent,针对图形界面交互场景我们训练了4B参数的Mano-CUA-Thinking模型,结合MLX推理框架做了优化。项目早期团队内部其实有分歧,一部分人觉得4B参数放在本地跑顶多做个演示demo,真正干活还得靠云端大模型。M5 Pro上实际跑起来之后decode速度大约80 tokens/s,prefill不到3秒,日常交互的体感和云端服务差距很小,这个结果比我们预期的好。所有截图、任务描述和推理过程都在本地设备上完成,不需要上传到外部服务器,对需要处理企业内部系统、生产环境界面或者包含敏感信息软件的团队来说,这一点直接消除了最大的顾虑。
在一组macOS GUI真机测试中,本地4B模型在100个真实任务上的成功率达到56%,同一组测试里云端通用视觉语言模型Qwen3-VL-Plus的成功率是39%。小模型当然没有全面超过大模型,高度垂直的任务上针对场景进行训练和优化,效果往往比单纯堆参数更直接,这个结论也是做测试之后才真正建立起来的,之前只是理论上的判断。
我们开源的Cider推理SDK专注于MLX框架下的量化推理优化,W8A8配置下相比W8A16基线prefill性能最高可以提升接近1.8倍。Cider最初只是Mano-P项目内部用的加速模块,后来发现很多做本地推理的开发者都在找类似的东西就拆出来单独开源了,现在300多个GitHub Star,关注度比我们预想的高。
云端和本地在很长一段时间内不会是谁替代谁的关系,各自承担不同的角色。云端模型在复杂推理、跨语言开发和通用编程能力上的优势会持续存在,个人项目和开源协作是它最适合的场景;本地模型会更多承担涉及企业核心代码、内部系统和敏感数据的开发任务。我们最后把Mano-P全部做成了本地模式,不是因为云推理做不了,开发过程中越来越觉得代码工具最好别依赖网络,这也是后来决定把模型和Cider SDK一起开源的原因。
AI编程工具确实进入了一个新的阶段。过去讨论的是模型够不够聪明、生成速度够不够快,现在开发效率提升的同时数据是否掌握在自己手里成了同等重要的问题。模型能力决定效率,数据边界决定信任。Mano-P在GitHub上Apache 2.0开源,4B模型权重和Cider SDK都在仓库里,M4及以上芯片32GB内存的Mac可以直接brew install mano-cua安装,加--local参数就是完全离线运行。
更多推荐


所有评论(0)