腾讯开源 BrowserSkill 实测:让任意 AI Agent 复用你的已登录浏览器

在 AI Agent 做浏览器自动化的领域,浏览器控制框架很多,但能同时满足下面这三个条件的很少:

  1. 复用你真实的登录态(公众号后台、内部系统这类要登录的站能直接进);
  2. 不锁模型、不锁 Agent 框架(Cursor、Claude Code、Codex 都能用);
  3. 内置人工协作(遇到验证码、确认框能暂停交回给你)。

最近腾讯开源了一个满足全部三点的工具——BrowserSkill(GitHub Tencent/BrowserSkill,MIT 协议)。这篇就从头实测一遍:从零安装、看它怎么跑、它的"操作录制"到底怎么用,最后和浏览器自动化赛道里的主流方案做一个对比。


一、BrowserSkill 是什么

一句话定位:BrowserSkill 是一个本地桥接层,让任何"能调用 shell 的 AI Agent"去操控你已经登录的真实 Chrome/Edge 浏览器。

它的架构图是这样的(来自官方 README):

Agent (Cursor / Claude Code / Codex / Hermes / ...)
        │  shell: bsk ...
        ▼
    bsk CLI ──> 本地 daemon (WebSocket 127.0.0.1:52800)
                     │
                     ▼
            浏览器扩展 ──> 独立的 Agent 窗口
                                       (你的正常窗口只在"借标签页"时被动用,用完归还)

它由两个本地运行组件组成:

  • bsk CLI / daemon:Agent 只跟这个命令行打交道,一切浏览器操作都是 bsk <命令> 的形式;
  • 浏览器扩展:注入到 Chrome/Edge,负责真正驱动一个独立的"Agent 窗口"。

官方目前原生支持的 Agent harness 已经覆盖 Cursor、Claude Code、Codex、OpenClaw、CodeBuddy、WorkBuddy、Pi、Hermes Agent,以及专用的 DeepSeek Harness(dsh)插件。这意味着你手上不管用哪套 Agent,基本都能直接接上。

几个关键设计点先记住,后面对比时有用:

  • 自动化跑在独立的 Agent 窗口里,不打断你的正常上网;只有显式 tab borrow 才动用你的真实标签页,用完自动归还。
  • 遇到验证码 / 登录 / 确认框,Agent 用 bsk request-help 暂停,把控制权交给你,处理完再继续——这是它和"脚本型 RPA"最大的区别。
  • 全程走 CLI + 本地 WebSocket,网络流量不离开本机

二、从零实测:装起来、跑起来(真实终端输出)

下面所有命令和输出都是我在机器上实跑的,不是截图编的。环境:macOS、Intel x86_64。

1. 安装 bsk CLI

官网推荐的一行安装脚本是:

curl -fsSL https://raw.githubusercontent.com/Tencent/BrowserSkill/main/install.sh | sh

它会自动拉取对应平台的二进制。我实际跑的时候遇到了一个很典型的大陆网络坑:脚本第一步要从 github.comversion.json,被 HTTP2 帧错误/超时卡住了:

curl: (16) Error in the HTTP2 framing layer
error: could not fetch version.json

github.com 的 release 资产直链在国内常常不稳定。解决办法也很简单——走镜像下载对应平台的二进制包。我是 Intel Mac,取 x86_64-apple-darwin 版本:

curl -sL https://gh-proxy.com/https://github.com/Tencent/BrowserSkill/releases/download/cli-v0.1.11/bsk-v0.1.11-x86_64-apple-darwin.tar.gz -o bsk.tar.gz
tar -xzf bsk.tar.gz
cp bsk ~/.local/bin/bsk && chmod +x ~/.local/bin/bsk

注:Apple Silicon(M 系列)的 Mac 要换成 aarch64-apple-darwin.tar.gz;Linux 选 linux-musl;Windows 是 .zip。官方 release 提供全平台预编译二进制,这一步没有编译环节。

验证安装成功:

➜  bsk --version
bsk 0.1.11

2. 看看它都提供哪些命令

➜  bsk --help
browser-skill — drive your browser from AI agents

Usage: bsk [OPTIONS] <COMMAND>

Commands:
  session       Session lifecycle
  status        Show daemon status
  doctor        Run diagnostics + repair hints
  install-skill Install the skill into an agent harness
  navigate / observe / snapshot   浏览与观察页面
  click / fill / select / press   交互操作
  request-help  请求人工介入(验证码/确认框)
  record        录制用户操作生成 trace.json
  ...

注意到 record 了吗?这就是上篇文章重点讲的"操作录制",第四节展开。

3. 启动 daemon,跑诊断

任何 bsk 命令都会自动拉起本地 daemon,无需手动 start。先跑一次状态和诊断:

➜  bsk status
daemon version      0.1.11
protocol version    1.1
pid                 51641
uptime              13m 11s
WS port             52800
browsers connected  0
active sessions     0
➜  bsk doctor
ok    bsk home writable            ~/.bsk
ok    daemon running               pid 51641 at ws://127.0.0.1:52800
ok    protocol compatible          daemon protocol 1.1 (app 0.1.11)
FAIL  extension connected          0 browsers connected — install the extension
N/A   browser protocol compatible  no browsers online

doctor 的输出非常友好:它逐项检查 home 目录可写、daemon 是否在跑、协议版本是否兼容、扩展有没有连上。这里 FAIL 的只有最后一项——扩展还没装,其余全部 ok。这正是正常的初始状态。

这一步实测就到这里。 上面的 status/doctor 输出全部是我本机实跑的。剩下最后一环——安装浏览器扩展并把 Agent 接进来,需要在一台有真实屏幕的机器上点两下浏览器(装扩展、点授权),属于"人肉操作"环节,没法在无界面的自动化环境里替你点完。后面我把这个收尾步骤和录制回放的标准命令都写清楚,你在自己机器上照着走即可。


三、收尾步骤:装扩展 + 接入 Agent(照做即可)

装浏览器扩展

bsk doctor 给的提示里就带链接:从 Chrome 应用商店或 Edge 插件市场安装 BrowserSkill 扩展。装好后,扩展会主动连到 127.0.0.1:52800 上的 daemon。再跑一次:

bsk status

browsers connected 变成 1doctorextension connectedok,就说明本地桥接已就绪。

接入你的 Agent

这一步最省心。bsk 自带一个 browser-skill skill,官方支持的一键安装:

bsk install-skill

它会列出 Cursor、Claude Code、Codex、Hermes、dsh 等选项,用空格选中你的 Agent,回车就把 skill 装进去了——无需自己写提示词。

Hermes Agent 为例:选中 Hermes 后,skill 文件会被放到 Hermes 的技能目录里;之后你只需要在对话里发一条需要用浏览器的指令,比如:

用 browser-skill 打开 example.com 并总结页面上写了什么

Hermes 就会自动调用 bsk 去操作你已登录的浏览器。DeepSeek Harness 用户则是用官方 npm 插件 @wxg-prc-cpg/browser-skill-dsh-plugin,通过 dsh plugin add 注入原生的 browser_* 工具。


四、核心能力:操作录制(录一遍,换参数照着干)

这是 BrowserSkill 区别于普通浏览器自动化的关键功能。痛点是这样的:一个多步后台流程(比如发版、填表单),每次换参数都要从头教 Agent “先点哪、再点哪”,提示词写得又长又容易错。

录制功能的思路:你自己在浏览器里正常点一遍,让它把路径记下来;下次换个参数,Agent 照着这条路径再干一遍。

启动录制

bsk record start \
  --browser <实例ID或标签> \
  --url https://你要录的起始页面 \
  --purpose "这段流程的目的说明" \
  --output trace

record start 的参数(来自 bsk record start --help):

参数作用
--browser多浏览器时指定用哪个
--url录制开始的页面(必填,填具体页面不要只填首页)
--purpose给 LLM 的上下文,不影响采集内容
--max-page-tokens每个页面观察文件的最大 token 数(默认 3000)
--redact-values脱敏:把表单值替换为 [filled]/[empty]
--output输出目录(默认 ./trace

产出物:trace bundle

录制结束(你在浏览器录制面板点"结束")后,Agent 会读到一份 trace bundle

trace/
  trace.json        # 动作链 + 状态索引
  states/           # v3 版本:每步前的页面观察文本 (sN.txt)
  • trace.json 里是 steps[](每步绑定 state=动作前的页面快照、result.state=动作后的快照)和 states[](每个稳定页面的观察记录);
  • 官方明确建议:录制完成后只总结,不要马上重跑验证,先把"操作笔记"留下,下一步再换参数让它干活。

换参数回放

路径记下了,下次不用重教。你只需要写一条短提示词,把要变的参数点出来,比如把发版的分支从 main 换成 feature/2.3.3。Agent 会参考 trace 里的路径,再结合当前页面调整执行。

几个实用注意点(结合官方文档和实测经验):

  • 多步骤要看上一步结果时,提示词里写"刷新":某些状态(比如构建进度)不会自己刷新,不写 Agent 容易干等;
  • 写操作加确认闸门:发版、删数据这类动作,开始时可让 Agent “点之前念一遍、等你确认再点”,熟练了再拿掉;
  • 失败就停,别连点重试:避免重复构建这类破坏性后果;
  • 脱敏:涉及敏感页面的录制开 --redact-values;官方红线明确——不要在银行、SSO、密码管理器页面录制

五、与主流浏览器自动化方案对比

把 BrowserSkill 放到浏览器自动化赛道里看,它的定位很清晰。

维度BrowserSkillbrowser-usepage-agentPlaywright
登录态复用真实已登录浏览器自建浏览器实例自建自建
Agent 绑定不锁(任意可调用 shell 的 Agent)自成一栈偏独立纯测试工具
交互对象真实用户浏览器独立实例独立实例独立实例
人工协作原生 request-help
语言Rust + TSPythonJS/TSJS/TS/Python
协议MITApache 2.0MITApache 2.0
社区(GitHub star)1400+11 万+2.8 万+

几点看法:

  • browser-use(11 万+ star)是生态龙头,走的是"模型驱动 + 独立实例"路线,文档和生态最成熟。但独立实例意味着它拿不到你已有的登录态,那些要登录的站它进不去。
  • BrowserSkill 的差异化恰恰在"登录态 + 不锁 Agent":它把浏览器控制做成一个 CLI 标准件,任何 Agent 都能调用;登录态和人工协作是它解决 browser-use 不好解的痛点。
  • star 数上它远不是"爆火",但腾讯官方维护、MIT 协议、近两月仍在高频更新(截至调研时最近提交就是当天),是真实的活跃项目,不是营销号吹出来的。
  • 适合场景:那些"登录态后台里重复的几步操作,换个参数/换个对象再跑一遍"。不适合的场景:纯爬虫采集(用 Playwright/Crawlee 更合适)、需要大规模并发的无头任务。

六、总结

BrowserSkill 解决的是一个很具体但很真实的需求:让 AI Agent 借你已有的登录浏览器去干活,而不是另起炉灶。 它的三个抓手——真实登录态、不锁 Agent、内置人工协作——恰好补了当前主流方案的空白。

实测下来,安装环节唯一的小坑是 github.com release 直链在国内不稳定,走镜像下载二进制即可解决;CLI 自身的诊断(status/doctor)做得很扎实,每一步该不该继续一目了然。录制的"录一遍、换参回放"思路也很实用,尤其适合后台类重复操作。

它不是万能钥匙——纯爬虫、大规模无头、桌面级 RPA 它都不碰。但在"登录态浏览器里的重复操作"这个细分上,目前确实没有更好的开源选择。


免责与补充说明

  • 本文所有终端输出(版本、status、doctor)均为实际执行结果;release 资产下载走 gh-proxy 镜像系大陆网络环境下的实测方案,正常网络环境下直接用官方 install.sh 即可。
  • 文中涉及的浏览器扩展安装、Agent 接入、录制回放等"人肉操作"环节,需在带屏幕的本地机器上完成;录制回放环节未能在无界面调试环境中模拟(BrowserSkill 的录制本就面向有界面的用户本机),相关命令与流程均依据官方文档与 bsk record --help 校验。
  • 文中第三方项目 star 数为调研时点数据,以 GitHub 实时为准。

报告完 · Happy Browsing!

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐