在这里插入图片描述

最近 GitHub 上有个项目挺有意思,叫 BrowserSkill,来自腾讯。

项目地址:

https://github.com/Tencent/BrowserSkill

如果你平时在用 Codex、Claude Code、Cursor、Hermes Agent 这类 AI Coding 工具,这个项目很值得看。

它解决的问题非常直接:

让 AI Agent 直接使用你已经登录的真实浏览器。

以前我们让 Codex 操作网页,通常会走 Playwright、Selenium 或独立浏览器环境。

问题也很明显。

比如你让 Codex:

打开我的后台,查看最近 10 条订单。

它启动一个新的浏览器以后,第一件事往往是:

请登录

接着又可能遇到:

短信验证码
二次验证
扫码登录
人机验证

但你自己的 Chrome 明明早就已经登录好了。

BrowserSkill 就是在解决这个问题。


BrowserSkill 是什么?

BrowserSkill 本质上是在 AI Agent 和你本机浏览器之间,加了一层本地桥接。

目前官方已经明确支持:

  • Codex
  • Claude Code
  • Cursor
  • OpenClaw
  • CodeBuddy
  • WorkBuddy
  • Pi
  • Hermes Agent
  • DeepSeek Harness
  • 其他可以调用 Shell 的 Agent

它不会要求 Agent 再启动一个完全独立的测试浏览器,而是可以复用你真实 Chrome 或 Edge 中已经存在的登录状态。

比如你的 Chrome 已经登录:

GitHub
博客后台
公司管理系统
电商后台
CRM
内部工具

Codex 就可以通过 BrowserSkill 继续操作这些网站。

这对电脑自动化来说非常实用。


最大的亮点:复用真实登录状态

这是我觉得 BrowserSkill 最有价值的地方。

传统浏览器自动化经常是:

Codex
  ↓
Playwright
  ↓
新浏览器
  ↓
重新登录

BrowserSkill 的流程更像:

Codex
  ↓
bsk CLI
  ↓
本地 Daemon
  ↓
BrowserSkill 浏览器扩展
  ↓
你已经登录的 Chrome

也就是说,Agent 不需要重新创建一套账号状态。

你已经登录的网站,它可以直接使用。

如果你的工作经常涉及:

  • 查询后台数据
  • 整理网页信息
  • 操作 CMS
  • 检查 GitHub
  • 查看内部系统
  • 自动填写网页表单
  • 批量处理后台任务

这个能力就非常有用了。


Agent 操作浏览器时,你还能继续正常工作

这也是 BrowserSkill 设计得比较好的一个地方。

它不会默认直接抢走你正在使用的 Chrome。

BrowserSkill 会给 Agent 创建一个独立、可见的 Agent Window

也就是说:

你的 Chrome 窗口
→ 你继续正常使用

Agent Window
→ Codex 自己操作

两个可以同时工作。

如果 Agent 确实需要操作你当前已经打开的某一个 Tab,它需要显式“借用”这个 Tab。

任务结束以后,再把 Tab 归还。

其他浏览器窗口不会被随便操作。

相比“AI 一启动自动化,我的鼠标键盘就不能用了”,这种方式舒服很多。


遇到验证码怎么办?

真实网站自动化一定绕不开验证码、扫码登录、确认弹窗这些问题。

BrowserSkill 没有尝试让 AI 强行绕过这些步骤,而是直接支持 Human-in-the-loop

流程类似:

Agent 自动执行任务
        ↓
遇到验证码
        ↓
请求用户接管
        ↓
你完成验证码
        ↓
把控制权交还 Agent
        ↓
继续执行

这个设计其实很重要。

真正能进入日常工作流的 Agent,不应该假设所有步骤都能 100% 自动完成。

很多时候最实用的方式反而是:

AI 完成 90%,人类只处理必须人工确认的 10%。


在 Codex 中怎么安装?

如果你使用 macOS 或 Linux,可以先安装 bsk CLI:

curl -fsSL https://raw.githubusercontent.com/Tencent/BrowserSkill/main/install.sh | sh

安装完成以后检查版本:

bsk --version

然后安装 BrowserSkill 的浏览器扩展。

官方目前支持:

Chrome
Microsoft Edge

其他 Chromium 浏览器只要支持 Chromium 扩展,也有机会使用。

接下来给 Codex 安装 Skill:

bsk install-skill

执行以后,可以选择你正在使用的 Agent。

例如:

Codex
Claude Code
Cursor
Hermes Agent
OpenClaw

安装完成以后,建议重新打开一个新的 Codex Session。


最简单的测试

安装好以后,可以先从一个最简单的任务开始。

在 Codex 里输入:

/browser-skill open example.com and summarize what is on the page.

如果浏览器可以正常打开页面并返回内容,说明基础链路已经跑通。

接下来就可以开始测试更真实的场景。


一个更适合实际工作的例子

假设你的 Chrome 已经登录了自己的博客后台。

你可以直接告诉 Codex:

使用 browser-skill 打开我已经登录的博客后台。

查看最近发布的 10 篇文章。

整理出:

1. 文章标题
2. 发布时间
3. 阅读量
4. 评论数

最后生成一个 Markdown 表格。

不要修改、删除或发布任何内容。

这时候 Codex 可以:

打开后台
↓
读取列表
↓
翻页
↓
整理数据
↓
生成 Markdown

你不需要再专门给 Codex 配置后台 API。

也不用重新在测试浏览器里登录一次。

这就是 BrowserSkill 真正实用的地方。


再进一步:让 Codex 操作真实业务系统

比如做电商,你可以让 Agent:

打开订单后台。

筛选今天所有“已付款未发货”的订单。

统计订单数量和总金额。

不要执行发货操作。

做内容运营,可以:

打开内容管理后台。

整理最近 30 天发布的文章。

找出阅读量最高的 10 篇。

分析标题有什么共同特点。

做开发,可以:

打开已经登录的测试环境。

按照测试用例依次检查几个页面。

记录出现报错的页面和错误信息。

不要修改线上数据。

这时候 Codex 已经不只是“写代码”。

它开始真正操作软件。


BrowserSkill 的工作原理

BrowserSkill 的架构并不复杂。

核心链路是:

Codex / Claude Code
        ↓
      bsk CLI
        ↓
    Local Daemon
        ↓
    WebSocket
        ↓
BrowserSkill Extension
        ↓
      Chrome

Agent 本身不会直接控制浏览器。

它会调用 bsk

bsk 再把任务交给本地 Daemon。

Daemon 通过本地 WebSocket 和浏览器扩展通信。

最后由扩展完成浏览器操作。

官方说明这里的通信主要发生在本机。

这种设计的好处是:

Agent 仍然通过标准 Shell 调用工具。

所以 BrowserSkill 并没有强绑定某个模型。

只要 Agent 能执行 Shell,就有机会接入。


为什么我觉得这个项目值得关注?

我觉得 BrowserSkill 真正有意思的地方,不只是:

AI 又会操作浏览器了。

浏览器自动化本身早就存在。

真正的变化是:

Agent 正在从“测试环境里的自动化工具”,进入我们真实正在使用的电脑。

以前的 Agent 更像:

启动一个沙盒
打开一个测试浏览器
运行一个自动化脚本

现在开始变成:

使用真实浏览器
使用真实登录状态
操作真实软件
遇到关键步骤让人接管
完成以后继续工作

这已经越来越接近一个真正的电脑操作 Agent。

尤其是 Codex、Claude Code 这类工具。

最开始大家只是拿它们写代码。

后来开始:

操作文件
生成 Excel
做 PPT
处理图片
调用 FFmpeg
操作浏览器
控制桌面软件

边界其实一直在往外扩。

BrowserSkill 就是一个非常典型的例子。


使用时一定要注意权限

BrowserSkill 能复用真实登录状态,同时也意味着权限更大。

所以我建议刚开始使用时,任务一定写清楚边界。

比如不要只说:

帮我处理后台。

最好写成:

查看后台最近 10 条订单。

只允许读取。

禁止:

- 删除数据
- 修改订单
- 发货
- 退款
- 修改账号
- 修改权限

完成后只返回分析结果。

尤其是:

支付
删除
发布
退款
权限修改
账号安全
生产环境配置

这些操作最好一直保留人工确认。

AI Agent 能做的事情越多,权限控制反而越重要。


最后

我觉得 BrowserSkill 很适合现在的 Codex 用户。

它没有去重新造一个完整的 Browser Agent,而是做了一件很实际的事情:

把 AI Agent 接到你已经在使用的真实浏览器里。

以后你可以一边正常使用电脑,一边让 Codex:

查网页
整理资料
操作后台
测试网站
填写表单
分析数据

遇到验证码或者关键确认时,你再临时接管。

这可能才是电脑 Agent 真正实用的形态:

不是完全取代人,而是让 AI 自动完成大量重复操作,把真正需要判断和确认的步骤留给人。

如果你本身就在用 Codex、Claude Code 或 Hermes Agent,我觉得这个项目值得装下来实际跑一次。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐