腾讯开源 BrowserSkill:让 Codex 直接操作你已经登录的 Chrome

最近 GitHub 上有个项目挺有意思,叫 BrowserSkill,来自腾讯。
项目地址:
https://github.com/Tencent/BrowserSkill
如果你平时在用 Codex、Claude Code、Cursor、Hermes Agent 这类 AI Coding 工具,这个项目很值得看。
它解决的问题非常直接:
让 AI Agent 直接使用你已经登录的真实浏览器。
以前我们让 Codex 操作网页,通常会走 Playwright、Selenium 或独立浏览器环境。
问题也很明显。
比如你让 Codex:
打开我的后台,查看最近 10 条订单。
它启动一个新的浏览器以后,第一件事往往是:
请登录
接着又可能遇到:
短信验证码
二次验证
扫码登录
人机验证
但你自己的 Chrome 明明早就已经登录好了。
BrowserSkill 就是在解决这个问题。
BrowserSkill 是什么?
BrowserSkill 本质上是在 AI Agent 和你本机浏览器之间,加了一层本地桥接。
目前官方已经明确支持:
- Codex
- Claude Code
- Cursor
- OpenClaw
- CodeBuddy
- WorkBuddy
- Pi
- Hermes Agent
- DeepSeek Harness
- 其他可以调用 Shell 的 Agent
它不会要求 Agent 再启动一个完全独立的测试浏览器,而是可以复用你真实 Chrome 或 Edge 中已经存在的登录状态。
比如你的 Chrome 已经登录:
GitHub
博客后台
公司管理系统
电商后台
CRM
内部工具
Codex 就可以通过 BrowserSkill 继续操作这些网站。
这对电脑自动化来说非常实用。
最大的亮点:复用真实登录状态
这是我觉得 BrowserSkill 最有价值的地方。
传统浏览器自动化经常是:
Codex
↓
Playwright
↓
新浏览器
↓
重新登录
BrowserSkill 的流程更像:
Codex
↓
bsk CLI
↓
本地 Daemon
↓
BrowserSkill 浏览器扩展
↓
你已经登录的 Chrome
也就是说,Agent 不需要重新创建一套账号状态。
你已经登录的网站,它可以直接使用。
如果你的工作经常涉及:
- 查询后台数据
- 整理网页信息
- 操作 CMS
- 检查 GitHub
- 查看内部系统
- 自动填写网页表单
- 批量处理后台任务
这个能力就非常有用了。
Agent 操作浏览器时,你还能继续正常工作
这也是 BrowserSkill 设计得比较好的一个地方。
它不会默认直接抢走你正在使用的 Chrome。
BrowserSkill 会给 Agent 创建一个独立、可见的 Agent Window。
也就是说:
你的 Chrome 窗口
→ 你继续正常使用
Agent Window
→ Codex 自己操作
两个可以同时工作。
如果 Agent 确实需要操作你当前已经打开的某一个 Tab,它需要显式“借用”这个 Tab。
任务结束以后,再把 Tab 归还。
其他浏览器窗口不会被随便操作。
相比“AI 一启动自动化,我的鼠标键盘就不能用了”,这种方式舒服很多。
遇到验证码怎么办?
真实网站自动化一定绕不开验证码、扫码登录、确认弹窗这些问题。
BrowserSkill 没有尝试让 AI 强行绕过这些步骤,而是直接支持 Human-in-the-loop。
流程类似:
Agent 自动执行任务
↓
遇到验证码
↓
请求用户接管
↓
你完成验证码
↓
把控制权交还 Agent
↓
继续执行
这个设计其实很重要。
真正能进入日常工作流的 Agent,不应该假设所有步骤都能 100% 自动完成。
很多时候最实用的方式反而是:
AI 完成 90%,人类只处理必须人工确认的 10%。
在 Codex 中怎么安装?
如果你使用 macOS 或 Linux,可以先安装 bsk CLI:
curl -fsSL https://raw.githubusercontent.com/Tencent/BrowserSkill/main/install.sh | sh
安装完成以后检查版本:
bsk --version
然后安装 BrowserSkill 的浏览器扩展。
官方目前支持:
Chrome
Microsoft Edge
其他 Chromium 浏览器只要支持 Chromium 扩展,也有机会使用。
接下来给 Codex 安装 Skill:
bsk install-skill
执行以后,可以选择你正在使用的 Agent。
例如:
Codex
Claude Code
Cursor
Hermes Agent
OpenClaw
安装完成以后,建议重新打开一个新的 Codex Session。
最简单的测试
安装好以后,可以先从一个最简单的任务开始。
在 Codex 里输入:
/browser-skill open example.com and summarize what is on the page.
如果浏览器可以正常打开页面并返回内容,说明基础链路已经跑通。
接下来就可以开始测试更真实的场景。
一个更适合实际工作的例子
假设你的 Chrome 已经登录了自己的博客后台。
你可以直接告诉 Codex:
使用 browser-skill 打开我已经登录的博客后台。
查看最近发布的 10 篇文章。
整理出:
1. 文章标题
2. 发布时间
3. 阅读量
4. 评论数
最后生成一个 Markdown 表格。
不要修改、删除或发布任何内容。
这时候 Codex 可以:
打开后台
↓
读取列表
↓
翻页
↓
整理数据
↓
生成 Markdown
你不需要再专门给 Codex 配置后台 API。
也不用重新在测试浏览器里登录一次。
这就是 BrowserSkill 真正实用的地方。
再进一步:让 Codex 操作真实业务系统
比如做电商,你可以让 Agent:
打开订单后台。
筛选今天所有“已付款未发货”的订单。
统计订单数量和总金额。
不要执行发货操作。
做内容运营,可以:
打开内容管理后台。
整理最近 30 天发布的文章。
找出阅读量最高的 10 篇。
分析标题有什么共同特点。
做开发,可以:
打开已经登录的测试环境。
按照测试用例依次检查几个页面。
记录出现报错的页面和错误信息。
不要修改线上数据。
这时候 Codex 已经不只是“写代码”。
它开始真正操作软件。
BrowserSkill 的工作原理
BrowserSkill 的架构并不复杂。
核心链路是:
Codex / Claude Code
↓
bsk CLI
↓
Local Daemon
↓
WebSocket
↓
BrowserSkill Extension
↓
Chrome
Agent 本身不会直接控制浏览器。
它会调用 bsk。
bsk 再把任务交给本地 Daemon。
Daemon 通过本地 WebSocket 和浏览器扩展通信。
最后由扩展完成浏览器操作。
官方说明这里的通信主要发生在本机。
这种设计的好处是:
Agent 仍然通过标准 Shell 调用工具。
所以 BrowserSkill 并没有强绑定某个模型。
只要 Agent 能执行 Shell,就有机会接入。
为什么我觉得这个项目值得关注?
我觉得 BrowserSkill 真正有意思的地方,不只是:
AI 又会操作浏览器了。
浏览器自动化本身早就存在。
真正的变化是:
Agent 正在从“测试环境里的自动化工具”,进入我们真实正在使用的电脑。
以前的 Agent 更像:
启动一个沙盒
打开一个测试浏览器
运行一个自动化脚本
现在开始变成:
使用真实浏览器
使用真实登录状态
操作真实软件
遇到关键步骤让人接管
完成以后继续工作
这已经越来越接近一个真正的电脑操作 Agent。
尤其是 Codex、Claude Code 这类工具。
最开始大家只是拿它们写代码。
后来开始:
操作文件
生成 Excel
做 PPT
处理图片
调用 FFmpeg
操作浏览器
控制桌面软件
边界其实一直在往外扩。
BrowserSkill 就是一个非常典型的例子。
使用时一定要注意权限
BrowserSkill 能复用真实登录状态,同时也意味着权限更大。
所以我建议刚开始使用时,任务一定写清楚边界。
比如不要只说:
帮我处理后台。
最好写成:
查看后台最近 10 条订单。
只允许读取。
禁止:
- 删除数据
- 修改订单
- 发货
- 退款
- 修改账号
- 修改权限
完成后只返回分析结果。
尤其是:
支付
删除
发布
退款
权限修改
账号安全
生产环境配置
这些操作最好一直保留人工确认。
AI Agent 能做的事情越多,权限控制反而越重要。
最后
我觉得 BrowserSkill 很适合现在的 Codex 用户。
它没有去重新造一个完整的 Browser Agent,而是做了一件很实际的事情:
把 AI Agent 接到你已经在使用的真实浏览器里。
以后你可以一边正常使用电脑,一边让 Codex:
查网页
整理资料
操作后台
测试网站
填写表单
分析数据
遇到验证码或者关键确认时,你再临时接管。
这可能才是电脑 Agent 真正实用的形态:
不是完全取代人,而是让 AI 自动完成大量重复操作,把真正需要判断和确认的步骤留给人。
如果你本身就在用 Codex、Claude Code 或 Hermes Agent,我觉得这个项目值得装下来实际跑一次。
更多推荐


所有评论(0)