Sep 24, 2026
BrowserAct:给你的 Agent 一个能穿过反爬封锁的真实浏览器
6k 星的 skill 给 coding agent 一个真实浏览器 CLI,带隐身指纹、验证码求解和人工接管——那些死在拦截页上的抓取终于能跑完。
无头浏览器很便宜——直到一个拦截页吃掉你的 Agent 一下午。BrowserAct Skills 是一个 6k 星、MIT 协议、专为 AI agent 打造的浏览器自动化 CLI,它在真实浏览器外面裹上了对付封锁的各层能力:隐身指纹、验证码求解、住宅代理,以及机器卡住时的人工接管。
为什么这个 Skill 重要
BrowserAct 用三层递进的机制对抗封锁。环境层伪造指纹、轮换 TLS、切换代理,让绝大多数封锁根本不触发。执行层提供 solve-captcha 自动解验证码,以及一条命令拉取受保护页面的 stealth-extract。人工层是 remote-assist:它生成一个实时 URL,你用任何设备打开就能接管浏览器,你操作完 Agent 从中断处无缝继续。
它的输出为 LLM 推理而非人工脚本设计:state 返回带索引的可点击元素列表,下一步就是 click 3 或 input 2 "hi"——不需要解析 DOM,而且 README 说这种紧凑文本格式比 JSON 或 HTML 省好几倍 token。
安装
README 给出的安装方式是给你 Agent 发一条消息:
Install browser-act. Skill source: https://github.com/browser-act/skills/tree/main/browser-act . Verify it works after installation.
你的 Agent 加载这个 skill,用 get-skills 发现浏览器状态,然后直接在本地环境执行命令。文档记载的兼容范围覆盖 Windows、macOS 和 Linux,点名支持 Claude Code、Cursor、VS Code、OpenCode、OpenClaw、Codex 和 Gemini CLI。
实战:先抓受保护页面,再自动化整个流程
- 从零配置路径开始——一条命令就能穿透隐身层抓取页面内容:
browser-act stealth-extract https://example.com
- 多步骤流程则开一个命名会话,按索引驱动:
browser-act --session my-task browser open <id> https://example.com
browser-act --session my-task state # See clickable elements
browser-act --session my-task click 3 # Click by index
browser-act --session my-task input 2 "hi" # Type into a field
- 按场景选浏览器模式:
chrome模式复用你本地 Chrome 的登录态访问需登录站点;隐身隐私模式给每个会话全新指纹、不留痕迹;隐身固定身份模式用一个稳定指纹加固定 IP 维持登录账号的并行运行。
并发是内建的——不同浏览器之间 cookie、指纹、代理互相独立,站点无法关联它们;同一浏览器内的多个会话共享登录态却互不阻塞。
技巧
- 敏感操作有确认门:浏览器的创建/删除、Profile 导入、代理变更、隐私开关都需要你明确批准,而且 README 说明先前的批准不会延续。
- 几乎所有功能都免费。只有托管代理(动态/静态)和前 5 个之外的隐身浏览器收费。
- 每个浏览器都带一个按语义匹配任务的
desc字段——给会话起有描述性的名字,多 Agent 并行就不会冲突。 - 对要反复抓取的站点,看看 Skill Forge:它先探索一遍站点,生成可部署的 skill 包;Solutions Catalog 已经内置 30 多个预置 skill,覆盖 Amazon、Google Maps、YouTube 等。
何时不用这个 Skill
如果站点提供官方 API,请用 API——真实浏览器是成本更高的路径。如果你想要零本地配置、单次运行成本更低,README 提供的另一种模式是完全云托管的执行方式,由 BrowserAct 替你构建并运行可复用的抓取机器人;本地 skill 适合需要本地 Chrome 登录态、或要把浏览器能力直接接进你自己 Agent 工作流的场景。
查看 排行榜 了解更多 skill。