一键导入
agent-browser
浏览器自动化 CLI 工具。支持打开网页、截图、抓取内容、点击元素、填写表单、文件上传、会话持久化。 当用户需要浏览器自动化、网页操作、内容抓取时触发。 核心功能:(1) 网页控制 (2) 元素交互 (3) 内容提取 (4) 截图录制 (5) 文件上传 (6) 会话持久化
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
浏览器自动化 CLI 工具。支持打开网页、截图、抓取内容、点击元素、填写表单、文件上传、会话持久化。 当用户需要浏览器自动化、网页操作、内容抓取时触发。 核心功能:(1) 网页控制 (2) 元素交互 (3) 内容提取 (4) 截图录制 (5) 文件上传 (6) 会话持久化
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
| name | agent-browser |
| description | 浏览器自动化 CLI 工具。支持打开网页、截图、抓取内容、点击元素、填写表单、文件上传、会话持久化。 当用户需要浏览器自动化、网页操作、内容抓取时触发。 核心功能:(1) 网页控制 (2) 元素交互 (3) 内容提取 (4) 截图录制 (5) 文件上传 (6) 会话持久化 |
| license | Apache-2.0 |
| metadata | {"author":"Vercel Labs + Claude Code Community","version":"3.0.0","categories":["browser-automation","web-scraping"],"keywords":["browser","automation","cli","screenshot","web","scraping","agent-browser","session-persistence"]} |
agent-browser 是 AI-native 的浏览器自动化 CLI 工具,基于 Playwright,使用 Refs 机制简化元素选择,上下文消耗比传统方案少 93%。当用户需要浏览器自动化操作时,立即使用 agent-browser CLI 工具完成任务。
当此 Skill 被调用时,你必须:
--session 或 --profile 参数# 使用命名会话
agent-browser --session my-session open <URL>
# 后续操作使用同一个会话
agent-browser --session my-session click @e1
# 使用持久化配置文件
agent-browser --profile ~/.my-profile open <URL>
# 登录状态会自动保存,下次使用同一个 profile 时会自动恢复
agent-browser --profile ~/.my-profile click @e1
agent-browser --session my-session --profile ~/.my-profile open <URL>
agent-browser open <url> # 导航到 URL
agent-browser back # 后退一页
agent-browser forward # 前进一页
agent-browser reload # 刷新当前页
agent-browser snapshot -i # 获取可交互元素
agent-browser click @ref # 点击元素
agent-browser fill @ref <text> # 填写输入框
agent-browser type @ref <text> # 输入文本
agent-browser hover @ref # 悬停元素
agent-browser get text <selector> # 获取文本内容
agent-browser get title # 获取页面标题
agent-browser get url # 获取当前 URL
agent-browser screenshot [path] # 截图
agent-browser upload @ref <filepath> # 上传文件
agent-browser close # 关闭浏览器
agent-browser connect [endpoint] # 连接到 Chrome 调试端口
当用户要求浏览网页或抓取内容时,按以下步骤执行:
agent-browser --profile ~/.my-profile open <用户提供的URL>
根据用户需求选择:
snapshot -iget text bodyscreenshot <路径>click @reffill @ref "内容"upload @ref "文件路径"back / forward / reloadagent-browser close
用户说:"打开百度首页并截图"
立即执行:
# 1. 打开网页
agent-browser open https://www.baidu.com
# 2. 截图
agent-browser screenshot ~/Desktop/baidu.png
# 3. 关闭
agent-browser close
用户说:"帮我看看 example.com 上有什么内容"
立即执行:
# 1. 打开网页
agent-browser open https://example.com
# 2. 获取内容
agent-browser get text body
# 3. 关闭
agent-browser close
用户说:"登录 GitHub 并保存会话以便将来使用"
立即执行:
# 第一次:使用可见浏览器登录
agent-browser --profile ~/.agent-browser/github --headed open https://github.com/login
# 用户在浏览器窗口中手动登录
# 会话自动保存到 profile
# 下次:自动登录
agent-browser --profile ~/.agent-browser/github open https://github.com/settings
agent-browser screenshot ~/Desktop/github-settings.png
agent-browser close
用户说:"上传我的头像到 GitHub 个人资料"
立即执行:
# 使用保存的会话打开个人资料设置
agent-browser --profile ~/.agent-browser/github open https://github.com/settings/profile
# 获取可交互元素以找到文件输入框
agent-browser snapshot -i
# 上传文件(假设文件输入框的 ref 是 @e68)
agent-browser upload @e68 "~/Pictures/avatar.jpg"
# 点击保存按钮(假设保存按钮的 ref 是 @e65)
agent-browser click @e65
# 截图确认
agent-browser screenshot ~/Desktop/profile-updated.png
agent-browser close
用户说:"填写 example.com 上的联系表单"
立即执行:
# 打开联系页面
agent-browser open https://example.com/contact
# 获取表单元素
agent-browser snapshot -i
# 填写表单字段(从 snapshot 获取 refs)
agent-browser fill @e1 "张三"
agent-browser fill @e2 "zhangsan@example.com"
agent-browser fill @e3 "你好,这是一条测试消息"
# 提交表单
agent-browser click @e4
# 等待确认
agent-browser wait 2000
agent-browser screenshot ~/Desktop/form-submitted.png
agent-browser close
用户说:"浏览多个页面并截图"
立即执行:
# 打开网页
agent-browser open https://example.com
# 批量执行多个命令
agent-browser batch "snapshot -i" "screenshot /tmp/page1.png" "click @e1" "wait 1000" "screenshot /tmp/page2.png"
agent-browser close
使用你现有的 Chrome 浏览器及其所有登录和扩展:
# 步骤 1:启动带调试端口的 Chrome
# Windows:
"C:\Program Files\Google\Chrome\Application\chrome.exe" --remote-debugging-port=9222
# macOS:
/Applications/Google\ Chrome.app/Contents/MacOS/Google\ Chrome --remote-debugging-port=9222
# Linux:
google-chrome --remote-debugging-port=9222
# 步骤 2:连接 agent-browser
agent-browser connect http://127.0.0.1:9222
# 步骤 3:正常使用(已登录所有网站!)
agent-browser open https://gmail.com
agent-browser get title
agent-browser close
为不同账户或用途创建独立的 profiles:
# 工作 GitHub 账户
agent-browser --profile ~/.agent-browser/github-work open https://github.com
# 个人 GitHub 账户
agent-browser --profile ~/.agent-browser/github-personal open https://github.com
# Twitter 账户
agent-browser --profile ~/.agent-browser/twitter open https://twitter.com
# Headless 模式(默认,无可见浏览器)
agent-browser open https://example.com
# Headed 模式(可见浏览器,用于调试或手动登录)
agent-browser --headed open https://example.com
click、fill 或 upload 前先运行 snapshot -i--profile 标志保存登录状态和 cookieswait <ms>snapshot当用户说以下内容时,立即使用此 Skill:
解决方案:等待页面完全加载
agent-browser open https://example.com
agent-browser wait 3000 # 等待 3 秒
agent-browser snapshot -i
解决方案:导航后 refs 会改变,获取新的 snapshot
agent-browser snapshot -i # 获取新的 refs
agent-browser click @e1
解决方案:使用绝对路径
# ❌ 错误(相对路径)
agent-browser --profile ./profile open https://example.com
# ✅ 正确(绝对路径)
agent-browser --profile ~/.agent-browser/myprofile open https://example.com
解决方案:验证安装
# 检查是否安装
which agent-browser
# 如果未找到,重新安装
npm install -g agent-browser
原因:浏览器二进制文件未安装或版本不匹配
解决方案:
# 重新安装 Playwright 浏览器
npx playwright install chromium
版本: v3.0(整合版) 最后更新: 2026-01-28 状态: ✅ 已测试可用 贡献者: Vercel Labs + Claude Code Community