你让 AI Agent 帮你订机票、填表单、做调研——它在浏览器里操作,你在旁边看着。
这件事现在有三种做法。第一种,你写几行 Python 代码调用一个库,它帮你操控浏览器。第二种,你装一个 Chrome 扩展,在侧边栏里告诉 AI 你要什么。第三种,你把这活完全外包给云端,每月付 $200,它在你睡觉的时候帮你干活。
这三种做法,对应着今天浏览器自动化 AI Agent 领域的三个代表性选择:browser-use(114k⭐ 的开源巨兽)、Nanobrowser(13.8k⭐ 的 Chrome 扩展新星)、OpenAI Operator(OpenAI 的云端浏览器 Agent)。
它们解决的其实是同一个问题——让 AI 像人一样用浏览器——但架构、体验、定价和适用场景天差地别。
一句话定位
先把三者的核心身份说清楚:
- browser-use — 给开发者用的 Python 库。你写代码,它帮你控制浏览器。114k⭐、46M 月下载、YC 孵化、$17M 融资。
- Nanobrowser — 给终端用户用的 Chrome 扩展。安装即用,多 Agent 架构(Planner + Navigator + Validator),用自己的 API Key,数据不出本地。
- OpenAI Operator — 给有钱用户用的云端服务。$200/月,ChatGPT Pro 专属,CUA(Computer-Using Agent)模型驱动,你睡觉它干活。
browser-use:114k⭐ 的开源巨兽
| 数据点 | 值 |
|---|---|
| 作者/维护者 | Browser Use Inc(YC W25,融资 $17M) |
| GitHub Stars | 114,000 ⭐ |
| Commits | 10,279 |
| 月下载量 | 4,600 万次 |
| 许可证 | MIT |
| 维护状态 | ✅ 极活跃(10 小时前提交) |
browser-use 是这个领域当之无愧的王者。114k⭐ 是什么概念?在整个 AI Agent 开源生态里,它仅次于 LangChain、CrewAI 这类平台级项目,在「单一功能工具」里几乎没有对手。
核心设计理念:browser-use 把自己定位为「让网站对 AI Agent 可访问」的中间层。它不是浏览器,也不是 AI 模型——它是连接 AI 模型和浏览器的管道。
架构上分为三层:
- Agent 层 — 核心循环(Observe → Think → Act)。接收 LLM 的决策,调用各种 Action(Click、Input、Scroll、Navigate 等),处理 Agent 记忆、状态管理和 Loop Detection
- Browser 层 — 基于 Playwright 的浏览器控制。管理 CDP(Chrome DevTools Protocol)会话池、tab 控制、DOM 处理引擎、截图高亮系统
- LLM 集成层 — 支持 OpenAI、Anthropic Claude、Google Gemini、本地模型(通过 Ollama/llama.cpp)
功能亮点:
- Skill 系统:复用已写好的 browser-use 技能(如「登录 GitHub」「搜索 Airbnb」),可热加载
- MCP Server:可以作为 MCP Server 供 Cursor/Claude 等客户端调用
- Cloud 服务:Browser Use Cloud,$0.02/浏览器小时,含防检测浏览器
- Textual TUI:终端内可视化界面,能看到 Agent 的每一步操作
- CLI + Docker:一行命令启动,Docker 部署
定价模式:
- 开源版:免费(Python 库,自备 LLM API Key)
- Cloud 版:$0.02/浏览器小时 + 按任务收费(~17¢/solved task on Internal Bench Hard)
一句话总结:如果你是个开发者,想在代码里让 AI 操控浏览器——browser-use 是唯一认真的选择。
Nanobrowser:Chrome 扩展里的多 Agent 架构
| 数据点 | 值 |
|---|---|
| 作者/维护者 | Nanobrowser(alexchenzl) |
| GitHub Stars | 13,800 ⭐ |
| Commits | 369 |
| 许可证 | Apache 2.0 |
| 维护状态 | ✅ 活跃(3 周前提交) |
Nanobrowser 的增长曲线非常有意思。它在 2024 年底还是一个不到 1k⭐ 的个人项目,2025~2026 年随着「AI 浏览器 Agent」概念爆发,一路冲到了 13.8k⭐。
核心设计理念:它解决了 browser-use 的一个根本矛盾——browser-use 需要你写 Python 代码。Nanobrowser 的选择是:不要代码,只要一个 Chrome 扩展。
它的架构采用两层 Agent 系统:
- Planner(规划器) — 负责理解用户目标,拆解为子任务,制定执行计划。遇到障碍时动态自校正
- Navigator(导航器) — 实际执行浏览器操作(点击、输入、导航、提取数据)
- Validator(验证器) — 检查任务是否完成,结果是否符合预期
三个 Agent 轮流工作,全部运行在你的 Chrome 浏览器内。
独特价值:
- 零部署:从 Chrome Web Store 安装即可,不需要 Python、Docker、API Key 配置
- 本地执行:所有计算在你的浏览器里完成,凭据和数据从不离开你的机器
- 自带 LLM Key:支持 OpenAI、Anthropic、Google Gemini、本地模型,用自己的 API Key 不产生额外订阅费
- 多 Agent 编排:比单 Agent 架构更健壮——Planner 被障碍卡住时可以调整策略,Navigator 执行时遇到验证失败可以重试
对比 browser-use 的取舍:
- 优势:零代码、零部署、隐私保护更好(数据不出本地)
- 取舍:灵活性低(不能写自定义 Action)、深度受限(Chrome 扩展沙箱限制了某些浏览器能力)、社区远小于 browser-use
一句话总结:如果你不想写代码,只想让 AI 帮你自动化浏览器操作——Nanobrowser 是 browser-use 的零代码版本。
OpenAI Operator:云端专属,$200/月
| 数据点 | 值 |
|---|---|
| 作者/维护者 | OpenAI |
| 发布日期 | 2025 年 1 月 |
| 定价 | ChatGPT Pro 专属($200/月) |
| 驱动模型 | CUA(Computer-Using Agent) |
| 维护状态 | ✅ 活跃(OpenAI 持续更新) |
OpenAI Operator 是这三个里唯一不是开源项目的。它是在 ChatGPT Pro 订阅里的一个功能——付 $200/月,获得一个能替你操作浏览器的 AI Agent。
核心设计理念:Operator 基于 OpenAI 的 CUA 模型——这个模型不是通过 API 调用浏览器,而是原生训练了「看屏幕截图 → 决定下一步操作 → 执行」的能力。它不需要 DOM 解析、不需要 Playwright,直接在截图层面理解页面。
能力范围:
- 自动填写表单、下单购买、订票
- 多步骤任务(如「在 Airbnb 上找东京 3 月 1-7 日的房源,预算 $150/晚以下,给前 3 个发消息问空房情况」)
- 后台执行(你关掉 App,它还在继续工作)
- 需要批准时暂停(邮件发送前、下单前确认)
三个方案中唯一的区别:
| 维度 | browser-use | Nanobrowser | Operator |
|---|---|---|---|
| 需要写代码 | ✅ 是 | ❌ 否 | ❌ 否 |
| 数据去向 | 你控制 | 不出本地 | 上 OpenAI 云端 |
| 月费用 | ~$10-50(LLM API) | ~$5-30(LLM API) | $200 固定 |
| 防检测 | ✅ Cloud 版有 | ❌ 普通 Chrome | ❌ OpenAI 管理 |
| 自定义 | ✅ 完全可编程 | ✅ 可配置有限 | ❌ 黑盒 |
一句话总结:如果你预算充足、不想管任何技术细节、愿意把数据交给 OpenAI——Operator 是最省事的方案。
核心差异全景
这三者最根本的区别在设计哲学的入口处:
- browser-use 认为「开发者是用户」——你写代码,它执行
- Nanobrowser 认为「浏览器用户是用户」——你安装,它执行
- OpenAI Operator 认为「付费用户是用户」——你付费,它执行
从技术架构看,它们的差异也很鲜明:
| 维度 | browser-use | Nanobrowser | OpenAI Operator |
|---|---|---|---|
| 架构 | Agent + Playwright CDP | Planner + Navigator + Validator | CUA 原生截图驱动 |
| 开源 | ✅ MIT | ✅ Apache 2.0 | ❌ 闭源 |
| 部署 | pip install | Chrome Web Store | ChatGPT Pro |
| LLM 控制 | 你自己选 | 你自己选 | OpenAI 固定 |
| 社区 | 114k⭐, 10k+ commits | 13.8k⭐, 369 commits | N/A |
| 防 Bot 检测 | ✅ Cloud 版内置 | ❌ 普通 Chrome | ✅ OpenAI 管理 |
| 自定义 Action | ✅ 完全可编程 | ❌ 有限 | ❌ 黑盒 |
| 隐私控制 | ✅ 你控制数据路径 | ✅ 数据在本地 | ❌ 数据上云 |
| 学习门槛 | 中等(Python) | 低(安装即用) | 最低(付钱即用) |
| 月成本估算 | $10-50(自备 Key) | $5-30(自备 Key) | $200(固定订阅) |
选型指南
场景 1:你在开发一个产品,需要内置浏览器自动化能力 → browser-use。Python 库可以 asyncio 集成到你的代码里,自定义 Action、控制流程、注入逻辑。Nanobrowser 是个独立的浏览器扩展,Operator 是个独立的 SaaS 产品——都无法嵌入你自己的产品。
场景 2:你是个人用户,想自动化一些重复的网页操作 → Nanobrowser。装一个扩展就好,不用写代码、不用管 Docker、数据还在本地。如果你月消费超过 $200 的 LLM API 费(几乎不可能),再考虑 Operator——否则 Nanobrowser + 自己的 API Key 划算得多。
场景 3:你们公司在做大规模网页数据采集/测试 → browser-use Cloud。$0.02/浏览器小时 + 防检测浏览器,比自己维护浏览器农场便宜得多。Nanobrowser 的 Chrome 扩展模式不适合规模化,Operator 没有 API 批量调用接口。
场景 4:预算不是问题,不想管技术,需要「设置完就不管」 → OpenAI Operator。$200/月对于企业的自动化预算来说不值一提,Operator 不需要任何技术维护——你的任务就是告诉它你要什么,然后等结果。
写在最后
浏览器 Agent 是 AI Agent 领域里最「实」的应用方向之一。Chatbot 在聊天,编码 Agent 在写代码——而浏览器 Agent 在替你真正地干活:填表、下单、搜索、比价。这是 AI 从「给你答案」到「替你完成」最直接的体现。
browser-use 以 114k⭐ 和 YC 加持证明了这个方向的爆发力。Nanobrowser 用 Chrome 扩展的零门槛走了一条不同的路。OpenAI Operator 则用 $200/月的定价定义了「顶配省心」的档位。
我个人的建议:如果你做开发,必须会用 browser-use。如果你给自己用,先试 Nanobrowser。如果你在企业里给老板汇报,Operator 的账单最好看。
📌 延伸阅读:
- 《Cloudflare Kitesurf:专为 AI Agent 设计的浏览器!》 — 另一种浏览器 Agent 方案(专用浏览器而非自动化库)
- 《Claude Fable 5.1 横空出世!》 — 新模型对复杂浏览器任务的推理能力提升