选择一个 Ollama 模型,然后交给 WebBrain
新的启动路径可以用一条终端命令为本地 Ollama 模型配置 WebBrain。目前可从我们的 Ollama 分支试用,同时我们正推动上游集成。
阅读公告WebBrain 是一款免费的开源浏览器扩展,为你的浏览器带来 AI 代理能力。阅读页面、提取数据、自动化网页任务 —— 使用你选择的 LLM。专有浏览器 AI 插件的可自托管替代品。
看看 WebBrain 如何阅读页面、提取数据并自动化浏览器任务。
一个功能齐全的 AI 代理,驻扎在浏览器侧边栏,能理解任何网页。
读懂任何网页 —— 文章、文档、仪表板、表单。对当前页面内容提问并立即获得答案。
代你点击、输入、滚动、导航,并与页面交互。用自然语言指令自动化重复性任务。
从任何页面提取结构化数据 —— 表格、列表、链接、表单。导出产品目录、搜索结果或任何页面内容。支持 PDF。
兼容本地 llama.cpp、OpenAI、Claude 和 OpenRouter。使用你偏好的模型 —— 或用本地 AI 完全离线运行。
你的数据依然属于你。配合本地 LLM 零数据泄露。无遥测、无追踪、无需账号。完全开源。
自动上下文管理防止 token 溢出。智能裁剪对话历史并限制工具输出,让会话顺畅不中断。
用一个快速的纯文本模型做规划,再配一个专门的视觉模型读取截图。比用一个庞大的多模态模型做所有事情更便宜也更快。
可选的纯文本自述 —— 姓名、工作邮箱、公司、一个一次性密码 —— 让代理无需每次询问即可轻松完成低风险注册表单。默认关闭,全部在本地存储。
在推理页面之前关闭常见框架的同意横幅(OneTrust、Cookiebot、Didomi、Quantcast)。检测到付费墙会如实告知,而不是编造文章内容或尝试绕过。
Plug in a CapSolver API key and the agent will auto-solve reCAPTCHA v2/v3, hCaptcha, and Cloudflare Turnstile when they block a step — instead of stopping to ask. Off by default, BYO key, no captcha service is shipped or contacted unless you turn it on.
插件提供 English、Español、Français、Türkçe 和 中文 五种语言。首次使用时自动检测浏览器语言;随时可通过侧边栏中的地球图标切换。本站也相应本地化。
截图在离开你的机器之前会先按比例缩放并迭代 JPEG 压缩,让图像 token 保持很小。智能上下文裁剪和工具输出上限让云端费用可预测 —— 长会话不会出现意外支出。
浏览器是真正工作发生的地方,也是一块对抗性表面。WebBrain 从只读的询问模式开始,行动前先请求确认,防御隐藏的提示注入,并用更严格的规则处理敏感字段。
连接任何 OpenAI 兼容 API,或运行一个本地模型。随时在扩展设置中切换提供商。
新的启动路径可以用一条终端命令为本地 Ollama 模型配置 WebBrain。目前可从我们的 Ollama 分支试用,同时我们正推动上游集成。
阅读公告支持 Chrome、Edge 和 Firefox。免费、开源、无需账号。
Manifest V3 · Chrome 116+ · 同时适用于 Brave、Opera、Vivaldi 等 Chromium 兼容浏览器。
Manifest V3 · Windows 10/11 · 需要 Windows 上的 Microsoft Edge。
WebBrain 位于浏览器原生 AI 插件与完整代理框架之间。以下是它的定位。
| 特性 | WebBrain | Chrome 中的 Claude |
|---|---|---|
| 开源 | MIT 许可 | 闭源 |
| 价格 | 永久免费 | 需要 Claude Pro(20 美元/月) |
| 本地 LLM 支持 | llama.cpp、Ollama | 否 —— 仅限 Claude |
| 多提供商 | All OpenAI-compatible endpoints | 仅限 Claude |
| Chrome | 是(MV3) | 是 |
| Firefox | 是(MV2) | 否 |
| 侧边栏 UI | 是 | 是 |
| 询问 / 执行 模式 | 是 | 类似 |
| 完全离线 | 是(使用本地 LLM) | 否 —— 需要云端 |
| 可自托管 | 是 | 否 |
| 维度 | WebBrain | OpenClaw / Browser-Use / 等 |
|---|---|---|
| 是什么? | 浏览器扩展(面向终端用户的工具) | 代理框架 / SDK(面向开发者的工具) |
| 目标用户 | 任何人 —— 无需编码 | 构建自动化的开发者 |
| 安装 | 一键浏览器安装 | 需要 Python/Docker 环境 |
| 界面 | 内置侧边栏聊天 | 无 UI —— 仅代码或 API |
| 浏览器控制 | Content script(轻量) | CDP / Playwright(完全控制) |
| 多标签工作流 | 按标签独立会话 | 可编程多标签编排 |
| 无头模式 | 否 —— 在你的浏览器中运行 | 是 —— 无头自动化 |
| 可扩展性 | 添加自定义 LLM 提供商 | 完整 Python SDK、自定义工具 |
| 最适合 | 日常浏览的 AI 助手 | 自动化抓取 / 测试流水线 |
WebBrain 是面向终端用户的浏览器扩展,适合希望在浏览时有 AI 助手陪伴的人。像 OpenClaw 这样的代理框架则是开发者用来构建自动化浏览器流水线的工具。不同工具适合不同工作 —— 两者可以并用。
是的。WebBrain 提供类似的 AI 浏览器代理能力 —— 阅读页面、提取数据、点击按钮、填写表单并自动化多步骤工作流。与需要 Claude Pro 订阅且仅支持 Anthropic 模型的专有 Claude 插件不同,WebBrain 完全免费、开源(MIT 许可),并支持多个 LLM 提供商,包括完全在你的机器上运行的本地模型。
WebBrain Cloud 目前为每个设备配置文件每月 5 美元,暂时比 Claude Pro 便宜得多。当前用量在公平使用政策下不限量:正常个人使用没问题,但不允许滥用、自动化刷量、转售或异常高流量使用。
订阅绑定到扩展为该浏览器 + 操作系统 GUID 生成的设备标识符,而不是用户账户。如果你重置扩展存储、删除浏览器配置文件、重新安装浏览器、更换浏览器/操作系统或丢失设备而导致该标识符丢失,我们无法找回或转移,也不会因此退款。
你可以在插件设置页的账户区域通过管理账单按钮订阅或管理账单。若要手动取消,请用结账时使用的邮箱地址给我们发邮件。
Cloud Sync 是面向有效 WebBrain Cloud 订阅用户的可选功能。它会同步你的 WebBrain 记忆、个人资料自动填充文本,以及受支持的提供商配置(包括 API 密钥)。它不会同步聊天记录、浏览器历史、页面截图,或旧版 OAuth 访问令牌与刷新令牌。
浏览器会在上传前使用你选择的密码对同步保险库进行加密。WebBrain Cloud 只存储加密后的保险库;无法读取你的记忆、个人资料文本、提供商设置或 API 密钥,也无法帮你找回同步密码。
邮箱字段用于 WebBrain Cloud 的 magic-link 账单/订阅身份验证,不是账户密码。如果界面在 Cloud Sync 中提示更改密码,指的是同步加密密码,而不是 WebBrain 账户密码。
如果你忘记了同步密码,旧的加密云端保险库将无法解密。你可以重置云端保险库,并从仍保留本地数据的设备重新上传一份新的加密副本。
它们属于不同类别的工具。WebBrain 是浏览器扩展 —— 你在 Chrome 或 Firefox 中安装它,并在侧边栏中与它对话,无需编码。OpenClaw 和 Browser-Use 等框架是面向开发者的 SDK,用 Python 构建自动化浏览器流水线,通常使用无头浏览器和 CDP。换句话说:WebBrain 用于日常浏览时的 AI 助手;代理框架用于构建抓取机器人和测试自动化。你可以同时使用 —— 二者互补。
可以。WebBrain 的默认提供商是 llama.cpp,它在你的电脑上运行本地 AI 模型。无需 API 密钥,AI 无需互联网,数据不会离开你的机器。下载一个 GGUF 模型,启动 llama-server,你就拥有了一个完全私有的 AI 浏览器代理。你也可以通过 OpenAI 兼容端点使用 Ollama。
WebBrain 支持四类提供商:llama.cpp(任意本地 GGUF 模型)、OpenAI(GPT-4o、GPT-4 等)、Claude(通过原生 API 使用 Claude Opus、Sonnet、Haiku)以及 OpenRouter(访问多家提供商的 100 多种模型)。任何 OpenAI 兼容的 API 端点都能工作,因此你也可以使用 Together AI、Groq、Mistral 等服务,或任何提供 OpenAI 兼容接口的本地服务器。
截至 2026 年 4 月 21 日,最推荐的是 Qwen 3.6 35B。原因:在我们的视觉基准测试中(vision-model-shootout),它在截图理解方面超过了 Gemma 4,同时对本地推理仍然可行。
在消费级 GPU 上,RTX 5090 是理想选择;RTX 4090 通常可借助 Intel/Qwen3.6-35B-A3B-int4-AutoRound 的 INT4 AutoRound 量化运行。
追求最高速度时,推荐使用 vLLM 提供服务。示例命令:
python -u -m vllm.entrypoints.openai.api_server --model Intel/Qwen3.6-35B-A3B-int4-AutoRound --served-model-name qwen3.6-35b --quantization auto --dtype bfloat16 --max-model-len 65536 --max-num-batched-tokens 32768 --max-num-seqs 4 --host 0.0.0.0 --port 8000 --gpu-memory-utilization 0.92 --enable-prefix-caching --enable-chunked-prefill --limit-mm-per-prompt '{"image": 4, "video": 1}' --mm-processor-cache-type shm --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --trust-remote-code --allowed-origins '["*"]' --speculative-config '{"method": "dflash", "model": "z-lab/Qwen3.6-35B-A3B-DFlash", "num_speculative_tokens": 15}' --attention-backend flash_attn
DFlash 推测解码是可选项。
如果你的 LLM 服务器在本地网络中的另一台机器上(例如 http://192.168.1.x:8000),除非服务器发送 CORS 头,否则 Chrome 会拦截该请求。解决方案因服务器而异:
vLLM:启动时添加 --allowed-origins '["*"]'(值必须是 JSON 列表)。
Ollama:启动前设置环境变量 OLLAMA_ORIGINS=*。
llama.cpp:默认启用 CORS,无需更改。
如果你的服务器运行在 localhost(与浏览器同一台机器),通常不需要 CORS。该问题仅影响本地网络上跨机器的连接。请确保 WebBrain 设置中的基础 URL 以 /v1 结尾(例如 http://192.168.1.47:8000/v1)。 例外:从浏览器扩展使用 Ollama 时仍可能需要 OLLAMA_ORIGINS;请参见下方的 Ollama FAQ。
较新的 Ollama 版本即使运行在同一台机器上,也可能拒绝来自浏览器扩展来源的请求。扩展会发送类似 chrome-extension://... 或 moz-extension://... 的 Origin,如果未允许这些来源,Ollama 可能返回 403。
先退出任何已经占用 11434 端口的 Ollama 桌面应用,然后用以下命令之一启动 Ollama:
OLLAMA_ORIGINS="*" ollama serveOLLAMA_ORIGINS="chrome-extension://*,moz-extension://*" ollama serve
将 WebBrain 的 Ollama Base URL 保持为 http://localhost:11434/v1。终端中的 curl 检查即使没有这个设置也可能正常工作,因为它们不会发送浏览器扩展来源。
能。WebBrain 同时提供 Chrome 版(使用 sidePanel API 的 Manifest V3)和 Firefox 版(使用 sidebar_action 的 Manifest V2)。两个版本功能一致。Firefox 版本可以作为临时附加组件用于开发,也可以发布到 addons.mozilla.org 进行永久安装。
可以 —— Firefox 的侧边栏默认显示在左侧,但你可以把它切换到右侧。在侧边栏标题栏上右键点击,选择「将侧边栏移到右侧」(也可以从菜单栏走「查看 → 侧边栏 → 将侧边栏移到右侧」)。重启后位置保持不变。Chrome 的 sidePanel 默认在右侧,且无法由用户从面板本身移动。
有。Vivaldi Web Panel 会屏蔽 confirm()、alert() 和 prompt() 等原生 JavaScript 对话框。WebBrain 的询问、执行和开发模式切换已不再依赖这些对话框,但少数次要操作仍然依赖。
新建对话: 在 Web Panel 中,由于确认框被屏蔽,按钮可能看起来毫无反应。右键点击 WebBrain 面板图标,选择在以下位置打开 → 新标签页,然后在该普通标签页中使用新建对话。
录制: 暂时不要在 Vivaldi 中使用 /record。如果录制失败,Vivaldi 可能会隐藏错误提示,因而不会显示任何说明。
设置、历史记录、跟踪记录和 Ollama 交接: 这些页面也包含原生对话框,但 WebBrain 通常会在普通标签页中打开它们,因此可以正常工作。如果你手动把其中某个页面放进 Web Panel,请先在普通标签页中打开它,再使用依赖对话框的操作。
WebBrain 有三种模式。询问模式(默认)只读,无法修改页面内容。执行模式可进行点击、输入和导航等浏览器操作,开发模式则增加页面调试工具。会产生后果的操作默认需要批准;如果关闭该权限门控,WebBrain 会显示明显的警告横幅。你可以随时通过「停止」按钮停止代理。扩展源代码在 GitHub 上完全开放供审计。
为了可靠地在页面上执行操作,WebBrain 通过标准的 chrome.debugger 扩展 API 使用 Chrome DevTools Protocol(CDP)——这也是触发 Chrome「WebBrain started debugging this browser」横幅的原因。CDP 让代理能够以现代网站真正接受的可信输入事件进行点击和输入;从 content script 派发的合成事件会被许多网站、Web Components 以及由框架控制的输入字段拒绝。WebBrain 也借此为视觉回退捕获像素级精确的截图,并访问 content script 看不到的跨域 iframe 和 shadow DOM。
只读的询问模式不需要 CDP——页面和无障碍树的读取都通过普通的 content script 完成。需要它的是执行模式的可靠性和跨域操作;而在 Manifest V3 扩展中,没有任何无需调试器的 API 能提供可信输入。WebBrain 仅在某个操作需要时才按标签页附加调试器,而且整个扩展都是开源的,你可以审计会话究竟做了什么。CDP 很强大,因此我们把它的影响范围当作需要约束的东西(按需附加、读取不经过它),进一步收紧它已列入我们的安全路线图。
这些批准提示是为了保护你的安全。即使在你信任的网站上,恶意行为者也可能伪造 LLM 指令或注入内容,试图让代理代表你执行你不会同意的操作。因此,WebBrain 在执行有后果的操作之前始终需要你的批准。如果你仍然不想经过这些提示,也可以关闭它们:打开侧边插件,点击标题栏中的齿轮图标,进入 settings.html 的 Permissions 标签页,然后关闭 Ask before consequential actions 选项。
打开任意网页,打开 WebBrain 侧边栏,用自然语言提问:「提取本页面所有产品名称和价格」、「获取本页面所有邮箱地址」或「用要点总结这篇文章」。AI 代理会读取页面内容、理解结构并返回提取的数据。对于更复杂的抓取,切换到执行模式,代理可以在页面间导航、点击分页按钮,并在多个页面上聚合数据。
默认情况下,WebBrain 对任何会创建、修改、删除、发送、提交、发布或购买的操作,始终通过可见界面进行。它会导航到页面、填写表单、点击按钮 —— 完全像你一样操作。它拒绝在后台通过 fetch() 直接调用 REST/GraphQL 端点进行变更。这是刻意设计:API 操作是不可见的(你看不到发送了什么),通常需要你可能未配置的单独认证令牌,而且相比于一次可见的误点击,影响范围大得多。UI-first 意味着一切都在屏幕上、在你平时的浏览器会话中、并且可中断。
对于读取数据 —— 获取 README、查找议题、跨站比价、检查状态页 —— WebBrain 会自由地通过 fetch_url 和 research_url 工具发送后台 HTTP 请求。读取不等于操作;它不会改变远程服务上的任何东西,因此不存在同样的安全顾虑。
如果你希望在某个具体任务上允许 API 变更,请在消息开头输入 /allow-api(可以后跟一段简短的任务描述)。这个按会话生效的覆盖会让 WebBrain 在界面确实失败或不可用时回退到 API 端点,但只要界面可用仍优先使用界面。覆盖启用期间,输入区上方会显示一枚置顶徽章,重置会话后该标志会清除。
可以。WebBrain 的只读网络工具 —— fetch_url 和 research_url —— 也作为独立的 LM Studio 插件发布在 webbrain/web-tools。用 lms clone webbrain/web-tools 安装,然后在任意 LM Studio 聊天里开启 —— 任何支持工具调用的模型都能调用这两个工具,你不需要安装浏览器扩展。纯 Node,无 headless 浏览器。源码:lmstudio-plugin/。
在 Chrome 上可以 —— 代理运行在后台 service worker 中,并绑定在启动它的标签上,因此即使你把焦点切到别处,它也会继续在那个特定标签上点击、输入和读取。针对标签的工具(CDP 的点击、输入、导航、截图)在 Chrome 中对后台标签同样有效。任务进行期间,侧边栏会锁定输入,防止你在新标签上意外启动第二个任务 —— 你需要等当前任务完成或手动停止它。需要注意的是,浏览器会限制后台标签上的计时器和动画,因此动画繁多的站点响应可能略慢。
在 Firefox 上,代理也会继续在其原始标签上运行,但自动截图会受限:Firefox 的截图 API 只能捕获当前活动标签,无法抓取后台的某个具体标签。WebBrain 会识别这一点,并在该轮跳过截图,而不是把一张无关页面的图像喂给模型。代理会继续基于文本上下文进行规划,直到你切回它的标签。
请避免在代理正在工作的同一标签上主动点击或输入 —— 这会造成你和代理争抢同一页面的竞态条件。切换标签没问题;共同驾驶同一标签则不行。
个人资料自动填写是 设置 → 个人资料 中的可选功能。你输入一段简短的自述 —— 姓名、工作邮箱、公司以及用于低风险注册的一次性密码 —— 然后将其打开。启用后,WebBrain 会将这段文本附加到代理的系统提示中,这样它就能无需每次询问即可填写注册表单。
该文本以明文保存在浏览器的本地存储中。它不会被传送到 WebBrain 项目,但会在每一轮作为系统提示的一部分发送给你配置的 LLM 提供商。默认关闭。
不要在此放置重要账户的密码(Google、Apple、iCloud、银行、公司 SSO、主邮箱)。这些账户应启用 2FA,而且本就不该交给代理。预期用途是你在订阅通讯和免费试用注册时反复使用的一次性密码。
不能——它只是降低了暴露风险,并不是保证。启用后(设置 → 多模态 → 截图打码,默认关闭),WebBrain 会在每张截图发送给视觉模型之前,对表单字段以及看起来像邮箱地址或电话号码的文本进行打码。检测完全在你的设备上通过 DOM 启发式方法运行;不会额外传输任何内容。
这是尽力而为且失败开放(fail-open)的处理。如果检测器无法在某个页面上运行——例如刚导航完成之后、在 PDF 查看器中,或在受限的浏览器页面上——截图仍会以未打码的原样发送,而不会中止你的任务。DOM 启发式方法看不到的内容(canvas 上绘制的文字、图片中的个人信息、不常见的组件)同样可能被遗漏。而且该设置只覆盖截图:发送给模型的页面文本不会被它打码。
若需要完全的视觉隐私,请使用本地模型。使用 llama.cpp 或 Ollama 等离线提供方时,截图和页面文本永远不会离开你的设备,因此从一开始就没有需要打码的内容——这是唯一能保证隐私的配置。参见上文的"我能完全离线使用 WebBrain 吗?"。
没有能运行支持视觉的本地模型的设备?一个不错的折中方案是:用一个体积小的本地模型负责规划和工具调用(轻量到普通 CPU/GPU 也能胜任),再搭配一个云端提供方负责视觉子调用,同时开启截图打码。这样你的对话和页面文本仍留在本地,而每一张发往云端视觉的截图都已先对表单字段和检测到的邮箱/电话进行了打码——在不需要完整本地视觉模型硬件的情况下减少了云端暴露。请在设置 → 视觉中配置这种拆分(参见上文的"WebBrain 如何控制云端 LLM 的账单?")。
Cookie 横幅:WebBrain 能识别常见框架(OneTrust、Cookiebot、Didomi、Quantcast、Google Funding Choices、TrustArc)的同意横幅,并在对页面进行推理之前将其关闭。当「全部拒绝」/「拒绝非必要」/「仅必要」清晰可见时优先选择这些选项;否则会退而点击「全部接受」,而不是陷入「管理偏好」的迷宫。
付费墙:WebBrain 会如实报告付费墙,并告诉你它实际看到了什么(标题、副标题、开头几段)。它不会尝试绕过付费墙 —— 不使用 archive.today、12ft.io、不清除 Cookie、不禁用 JS、不使用阅读模式小技巧。如果你想要完整文章,请使用订阅登录,或请 WebBrain 搜索同一报道的免费报道。
截至 7.0.0 版本, 还不支持。dry-run 模式已在路线图中, 后续会提供。
三个独立的层:
节省 token 的截图。在任何图像离开你的机器之前,WebBrain 会先缩放它(短边封顶,保持宽高比),然后迭代 JPEG 压缩直到适配每轮的图像 token 预算。一张 2000×1200 的截图,在 GPT-4o 上原本大约要花 1500 个输入 token,可被压缩到约 300–500 个 token,对页面阅读任务来说没有实际损失。实现位于 _fitImageDimensions,并有覆盖预算计算的单元测试。
智能上下文裁剪。对话历史、工具输出和内联 DOM 转储都会按每轮加以限制,当活跃模型的上下文窗口接近占满时,会从最早的内容开始裁剪。你不会看到一次运行因为一次 read_page 返回了一篇长篇大论,就从 1 万 token 悄悄膨胀到 10 万。
专用视觉模型。将便宜的文本模型(如 GPT-4o-mini)用于规划和工具调用,再配一个专门的视觉模型(如 GPT-4o)只用于截图,这样你不必在每一轮都支付多模态模型的价格。可在 设置 → 视觉 中配置。
结果:与云端提供商的长会话保持可预测。如需完全控制,请使用本地 llama.cpp —— 每 token 成本为零。
当然可以!WebBrain 采用 MIT 许可,欢迎贡献。请查看 GitHub 仓库 了解议题、功能请求和贡献指南。