browser-use 是 2024 年 10 月在 GitHub 上线的开源 Python 框架,让 AI Agent 像人一样使用浏览器——打开页面、点击按钮、填写表单、提取数据——无需编写 XPath 或 CSS 选择器,只需用自然语言描述任务。项目在不到两年内累计突破 106,038 GitHub Star,Manus 等商业 AI 产品以其为核心浏览器操控组件,在 Odysseys Benchmark 200 个真实长流程 Web 任务中,browser-use 以 87.4% 平均成功率位居全球第一,超越 OpenAI、Anthropic、Google 和 Microsoft 的 computer-use 方案。本文从原理、快速上手、与 Playwright/Selenium 的本质区别,到开源版与云版选型逻辑,系统梳理 browser-use 正在改变 Web 自动化的方式。

 

browser-use 是什么?

browser-use 是一个让 AI Agent 直接操控 Web 浏览器的开源框架,核心思路只有一句话:不改造目标网站,让 AI 学会"像人一样用浏览器"

传统自动化方案(Playwright、Selenium)要求开发者用代码写死每一步——找到某个按钮的 ID、等待某个元素出现、点击它。这套方式在页面结构稳定时效率极高,但一旦网站改版,脚本就得重写。

browser-use 的不同之处在于中间多了一层:AI 理解层。Agent 接收自然语言任务,通过视觉识别和 DOM 解析理解当前页面状态,再决定下一步动作。页面结构变了?AI 重新看一眼,继续执行——不需要人工介入。

相关技术实体:Playwright(底层浏览器驱动)、LangChain(Agent 框架整合)、Stagehand(同类竞品,Browserbase 出品)、Skyvern(同类竞品,专注 RPA 场景)、computer-use(Anthropic 提出的桌面级控制方案)。

106,038 Star 背后:它能做什么?

一句话驱动 AI 帮你完成的事情:

 表单填写:“用我的简历填写这份工作申请”

 数据提取:“把我所有关注者信息整理成 CSV”

 QA 自动化:“测试我的网站,截图标注所有 bug 和视觉问题”

 竞品监控:“每天抓取这三个竞品的价格和库存变化”

 流程自动化:登录、搜索、选项、提交——完整操作链路

不依赖目标网站提供 API,对动态渲染、SPA 应用、需要登录的页面同样有效。这是它爆发的根本原因:覆盖了"有 API 的世界"触及不到的大量真实业务场景

browser-use vs Playwright vs computer-use:三者的本质差异

这是最常被问到的问题,需要说清楚层级关系:

维度

Playwright / Selenium

browser-use

computer-use

控制范围

Web 浏览器

Web 浏览器

整个桌面

操作方式

代码写死每步

自然语言描述目标

截图 + 坐标点击

动态页面适应

弱,改版即失效

强,AI 重新理解

中,逐帧识别慢

速度

中(有 AI 推理延迟)

适合场景

稳定结构的大规模测试

复杂流程、无 API 场景

桌面应用操作

browser-use 底层直接用 Playwright 驱动浏览器,两者是叠加关系,不是替代关系。需要高并发、精确控制的回归测试继续用 Playwright;需要"理解意图"、应对未知页面结构的复杂任务,browser-use 大幅降低了开发成本。

Odysseys Benchmark 2026 年数据,browser-use 在 200 个真实 Web 任务中平均成功率 87.4%,是目前公开排行榜上成绩最高的方案。

5 分钟跑起来

环境要求:Python 3.11+

 

# 安装框架
uv add browser-use
# 或
pip install browser-use
 
# 安装浏览器内核
playwright install chromium

项目根目录创建 .env,填入大模型 API Key:

 

BROWSER_USE_API_KEY=your-key

最小可运行代码:

 

import asyncio
from browser_use import Agent, ChatBrowserUse
 
async def main():
    agent = Agent(
        task="搜索 browser-use 的 GitHub Star 数量并返回",
        llm=ChatBrowserUse(model='openai/gpt-5.5'),
    )
    history = await agent.run()
    print(history.final_result())
 
asyncio.run(main())

需要接入国内可直接访问的多款主流大模型时,可以通过兼容 OpenAI SDK 格式的 API 接入,例如七牛云推理服务支持该接口格式,无需修改现有代码结构。

开源版 vs 云版:一张表说清楚

browser-use 提供两种使用路径,核心差异在反爬能力运维成本

开源版(自托管)

 完全免费,代码运行在本地

 可以接入任意 LLM、自定义 Agent 行为、深度融入业务系统

 需要自行处理代理、验证码等反爬问题

Cloud 版(全托管)

 内置代理轮换 + 浏览器指纹伪装 + 验证码处理

 在 BU Bench V1 基准测试中,Cloud 版成功率明显高于开源版搭配普通模型的组合

 按调用量计费,无需维护浏览器环境

选型建议:个人项目和技术验证,开源版足够。商业应用需要规模化跑通带反爬的网站,Cloud 版稳定性有保障。

生态与现状:两年内发生了什么

 Star 增速:2024 年 10 月上线,2026 年 7 月突破 106,038 Star,是同期增速最快的 AI Agent 基础设施项目之一

 商业落地:Manus(引发广泛关注的 AI 自动化产品)以 browser-use 为核心浏览器操控组件

 版本迭代:最新版 v0.13.6(2026-07-17 发布),GitHub 仓库保持每周活跃更新

 工具链:官方提供 browser-use skill install CLI,支持在 Claude Code、Cursor、Codex 等 AI 编程助手中一键注册为 skill,直接用自然语言驱动

 排行榜:Odysseys Benchmark 第一名,超越 OpenAI/Anthropic/Google/Microsoft 的 computer-use 方案

常见问题

Q:browser-use 会被网站反爬拦截吗?

开源版使用标准 Playwright 驱动,在指纹伪装方面有限,复杂反爬场景可能被拦截。Cloud 版内置了代理轮换和浏览器指纹伪装,在 Odysseys 测试中通过了包含 CAPTCHA 的真实任务。如果自己部署,搭配 CloakBrowser(本周 GitHub Trending)这类隐身 Chromium 方案是常见选择。

Q:browser-use 和 computer-use 哪个更适合 Web 任务?

Web 任务场景 browser-use 更合适。computer-use 控制整个桌面,通过截图+坐标点击,速度较慢;browser-use 通过 Playwright 直接访问 DOM,效率更高。在 Odysseys 200 项 Web 任务基准中,browser-use 87.4% 的成功率优于 Anthropic computer-use 方案。

Q:不写代码能用吗?

可以。browser-use 提供 CLI 工具,将以下提示词粘贴给任意 AI 编程助手,它会自动完成安装配置:“Install or upgrade browser-use to the latest stable version with uv using Python 3.12, run browser-use skill install to register the skill.”

结语

browser-use 填补了"有 API 的世界"覆盖不到的盲区:那些只有 Web 界面、没有开放 API 的场景,现在可以用 AI 直接操控浏览器完成。从 Manus 的商业落地到 Odysseys 排行榜第一名,这个框架正在从开发者实验工具演变为 AI Agent 的标准基础设施层。

Odysseys Benchmark 官方数据显示,browser-use 是目前唯一在 200 项真实 Web 任务中突破 85% 成功率的公开方案。项目由 browser-use 团队在 GitHub 持续维护,Discord 社区活跃。

本文内容基于 2026 年 7 月数据及 v0.13.6 版本,如需获取最新 API 文档和示例代码,建议访问 browser-use 官方文档

 

延伸资源

 browser-use GitHub:https://github.com/browser-use/browser-use

 Odysseys 排行榜:https://odysseysbench.com/leaderboard

 多模型 API 测试对比:https://www.qiniu.com/ai/models