
这是什么
一个 Python 库,让语言模型驱动真实浏览器——打开页面、点击、填表、抓数据。它走的是与同时期多数浏览器 Agent 相反的路:不把截图丢给模型让它判断点哪儿,而是先把界面转换成结构化文本。团队的说法是这样更快、更便宜,也比基于像素的导航更可靠。
谁做的Magnus Müller 与 Gregor Žunič 于 2024 年创办公司,两人此前都是苏黎世联邦理工学院(ETH Zurich)的数据科学学生;档案记录的原型开发时间是四天。项目走的是 Y Combinator W25 批次,并在 2025 年 3 月宣布由 Felicis Ventures 领投的 1700 万美元种子轮。两位创始人公开的说法一致:选文本而非视觉,是为了让 Agent 更便宜、也少依赖像素坐标。
制作过程
3 个阶段- 01
四天做出来,然后直接发 Hacker News
按团队自己的说法,项目最初只是一个周末实验,想看看 LLM 能不能像人一样浏览网页。四天内做出初版,随即发到 Hacker News。仓库创建于 2024 年 10 月 31 日,与这个时间线吻合,但并不能独立证明「四天」这个说法。
- 02
选文本,不选视觉
当时多数浏览器自动化方案是把截图交给模型,让它对着像素推理。Browser Use 把页面转成结构化文本,让模型在此基础上行动。给出的理由是确定性:不用猜坐标、不受渲染差异影响、每一步成本更低。
- 03
从库变成公司
2025 年 3 月宣布 1700 万美元种子轮,Felicis Ventures 领投,Y Combinator、Paul Graham、Nexus Ventures、SV Angel 等参投。官网现在卖两样东西——Agent 工作流和浏览器基础设施——与开源库并列。
他会告诉你什么
- 一个周末实验,如果当周就发出来,有可能变成这个领域的参照实现。
- 早期选一条不那么主流的技术路线,才有在上面长出公司的空间。