档案库 · 产品创意 · 产品决策 · 2024
Skyvern让视觉LLM读取任意网站并自动化,无需XPath脚本
Skyvern将任务驱动的LLM智能体与Playwright结合,使浏览器工作流无需针对每个站点的选择器,并且能适应每次重新设计。
Skyvern
当时的题目
Classic browser automation and RPA meant custom scripts per website — DOM parsing and XPath interactions that broke whenever a layout changed and had to be rewritten for every new site. The open-source project Skyvern proposed replacing that with LLMs and computer vision: an agent that understands what it sees, the way a person does.
它是怎么成立的
在Skyvern之前,浏览器自动化是一场脆弱的特定性的游戏:团队编写自定义脚本,通过DOM结构和XPath定位按钮和表单,因此每次网站重新设计都会破坏机器人,每个新网站都需要新脚本。RPA供应商把这吹嘘为不可避免的。2024年3月发布的Skyvern开源项目将其视为过时的假设。
该项目的想法是给智能体一双眼睛。借鉴BabyAGI和AutoGPT推广的任务驱动智能体设计,Skyvern增加了Playwright浏览器控制和一组智能体,能在视觉上理解页面,规划完成工作流的步骤,并通过点击、键入和数据提取来执行。由于不依赖预定义的选择器,同一工作流可以在系统从未见过的网站上运行,并能适应布局变化。
3月14日的Show HN吸引了422分和139条评论,其中许多关注负面含义——自动化垃圾信息、机器人vs反机器人升级、AI智能体是否会主导网络流量。创始人回应称他们拒绝了滥用用例,并刻意将核心保持开源,以便网站所有者能审计工具的能力。
妙在哪
- 无选择器的自动化逆转了维护成本:不是在每次重新设计后重写脚本,而是智能体在运行时适应,因为它读取渲染的页面。
- 视觉是人类和智能体共享的界面:将视觉元素映射到动作在网站所有者从没见过的政府门户、保险表单和商店上也能工作。
- 开源智能体为该类别设定了新默认值,并回答了发布帖中提出的信任问题:网站所有者能确切地读取工具能做什么。
- API优先的设计意味着浏览器智能体可以作为服务插入现有自动化栈,而不是要求团队放弃现有工具。
做出来什么
The Show HN drew 422 points and 139 comments, with the founders answering questions about abuse, pricing and openness in the thread. By 2026 the GitHub repository showed about 22.9k stars and 2.2k forks, and the project's page claimed state-of-the-art results (64.4% accuracy on WebBench) for browser agents.
可以借走的
当自动化因为世界变化而失效时,用能力取代脆弱的假设——页面结构——让智能体读取渲染后的界面,就能在没人coding过的布局上工作。
后来
发布帖预见了后续辩论:评论者担心Skyvern会加速垃圾信息,并引发AI智能体和反机器人检测之间的军备竞赛,而创始人表示他们拒绝了滥用案例,并保持代码开放,以便网络能够自我防御。该仓库发展成一个兼容Playwright的SDK和无代码工作流构建器,并提供托管云服务,到2026年,它显示约22.9k星和2.2k次fork,项目声称在浏览器智能体基准测试上达到领先准确率。
资料来源
发现哪里写错了?告诉我们。
轮到你了
你刚读完一个点子。把你手上的题目说出来,看看谁接过同样的题。
免费账号 · 3 次免费提问 · 不用绑卡