OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  代码  ›  LaVague — 通过浏览器自动执行网页任务的开源 Agent

LaVague — 通过浏览器自动执行网页任务的开源 Agent

 
  claim ·  2026-08-09 11:00:21 · 17 次点击  · 0 条评论  

Stargazers Issues Forks Contributors


LaVague Logo

欢迎使用 LaVague

加入我们的 Discord 服务器! 文档

一个用于开发 AI Web Agent 的大型动作模型框架

LaVague:为开发者打造的 Web Agent 框架

LaVague 是一个开源框架,专为希望创建 AI Web Agent 来为最终用户自动化流程的开发者而设计。

我们的 Web Agent 可以接收一个目标,例如“打印 Hugging Face Diffusers 库的安装步骤”,并生成并执行实现该目标所需的操作。

LaVague Agent 由以下部分组成:

  • 一个世界模型,接收目标与当前状态(即当前网页),并输出一组适当的指令。
  • 一个动作引擎,将这些指令“编译”为动作代码(例如 Selenium 或 Playwright)并执行它们。

LaVague QA:专为 QA 工程师打造的工具

🌊 基于 LaVague 构建

LaVague QA 是一个专为 QA 工程师量身定制的工具,利用我们的框架。

它允许你将 Gherkin 规范转换为易于集成的测试,从而实现测试编写的自动化。LaVague QA 是一个在后台利用 LaVague 框架的项目,使 Web 测试效率提升 10 倍。

有关详细信息和设置说明,请访问 LaVague QA 文档

🚀 快速开始

演示

以下是 LaVague 如何通过多个步骤实现“前往 PEFT 的快速教程”目标的示例:

Agent 演示

动手实践

你可以按照以下步骤操作:

  1. 安装 LaVague:
pip install lavague
  1. 使用我们的框架构建一个 Web Agent 并实现目标:
from lavague.core import  WorldModel, ActionEngine
from lavague.core.agents import WebAgent
from lavague.drivers.selenium import SeleniumDriver

selenium_driver = SeleniumDriver(headless=False)
world_model = WorldModel()
action_engine = ActionEngine(selenium_driver)
agent = WebAgent(world_model, action_engine)
agent.get("https://huggingface.co/docs")
agent.run("Go on the quicktour of PEFT")

# 启动 Gradio Agent 演示
agent.demo("Go on the quicktour of PEFT")

有关此示例以及如何使用 LaVague 的更多信息,请参阅我们的快速教程

注意,这些示例使用我们默认的 OpenAI API 配置,你需要在本地环境中设置 OPENAI_API_KEY 变量并提供有效的 API 密钥才能运行。

如需在 Google Colab 中查看 LaVague 的端到端示例,请参阅我们的快速教程笔记本

主要功能

支持的驱动

我们支持三种驱动选项:

  • Selenium Webdriver
  • Playwright Webdriver
  • Chrome 扩展驱动

请注意,并非所有驱动都支持所有 Agent 功能:

功能 Selenium Playwright Chrome 扩展
无头 Agent 不适用
处理 iframe
打开多个标签页
高亮元素

✅ 支持
⏳ 即将推出
❌ 不支持

🔎 支持

如果你在开始使用 LaVague 时遇到任何问题,你可以:

  • 查看我们的故障排除指南,其中列出了常见问题的信息和修复方法。
  • 在我们的 GitHub Issues 中描述你的问题。
  • 在我们的 Discord 服务器的 '#support' 频道中给我们留言。

🙋 贡献

我们非常希望得到你的帮助和支持,共同构建一个稳健可靠的用于 Web 自动化的“大型动作模型”。

为了避免多人同时处理相同事务而导致无法合并你的工作,我们制定了以下贡献流程:

1) 📢 我们通过 GitHub Issues 概述任务:我们建议查看带有 help-wantedgood first issue 标签的问题。
2) 🙋‍♀️ 如果你对其中某个任务感兴趣,请在 issue 下留言!
3) 🤝 我们将与你讨论,并为你分配带有 community assigned 标签的任务。
4) 💬 我们将随时与你讨论此任务。
5) ⬆️ 你应该将你的工作作为 PR 提交。
6) ✅ 我们将审查并合并你的代码,或请求更改/提供反馈。

请查看我们的贡献指南了解更多详情。

🗺️ 路线图

要了解我们的项目积压工作,请点击此处

💰 运行一个 Agent 需要多少成本?

LaVague 在底层使用 LLM(默认使用 OpenAI 的 gpt4-o,但完全可以自定义)。

这些 LLM 调用的成本取决于:
- 为给定 Agent 选择的模型
- 目标的复杂度
- 你交互的网站。

请参阅我们关于 Token 计数与成本估算的专门文档,了解如何跟踪所有 token 并估算运行 Agent 的成本。

📈 数据收集

我们希望构建一个可供 AI 社区使用的数据集,以构建更好的、用于开发更优 Web Agent 的“大型动作模型”。你可以通过我们的 BigAction HuggingFace 页面 查看我们在构建社区数据集方面的现有工作。

因此,LaVague 默认收集以下用户数据遥测信息:

  • 已安装的 LaVague 版本
  • 为每个 Web 动作步骤生成的代码/操作列表
  • 之前的操作
  • “观测结果”(用于检查当前页面的方法)
  • 使用的 LLM(如 GPT4)
  • 使用的多模态 LLM(如 GPT4)
  • 随机生成匿名用户 ID
  • 你是否使用了 CLI 命令(例如 lavague-qa)、Gradio 演示或直接使用我们的库
  • 使用的目标
  • Agent 的思维链
  • 页面上的交互区域(边界框)
  • 浏览器的视口大小
  • 当前步骤
  • 生成的指令及当前使用的引擎
  • Token 成本和使用量
  • 执行操作的 URL
  • 操作是否失败或成功
  • 使用的额外指定数据
  • 相关的错误消息
  • 源节点(从网页中检索用于执行此操作的 HTML 片段)

请注意:切勿在你的目标及额外用户数据中包含个人信息。如果你打算在目标/额外用户数据中包含个人信息,强烈建议关闭遥测。

🚫 关闭所有遥测

如果你想关闭所有遥测,应将 LAVAGUE_TELEMETRY 环境变量设置为 "NONE"

有关如何设置 LAVAGUE_TELEMETRY 环境变量的指南,请参阅我们的指南

17 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 39 ms
Developed with Cursor