2026-06-30 · GitHub

Einsia/Browser-BC

An AI-assisted editorial analysis of this GitHub repository, based on the source information and signals available on 2026-06-30.

301 stars27 forks3 days old
Published
Data source
GitHub

Analysis

将浏览器操作轨迹蒸馏为 Claude 可用技能的本地工具

Journey Forge Local 是一个本地优先的浏览器行为克隆工具,它能将你在网页上的操作轨迹自动蒸馏成 Claude Desktop 和 Claude Code 可直接调用的技能文件。它面向那些厌倦了编写脆弱的自动化脚本,希望直接通过演示来教会 AI 如何操作特定网站的开发者。

在过去,如果想让 AI 帮忙操作浏览器,开发者通常只有两条路:要么使用 Playwright 或 Selenium 编写底层的自动化脚本,手动处理选择器、等待逻辑和异常捕获;要么直接把网页截图或 DOM 树扔给云端 Agent,让它自己尝试点击。写脚本的方式维护成本极高,网页前端改版一次,脚本往往就全部失效;而依赖云端 Agent 的通用方案,虽然不需要写代码,但经常在复杂交互中迷失方向,或者因为找不到元素而陷入死循环。更麻烦的是,这些方案很难将“如何在某个内部系统提单”这种私有知识沉淀下来复用。

用户真正卡住的地方在于“隐性知识的显性化转换”。开发者脑子里知道怎么操作,但很难把这种包含上下文判断的操作逻辑,稳定地翻译成 Agent 能理解的 Prompt 或函数代码。现有的方案要么太底层,要么太不可控,且缺乏将一次成功的操作转化为永久资产的能力。

这个项目切入的是 Agent 执行层中的技能沉淀层。它不负责模型推理,也不负责浏览器驱动,而是专注于连接“人的演示”与“Agent 的技能”。它通过浏览器扩展录制操作,经由本地 Server 汇聚,再通过 Harness Pipeline 将轨迹原子化、分类归入“能力桶”,最终蒸馏成标准的 Markdown 技能描述。

它之所以现在能获得关注,是因为 Claude Desktop 和 Claude Code 的普及让本地 Agent 环境成为了开发者的新工作台。随着 AI 从聊天转向执行,开发者不再满足于通用的浏览能力,而是迫切需要针对特定网站、特定工作流的私有技能。同时,大模型的理解能力已经进化到足以从操作轨迹中归纳出逻辑,使得“演示即编程”在浏览器自动化领域成为可能。

这透露出一个明显的变化:AI 自动化正在从“通用指令执行”转向“特定技能习得”。开发者不再试图训练一个万能的浏览器 Agent,而是开始像管理代码库一样管理 Agent 的技能集。技能不再是一次性的 Prompt,而是可以被本地存储、版本控制和自动安装的资产。

Builder 今天可以直接用它来为 Claude 补充缺失的网站操作能力,例如录制一次在 GitHub 上创建 Issue 的流程,生成技能后让 Claude 在代码审查时自动调用。最值得学习的是它的“轨迹蒸馏”设计思路:将连续的鼠标点击和输入动作,智能拆解并归类为不同的“能力桶”,再反向生成结构化的技能文档。这种从非结构化行为到结构化工具的转换机制,完全可以迁移到桌面应用录制、移动端测试或复杂的 CLI 操作流程中,把任何 GUI 交互转化为 LLM 的可复用工具。