浏览器自动化工具不少,但大多数都有一个共同的麻烦:要么得启动一个全新的浏览器实例,要么得单独搞一套配置文件,AI智能体根本碰不到你正在用的那个Chrome——尤其是那些已经登录了各种服务的标签页。
一个名为 chrome-bridge 的开源项目想解决这个问题。它的思路很直接:做一个轻量级的命令行工具,让任意AI智能体(Claude、Kimi、Qwen、DeepSeek、GLM等)直接操控你当前正在使用的Chrome会话。不需要重启浏览器,不需要MCP服务器,甚至不需要额外的配置文件。
![]()
核心逻辑:桥接而非替代
这个工具的实现方式,是在本地跑一个由单个Node.js文件构成的服务器,再配上一个极简的Chrome扩展。用户只需点击一次加载扩展,AI智能体就能通过命令行接口下达操作指令——点击、填写表单、拖拽、截图、监控网络流量,都在支持范围内。
关键在于,它连接的是你现有的Chrome会话。这意味着AI能操作你已经打开的标签页,包括那些已经完成登录的页面,无需重复进行身份验证。对于需要用到单点登录(SSO)状态的场景,这一点尤其省事。
零依赖设计,缩小攻击面
项目在设计上刻意追求极简。服务器端是单个无外部依赖的Node.js文件,Chrome扩展也是体积小、可读性高的轻量脚本。相比那些动辄引入一堆依赖的复杂框架,这种设计不仅部署速度快,还能有效缩小潜在的攻击面。
在安全性上,chrome-bridge 也做了约束。服务器绑定在 127.0.0.1 地址,并且会拒绝来自浏览器来源的请求——通过 Origin、Sec-Fetch、Host 等校验规则,确保你访问的网页无法反过来操控这个桥接工具。
元素定位:靠无障碍快照,不靠坐标
AI操控浏览器的一个难点在于如何精准找到页面上的元素。chrome-bridge 的做法是利用无障碍快照(Accessibility Snapshot)来识别元素,再通过元素引用机制实现稳定、精准的定位。相比依赖像素坐标的笨办法,这种方式对UI组件的定位更可靠,也更能适应页面布局的变化。
项目作者在介绍中强调,这套桥接工具从设计上就不限定使用框架——它只由本地CLI和HTTP端点构成,任何能发HTTP请求的AI智能体都能接入。
一个值得关注的自动化新方向
浏览器自动化工具赛道并不缺玩家,但 chrome-bridge 切入的角度确实不同:它不试图替代你的浏览器环境,而是选择与现有会话无缝集成。对于经常需要在已登录状态下让AI帮忙处理任务的开发者来说,这种"轻量化桥接"的思路,或许比那些重型的自动化框架更实用。
项目目前在Hacker News上获得了不少关注,AI筛查评分85。如果你正在寻找一种让AI智能体操作真实浏览器环境的方式,这个开源项目值得一试。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.