来源:市场资讯
(来源:刘聪NLP)
这两天刷到一个项目bigset,tinyfinsh开源的一个项目,
核心功能是通过用户的一句话需求,将散落在网页上的信息,变成一张可以持续维护的高质量的数据集(excel),同时支持定时自动刷新。
比如,现在LLM模型的API价格都是多少?能不能直接让把从各个网站上把所有LLM的价格都获取下来,同时每天进行更新检测。
bigset有点Clay AI 的开源版那意思,并且整理后的高质量、可持续更新的数据,对于其他agent应用来说,也能发挥作用。
bigset整个流程十分丝滑,可以理解为一支自动化的研究小队,
当获取用户描述需求后,AI 会自动推断出数据结构,判断出这张表需要哪些列,比如我们上面的case,"模型ID、厂商、输入输出缓存价格、价格链接"等列,并确定模型ID应作为主键。
![]()
然后,编排智能体通过网络搜索去发现实体,比如先找出OpenAI、Google、Anthropic、DeepSeek、Alibaba模型等厂商。
![]()
接着,子智能体并行分头行动,每个子智能体专注调研一个实体,比如其中一个去抓取OpenAI某一个模型的真实定价页面,各自获取真实数据并在经过校验后插入一行。
![]()
最后,得到一张可以在界面里浏览、可导出 CSV 或 XLSX 的结构化表格。
如果设定了刷新频率(30 分钟、6 小时、12 小时、每天或每周),就会按计划自动重跑,让API价格始终保持最新。
同时编排 + 并行子智能体的架构,可以让bigset兼顾覆盖广度与数据准确性。
结果也很适合作为深度研究场合的信息基础。
提到tinyfinsh,前阵子免费Web Search 和 Fetch两大接口应该还是蛮出圈的。
你在各种Agent可以免费使用,但会有频率限制Search每分钟5次,Fetch每分钟25次,
Fetch尤为好用,任意一个 URL 进去,用真实 Chromium 渲染,然后把导航栏、cookie 弹窗、广告脚本全部剥掉,输出干净的 Markdown。
![]()
回到bigset,如何部署使用呢?
官方的部署文档写的也是十分仔细, 先把仓库拉下来:
git clone https://github.com/tinyfish-io/bigset.gitcd bigsetcp .env.example .env接下来要填 .env。
BigSet 主要需要三类 key。
TinyFish API Key 用来做网页搜索和页面抓取,也就是 Search 和 Fetch。
![]()
OpenRouter API Key 用来跑 LLM,包括 schema inference 和后面的 agent。
![]()
Clerk 用来做登录认证,需要 Publishable Key、Secret Key,以及 Clerk JWT Issuer URL。
![]()
对应分别填写,
TINYFISH_API_KEY=OPENROUTER_API_KEY=NEXT_PUBLIC_CLERK_PUBLISHABLE_KEY=CLERK_SECRET_KEY=CLERK_JWT_ISSUER_DOMAIN=填完以后,直接启动:
make dev![]()
跑起来以后,默认有三个入口:
BigSet App: http://localhost:3500Convex Dashboard: http://localhost:6791Mastra Studio: http://localhost:4111![]()
真正使用时,打开 localhost:3500,注册或登录,然后新建 dataset,就可以了。
![]()
![]()
比如,你先用自然语言描述想要的数据集,
收集AI Agent的Web Search / Fetch / Browser API工具,字段包括产品名、公司、支持能力、是否开源、免费额度或起步价格、并每周刷新。系统会先生成 schema,也就是这张表应该有哪些列、字段类型是什么、哪一列是主键。用户可以在页面里手动修改字段、刷新频率和最大行数。
![]()
确认之后,进入 dataset 页面,触发 populate。
![]()
BigSet 后端会启动 agent workflow,先搜索候选实体,
![]()
再让 sub-agent 逐个研究每一行,把结果写进表里。
![]()
数据可以excel导出。
![]()
我在window下面部署,还遇到了一个问题,就是在wsl2 Ubuntu-22.04启动的时候,
frontend镜像一直启动不起来,直接使用bun启动也不行,会出现拉起之后,程序直接停止
![]()
最后把项目从 /mnt/d 挪到 WSL 自己的 Linux 目录下就好了,
我也是醉了,准备Mac了,感谢CodeX。
![]()
当然,bigset还是存在一些不足,
比较核心的问题就是没办法使用在采集需要登录的网站、或者付费的内容,
但这恰恰是很多高价值数据所在的地方,也是我们经常获取数据的地方。
最后,
我觉得,bigset真正有意思的地方,
是把AI从一次性问答,向可维护的数据资产推进了一步。
搜索引擎给你网页,
rag给你答案,
bigset想给你一张会持续更新的表。
对agent来说,可能比多回答几句话更重要。
对于很多真实业务来说,
持续维护有一份真实有效的结构化数据,就足够了。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.