网易首页 > 网易号 > 正文 申请入驻

RAG 没死,但也快了

0
分享至

PG 三十周年系列直播,第七期聊 PG + AI。主持人的手卡上有这么一问:

RAG 火了两年了,就是让大模型查你的私有资料再回答。PG 在这套架构里到底扮演什么角色?只存向量,还是连元数据、权限、对话记忆都兜住?

老冯看了半天,觉得该先问另一个问题:这套架构本身,还值得照着搭吗?

RAG 这个词当然还活着。但大家熟悉的那套“切片、向量化、Top-K”流水线,已经不该是默认答案了。向量检索正在退回一个普通工具的位置,越来越多的工作,被目录、全文检索和会自己翻资料的 Agent 接了过去。

向量检索有用,但这不妨碍我认为,这几年大家把它捧得太高了。

发明者为什么要辟谣?

2020 年那篇 RAG 论文的共同作者之一 Douwe Kiela,后来创办了 Contextual AI。2025 年,他写了一篇《RAG is dead, long live RAG![8]》,反驳“长上下文让 RAG 过时”的说法,公司还为此买了个域名。


后来接受 The New Stack 采访时,他又解释:大家只是把 RAG 重新包装成了 context engineering。通过 MCP 去检索资料,也可以算 RAG。报道还提到,RAG 仍在公司的技术栈里,只是首页上已经不再突出这个词。

发明者没放弃,老冯不能替他宣布死亡。不过,一个技术名词需要专门辟谣,还得不断扩充定义来证明自己依然重要,处境如何大家心里有数。

按字面理解,“检索增强生成”确实很难死。模型回答前去外面找了点东西,都能算。但多数人在 2023 年学会、2024 年上线、今天还在维护的 RAG,是一条具体得多的流水线:

文档切片 → embedding → 存向量库 → 问题转向量 → 相似度检索 → 捞 Top-K → 塞进 prompt。

老冯要说的就是这套东西。

Claude Code 最后选了 grep

Claude Code 作者 Boris Cherny 在 2025 年的 Latent Space 播客里讲过:他们早期试过 RAG,也试过几种搜索方案,最后选择了 agentic search,因为效果更好。后来他又补充,早期版本确实用了本地向量库,但让 Agent 自己搜索更简单,也省掉了索引陈旧等麻烦。

Anthropic 后来的方法论也是这条路。CLAUDE.md 这类文件预先放进上下文,其余内容靠 glob、grep 按需查找。读到一个文件,发现它引用了另一个文件,就继续往下读。Agent Skills 也是先给简短描述,用到了再加载正文,需要细节再翻附件。


说白了,就是先给目录,让它自己翻。老冯给 Pigsty 做 Skill 时,走的也是这个路子。没切块,没算向量,只是把文档站的目录写进 AGENTS.md / CLAUDE.md:装 PG 去哪一页,配高可用去哪一页,某个参数在哪一节。Agent 看目录找入口,不够就顺着链接继续读,简单粗暴,效果很好。


实际用下来,已经足够解决我的问题。一个副作用是,Pigsty 文档站的流量被 Agent 拉到了每月上亿 PV。至于向量检索,我已经很久没碰过了——不是不会,是在自己的场景里用不上。

这和固定的向量流水线有个很大的区别:Agent 可以边找边改主意。

一次 Top-K 检索,是提前猜好哪几段可能相关,交给模型作答。Agent 则可以先读目录,再看正文;发现找错了,换个词;发现条件不全,继续翻前后文。

当然,代码库和文档站本来就有结构,函数名、参数名、章节标题都适合搜索。这不能证明 grep 在所有场景里都赢。但它至少说明:有现成的结构可用时,先把内容切碎再算向量,未必是最聪明的做法。

你把这种按需查资料的方式也叫 RAG,当然可以。只是它已经不是当初那条流水线了。

小窗口时代的办法,不该一直照搬

RAG 诞生于 2020 年,并不是专门为 ChatGPT 的 4K 窗口发明的。但它在 2023 年爆火,和当时捉襟见肘的上下文窗口脱不开关系。

你有一本三百页的产品手册,模型却只能吃下几页。怎么办?只能挑一点塞进去。

挑选的方法很多,倒排索引、BM25 都能用。但 embedding 加相似度检索最容易演示,教程最多,一个下午就能跑通。于是,切片、向量库、Top-K 成了标准答案。

后来,几十万乃至百万 token 的上下文窗口出现了。原来塞不进去的资料,现在可能放得下了。


长上下文当然不是免费的,也不保证模型看过就能用好。成本、延迟、信息遗漏,一个都没消失。但对小知识库来说,动手搭管线之前,至少应该先数一遍 token:完整内容就在可接受的预算里,为什么非要先切碎?

即便不谈窗口,纯向量召回也有几个老问题。

切片首先会拆散上下文。“以下项目不予报销”和后面的清单被切开了,结论捞回来了,前提没捞回来。块小,容易匹配到具体内容,却容易丢背景;块大,背景多了,匹配又可能不够准确。Late Chunking、Contextual Retrieval 都在缓解这个问题,但不能指望随手切一刀,语义就刚好落在边界里。

其次,Top-K 给你的是库里最像的几条,不是足以回答问题的几条。库里根本没有答案,它照样能排出一个名次。相似段落被塞进 prompt,模型又倾向于接着往下说,错误就这么出来了。

阈值、reranker、拒答机制都能补。只是补到最后,你搭的已经是一套需要认真设计的检索系统,不再是教程里那次轻巧的余弦计算。

还有最根本的一条:相似不等于相关。

问“哪些项目不能报销”,捞回来一篇“报销流程说明”,语义上确实很近,问题却未必答得上。否定、数字、错误码、产品型号,这些地方尤其不能只靠“大意相近”。而企业知识库里,用户经常问的恰恰就是这些细节。

grep 也不是灵丹妙药。用户说“数据库连不上”,文档写的是 connection refused,搜一次照样可能不中。Agent 的好处是能换词再搜、读原文核对,而不是把第一次结果当成最终证据。

向量检索同样可以放进这个循环。没必要把它和 Agent 对立起来,该放弃的是“一次相似度排序就足够回答问题”的侥幸。

先看资料,再选架构

老冯现在会先看资料长什么样。资料不多,就先试直接放进上下文。能用简单办法解决,没必要为了架构完整,额外养一套检索系统。当然,每次调用的成本和延迟还是要算。

代码库、文档站、Wiki、API 手册,优先用它们已有的结构。目录、文件树、交叉引用、全文搜索,本来就是人找资料的工具,也可以交给 Agent。几千页的手册不需要一次读完,每次找到相关的几页就够了。

这里真正值得花功夫的是目录质量、页面组织和搜索能力。目录也会过期,但如果它能随文档构建自动生成,通常比额外维护一套分块、embedding 和索引同步流程省事。

十万份合同、几年的邮件、杂乱的群聊和扫描件,就没这么轻松了。这里确实需要建索引,但也不该只留一路向量召回。

全文检索负责关键词、型号、错误码;向量补充同义词、跨语言和口语化问法;元数据用来缩小范围,权限决定哪些内容能被看到。找到文档后,再读相关章节,必要时继续检索。

Agent 多翻几轮也有代价:调用更多,延迟更高。对响应时间和成本要求严格的服务,一套经过评测的固定检索管线,仍然可能是更好的选择。

所以别把“用不用 RAG”当成一道信仰题。语料、权限、成本、延迟,才是选型依据。

向量还是有用,只是没那么神

向量检索的老本行,是找相似对象。

在大模型知识库火起来之前,图像搜索、推荐、去重、聚类就已经在用它。文本向量也不是 2023 年才有的,只是那一年,embedding API 和大模型问答把它推到了所有开发者面前。

问题出在,“找相似内容”被包装成了“找到正确答案”。

找相似图片、相似工单,做推荐、聚类,向量当然好用。文本问答里的同义词、跨语言表达,也值得留一路向量召回。但要找某条报销规定的适用条件,最终还得看原文,不能拿余弦相似度代替证据。

这就是 2023 年的那句话:。

到处都用,每个数据库都值得支持。但支持一种数据类型、提供一种检索能力,不意味着用户就该为它单独养一个数据库。

专用向量数据库,问题出在位置上

老冯 2023 年写 时,判断很简单:向量存储和检索是真实需求,会随 AI 一起增长;但专用向量数据库未必能分到多少。

今天我还是这个看法。

Databricks 收购 Neon,Snowflake 收购 Crunchy Data,至少说明一件事:通用数据库没有因为 AI 的到来失去价值。PG 不必先改名叫“AI 原生数据库”,照样是值钱的资产。

专用向量库也早就不只做 Top-K 了。混合检索、元数据过滤、多租户、备份,大家都在补。它们面临的麻烦,是这些东西补着补着,就走进了通用数据库的地盘。

业务上了生产,用户要的不会只有检索速度。高可用、备份恢复、事务、权限、监控、驱动,迟早都得有人负责。pgvector 可以直接使用 PostgreSQL 已有的这些能力。一个扩展背后站着整套数据库,这是 PG 不讲武德的地方。

更实际的问题是一致性。

主数据在 PG,向量在另一套系统,你就得负责同步。用户删了一行数据,向量库里那份还没删,检索就可能翻出一条本不该存在的记录。CDC、outbox、重试、对账都能解决,但每一样都是额外工程。

向量和原文放在同一个 PG 里,就可以在同一事务中维护,一起提交、删除、回滚。它不会自动替你生成新 embedding,却能少掉一个跨系统一致性问题。这个价值,通常不会出现在向量检索的 benchmark 表格里。

再看实际需要的检索:全文、向量、元数据过滤、权限,还有业务表关联。PG 配上合适的扩展,往往就能放在一起做。为了向量单独拆出一套系统,再把这些东西同步过去,得有足够大的收益才划算。

这不等于 pgvector 没有短板。索引构建、写入、内存占用、大规模部署,都该拿真实负载测。HNSW 自身有成本,PG 的实现也有取舍,不能把所有问题都推给其中一方。VectorChord 等扩展在尝试不同的索引和量化路线,也需要按场景评估。

规模大到值得拆一个专门的检索系统,那就拆。只是别在还没有数据、没有负载的时候,先把分布式数据同步的债背上。

至于向量要不要进 PG 内核,老冯觉得没必要着急。检索方案还在变化,扩展可以各走各的路。用户需要的是好用的能力,不是一张“已进入内核”的奖状。

结语


回到直播手卡上的问题:PG 在 RAG 架构里扮演什么角色?

不用拿 RAG 把它框住。PG 可以存原始内容,做全文和向量检索,甚至存储检索图数据,地理空间数据,可以处理管理权限,也可以保存 Agent 的任务、对话和执行状态。查资料只是其中一部分,持久化、事务、回滚和审计,同样重要。

把上下文窗口理解成工作内存,那么 Agent 还需要一个可靠的地方保存长期状态。PG 在这里的价值,比一个 “放向量的柜子”大得多。

向量检索值得保留,但是围着向量检索搭建一切的习惯,可以退场了。有些系统还在为小窗口时代的限制付账,有些则只是照着教程,给自己添了一堆本来不需要的零件。十年前问要不要上 NoSQL,五年前问要不要上云原生数据库,两年前问要不要上向量数据库,今天又问要不要上 AI 原生数据库。

老冯的建议还是那句:

先把 Postgres 用明白吧。

参考资料

•冯若航,《专用向量数据库凉了吗?[10]》,2023 年 11 月。•Lewis et al.,《Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks[11]》,2020 年。•Douwe Kiela,《RAG is dead, long live RAG![12]》,Contextual AI Blog,2025 年;Richard MacManus,《RAG isn’t dead, but context engineering is the new hotness[13]》,The New Stack,2026 年 1 月。•Latent Space,《Claude Code: Anthropic’s Agent in Your Terminal[14]》,2025 年 5 月;Boris Cherny 在 X 上的补充说明[15],2026 年 2 月。•Anthropic,《Effective context engineering for AI agents[16]》,2025 年 9 月;《Introducing Contextual Retrieval[17]》,2024 年 9 月;Agent Skills 发布说明[18],2025 年 10 月。•Databricks 收购 Neon 公告[19],2025 年 5 月;TechCrunch 关于 Snowflake 收购 Crunchy Data 的报道[20],2025 年 6 月。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
笑不活了!你如果不开心的话就去赵星棠评论区吧,要笑趴了!

笑不活了!你如果不开心的话就去赵星棠评论区吧,要笑趴了!

黄丽搞笑小能手
2026-09-27 17:55:01
财政部为什么是党组、公安部为什么是党委?

财政部为什么是党组、公安部为什么是党委?

画生笔记
2026-09-20 09:10:50
张杰谢娜一家五口出游,仨女儿都坐推车不带腿,有专属摄影师摄像

张杰谢娜一家五口出游,仨女儿都坐推车不带腿,有专属摄影师摄像

阿废冷眼观察所
2026-09-28 00:02:06
裴轶被北理工解聘仅仅是拔掉一根毒草,高校文科打拳女教授的脏土还有待强力净化

裴轶被北理工解聘仅仅是拔掉一根毒草,高校文科打拳女教授的脏土还有待强力净化

少爷写春秋
2026-09-30 00:32:15
辽宁富豪一家被灭门,保姆装死幸存,15年后才敢说出当晚实情

辽宁富豪一家被灭门,保姆装死幸存,15年后才敢说出当晚实情

悬案解密档案
2025-04-02 11:31:49
日乒懵了,张本美和沉默了!亚运会乒乓一大惨案诞生,国乒不让了

日乒懵了,张本美和沉默了!亚运会乒乓一大惨案诞生,国乒不让了

老腘的世界视角
2026-09-29 10:55:42
特朗普称美伊代表已通过调解方交换信息,被问及谈判进展时称“我们会赢”

特朗普称美伊代表已通过调解方交换信息,被问及谈判进展时称“我们会赢”

一口娱乐
2026-09-29 08:00:38
德媒:普京受邀出席G20峰会,这不是和平提议,而是对普京的考验

德媒:普京受邀出席G20峰会,这不是和平提议,而是对普京的考验

阿尔卑斯瞭望
2026-09-28 23:35:42
研究发现:四种食物自带他汀,每天换着吃,降低血脂有帮助

研究发现:四种食物自带他汀,每天换着吃,降低血脂有帮助

路医生健康科普
2026-09-22 22:10:03
问题干部被纪委监委留置的第一天,你知道什么样吗?

问题干部被纪委监委留置的第一天,你知道什么样吗?

职场资深秘书
2026-09-29 18:26:19
伊朗男排0-2落后惊魂大逆转,决胜局救赛点,17-15虎口夺下小组第一

伊朗男排0-2落后惊魂大逆转,决胜局救赛点,17-15虎口夺下小组第一

烟雨洛神生
2026-09-29 18:59:24
苹果发布双正式版更新!建议升级

苹果发布双正式版更新!建议升级

花果科技
2026-09-29 11:40:25
9月起,出租房屋要缴这些税!

9月起,出租房屋要缴这些税!

法律内参
2026-09-25 01:42:09
509元众筹,小米把450mm导轨塞进了腰靠

509元众筹,小米把450mm导轨塞进了腰靠

报错免疫体
2026-09-28 18:24:18
一个离婚女人的自述:婚内追我的人排着队,离了婚他们全跑了

一个离婚女人的自述:婚内追我的人排着队,离了婚他们全跑了

千秋文化
2026-05-27 19:53:48
郑秉文设计的“养老金改革方案”,导致差别过大,到该修正时候了

郑秉文设计的“养老金改革方案”,导致差别过大,到该修正时候了

小莜读史
2026-09-29 20:59:07
宋美龄曾直言:当年美国人真是笨蛋,有原子弹为何不投向中国大陆?

宋美龄曾直言:当年美国人真是笨蛋,有原子弹为何不投向中国大陆?

搜史君
2026-09-09 09:30:18
马珊珊当选沈阳市市长(附简历)

马珊珊当选沈阳市市长(附简历)

上观新闻
2026-09-29 17:03:24
中美卫星导航用户数断崖差距:美国GPS用户数超60亿,中国北斗呢

中美卫星导航用户数断崖差距:美国GPS用户数超60亿,中国北斗呢

月下守候
2026-09-28 16:00:42
咸鱼涉黄:“夜总会”不会消失,但会转移

咸鱼涉黄:“夜总会”不会消失,但会转移

梁欢欢的理智与情感
2026-09-22 11:04:57
2026-09-30 02:28:49
老冯云数 incentive-icons
老冯云数
数据库老司机,云计算泥石流,PostgreSQL大法师
252文章数 67关注度
往期回顾 全部

科技要闻

82亿美元收购!李飞飞将与苏姿丰并肩做AI

头条要闻

空姐推餐车碰到男子 哭着下跪还被要求踹一脚

头条要闻

空姐推餐车碰到男子 哭着下跪还被要求踹一脚

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

赌王四房婚礼,何超琼带三房成员现身

财经要闻

央行调整完善若干货币政策工具

汽车要闻

搭华为乾崑ADS 5/设计风格换新 2027款纵横G700售30.49万起

态度原创

手机
亲子
家居
房产
公开课

手机要闻

苹果iPhone 18 Pro售价大涨,越来越多日本人开始考虑二手手机

亲子要闻

小朋友的语言体系真的能把人萌翻!网友:我都不知道咋接话了!

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

三亚楼市下半场,被一次交付和一座艺术馆讲透了

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版