每天早上,科技编辑的“信息早课”已经变成一场重复轰炸——五六个应用刷下来,其实就三件事,穿着不同标题的外衣轮番出现。不是漏了什么,而是同一段新闻被包装出五个版本,消耗的不只是时间,更是注意力带宽。当“今天有什么新事”变成“这标题昨天已经见过”,早晨的阅读已经从获取信息退化成做减法。
这不是某一家媒体的锅。媒体编辑按自己的角度写标题太正常了,但读者面对的是信源矩阵:Google News、Reddit、X、几家新闻App,再加几封电子邮件摘要。每个渠道都觉得自己提供了筛选价值,可叠加在一起就成了复读机。更折腾人的是,同样的结论被不同标题伪装成独立报道,让人忍不住各点一遍,点完才发现讲的还是那件事。
![]()
试过几家AI聚合工具,要么免费额度少得可怜,要么数据全走云端API,隐私和自由度双双打折扣。于是回头找自己能掌控的方案,在 r/selfhosted 发现了 MuckScraper——一个开源项目,能自己指定信源,自动对重复报道做聚类,再把同主题的若干篇文章扔给本地大语言模型生成一条摘要。整套流程跑在本地硬件上,不开云端。
部署比想象中顺畅,基本开箱即用,但对个人工作流来说还没到完美。它的价值在于把“人工过滤重复”这件事交给了机器,而且过程透明可定。选了哪些 RSS 源、聚类阈值怎么设、用哪个本地模型做摘要,都可以自己调。第一次看到它把三个科技媒体对三星新表的报道压成一条要点时,那种“终于不用手动比对标题了”的爽感很实在。
不过,本地 LLM 的摘要质量受限于模型大小,偶尔会丢一些细节,比如参数表里某个传感器规格,或者文章的微妙评价语气。好处是响应快、零延迟、不依赖网络,大早上断网也能跑。如果愿意投入时间调 Prompt 和模型,摘要完全可以做到只留干货,去掉那些“据外媒报道”的套娃开场。
MuckScraper 不代表新闻消费的终极答案,但它提供了一个很清晰的方向:信息筛选的控制权应该回到用户手里。不是把五个 App 的重复推送硬塞过来,而是先帮你去重,再让你决定看什么。对每天早上被同样三条新闻追着跑的人来说,这个思路本身就已经足够解压。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.