上周,跟我一个做自媒体的朋友撸串。他给我诉苦:
想做一批小红书的选题分析,研究 20 个竞品账号最近的爆款标题。
结果光复制粘贴标题、点赞、评论数,就熬了两个晚上。
Excel 里堆了 3000 多行,眼睛都花了,最后根本不知道该怎么看。
我说:你这哪是自媒体运营,你这是人肉爬虫。
又问我,有没有办法让机器干这件事。
有,但前提是——你得知道自己在采什么、为什么采、采了之后怎么用?
![]()
它不是万能钥匙,是把螺丝刀
MediaCrawler说白了,就是一个帮你把网页上的公开内容抓下来的工具。
它支持的平台很多:小红书、抖音、快手、B 站、微博、贴吧、知乎,几乎覆盖了我们日常做内容研究的主战场。
但你别一听「爬虫」就觉得很高深。
它的作者把这些平台的数据抓取逻辑都封装好了。你不需要懂反爬,不需要写正则,不需要研究每个平台的接口。
你只需要告诉它:我要哪个平台、搜什么关键词、抓多少条,它就开始跑。
这跟你自己一行行复制,完全是两个世界。
![]()
它会用Playwright模拟真人浏览器。很多爬虫工具被平台封,是因为它跑得太像机器。
MediaCrawler会让你先扫码登录一次,然后复用你的登录态,后面再跑就顺多了。
先让你以「人」的身份进去,然后让机器以「你」的身份干活。它到底能帮你采什么?
我第一次用的时候,其实有点惊讶。
我以为它只能抓标题和链接,结果发现它能把笔记正文、评论、点赞数、发布时间、作者信息一起抓下来。如果你要分析爆款,光看个标题没用,你得看评论里的人在讨论什么。
比如我让小林抓了一个关键词「AI 工具」下面 500 条小红书笔记。
跑完之后,他不光有了 500 个标题,还有每篇笔记下面的热评。
他把评论做了一个简单的词频统计,发现出现最多的三个词是:「免费」「替代」「工作效率」。
就这三个词,他直接定了接下来一周的选题方向。
这就是数据采集真正的价值:不是把网页搬到硬盘,而是让你看见你肉眼看不到的 pattern。
![]()
快速使用
如果你会一点点命令行,上手其实很快。
git clone https://github.com/NanmiCoder/MediaCrawler.gitcd MediaCrawlerpip install -r requirements.txtplaywright install装好之后,跑一条命令:
python main.py --platform xhs --type search --keywords "AI工具"几分钟之后,你的 data/ 文件夹里就会出现一份整理好的数据。
不会命令行也没关系。MediaCrawler提供了一个WebUI,打开浏览器填几个参数就能跑。我试了一下,对非技术出身的人来说,友好度确实在线。
![]()
谁最需要它?
我觉得三类人最应该看看这个工具。
第一类:像我朋友小林这样的自媒体运营
研究竞品、找选题、看评论,这些工作重复性极高,交给机器省下来的时间,可以用来真正想内容。
第二类:做品牌和市场的人
你想知道用户最近对你的产品是什么情绪,直接去相关平台抓评论,比看第三方报告真实得多。
第三类:搞学术研究的人
社交媒体数据、舆情传播、热点演化,这些都需要大量一手数据。Mediacrawler 这种开源工具,比很多收费数据库灵活多了。
![]()
当然,如果你只是偶尔看看,手动也够用了。
这个工具真正的价值,在于你要研究的东西有一定规模。
我觉得自媒体这个行业,已经慢慢从「谁更会写」变成「谁更懂用户」。
而懂用户的前提,是愿意花时间去听用户说了什么。Mediacrawler这种工具,其实就是帮你批量「听见」的工具。
它不是让你偷懒的,是让你把力气花在真正重要的地方——比如,写出下一条让人愿意点赞收藏的内容。
项目信息
- 授权协议:MIT
- GitHub 数据:59k+ Stars / 11.7k+ Forks / Python
过客聊 AI · 每天9:00为您甄选推荐
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.