你现在发的每一篇内容,都在面对两个截然不同的读者。
第一个是人。他们点开、阅读、判断这篇东西值不值得花时间。这没什么新鲜的——我们一直在为这个读者写作。但第二位读者最近出现了,它不是人,是一个模型。它会阅读你的文字,弄清楚内容究竟在说什么,然后决定要不要把它推荐出去、或者作为答案引述给某个提问。你在同时为两者写作。它们想要的东西确实稍有不同——但差别远没你担心的那么大。
领英是最容易理解的例子,因为他们公开了这套机制如何运作。根据领英工程团队的博文,内容筛选方式已经变了:过去是靠一堆各自独立的管道,现在改成了一套大语言模型检索器。它会将每篇帖子和每个用户档案都转化成一个意义向量,然后从数百万候选中,按意义距离的远近拉出几千个备选项。这是模型第一次阅读你的文字——在任何排名动作发生前,已经有东西搞懂了你在写什么。
接下来的环节,几乎所有复盘文章都搞错了。检索确实跑在大语言模型上,没错。但最终对这些候选内容进行排名的,并不是语言模型——而是一个叫 Feed-SR 的独立变换器。领英在自己的论文里说得很直白:他们试过大语言模型来做排名,但决定不上线;那个变换器评分更高,运行成本更低。所以"整个信息流现在就是一个巨型大语言模型"这种说法,并非事实。大语言模型只卡在决定你的文字能否进入候选池这一步——也就是理解含义的环节。
这里有个值得注意的小插曲。网上现在到处都在说这套系统叫"360Brew",还煞有其事地复述它的精确规则。360Brew 是一个来自另一篇论文的预研模型,它在 arXiv 上所有版本都标记为已撤回,领英也从未确认它真的在跑信息流。领英自己那篇 Feed-SR 论文,直接推翻了那个故事。不知从哪一环节起,有人给一篇真实的工程论文起了个好记的名字,然后所有人都在传。如果一个信源连引擎的名字都搞不对,那它嘴里那些"精确规则"也只能当猜测听。看一手信源,别看别人转述的转述。
名字不是重点。重点是这层转向。过去的信息流可以靠机械手段钻空子——堆关键词、抢早间发布窗口、互赞群里刷互动。现在门口站着一个会读懂含义的模型,那些能骗过计数器的招数骗不了它。它阅读的方式,跟你向一个助手提问后、助手阅读你问题的方式,大致相同。
这也就是两个读者开始看起来惊人相似的地方。那个替你找专业问题答案的助手,和决定是否推荐你帖子的信息流检索器,在做同一件事:阅读文字,判断其中是否包含关于某个特定主题的明确观点。能打动第一个读者的内容,同样能打动第二个。两者都不吃华而不实的空洞文字;两者都倾向于那些一眼就能看出在讲什么、为谁而写的内容。
这并不意味着你要开始为算法写作。恰恰相反,它指向的是反方向。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.