Perplexity 发布了一个新的上下文嵌入模型 pplx-embed-v2,预览版命名为 pplx-embed-v2-context-9b-preview。它要解决的问题很具体:让模型在编码文档的每一个片段时,都能"看见"整篇文档。
官方给出的说法是,他们为此搭建了一套全新的上下文嵌入模型训练方式。核心思路是——编码每一块内容时,把整篇文档作为背景一起纳入视野,而不是把文档切碎后各管各的。
![]()
两个榜单,一个新名字
pplx-embed-v2-context-9b-preview 在 ConTEB 上刷新了最好成绩。同时,它也在 turbopuffer 新推出的 context-bench 上拿到了最好成绩。context-bench 被描述为一个"私下持有"的基准,也就是说它并非完全公开的评测集。
从命名看,这个预览版的参数量是 9B。这个数字放在上下文嵌入这个细分方向上,不算小。Perplexity 没有在公开信息里展开训练细节,只给出了"新训练方式"这一层描述。
为什么"整篇文档"这件事重要
传统嵌入模型处理长文档时,通常要把文档切成若干块,再逐块编码。块与块之间的上下文关系,在这种切法里容易丢失。Perplexity 这次强调的"whole document in view",指向的正是这个老问题。
把整篇文档纳入编码视野,意味着每个片段的向量表示里,可能携带了它在全文中的位置和语义关系。对检索类应用来说,这直接影响召回质量。
目前这个模型还是 preview 状态,Perplexity 同步放出了博客链接,但没有公布更多落地场景或定价信息。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.