网易首页 > 网易号 > 正文 申请入驻

NVIDIA PAIR:让家庭多设备协同处理AI推理任务

0
分享至


AI智能体正在学会协同工作以完成更多任务。一个主智能体可以将复杂任务拆分成较小的工作,并将这些工作分配给专门的子智能体。此外,用户也开始同时运行多个智能体会话,通过多智能体工作流完成复杂任务的方式也越来越普遍。

这种广度优先的方式可以提高任务完成速度并提升响应质量,但当大量请求同时发送到GPU时,也可能造成系统瓶颈。

NVIDIA个人AI路由器(PAIR)利用本地硬件来缓解这种多智能体和子智能体带来的瓶颈问题。PAIR将每个独立的推理请求路由到家庭网络上可用的系统。它兼容常见的本地推理服务,包括Ollama和LM Studio,因此用户无需重新设计智能体本身,就能扩展其可用的计算资源,也无需对智能体框架进行任何更改。

NVIDIA PAIR测试版目前可通过图形界面和终端界面在支持的Windows、macOS和Linux系统上使用。它支持配备NVIDIA GeForce RTX 20系列及更新GPU、NVIDIA RTX PRO工作站GPU(图灵架构及更新)的兼容系统,以及NVIDIA DGX Spark和Apple M4+芯片。

什么是NVIDIA PAIR

NVIDIA PAIR是一个虚拟推理路由器,旨在最大化利用家中的AI计算资源。它并非一个新的推理引擎,Ollama或LM Studio仍会在选定的机器上运行模型。PAIR负责发现参与的系统,追踪每个系统是否准备好接受请求,调度独立任务,并将每个响应返回给发起请求的应用程序。

智能体可以通过其熟悉的本地接口发送请求。PAIR通过其代理接收请求,识别其引擎和模型需求,然后选择一个符合条件的节点。该节点从头到尾执行该请求,并将响应通过PAIR发回。智能体始终只能看到一个连接,而PAIR则在后台处理任务分配。其特性包括:

无需新API:PAIR代理兼容的Ollama和LM Studio接口,而不是要求每个智能体框架都去集成一个新的集群API。

弹性客户端:兼容系统可以在有空闲资源时加入贡献算力,在需要时(如关机或休眠)随时退出。

本地控制:PAIR设计的目标是让提示词、数据和推理流量始终保留在用户现有的本地网络中。

PAIR如何解决多智能体本地推理问题

设想一位AI资深用户在主力NVIDIA RTX AI PC上运行本地智能体。该智能体接到一项研究、编程或个人事务整理任务后,将其拆分给多个子智能体。每个工作单元探索问题的一个特定部分,其他单元则负责验证证据或整合结果。

从用户角度看,这只是一个任务。但在推理层面,它可能变成数十次独立的模型调用。如果所有调用都指向同一个本地引擎,它们就会争夺相同的执行槽位。队列会不断增长,主力PC始终处于繁忙状态,即便网络上的其他RTX PRO工作站、笔记本电脑或DGX Spark可能有兼容的可用算力。

PAIR能让推理层随着智能体的扩展而扩展。一些子智能体请求可以在主力PC上运行,而其他请求则可以在其他配对节点上运行。当工作负载具有足够的独立性时,使用更多就绪系统可以减少排队并提升端到端完成时间。

这样一来,主力PC可以专注于图形密集型的游戏、内容创作或其他交互式工作,同时将推理任务分配到其他节点。

这是工作负载层面的并发,PAIR并不会让单个推理请求跨多个GPU运行。每个请求都会被分配到一个符合条件的节点,并在整个生命周期内保持在该节点上。

利用家庭AI集群的弹性

家庭AI集群并非微型数据中心。专用集群通常围绕保持开机、配置一致且持续可用的系统构建。而家庭硬件是动态变化的:一台游戏PC可能正在运行游戏而变得繁忙;一台笔记本电脑可能休眠、关闭或离开网络;一台工作站可能拥有请求的模型,而另一台没有;推理引擎可能被停止,或者用户可能需要将GPU重新分配给前台应用程序。

PAIR正是围绕这些变化条件而设计的。它可以通过mDNS发现本地系统,为私有网络上的支持设备建立配对,并实时掌握哪些节点可以接受新任务。客户端节点可以在就绪时加入可用资源池,在需要时随时退出,而无需将家庭变成一个专用的、始终在线的推理设施。

对于每个新请求,PAIR会考虑多种因素,包括:

配对节点是否在线且就绪

是否启用了支持的推理引擎

是否存在请求的确切模型

当前节点和引擎的工作负载,包括正在运行的任务

现有的GPU利用率(是否有图形密集型应用或工具正在运行)

PAIR不依赖于每个系统都完全相同或永久可用,它会根据日常使用情况来调度推理请求并管理整个集群。

演示:Hermes五子智能体场景

此演示展示了PAIR与Hermes Desktop(创建子智能体工作负载)以及Ollama(在每个选定节点上执行模型)的配合使用。任务要求Hermes分析一个模拟的家庭收件箱,并生成一份可信的“周日重置”计划——明确今晚必须完成什么、本周需要完成什么、稍后可以处理什么、以及哪些不需要处理——并为每个重要结论提供依据。

在五子智能体运行中,Hermes创建五个专家角色,分别审查证据的不同独立部分,协调冲突并返回一份整合计划。Hermes负责任务拆解、委派与整合,PAIR负责推理路由,Ollama则在PAIR选定的节点上执行每个请求。

使用Qwen 3.6 35B A3B模型,在单台NVIDIA RTX Spark笔记本电脑上,相同的五子智能体工作负载平均耗时18分钟完成。相比之下,一个包含RTX Spark笔记本电脑、DGX Spark和RTX 5090的三设备PAIR集群平均耗时8分48秒完成。请注意,这是一个非正式的、特定配置下的演示,而非通用基准测试或线性扩展的承诺。

这是非正式的、特定配置下的演示。结果取决于工作负载的并行性、模型、引擎设置、硬件、网络和节点可用性,并非通用基准测试。

PAIR中的任务视图是了解推理实际运行位置的准确依据。Hermes智能体数量与PAIR任务数量是不同的度量指标,因为一个智能体可能会生成多个模型请求。只有当PAIR遥测数据显示任务在多个符合条件的节点上运行时,才能声称实现了多节点执行。

NVIDIA PAIR如何工作

本节详细逐步说明NVIDIA PAIR的工作原理。

使用本地网络发现附近的系统

在每个兼容的Windows、macOS或Linux系统上安装PAIR后,它会使用本地网络发现(mDNS)自动查找附近的系统。也可以在需要时通过IP地址添加节点。用户批准安全配对请求后,即可创建PAIR可考虑的可信本地节点集合。

在建立安全连接和配对之前,所有节点间的通信都会被阻止。一旦建立连接,通信将通过MTLS和生成的证书进行加密,确保节点之间的通信在网络中保持私密。

准备推理引擎和模型

每个参与的节点都运行一个受支持的本地推理引擎:Ollama或LM Studio。PAIR可以协助在配对系统上安装引擎并启动模型下载,从而减少准备多台机器所需的工作量。只有当所需引擎已启用且请求的确切模型在该节点上可用时,该节点才符合请求条件。

不过,集群中各节点的模型不必完全相同。不同的系统可以托管不同的模型,PAIR可以根据模型所在位置进行路由。在更多节点上加载相同的模型标签,只是为该请求提供了更大的符合条件节点池。

代理兼容的本地接口

兼容的应用程序通过PAIR代理的本地端点发送Ollama兼容或LM Studio兼容的请求。智能体框架可以继续使用它们已经熟悉的接口,而不必单独发现并集成每台机器。暴露可配置基础URL的应用程序可以继续指向其各自的Ollama或LM Studio端点。

PAIR通过接管Ollama和LM Studio服务默认使用的端口来代理请求。如果智能体框架使用不同的端口,可以在PAIR引擎设置中配置代理端口。

PAIR检查请求的引擎和模型需求,然后将这些需求传递给路由器。这种分离是设计的核心:智能体决定请求什么工作,而PAIR决定符合条件的工作应该在哪里运行。

调度一个符合条件的节点

调度器利用有关就绪状态、支持的引擎状态、请求模型是否存在以及任务负载的当前信息来筛选配对系统。它会选择一个符合条件的节点,该系统上的PAIR路由器将请求传递给本地推理引擎。来自其他子智能体的独立调用可以同时分配给其他就绪节点。

返回响应并使路由过程可见

选定的引擎执行请求,PAIR通过同一本地接口将响应流式传输回发起请求的应用程序。任务和指标视图会显示哪个节点处理了每个路由请求,使任务分配过程变得可观察。

哪些工作负载从PAIR中受益最多

PAIR最适用于同时暴露多个独立请求的工作负载,包括多智能体应用程序和并发本地AI工具。

对于这些工作负载,PAIR可以:

将独立任务路由到本地网络上就绪的系统

当多个请求原本需要在一个本地引擎后排队等待时,减少排队现象

在兼容配置下为足够并行的工作负载提升完成时间

有助于释放主力PC用于游戏、创作或其他交互式任务

保持应用工作流程的熟悉性和本地优先特性

PAIR不会:

合并GPU或将显存池化成一个更大的加速器

对单个模型进行分片,或将一个推理请求拆分到多台机器上执行

高度顺序化的任务、由单次长模型调用主导的工作负载,或只有一个节点拥有所需模型的配置,可能获益较少。应使用端到端完成时间、排队情况、输出质量以及实际使用系统上观察到的路由情况来衡量真正重要的工作负载。

开始使用NVIDIA PAIR

PAIR为家中已有的动态NVIDIA系统带来了类似集群的体验,同时保持本地推理工作流程的熟悉感。请按照以下步骤开始使用:

下载适用于支持的Windows、macOS或Linux系统的NVIDIA PAIR测试版。

在需要纳入的NVIDIA RTX PC、NVIDIA RTX PRO工作站或NVIDIA DGX Spark系统上安装PAIR。

在本地网络上发现并安全配对这些系统。

启用Ollama或LM Studio,并在符合条件的节点上下载或放置所需模型。

在已安装PAIR并使用Ollama或LM Studio的系统上运行兼容的智能体。

NVIDIA PAIR项目是开源的。开发者可以查看代码、报告问题,并为发现、配对、路由、引擎集成、模型、端点及用户体验等方面的改进做出贡献。

Q&A

Q1:NVIDIA PAIR是什么?

A:NVIDIA PAIR是一个虚拟推理路由器,可以调用家庭网络中多台设备的算力,将AI智能体的推理请求分配到不同的空闲设备上执行,从而缓解多智能体任务带来的算力瓶颈问题。

Q2:使用NVIDIA PAIR需要哪些硬件条件?

A:PAIR支持配备NVIDIA GeForce RTX 20系列及更新GPU、NVIDIA RTX PRO工作站GPU(图灵架构及更新)的系统,以及NVIDIA DGX Spark和Apple M4+芯片设备,同时需要在Windows、macOS或Linux系统上运行。

Q3:PAIR能否让多个GPU合并成一个更强的算力单元?

A:不能。PAIR不会合并GPU或池化显存,也不会将单个推理请求拆分到多台机器上执行,它只是将不同的独立请求分别调度到不同的符合条件的节点上运行。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
郑钦文最大的考验不是凯斯,而是斯瓦泰克,有望杀入美网4强

郑钦文最大的考验不是凯斯,而是斯瓦泰克,有望杀入美网4强

搏击江湖
2026-09-05 09:30:00
《花少8》首播:殷桃住北京大平层,周冬雨一人住小房,他最简朴

《花少8》首播:殷桃住北京大平层,周冬雨一人住小房,他最简朴

椰黄娱乐
2026-09-05 12:16:49
妻子升局长逼我签离婚,领证那天省纪委让我去任职,她彻底慌了

妻子升局长逼我签离婚,领证那天省纪委让我去任职,她彻底慌了

千秋文化
2026-08-27 20:16:52
别再喊收复台湾了

别再喊收复台湾了

乌克兰小静
2026-09-05 08:26:20
龚爽离世仅一天,为她弹琴数年的丈夫就因一个动作,口碑暴涨

龚爽离世仅一天,为她弹琴数年的丈夫就因一个动作,口碑暴涨

小娱乐悠悠
2026-09-05 14:16:23
太过分了!凤姐下场连发帖子撕景甜,评容貌、咒断子绝孙,引发网友怒骂

太过分了!凤姐下场连发帖子撕景甜,评容貌、咒断子绝孙,引发网友怒骂

火山詩话
2026-09-04 06:34:14
亚洲最穷国:当地女性惊人开放,游客秒变土豪

亚洲最穷国:当地女性惊人开放,游客秒变土豪

怪味历史连连看
2026-08-28 03:15:09
同样是带鱼,“黑眼”和“黄眼”的区别很大!知道后别再乱买

同样是带鱼,“黑眼”和“黄眼”的区别很大!知道后别再乱买

阿龙美食记
2026-09-05 08:56:03
【油价大涨】近1.4元/升,全国92汽油“5跌11涨”接近8.1元/升,下次9月11日调价,预涨1.4毛/升!

【油价大涨】近1.4元/升,全国92汽油“5跌11涨”接近8.1元/升,下次9月11日调价,预涨1.4毛/升!

猪友巴巴
2026-09-05 08:40:03
CCTV5直播,中国女篮VS捷克女篮,杨舒予2人自我救赎,鹿死谁手

CCTV5直播,中国女篮VS捷克女篮,杨舒予2人自我救赎,鹿死谁手

体坛小快灵
2026-09-05 10:33:46
中建裁员神操作

中建裁员神操作

地产微资讯
2026-09-05 14:20:10
不敢征税,只能哄富人花钱?中国内需困局,被经济学家一语戳穿

不敢征税,只能哄富人花钱?中国内需困局,被经济学家一语戳穿

趣味萌宠的日常
2026-09-05 06:48:14
随着中国女篮惨败美国, 为了出线, 宫鲁鸣极有可能做出以下四个调整

随着中国女篮惨败美国, 为了出线, 宫鲁鸣极有可能做出以下四个调整

隐于山海
2026-09-05 06:21:56
“韦东奕这么牛,为啥没女孩子喜欢他呢?”女儿白了我一眼说:“别的先不讲,要是有人能把这三点都接纳了,我不光服,还得佩服。”

“韦东奕这么牛,为啥没女孩子喜欢他呢?”女儿白了我一眼说:“别的先不讲,要是有人能把这三点都接纳了,我不光服,还得佩服。”

背包旅行
2026-09-01 11:59:13
台湾问题即将突破临界点,2大迹象表明,大陆或要准备出手了

台湾问题即将突破临界点,2大迹象表明,大陆或要准备出手了

探索新高度
2026-09-04 07:38:25
伊朗副总统:当初选择日本车就好了,中国车质量差价格高

伊朗副总统:当初选择日本车就好了,中国车质量差价格高

贱议你读史
2026-09-02 21:21:39
震惊!网传长沙前8名抢空6个烟草岗,引热议:有人羡慕,有人断言10年后要后悔

震惊!网传长沙前8名抢空6个烟草岗,引热议:有人羡慕,有人断言10年后要后悔

火山詩话
2026-09-04 11:47:52
老年痴呆越来越多?医生提醒:老人宁可在家不出门,也别做这6事

老年痴呆越来越多?医生提醒:老人宁可在家不出门,也别做这6事

健康之光
2026-09-01 19:10:08
菲律宾副总统莎拉缴纳保释金 法院解除逮捕令

菲律宾副总统莎拉缴纳保释金 法院解除逮捕令

新京报
2026-09-05 13:36:04
100个查出肺结节的人,最终会有多少个发展成肺癌?看看权威统计

100个查出肺结节的人,最终会有多少个发展成肺癌?看看权威统计

荷兰豆爱健康
2026-09-04 18:40:44
2026-09-05 17:23:00
至顶科技 incentive-icons
至顶科技
科技产业媒体与 AI 产业服务机构
21579文章数 49729关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

兰州榆中通报"莴笋收购环节染色":立案查处6家企业

头条要闻

兰州榆中通报"莴笋收购环节染色":立案查处6家企业

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

她曾被名导抛弃,凭《生逢其时》翻红

财经要闻

姚洋:刺激消费要守住两个“大西瓜”

汽车要闻

全新第四代博越Li‑HEV系列 怎么开都省

态度原创

旅游
教育
亲子
数码
公开课

旅游要闻

葫芦爷爷走红:最美风景里必定站着最温暖的人 | 风向标工作室

教育要闻

太难了!会做的基本都是顶级学霸了吧!

亲子要闻

鸡娃不如鸡自己!经济学信号和原因 #教育孩子 #科普新锐扶持计划

数码要闻

小米平板9 Pro Max预热:搭载13.3英寸3.4K分辨率屏幕

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版