NVIDIA PAIR:让家庭多设备协同处理AI推理任务
创始人
2026-09-04 23:26:00

AI智能体正在学会协同工作以完成更多任务。一个主智能体可以将复杂任务拆分成较小的工作,并将这些工作分配给专门的子智能体。此外,用户也开始同时运行多个智能体会话,通过多智能体工作流完成复杂任务的方式也越来越普遍。

这种广度优先的方式可以提高任务完成速度并提升响应质量,但当大量请求同时发送到GPU时,也可能造成系统瓶颈。

NVIDIA个人AI路由器(PAIR)利用本地硬件来缓解这种多智能体和子智能体带来的瓶颈问题。PAIR将每个独立的推理请求路由到家庭网络上可用的系统。它兼容常见的本地推理服务,包括Ollama和LM Studio,因此用户无需重新设计智能体本身,就能扩展其可用的计算资源,也无需对智能体框架进行任何更改。

NVIDIA PAIR测试版目前可通过图形界面和终端界面在支持的Windows、macOS和Linux系统上使用。它支持配备NVIDIA GeForce RTX 20系列及更新GPU、NVIDIA RTX PRO工作站GPU(图灵架构及更新)的兼容系统,以及NVIDIA DGX Spark和Apple M4+芯片。

什么是NVIDIA PAIR

NVIDIA PAIR是一个虚拟推理路由器,旨在最大化利用家中的AI计算资源。它并非一个新的推理引擎,Ollama或LM Studio仍会在选定的机器上运行模型。PAIR负责发现参与的系统,追踪每个系统是否准备好接受请求,调度独立任务,并将每个响应返回给发起请求的应用程序。

无需新API:PAIR代理兼容的Ollama和LM Studio接口,而不是要求每个智能体框架都去集成一个新的集群API。

弹性客户端:兼容系统可以在有空闲资源时加入贡献算力,在需要时(如关机或休眠)随时退出。

本地控制:PAIR设计的目标是让提示词、数据和推理流量始终保留在用户现有的本地网络中。

PAIR如何解决多智能体本地推理问题

设想一位AI资深用户在主力NVIDIA RTX AI PC上运行本地智能体。该智能体接到一项研究、编程或个人事务整理任务后,将其拆分给多个子智能体。每个工作单元探索问题的一个特定部分,其他单元则负责验证证据或整合结果。

从用户角度看,这只是一个任务。但在推理层面,它可能变成数十次独立的模型调用。如果所有调用都指向同一个本地引擎,它们就会争夺相同的执行槽位。队列会不断增长,主力PC始终处于繁忙状态,即便网络上的其他RTX PRO工作站、笔记本电脑或DGX Spark可能有兼容的可用算力。

PAIR能让推理层随着智能体的扩展而扩展。一些子智能体请求可以在主力PC上运行,而其他请求则可以在其他配对节点上运行。当工作负载具有足够的独立性时,使用更多就绪系统可以减少排队并提升端到端完成时间。

这样一来,主力PC可以专注于图形密集型的游戏、内容创作或其他交互式工作,同时将推理任务分配到其他节点。

这是工作负载层面的并发,PAIR并不会让单个推理请求跨多个GPU运行。每个请求都会被分配到一个符合条件的节点,并在整个生命周期内保持在该节点上。

利用家庭AI集群的弹性

家庭AI集群并非微型数据中心。专用集群通常围绕保持开机、配置一致且持续可用的系统构建。而家庭硬件是动态变化的:一台游戏PC可能正在运行游戏而变得繁忙;一台笔记本电脑可能休眠、关闭或离开网络;一台工作站可能拥有请求的模型,而另一台没有;推理引擎可能被停止,或者用户可能需要将GPU重新分配给前台应用程序。

PAIR正是围绕这些变化条件而设计的。它可以通过mDNS发现本地系统,为私有网络上的支持设备建立配对,并实时掌握哪些节点可以接受新任务。客户端节点可以在就绪时加入可用资源池,在需要时随时退出,而无需将家庭变成一个专用的、始终在线的推理设施。

对于每个新请求,PAIR会考虑多种因素,包括:

配对节点是否在线且就绪

是否启用了支持的推理引擎

是否存在请求的确切模型

当前节点和引擎的工作负载,包括正在运行的任务

现有的GPU利用率(是否有图形密集型应用或工具正在运行)

PAIR不依赖于每个系统都完全相同或永久可用,它会根据日常使用情况来调度推理请求并管理整个集群。

演示:Hermes五子智能体场景

此演示展示了PAIR与Hermes Desktop(创建子智能体工作负载)以及Ollama(在每个选定节点上执行模型)的配合使用。任务要求Hermes分析一个模拟的家庭收件箱,并生成一份可信的“周日重置”计划——明确今晚必须完成什么、本周需要完成什么、稍后可以处理什么、以及哪些不需要处理——并为每个重要结论提供依据。

在五子智能体运行中,Hermes创建五个专家角色,分别审查证据的不同独立部分,协调冲突并返回一份整合计划。Hermes负责任务拆解、委派与整合,PAIR负责推理路由,Ollama则在PAIR选定的节点上执行每个请求。

使用Qwen 3.6 35B A3B模型,在单台NVIDIA RTX Spark笔记本电脑上,相同的五子智能体工作负载平均耗时18分钟完成。相比之下,一个包含RTX Spark笔记本电脑、DGX Spark和RTX 5090的三设备PAIR集群平均耗时8分48秒完成。请注意,这是一个非正式的、特定配置下的演示,而非通用基准测试或线性扩展的承诺。

这是非正式的、特定配置下的演示。结果取决于工作负载的并行性、模型、引擎设置、硬件、网络和节点可用性,并非通用基准测试。

PAIR中的任务视图是了解推理实际运行位置的准确依据。Hermes智能体数量与PAIR任务数量是不同的度量指标,因为一个智能体可能会生成多个模型请求。只有当PAIR遥测数据显示任务在多个符合条件的节点上运行时,才能声称实现了多节点执行。

NVIDIA PAIR如何工作

本节详细逐步说明NVIDIA PAIR的工作原理。

使用本地网络发现附近的系统

在每个兼容的Windows、macOS或Linux系统上安装PAIR后,它会使用本地网络发现(mDNS)自动查找附近的系统。也可以在需要时通过IP地址添加节点。用户批准安全配对请求后,即可创建PAIR可考虑的可信本地节点集合。

在建立安全连接和配对之前,所有节点间的通信都会被阻止。一旦建立连接,通信将通过MTLS和生成的证书进行加密,确保节点之间的通信在网络中保持私密。

准备推理引擎和模型

每个参与的节点都运行一个受支持的本地推理引擎:Ollama或LM Studio。PAIR可以协助在配对系统上安装引擎并启动模型下载,从而减少准备多台机器所需的工作量。只有当所需引擎已启用且请求的确切模型在该节点上可用时,该节点才符合请求条件。

不过,集群中各节点的模型不必完全相同。不同的系统可以托管不同的模型,PAIR可以根据模型所在位置进行路由。在更多节点上加载相同的模型标签,只是为该请求提供了更大的符合条件节点池。

代理兼容的本地接口

兼容的应用程序通过PAIR代理的本地端点发送Ollama兼容或LM Studio兼容的请求。智能体框架可以继续使用它们已经熟悉的接口,而不必单独发现并集成每台机器。暴露可配置基础URL的应用程序可以继续指向其各自的Ollama或LM Studio端点。

PAIR通过接管Ollama和LM Studio服务默认使用的端口来代理请求。如果智能体框架使用不同的端口,可以在PAIR引擎设置中配置代理端口。

PAIR检查请求的引擎和模型需求,然后将这些需求传递给路由器。这种分离是设计的核心:智能体决定请求什么工作,而PAIR决定符合条件的工作应该在哪里运行。

调度一个符合条件的节点

调度器利用有关就绪状态、支持的引擎状态、请求模型是否存在以及任务负载的当前信息来筛选配对系统。它会选择一个符合条件的节点,该系统上的PAIR路由器将请求传递给本地推理引擎。来自其他子智能体的独立调用可以同时分配给其他就绪节点。

返回响应并使路由过程可见

选定的引擎执行请求,PAIR通过同一本地接口将响应流式传输回发起请求的应用程序。任务和指标视图会显示哪个节点处理了每个路由请求,使任务分配过程变得可观察。

哪些工作负载从PAIR中受益最多

PAIR最适用于同时暴露多个独立请求的工作负载,包括多智能体应用程序和并发本地AI工具。

对于这些工作负载,PAIR可以:

将独立任务路由到本地网络上就绪的系统

当多个请求原本需要在一个本地引擎后排队等待时,减少排队现象

在兼容配置下为足够并行的工作负载提升完成时间

有助于释放主力PC用于游戏、创作或其他交互式任务

保持应用工作流程的熟悉性和本地优先特性

PAIR不会:

合并GPU或将显存池化成一个更大的加速器

对单个模型进行分片,或将一个推理请求拆分到多台机器上执行

高度顺序化的任务、由单次长模型调用主导的工作负载,或只有一个节点拥有所需模型的配置,可能获益较少。应使用端到端完成时间、排队情况、输出质量以及实际使用系统上观察到的路由情况来衡量真正重要的工作负载。

开始使用NVIDIA PAIR

PAIR为家中已有的动态NVIDIA系统带来了类似集群的体验,同时保持本地推理工作流程的熟悉感。请按照以下步骤开始使用:

下载适用于支持的Windows、macOS或Linux系统的NVIDIA PAIR测试版。

在需要纳入的NVIDIA RTX PC、NVIDIA RTX PRO工作站或NVIDIA DGX Spark系统上安装PAIR。

在本地网络上发现并安全配对这些系统。

启用Ollama或LM Studio,并在符合条件的节点上下载或放置所需模型。

在已安装PAIR并使用Ollama或LM Studio的系统上运行兼容的智能体。

NVIDIA PAIR项目是开源的。开发者可以查看代码、报告问题,并为发现、配对、路由、引擎集成、模型、端点及用户体验等方面的改进做出贡献。

Q&A

Q1:NVIDIA PAIR是什么?

A:NVIDIA PAIR是一个虚拟推理路由器,可以调用家庭网络中多台设备的算力,将AI智能体的推理请求分配到不同的空闲设备上执行,从而缓解多智能体任务带来的算力瓶颈问题。

Q2:使用NVIDIA PAIR需要哪些硬件条件?

A:PAIR支持配备NVIDIA GeForce RTX 20系列及更新GPU、NVIDIA RTX PRO工作站GPU(图灵架构及更新)的系统,以及NVIDIA DGX Spark和Apple M4+芯片设备,同时需要在Windows、macOS或Linux系统上运行。

Q3:PAIR能否让多个GPU合并成一个更强的算力单元?

A:不能。PAIR不会合并GPU或池化显存,也不会将单个推理请求拆分到多台机器上执行,它只是将不同的独立请求分别调度到不同的符合条件的节点上运行。

相关内容

热门资讯

股票行情快报:本钢板材(000... 证券之星消息,截至2026年9月4日收盘,本钢板材(000761)报收于2.33元,上涨0.0%,换...
华为何庭波再次更新韬定律论文:... 一颗本最容易被“热”困住的堆叠芯片,为什么反倒能够做到更加省电? 9月4日,华为半导体负责人何庭波再...
霸王茶姬创始人张俊杰卸任董事长... 快科技9月4日消息,近日,工商信息显示,霸王茶姬主体公司完成工商变更,茶姬(上海)商业管理有限公司正...
奇瑞商用车申请玻璃升降电机堵转... 国家知识产权局信息显示,奇瑞商用车(安徽)有限公司申请一项名为“一种玻璃升降电机的堵转检测系统及方法...
奈雪的茶(02150)9月4日... 智通财经讯,奈雪的茶(02150)公布,2026年9月4日耗资约156.4万港元回购227.1万股股...