连接多台闲置 PC 并不会变出一块巨型 GPUNVIDIA PAIR 的真正作用是把独立的 AI 请求逐一发送到可用 PC,避免多条请求都排在同一块 GPU 前面。

3 秒摘要
在每台 PC 上安装 PAIR 通过 6 位 PIN 连接 在多个节点准备相同模型 通过一个本地 API 发出请求 在 Jobs 中确认实际分发情况

PAIR 不合并 GPU,而是分发请求

PAIR 会发现同一本地网络中的计算机,检查每个节点的推理引擎、模型和工作负载,然后转发请求。它是一个本地推理路由器。目前支持 Ollama 和 LM Studio,并向应用提供一个 Ollama 兼容或 OpenAI 兼容端点。

这里有一条最重要的界限。PAIR 不会合并 VRAM,也不会将一个模型拆分部署到多台计算机上。单个请求会从头到尾在一台选定的节点上处理。因此,它并不是用来连接两块 24GB GPU 以运行需要 48GB 的模型。相反,它适合分散多个代理或多个用户同时发送的独立请求队列。

想做的事 PAIR 是否适合 原因
同时处理多个子代理的请求 适合 将独立请求安排到不同的已就绪节点
分发多个应用发出的本地推理请求 适合 提供 Ollama 和 OpenAI 兼容的代理端点
按 GPU 数量提高单个请求的生成速度 不适合 不会将进行中的请求拆分到多个节点
合并多块 GPU 的 VRAM 来运行大型模型 不适合 不支持 VRAM 池化和模型分片

在 NVIDIA 的发布演示中,Hermes Desktop 的五个子代理使用了 Qwen 3.6 35B A3B。使用一台 RTX Spark 笔记本电脑时平均耗时 18 分钟;使用该笔记本电脑、DGX Spark 和 RTX 5090 组成的三个节点时,平均耗时 8 分 48 秒。不过 NVIDIA 也明确说明,这只是特定配置下的非官方演示。结果会随并行度、模型、网络、引擎设置和节点状态而变化,因此不应将其理解为普遍的 2 倍加速数据。

决定性能的不是 PC 数量,而是“相同模型的副本”

仅在多个节点上安装 PAIR,并不会让请求自动均匀分散。节点要能接收请求,必须处于在线状态、运行兼容的引擎,并且拥有被请求的准确模型。如果三个节点中只有一个下载了相同的模型标签,该模型的请求最终都会集中到那一个节点。

反过来说,也不必只在所有计算机上放置完全相同的模型。你可以在大内存工作站上放大模型,在笔记本电脑上放小模型,并按名称分配目标节点。不过,如果想提高特定模型的并发处理量,就必须在负责该模型的所有节点上准备相同的模型标签。

第一次实验时,两台配置相近的电脑更方便

当前调度器主要查看排队任务和经过平缓修正的 GPU 使用率。它不会判断 GPU 型号、可用内存、模型是否已加载到内存中,或请求有多重。与其立即混用性能差异很大的 PC,不如先用两台相似的机器和一个小型共享模型确认路由,这样更容易定位原因。

还应将 PAIR 支持范围与推理引擎支持范围分开看。PAIR 本身可在 Windows 11、Linux 和 macOS 的 x64 与 arm64 平台上运行,也可以将不同操作系统的节点组合在一起。NVIDIA 介绍的已验证硬件包括 GeForce RTX 20 系列及以上、Turing 之后的 RTX PRO、DGX Spark,以及搭载 Apple M4 及更高版本的系统。但模型能否实际运行,取决于 Ollama 或 LM Studio 对操作系统、GPU 和驱动程序的支持,以及容纳该模型所需的内存。

即使是“本地”,也需要可信网络

节点通过 mDNS 发现彼此;如果自动发现不可用,也可以通过 IP 地址添加。将邀请 PC 显示的 6 位 PIN 输入另一台 PC 后,会建立证书信任关系,之后关键节点间通信会使用双向 TLS。

但这并不意味着可以在公共 Wi-Fi 上安全使用。6 位 PIN 不是长期凭据,而是用于首次连接的短代码。NVIDIA 的安全文档指出,部分发现和节点信息流量可能为明文,同一子网中的其他设备可能读取主机名、硬件信息和使用率。请仅在可信的家庭或私人办公网络中配对,不要通过路由器端口转发或未经身份验证的公开反向代理暴露 PAIR 端点。

本地推理不等于完全离线

PAIR 的推理路径旨在保留在本地网络中,但下载模型需要互联网。已连接的应用、模型目录、更新功能或单独配置的引擎也可能连接外部服务。如果处理敏感材料,请不仅检查 PAIR,也检查客户端应用和模型获取路径。

从两台电脑开始的 PAIR 设置流程

1

确认支持情况,并在每台 PC 上安装

从 NVIDIA PAIR 发布页面下载 Windows 可执行文件、适用于 Debian 系 Linux 的 .deb,或适用于 macOS 的 .dmg。在 Linux 上,可以在下载文件夹中使用 sudo apt install./NVPAIR-Setup-*.deb 安装。RPM 系发行版目前需要从源码构建。安装后,在每台计算机上运行 PAIR,并等待本地节点出现在 Overview 中。

2

启动 Ollama 或 LM Studio

在首次运行窗口中安装引擎,或前往 Overview → 选择节点 → Engine settings。如果已安装的 Ollama 或 LM Studio 正在运行,PAIR 可能会采用该现有安装。如果是新安装的,请确认状态已变为运行中。PAIR 只是路由器,并不直接运行模型,因此每个工作节点都需要引擎。

3

通过 6 位 PIN 连接第二台 PC

将两台 PC 放在同一个可信本地网络中。在第一台 PC 上点击右上角的 Add node,或打开 Settings → Cluster → Available nodes。选择另一台 PC,并在另一台 PC 的邀请窗口中输入第一台 PC 上显示的 6 位 PIN。如果自动发现为空,请通过 IP 地址添加,并确认防火墙允许 PAIR 通信。完成后,应能在 Connected nodes 中看到两台设备。

4

在两个节点上准备相同的测试模型

在每个节点的 Engine settings → Add model 中下载相同的模型标签。开始时,建议选择能轻松放入两台计算机内存的小模型。如果引擎要求显式加载,请在下载后执行 Load。模型名称哪怕只差一个字符,也可能无法成为同一请求的候选节点。

5

连接端点并验证是否发生分发

Endpoints → API endpoints 复制当前地址,并填入客户端的 Base URL。默认情况下,Ollama 代理会在 http://127.0.0.1:11434 提供 Ollama API 和 OpenAI 兼容路径,LM Studio 代理会在 http://127.0.0.1:1234 提供 OpenAI 兼容路径。如果更改了端口,必须使用屏幕上显示的地址。同时发送多个独立请求后,在 Jobs 中检查每个任务的 Ran on。只有记录了不同节点,才说明确实发生了分发。

验证时,不要只看单个请求的每秒令牌数。应分别在单节点和多节点上运行同一组提示词,并比较总完成时间、等待时间、失败数量和结果质量。也应加入笔记本电脑休眠或运行游戏等节点状态变化的场景。PAIR 的价值并不主要体现在峰值速度,而在于多个请求重叠时能减少多少排队。

如果想进一步深入了解

Personal AI Router for Local Inference | NVIDIA PAIR — 可查看支持的平台、已验证配置和官方下载。 nvidia.com

NVIDIA PAIR Virtual Inference Router Expands Available Compute on Your Local Network — 说明路由架构、多代理演示以及适用工作负载的边界。 developer.nvidia.com

Getting Started | NVIDIA Personal AI Router — 可按照实际菜单从安装、PIN 配对到模型准备和 API 连接逐步操作。 docs.nvidia.com

Known issues — 可在部署前查看当前调度器未考虑的因素及各平台限制。 docs.nvidia.com

Security: NVIDIA/Personal-AI-Router — 具体说明 PIN、双向 TLS、本地端点和 LAN 信任边界。 github.com