남는 PC 여러 대를 연결한다고 거대한 GPU 한 장이 생기지는 않아요. NVIDIA PAIR의 진짜 역할은 여러 AI 요청이 한 GPU 앞에서 줄 서지 않도록, 독립된 요청을 실행 가능한 PC에 하나씩 보내는 것입니다.
PAIR는 GPU를 합치지 않고 요청을 나눕니다
PAIR는 같은 로컬 네트워크에 있는 컴퓨터를 발견하고, 각 노드의 추론 엔진·모델·작업량을 확인한 뒤 요청을 전달하는 로컬 추론 라우터예요. 현재 Ollama와 LM Studio를 지원하고, 애플리케이션에는 Ollama 호환 또는 OpenAI 호환 엔드포인트 하나를 제공합니다.
여기서 가장 중요한 경계가 있어요. PAIR는 VRAM을 합치거나 하나의 모델을 여러 컴퓨터에 쪼개 올리지 않습니다. 요청 하나는 선택된 노드 한 대에서 처음부터 끝까지 처리돼요. 따라서 24GB GPU 두 장을 연결해 48GB가 필요한 모델을 실행하는 용도가 아닙니다. 대신 여러 에이전트나 여러 사용자가 동시에 보내는 독립 요청의 대기열을 분산하는 데 맞습니다.
| 하고 싶은 일 | PAIR로 가능한가 | 이유 |
|---|---|---|
| 여러 서브에이전트의 요청을 동시에 처리 | 적합 | 독립 요청을 서로 다른 준비된 노드에 배치 |
| 여러 앱이 보내는 로컬 추론 요청 분산 | 적합 | Ollama·OpenAI 호환 프록시 엔드포인트 제공 |
| 한 요청의 생성 속도를 GPU 수만큼 높이기 | 부적합 | 진행 중인 요청을 여러 노드로 분할하지 않음 |
| 여러 GPU의 VRAM을 합쳐 큰 모델 실행 | 부적합 | VRAM 풀링과 모델 샤딩을 지원하지 않음 |
NVIDIA의 출시 데모에서는 Hermes Desktop의 다섯 서브에이전트가 Qwen 3.6 35B A3B를 사용했어요. RTX Spark 노트북 한 대에서는 평균 18분, 그 노트북과 DGX Spark·RTX 5090을 묶은 세 노드에서는 평균 8분 48초가 걸렸습니다. 다만 NVIDIA도 이를 특정 구성의 비공식 데모라고 명시합니다. 병렬성, 모델, 네트워크, 엔진 설정과 노드 상태에 따라 결과가 달라지므로 일반적인 2배 가속 수치로 받아들이면 안 돼요.
성능을 결정하는 건 PC 수보다 ‘같은 모델의 복제본’입니다
여러 노드에 PAIR만 설치했다고 요청이 자동으로 골고루 퍼지지는 않아요. 어떤 노드가 요청을 받으려면 온라인 상태여야 하고, 호환 엔진이 실행 중이며, 요청한 정확한 모델이 그 노드에 있어야 합니다. 같은 모델 태그를 세 노드 중 한 곳에만 내려받았다면 그 모델의 요청은 결국 한 곳으로 몰립니다.
반대로 모든 컴퓨터에 똑같은 모델만 둘 필요도 없어요. 메모리가 큰 워크스테이션에는 큰 모델을, 노트북에는 작은 모델을 두고 이름에 따라 목적지를 나눌 수 있습니다. 다만 특정 모델의 동시 처리량을 높이고 싶다면 그 모델을 담당할 모든 노드에 같은 모델 태그를 준비해야 해요.
첫 실험은 비슷한 사양 두 대가 편합니다
현재 스케줄러는 대기 중인 작업과 완만하게 보정된 GPU 사용률을 주로 봅니다. GPU 모델, 사용 가능한 메모리, 모델이 이미 메모리에 올라왔는지, 요청이 얼마나 무거울지는 판단하지 않아요. 성능 차이가 큰 PC를 바로 섞기보다 비슷한 두 대와 작은 공통 모델로 라우팅부터 확인하는 편이 원인을 찾기 쉽습니다.
지원 범위도 PAIR와 추론 엔진을 나눠서 봐야 합니다. PAIR 자체는 Windows 11·Linux·macOS의 x64와 arm64에서 실행되고 운영체제가 다른 노드도 함께 묶을 수 있어요. NVIDIA가 소개한 검증 하드웨어에는 GeForce RTX 20 시리즈 이상, Turing 이후 RTX PRO, DGX Spark와 Apple M4 이상 시스템이 포함됩니다. 하지만 실제 모델 실행 가능 여부는 Ollama나 LM Studio의 운영체제·GPU·드라이버 지원과 해당 모델을 담을 메모리에 달려 있습니다.
‘로컬’이어도 신뢰할 수 있는 네트워크가 필요합니다
노드는 mDNS로 서로를 찾고, 자동 발견이 안 되면 IP 주소로 추가할 수 있어요. 초대하는 PC가 표시한 6자리 PIN을 상대 PC에 입력하면 인증서 신뢰 관계가 만들어지고, 이후 주요 노드 간 통신에는 상호 TLS가 사용됩니다.
그렇다고 공용 와이파이에서 안전하게 쓸 수 있다는 뜻은 아닙니다. 6자리 PIN은 장기 자격증명이 아니라 최초 연결을 위한 짧은 코드예요. NVIDIA의 보안 문서는 일부 검색·노드 정보 트래픽이 평문일 수 있고, 같은 서브넷의 다른 장치가 호스트 이름·하드웨어 정보·사용률을 읽을 수 있다고 밝힙니다. 신뢰하는 가정·개인 사무실 네트워크에서만 페어링하고, 라우터 포트 포워딩이나 인증 없는 공개 리버스 프록시로 PAIR 엔드포인트를 노출하지 않는 게 맞습니다.
로컬 추론과 완전한 오프라인은 다릅니다
PAIR의 추론 경로는 로컬 네트워크에 머물도록 설계됐지만, 모델 다운로드에는 인터넷이 필요합니다. 연결한 앱, 모델 카탈로그, 업데이트 기능이나 별도로 설정한 엔진이 외부 서비스에 접속할 수도 있어요. 민감한 자료를 다룬다면 PAIR뿐 아니라 클라이언트 앱과 모델 공급 경로까지 함께 점검하세요.
두 대로 시작하는 PAIR 설정 워크플로
지원 여부를 확인하고 각 PC에 설치합니다
NVIDIA PAIR 배포 페이지에서 Windows용 실행 파일, Debian 계열 Linux용 .deb, macOS용 .dmg를 내려받으세요. Linux에서는 다운로드 폴더에서 sudo apt install./NVPAIR-Setup-*.deb로 설치할 수 있습니다. RPM 계열 배포판은 현재 소스 빌드가 필요해요. 설치 후 각 컴퓨터에서 PAIR를 실행하고 Overview에 로컬 노드가 표시될 때까지 기다립니다.
Ollama 또는 LM Studio를 켭니다
첫 실행 창에서 엔진을 설치하거나, Overview → 노드 선택 → Engine settings로 이동하세요. 이미 설치된 Ollama나 LM Studio가 실행 중이면 PAIR가 기존 설치를 채택할 수 있습니다. 새로 설치했다면 상태가 실행 중으로 바뀌었는지 확인하세요. PAIR는 라우터일 뿐 모델을 직접 실행하지 않으므로 각 작업 노드에 엔진이 필요합니다.
두 번째 PC를 6자리 PIN으로 연결합니다
두 PC를 같은 신뢰 가능한 로컬 네트워크에 놓으세요. 첫 PC에서 오른쪽 위 Add node를 누르거나 Settings → Cluster → Available nodes를 엽니다. 상대 PC를 선택하고 첫 PC에 나온 6자리 PIN을 상대 PC의 초대 창에 입력하세요. 자동 발견이 비어 있으면 IP 주소로 추가하고, 방화벽에서 PAIR가 허용됐는지 확인합니다. 완료 후 Connected nodes에 두 장치가 보여야 해요.
같은 테스트 모델을 두 노드에 준비합니다
각 노드의 Engine settings → Add model에서 동일한 모델 태그를 내려받으세요. 처음에는 두 컴퓨터 메모리에 무리 없이 들어가는 작은 모델이 좋습니다. 엔진이 명시적인 로드를 요구한다면 다운로드 뒤 Load까지 실행하세요. 모델 이름이 한 글자라도 다르면 같은 요청의 후보 노드가 되지 않을 수 있습니다.
엔드포인트를 연결하고 분산 여부를 증명합니다
Endpoints → API endpoints에서 현재 주소를 복사해 클라이언트의 Base URL에 넣으세요. 기본적으로 Ollama 프록시는 http://127.0.0.1:11434에서 Ollama API와 OpenAI 호환 경로를 제공하고, LM Studio 프록시는 http://127.0.0.1:1234에서 OpenAI 호환 경로를 제공합니다. 포트를 바꿨다면 화면의 주소를 사용해야 해요. 독립 요청을 여러 개 동시에 보낸 뒤 Jobs에서 각 작업의 Ran on을 확인하세요. 서로 다른 노드가 기록돼야 분산이 실제로 일어난 것입니다.
검증할 때는 단일 요청의 초당 토큰만 보지 마세요. 같은 프롬프트 묶음을 한 노드와 여러 노드에서 각각 실행해 전체 완료시간, 대기시간, 실패 수, 결과 품질을 비교해야 합니다. 노트북 절전이나 게임 실행처럼 노드 상태가 바뀌는 상황도 넣어보세요. PAIR의 효용은 최고 속도보다 여러 요청이 겹쳤을 때 대기열을 얼마나 줄이는지에서 드러납니다.




