NVIDIA, 집 안 여러 기기에 추론 요청을 나눠 보내는 PAIR 공개

NVIDIA가 같은 네트워크의 여러 기기로 추론 요청을 분배하는 오픈소스 라우터 PAIR를 공개했습니다. 이 도구가 하는 일과 하지 않는 일을 정리했습니다.

왜 지금 이 주제인가

로컬에서 모델을 돌리는 환경은 대체로 장비 한 대에 갇혀 있었습니다. 집이나 사무실에 GPU가 달린 컴퓨터가 여러 대 있어도, 에이전트를 돌리는 쪽에서 그것들을 하나의 자원처럼 쓸 방법이 마땅치 않았습니다. NVIDIA가 9월 3일 공개한 Personal AI Router(PAIR)는 이 지점을 겨냥합니다. 같은 네트워크에 있는 기기를 찾아 묶은 뒤, 들어오는 추론 요청을 그중 한 대로 보내 주는 라우터입니다. 소스는 Apache 2.0 라이선스로 GitHub에 올라와 있습니다.

핵심 내용

하는 일은 요청 분배 한 가지

PAIR는 각 기기에 설치하는 데스크톱 애플리케이션입니다. 실행하면 같은 네트워크의 참여 기기를 mDNS로 찾아내고, 자동 탐색이 되지 않으면 IP를 직접 넣어 연결합니다. 묶인 기기들 앞에는 프록시 엔드포인트가 서는데, Ollama 호환과 OpenAI 호환 두 종류를 제공합니다. Ollama 기본 포트인 11434를 그대로 쓰기 때문에 이미 로컬 모델을 호출하고 있던 에이전트 코드는 고칠 필요가 없다는 것이 NVIDIA의 설명입니다. 뒤에서 실제로 모델을 실행하는 엔진으로는 Ollama와 LM Studio를 지원합니다.

요청이 들어오면 PAIR는 어떤 엔진과 어떤 모델이 필요한지 확인한 뒤 조건에 맞는 기기 중 한 대를 골라 넘깁니다. 선택 기준은 기기의 준비 상태, 엔진 실행 여부, 해당 모델의 보유 여부, 그리고 현재 부하입니다. 저장소 문서는 이 스케줄링 정책을 대기 중인 작업량과 거칠게 평활한 GPU 사용률 신호를 합친 단순한 방식이라고 밝히고, GPU 모델이나 남은 메모리, 모델이 이미 올라와 있는지, 요청이 얼마나 무거운지는 고려하지 않는다고 명시합니다.

묶는 절차와 보안

기기를 묶는 과정에는 PIN 기반 승인이 들어갑니다. 승인 전에는 통신이 시작되지 않고, 이후 노드 사이 통신은 생성된 인증서를 이용한 mTLS로 암호화합니다. 설치 파일은 Windows 11, Linux, macOS용 서명 설치본으로 제공되며 x64와 arm64를 모두 지원합니다. 다만 Windows on ARM은 실험 단계로 표시돼 있고, Windows에서는 방화벽 규칙을 열어 줘야 합니다. 지원 하드웨어로는 GeForce RTX 20 시리즈 이상, RTX PRO 워크스테이션 GPU, DGX Spark, Apple M4 이상 실리콘이 명시돼 있습니다.

공개된 측정치

NVIDIA는 서브에이전트 다섯 개를 동시에 굴리는 시연 결과를 함께 실었습니다. Hermes와 Qwen 3.6 35B를 쓴 이 작업에서 단일 노트북은 평균 18분이 걸렸고, 기기 세 대를 묶은 구성에서는 평균 8분 48초가 걸렸습니다. NVIDIA는 이 수치가 보편적인 벤치마크가 아니며 구성에 따라 달라진다고 덧붙였습니다.

의미와 한계

PAIR가 하지 않는 일을 먼저 보는 편이 이해가 빠릅니다. 여러 GPU를 하나로 합치지 않고, VRAM을 모아 더 큰 가속기를 만들지도 않으며, 모델 하나를 여러 기기에 쪼개 올리지도 않습니다. 요청 하나는 언제나 기기 하나에서 처리됩니다. 혼자서는 못 돌리던 큰 모델을 여럿이 나눠 돌리게 해 주는 도구가 아니라, 각자 이미 돌릴 수 있는 모델에 대해 동시에 들어오는 요청을 흩어 놓는 도구입니다.

그래서 효과가 나는 구간도 좁습니다. NVIDIA는 앞 단계 결과를 받아야 다음이 진행되는 순차적 작업, 긴 호출 하나가 시간을 대부분 잡아먹는 작업, 요청한 모델을 가진 기기가 한 대뿐인 경우에는 이득이 줄어든다고 적었습니다. 스케줄러가 기기 사이의 성능 차이를 보지 않는다는 점도 걸립니다. 저장소 문서 스스로 성능이 비슷한 기기를 묶을 때를 전제한 정책이라고 밝히고 있어, 노트북과 워크스테이션을 섞어 놓은 구성에서는 느린 쪽이 병목이 될 수 있습니다. 이 부분은 정책이 정교해질 여지로 보이지만, 공개된 계획은 아직 없습니다.

여러 대를 갖춘 사용자가 많지 않다는 점에서 당장의 수요는 제한적일 수 있습니다. 다만 서브에이전트를 여럿 띄우는 방식이 흔해질수록 로컬 환경에서도 동시 요청을 어디로 보낼지가 문제로 떠오르는 만큼, 그 문제를 표준 엔드포인트를 유지한 채 다루려 한 시도라는 점은 기록해 둘 만합니다.

한 줄 정리

PAIR는 로컬 추론의 한계를 넓히는 도구가 아니라, 이미 갖고 있는 기기들을 놀리지 않게 만드는 배분 도구입니다.

출처

  1. NVIDIA PAIR Virtual Inference Router Expands Available Compute on Your Local Network
  2. NVIDIA/Personal-AI-Router README