PAIR giải quyết bài toán gì?
Khi chỉ chạy một chatbot Local AI, một máy thường là đủ. Nhưng khi bạn mở nhiều phiên agent hoặc một agent tạo nhiều sub-agent, số request inference có thể tăng nhanh và cùng xếp hàng trên một GPU.
NVIDIA Personal AI Router (PAIR) được thiết kế để phân phối các request độc lập sang những máy phù hợp khác trong cùng mạng nội bộ. Ứng dụng phía trên vẫn có thể nói chuyện theo giao diện quen thuộc của Ollama hoặc LM Studio; PAIR đứng ở giữa để quyết định máy nào sẽ xử lý từng request.
Điều quan trọng: PAIR không gộp GPU thành một GPU lớn
Đây là điểm dễ hiểu sai nhất. PAIR không cộng VRAM của hai máy thành một vùng nhớ chung, không chia một model khổng lồ qua nhiều máy và không cắt một request đang chạy thành nhiều phần.
Mỗi request được giao cho một node đủ điều kiện và chạy trọn vẹn trên node đó. Lợi ích xuất hiện khi workload có nhiều request độc lập có thể chạy song song.
Khi nào PAIR đáng thử?
PAIR phù hợp nếu nhà hoặc văn phòng nhỏ đã có từ hai máy có khả năng chạy Local AI, chẳng hạn desktop RTX, laptop RTX, workstation hoặc một số máy Apple Silicon tương thích. Mỗi node cần có inference engine và model cần thiết.
Ví dụ thực tế: một agent nghiên cứu tạo năm worker độc lập. Thay vì năm worker cùng chờ một GPU, PAIR có thể đưa một số request sang máy khác đang rảnh. NVIDIA cho biết trong demo năm sub-agent của họ, ba thiết bị hoàn thành workload nhanh hơn đáng kể so với một máy đơn. Con số benchmark này nên được xem là minh họa cho workload cụ thể, không phải cam kết tăng tốc cho mọi hệ thống.
Luồng thử nghiệm ở mức đơn giản
Một thử nghiệm hợp lý gồm bốn phần: cài PAIR trên các máy tham gia, ghép các máy trong mạng tin cậy, chuẩn bị Ollama hoặc LM Studio cùng model cần dùng, rồi trỏ ứng dụng tương thích vào endpoint cục bộ của PAIR.
Sau đó, điều cần quan sát không chỉ là “có chạy hay không” mà là request nào được đưa tới node nào, thời gian chờ có giảm không, và chất lượng trải nghiệm tổng thể có tốt hơn một máy đơn hay không.
Bảo mật: giữ đúng phạm vi Local AI
Tài liệu của dự án nói các node dùng cơ chế ghép cặp và kết nối mã hóa giữa những máy đã tin cậy. Dù vậy, đây vẫn là phần mềm beta và làm việc với giao tiếp trong mạng nội bộ. Chỉ nên ghép các máy bạn kiểm soát và thử trên mạng đáng tin cậy.
Nếu mục tiêu của bạn đơn giản là một chatbot Local AI cho một người, PAIR có thể là quá mức cần thiết. Nhưng nếu bạn đang tiến tới nhiều agent hoặc có sẵn nhiều máy rảnh, đây là một hướng thú vị: biến phần cứng phân tán trong nhà thành một pool xử lý request, trong khi vẫn giữ mô hình sử dụng quen thuộc của Ollama và LM Studio.