Logo CNTTShop.vn

Hotline:

Hà Nội: NTT03, Line 1, Thống Nhất Complex, 82 Nguyễn Tuân, Thanh Xuân, Hà Nội. ● HCM: Số 13, đường 7C, phường Bình Trưng, Thành phố Hồ Chí Minh. ===> Đơn Vị Hàng Đầu Trong Lĩnh Vực Cung Cấp Thiết Bị Security - Network - Wifi - CCTV - Conference - Máy chủ Server - Lưu trữ Storge.
Thiết bị mạng: 0862 158 859 Máy chủ Server: 0866 176 188 - 0968 498 887 Nvidia GPU-AI: 0906 051 599
Danh mục sản phẩm

Giải Pháp NVIDIA PAIR tận dụng PC, Laptop nhàn rỗi thành cụm AI Cluster cục bộ

NVIDIA vừa giới thiệu PAIR, một phương thức mới giúp kết hợp và phân phối tác vụ suy luận AI (AI inference) trên các thiết bị trong gia đình bạn mà không cần lắp đặt thêm bất kỳ phần cứng nào.

Giải pháp Nvidia Pair

Hầu hết các gia đình đều có tiềm năng suy luận AI chưa được khai thác trên nhiều thiết bị khác nhau & NVIDIA PAIR ra đời để đảm bảo nguồn lực này được tận dụng đúng cách.

Logic đằng sau NVIDIA PAIR rất đơn giản. Có rất nhiều sức mạnh suy luận AI chưa được khai thác bên trong một hộ gia đình. NVIDIA chỉ ra rằng phần lớn các hộ gia đình sở hữu nhiều PC và mức độ sử dụng trung bình của các máy tính này chỉ rơi vào khoảng 17% mỗi ngày, tương đương hơn bốn giờ một chút. Nếu bạn cộng dồn lại và tính toán mức hiệu suất, con số đó tương đương khoảng 165 TFLOPs năng lực tính toán chưa được tận dụng triệt để chỉ trong một gia đình.

Tận dụng tối đa các PC, laptop trong hộ gia đình để suy luận ai

Với mức sử dụng 60% khi chạy QWEN 3.8 27 B, con số này tương đương khoảng 120 triệu token không dùng đến mỗi ngày, và với GPT5.6 là khoảng 5 triệu token mỗi giờ. Về mặt kinh tế, con số đó ước tính khoảng 1,2 nghìn USD mỗi tháng tiền tín dụng API đám mây (cloud API credits). Cộng thêm 120 USD tiền điện với mức sử dụng 60%, đó là rất nhiều giá trị AI ngay trong một ngôi nhà.

Phần lớn sức mạnh tính toán đến từ các dàn Gaming PC vốn có GPU rời dung lượng lớn, nhưng không phải chiếc PC nào cũng có card đồ họa như vậy. Vậy làm thế nào để bạn chia sẻ toàn bộ sức mạnh tính toán đó giữa các thiết bị với nhau?

Giải pháp miễn phí Nvidia pair

Đó chính là lúc NVIDIA PAIR xuất hiện. NVIDIA gọi đây là một công cụ định tuyến AI cá nhân (personal AI router tool) có nhiệm vụ phân phối tác vụ suy luận AI đến các thiết bị bên trong ngôi nhà để tối đa hóa tiềm năng suy luận. Hoàn toàn không cần phần cứng mới; tất cả gói gọn trong một phần mềm duy nhất.

Tải phần mềm NVIDIA Personal AI Router (PAIR) cho Windows, MacOS, Linux tại: https://www.nvidia.com/en-us/ai-on-rtx/personal-ai-router/

Cách thức hoạt động

NVIDIA PAIR được phát hành dưới dạng một phần mềm cài đặt trên từng chiếc PC trong gia đình. Bạn là người nắm toàn quyền kiểm soát, vì vậy bạn có thể quyết định xem một số thiết bị nhất định hay toàn bộ các thiết bị sẽ duy trì kết nối với bộ định tuyến. Phần mềm tự động dò tìm các thiết bị thông qua mDNS, ghép nối các máy bằng mã bảo mật gồm 6 chữ số, và toàn bộ thiết bị sau đó sẽ giao tiếp qua mTLS (kênh truyền thông bảo mật).

Cách thức hoạt động của Nvidia pair

Trong phần demo, NVIDIA trình diễn một ví dụ khi có các lệnh gọi suy luận gửi đến. NVIDIA PAIR sẽ phân phối lệnh gọi suy luận này tới một node (nút máy tính) đang rảnh rỗi trên mạng nội bộ. Phần mềm cũng kiểm tra xem hiện có bao nhiêu tải hoặc tác vụ suy luận đang chạy trên node cụ thể đó. Nếu không có lệnh gọi suy luận nào trên node, nó sẽ phân phối tác vụ tính toán suy luận đến node tương ứng. Nhưng giả sử bạn đang chơi game trên PC; trong trường hợp đó, phần mềm sẽ chủ động né node đó ra và phân phối lệnh gọi tới các phần cứng khả dụng khác.

  • Không cần API mới: PAIR hoạt động như một proxy tương thích với giao diện của Ollama và LM Studio, thay vì bắt từng hệ thống agent phải tích hợp với một API cluster mới hoàn toàn.
  • Máy khách linh hoạt: Các hệ thống tương thích có thể đóng góp tài nguyên khi sẵn sàng và tự động rời khỏi cụm khi cần thiết, chẳng hạn như khi tắt máy hoặc đưa hệ thống về chế độ ngủ đông.
  • Kiểm soát cục bộ: PAIR được thiết kế để giữ trọn vẹn các prompt, dữ liệu và lưu lượng suy luận bên trong mạng nội bộ hiện có của người dùng.

Bộ định tuyến AI cá nhân Nvidia Pair

Phần mềm được thiết kế để nhận biết trạng thái GPU (GPU-aware). Nó sử dụng cơ chế ủy nhiệm (proxying) thông qua Ollama và LM Studio. Phía agent không cần phải thực hiện bất kỳ cấu hình phức tạp nào; và vì đây không phải là cơ chế chia sẻ mô hình hay bất kỳ dạng song song hóa tensor (tensor parallelism) nào, NVIDIA PAIR chỉ đơn giản là nhận cùng một yêu cầu suy luận cùng cấu hình của nó rồi chuyển hướng trọn vẹn sang một chiếc PC khác.

Ở trạng thái hiện tại, NVIDIA PAIR chủ yếu dựa trên độ sâu của hàng đợi (queue depth) và mức sử dụng GPU. Đây là bộ lập lịch BETA của NVIDIA PAIR ở thời điểm này, nhưng NVIDIA khẳng định họ sẽ cải thiện trình lập lịch của PAIR trong tương lai và bổ sung thêm các tín hiệu phân tích khác để khai thác.

Khả năng tương thích

Khi ra mắt, NVIDIA PAIR sẽ được hỗ trợ trên các nền tảng Windows, Linux và macOS, đồng nghĩa với việc nó có thể cài đặt trên hầu hết mọi thiết bị. Phần mềm này cũng sẽ được mở mã nguồn theo giấy phép Apache 2.0 (bắt đầu từ hôm nay). Phiên bản phát hành sẽ là BETA, và NVIDIA sẽ tiếp tục hoàn thiện hướng tới bản phát hành chính thức sau đó.

PAIR có thể làm gì?

  • Định tuyến các tác vụ độc lập trên các hệ thống đã sẵn sàng trong mạng cục bộ.
  • Giảm thiểu tình trạng chờ đợi khi nhiều yêu cầu cùng lúc phải xếp hàng sau một công cụ cục bộ duy nhất.
  • Cải thiện thời gian hoàn thành cho các khối lượng công việc song song phù hợp trong một cấu hình tương thích.
  • Giúp giải phóng PC chính để phục vụ chơi game, sáng tạo nội dung hoặc các tác vụ tương tác khác.
  • Giữ nguyên quy trình làm việc quen thuộc của ứng dụng và ưu tiên xử lý cục bộ (local-first).

PAIR không thể làm gì?

  • Gộp nhiều GPU hoặc gom VRAM lại thành một bộ tăng tốc lớn hơn.
  • Phân mảnh (shard) một mô hình đơn lẻ hoặc chia nhỏ một yêu cầu suy luận ra nhiều máy khác nhau.

Kết nối Agent

NVIDIA PAIR cũng sẽ hỗ trợ bất kỳ thiết bị nào đáp ứng các yêu cầu tối thiểu của Ollama và LM Studio. Do đó, nếu thiết bị của bạn có thể chạy được các công cụ này hoặc chạy được một mô hình nhỏ, thì ngay cả một chiếc laptop cũ chạy GPU tích hợp (iGPU) cũng hoàn toàn sẵn sàng sử dụng phần mềm. Và công cụ này sẽ chạy với mọi GPU đáp ứng được các yêu cầu trên chứ không riêng gì GPU của NVIDIA. NVIDIA cho biết họ đã thử nghiệm lên tới 18 thiết bị (GPU) cho đến thời điểm hiện tại, nhưng bạn hoàn toàn có thể kết nối nhiều hơn con số đó.

Với mỗi yêu cầu mới, PAIR sẽ cân nhắc các yếu tố bao gồm:

  • Liệu node đã ghép nối có đang online và sẵn sàng hay không
  • Liệu engine suy luận được hỗ trợ có đang bật hay không
  • Liệu model chính xác được yêu cầu có sẵn trên máy hay không
  • Khối lượng công việc hiện tại của node và engine, bao gồm các tác vụ đang hoạt động
  • Mức độ sử dụng GPU hiện tại (nghĩa là liệu có ứng dụng hoặc công cụ đồ họa nặng nào đang chạy hay không)

Về yêu cầu mạng, NVIDIA PAIR đòi hỏi băng thông mạng rất thấp do nó chỉ gửi các lệnh REST API dạng văn bản (text), vì vậy nó sẽ không gây ảnh hưởng nhiều đến việc cấp phát tài nguyên trên router cho các dịch vụ như xem phim trực tuyến (streaming).

Các trường hợp sử dụng phù hợp

NVIDIA giới thiệu ba trường hợp sử dụng của NVIDIA PAIR, bao gồm: Quy trình Đa Agent (Multi-Agent Workflows), Đa nhiệm (Multi-Tasking), và Giảm tải hệ thống (System Offload).

Tận dụng tối đa tài nguyên nhàn rỗi của PC, Laptop cá nhân trong gia đình

Trong Quy trình Đa Agent, NVIDIA đưa ra ví dụ về một agent lớn gồm 5 sub-agent phụ thuộc. Khi mỗi sub-agent đó gửi yêu cầu suy luận đến một node duy nhất, các tác vụ suy luận đó sẽ bị dồn ứ trong hàng đợi. Về cơ bản, máy sẽ xử lý xong sub-agent đầu tiên, sau đó mới tiếp tục chạy cái tiếp theo và cứ thế lần lượt. Do đó, bạn nhận được lợi ích về mặt chất lượng từ cấu trúc sub-agent, nhưng tốc độ thì không đạt được. Các tác vụ về cơ bản chỉ nằm yên và chờ đến lượt trong hàng đợi.

hiệu suất của giải pháp Nvidia Pair

Với NVIDIA PAIR, bạn có thể tách các tác vụ của sub-agent đang gửi yêu cầu suy luận đó và phân bổ đều chúng qua các node khác nhau trong nhà. Ví dụ: tác vụ có thể chia cho một laptop RTX Spark trên một node, một chiếc PC gắn RTX 5090 trên một node khác, một DGX Spark trên một node kế tiếp, v.v. Kết quả mang lại rất ấn tượng: chỉ bằng cách tận dụng phần cứng nhàn rỗi trong nhà, bạn có thể nhận thấy tốc độ tăng gấp 2 lần trong các quy trình Multi-Agent như Hermes agent.

Tác vụ Đa nhiệm cũng có thể hưởng lợi từ NVIDIA PAIR bằng cách chạy nhiều phiên làm việc song song trên các thiết bị khác nhau. Và cuối cùng là giảm tải hệ thống (system offload). Giảm tải hệ thống về bản chất là chuyển khối lượng công việc suy luận AI sang một thiết bị khác khi thiết bị chính đang bận phục vụ mục đích khác, chẳng hạn như chơi game hoặc các tác vụ sáng tạo nội dung. Điều này giúp giải phóng tài nguyên trên PC chính của bạn mà công việc xử lý AI vẫn được hoàn thành.

Khi sử dụng Qwen3.6 35B A3B trên một card RTX 5090 đơn lẻ, cùng một khối lượng công việc gồm 5 sub-agent mất trung bình 6 phút 18 giây để hoàn thành, trong khi một cụm PAIR gồm 2 thiết bị trang bị hai card RTX 5090 chỉ mất trung bình 3 phút 48 giây để xử lý xong. Đây là bản trình diễn mang tính tham khảo trên một cấu hình cụ thể, không phải là một bài benchmark chung hay lời cam kết về khả năng mở rộng tuyến tính.

NVIDIA PAIR là một ý tưởng đơn giản nhưng được triển khai rất tốt: hầu hết các gia đình đều sở hữu năng lực suy luận nhiều hơn mức họ thực sự dùng đến, và bộ định tuyến hoàn toàn bằng phần mềm này đã đưa nguồn năng lượng nhàn rỗi đó vào hoạt động mà không cần thêm thiết bị phần cứng mới, không cần các API mới, cũng như không phải gửi prompt lên đám mây. Bằng cách tự động nhận diện các cỗ máy trong mạng cục bộ, điều hướng toàn bộ tác vụ đến bất kỳ node nào đang rảnh, và chủ động tránh xa những chiếc PC đang bận chơi game hay render đồ họa, nó đã biến những chiếc laptop dư thừa và GPU chưa dùng hết công suất thành một cụm cluster cá nhân ngay trong gia đình.

Nó sẽ không gộp chung VRAM hay chia nhỏ một mô hình ra nhiều card khác nhau, nhưng nó cắt giảm thời gian chờ hàng đợi, tăng tốc đáng kể các quy trình làm việc multi-agent, và giải phóng cỗ máy chính để người dùng làm các công việc thực tế. Với tính chất mã nguồn mở, đa nền tảng và tương thích tốt với cả Ollama lẫn LM Studio trên phần cứng của NVIDIA lẫn các hãng khác, PAIR là một phương thức thực tế để khai thác tối đa giá trị AI từ chính những chiếc máy tính mà bạn đang sở hữu.

Lê Văn Tuấn

Là chuyên gia trong lĩnh vực Network System, Security, Server.. Có kinh nghiệm nhiều năm tư vấn giải pháp mạng, triển khai các giải pháp CNTT và phân phối thiết bị mạng Switch, Wifi, Router, Máy chủ Server, Lưu trữ Storage, Tường lửa Firewall, Video Conferencing, Module quang, Load Balancing. Hiện tại tôi là Founder và Managing Director công ty TNHH Công Nghệ Việt Thái Dương (CNTTShop.vn).

Bình luận bài viết!

Có 0 bình luận:
Chuyên mục chính
Bài viết cùng danh mục