Điểm chính của CUDA 13.4
NVIDIA vừa phát hành CUDA Toolkit 13.4 với một nhóm thay đổi trải từ nền tảng phần cứng tới quản lý tài nguyên và Python. Với developer AI, ba điểm dễ thấy nhất là hỗ trợ Windows on Arm, hỗ trợ sớm cho kiến trúc Rubin và lớp quản lý GPU dùng chung được mở rộng.
Windows on Arm bước vào hệ sinh thái CUDA
Theo release notes của NVIDIA, CUDA 13.4 bổ sung hỗ trợ Windows on Arm trên các thiết bị RTX Spark. Trước đây Arm đã xuất hiện trong hệ sinh thái CUDA qua Linux; thay đổi lần này mở thêm một nhánh phát triển cho ứng dụng Windows chạy trên nền Arm.
Điều này chưa có nghĩa mọi laptop Windows on Arm đều trở thành máy CUDA. Phạm vi phần cứng và driver vẫn phải theo danh sách hỗ trợ của NVIDIA. Nhưng về chiến lược, đây là tín hiệu cho thấy stack CUDA đang chuẩn bị cho hệ máy Arm rộng hơn ở phía client và workstation.
Rubin có mặt, nhưng chưa dành cho production
CUDA 13.4 cũng đưa hỗ trợ chức năng cho nền tảng Vera Rubin ở mức developer preview. NVIDIA nói rõ trong release notes rằng phần hỗ trợ này không nhằm benchmarking, phân tích hiệu năng hay triển khai production.
Vì vậy, giá trị của Rubin support trong bản này chủ yếu là cho đội ngũ cần port và kiểm tra phần mềm sớm, không phải lý do để một hệ thống production hiện tại thay đổi ngay.
MPS V3: đáng chú ý với môi trường nhiều workload
Multi-Process Service V3 bổ sung lớp điều khiển mới, khả năng cấu hình có thể script và cơ chế giới hạn bộ nhớ GPU tích hợp với cgroup. Với server chạy nhiều workload hoặc container, đây là thay đổi có ý nghĩa vì quản lý GPU không chỉ là “có bao nhiêu GPU” mà còn là kiểm soát cách nhiều tiến trình cùng sử dụng một thiết bị.
CUDA Python cũng tiếp tục mở rộng với API cho texture, surface, quản lý bộ nhớ nhận biết NUMA và các cải tiến liên quan đến compilation.
Có nên nâng cấp ngay?
Không nhất thiết. Nếu bạn đang vận hành một stack AI ổn định, quyết định nâng CUDA luôn phải đi cùng kiểm tra driver, framework, thư viện inference và phần cứng. CUDA 13.4 đáng quan tâm nhất với các nhóm đang nhắm tới Windows on Arm, thử nghiệm Rubin sớm hoặc cần kiểm soát tài nguyên GPU dùng chung tốt hơn.
Đối với người dùng Local AI thông thường, tác động trước mắt có thể chưa lớn. Nhưng ở tầng hạ tầng, các thay đổi này cho thấy CUDA đang mở rộng theo cả hai hướng: nhiều kiến trúc thiết bị hơn và khả năng vận hành GPU như tài nguyên dùng chung tinh vi hơn.