Người dùng đã sử dụng Claude Opus 5.5 để viết mã C++ và CUDA, kết hợp NVIDIA OptiX 9.1 nhằm tạo ra trình dò tia (path tracer) tăng tốc phần cứng đạt 34 FPS và 267 triệu mẫu tia mỗi giây.
NVIDIA giới thiệu cơ chế truyền dữ liệu không sao chép (zero-copy) cho ROS 2 thông qua CUDA buffer, giúp tối ưu hiệu suất xử lý dữ liệu GPU giữa các node, đồng thời tích hợp AI Agent để nâng cao khả năng tự động hóa trong robot.
Nghiên cứu giới thiệu phương pháp phân tích đột biến để đo lường hiệu quả của các bộ kiểm thử (oracle) cho nhân GPU, phát hiện ra rằng các giao thức hiện tại bỏ sót gần 17% lỗi, đặc biệt là các lỗi về độ chính xác số thực.
Loongson chính thức phát hành phiên bản phần mềm đầu tiên cho nền tảng GPU LG200, hỗ trợ các chuẩn lập trình CUDA, OpenCL 3.0 cùng thư viện tối ưu cho suy luận AI.
Great blog from Kevin Lu at @vllm_project about quality control at the inference engine. Unfortunate…
DịchBài viết từ SemiAnalysis chỉ ra rằng sự thiếu hụt hạ tầng kiểm thử ổn định cho AMD khiến chất lượng phần mềm vLLM trên nền tảng này kém xa so với CUDA, gây ra tình trạng gián đoạn CI thường xuyên.
NVIDIA chính thức hỗ trợ lập trình GPU bằng Rust, cho phép biên dịch trực tiếp kernel sang PTX thông qua hai lộ trình cuda-oxide và cutile-rs, giúp tối ưu hóa hiệu năng mà không cần thông qua các ngôn ngữ trung gian.
Dự án CUDA-for-AMD-Windows cho phép người dùng card AMD RX 9060 XT chạy các phần mềm phụ thuộc CUDA thông qua lớp chuyển đổi ZLUDA và nền tảng AMD HIP/ROCm.
Dự án mã nguồn mở mới cho phép chạy các ứng dụng CUDA trên GPU AMD thông qua sự kết hợp giữa ZLUDA v6 và AMD HIP SDK, mở ra khả năng tương thích phần cứng linh hoạt hơn cho người dùng Windows.
POWER OF CUDA MOAT ALERT🚨: 2 days after CUDA vLLM supported DeepSeekv4.1 Flash, AMD finally publicl…
DịchTrong khi vLLM trên CUDA đã hỗ trợ DeepSeek v4.1 Flash từ sớm, AMD mất thêm 2 ngày mới tung ra bản cập nhật. Dù hoạt động ổn định, hiệu năng trên mỗi USD của chip AMD vẫn thua kém đáng kể so với H200 và B200/B300 của NVIDIA.
NVIDIA is bringing CUDA to Windows on Arm ahead of RTX Spark laptops arriving in October. CUDA 13.4…
DịchNVIDIA phát hành CUDA 13.4 hỗ trợ Windows on Arm, giúp các nhà phát triển tối ưu ứng dụng cho dòng laptop RTX Spark sắp ra mắt vào tháng 10. Đây là bước tiến quan trọng để đưa các mô hình AI cục bộ và tác nhân thông minh lên thiết bị Arm.
NVIDIA ra mắt CUDA Toolkit 13.4, lần đầu tiên cung cấp bộ công cụ phát triển gốc cho Windows on Arm, mở rộng khả năng hỗ trợ từ Linux sang nền tảng Windows Arm.
NVIDIA giới thiệu CUDA Rust, cho phép lập trình viên viết GPU kernel bằng Rust với khả năng kiểm soát lỗi bộ nhớ ngay từ lúc biên dịch, nhờ tận dụng cơ chế quản lý quyền sở hữu của ngôn ngữ này.
TPU Inference Externalization Full Steam Ahead - InferenceX, Up to 50% Better Performance per Dolla…
DịchBáo cáo từ SemiAnalysis cho thấy công nghệ InferenceX giúp tối ưu hóa chi phí TPU lên tới 50%, đồng thời đẩy nhanh quá trình phổ cập hạ tầng TPU, trực tiếp thách thức rào cản kỹ thuật của hệ sinh thái CUDA.
Chinese robots hold 86% of total global humanoid shipments and Nvidia is extending its CUDA playbook…
DịchVới việc Trung Quốc nắm giữ 86% thị phần robot hình người toàn cầu, NVIDIA đang sao chép chiến lược CUDA bằng cách tích hợp sâu phần cứng và nền tảng Isaac/GR00T vào các nhà sản xuất, tạo ra hệ sinh thái phụ thuộc từ mô phỏng đến triển khai.
I've put together an up-to-date, validated DGX Spark setup for ML experiments such as post-training: …
DịchHướng dẫn cấu hình tối ưu cho DGX Spark bao gồm PyTorch 2.13 trên CUDA 13, nhân huấn luyện đã kiểm chứng qua GB10 và môi trường vLLM biệt lập, giúp tăng hiệu suất cho các thử nghiệm hậu huấn luyện.
TorchMorph là tiện ích mở rộng nhẹ cho PyTorch, cung cấp 22 toán tử tối ưu hóa bằng CUDA, hỗ trợ xử lý hình thái học nhị phân/thang độ xám và vận chuyển tối ưu trên tensor lên tới 8 chiều.
AgentX - InferenceXv3: Does CUDA Moat Hold up in Agentic Inferencing? $3 Million USD dataset open s…
DịchAgentX giới thiệu bộ dữ liệu 3 triệu USD với ngữ cảnh 1 triệu token, tối ưu hóa KVCache cho AI Agent đạt hiệu suất trên 95% trên các nền tảng phần cứng mạnh mẽ như GB300 và MI355.
NVIDIA built its own coding harness to optimize CUDA GPU kernels and achieved a 100% score on ARC-AG…
DịchNVIDIA vừa ra mắt khung lập trình giúp tối ưu hóa nhân CUDA, đạt tỷ lệ giải quyết 100% các bài toán trong ARC-AGI-3. Bước tiến này hứa hẹn sẽ hạ thấp rào cản kỹ thuật, giúp việc huấn luyện và tối ưu hóa AI trở nên dễ dàng hơn cho mọi người.
SGLang giới thiệu Weight Cache Daemon sử dụng CUDA IPC để giảm thời gian tải trọng số từ 495 giây xuống còn 0,63 giây. Công nghệ này giúp tăng tốc khởi động hệ thống lên 785 lần, hỗ trợ chia sẻ đa thực thể và phục hồi engine tức thì.
CUDA Agent là hệ thống học tăng cường giúp LLM tự động viết mã CUDA, đạt tốc độ vượt trội gấp 2.11 lần so với torch.compile và tỷ lệ thành công lên tới 98.8%.
SGLang vừa tái cấu trúc hỗ trợ CUDA Graph, biến Breakable CUDA Graph (BCG) thành mặc định cho giai đoạn prefill. Giải pháp này giúp giảm 75% lượng code so với torch.compile và tăng tốc độ xây dựng lên tới 5,2 lần.
Scott Gray, kỹ sư GPU hàng đầu được mệnh danh là 'thần nhân CUDA', đã xác nhận rời OpenAI sau một thập kỷ. Sự ra đi của ông đánh dấu thêm một tổn thất nhân sự cấp cao đáng chú ý của OpenAI trong năm nay.
The mighty A100 fleet are mission-capable from 2020 through 2029. NVIDIA computing is more than chip…
DịchJensen Huang nhấn mạnh sức mạnh của NVIDIA không chỉ nằm ở chip mà còn ở hệ sinh thái CUDA, giúp các kiến trúc từ Ampere đến Blackwell duy trì tính bền bỉ và khả năng sử dụng lâu dài cho các trung tâm dữ liệu.