# DeepSeek-V4-PRO trên nền tảng Nvidia Vera Rubin: Hiệu suất năng lượng gấp 30 lần GB300

- Nguồn: IT Home
- Thời gian phát hành: 2026-08-25 13:58 (giờ Việt Nam)
- Điểm AI: 50/100
- Link AIHOT.vn: https://aihot.vn/items/d7e5d1df10d4139b
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmt8cb8po31bmro735fn1o3vq
- Link gốc: https://www.ithome.com/0/993/750.htm

## Tóm tắt AI

Thử nghiệm với mô hình DeepSeek-V4-PRO cho thấy hệ thống Vera Rubin NVL72 đạt hiệu suất năng lượng gấp 30 lần so với GB300, đồng thời giảm chi phí vận hành trên mỗi triệu token xuống chỉ còn 1/35.

## Thân bài

Theo tin từ IT ngày 24 tháng 8, Nvidia hôm qua đã sử dụng khối lượng công việc SemiAnalysis AgentX với mô hình DeepSeek-v4-PRO 1.6T để thực hiện đánh giá, kết quả cho thấy lưu lượng trên mỗi megawatt của Vera Rubin đạt gấp 30 lần so với Blackwell.

Lưu lượng trên mỗi megawatt (Tokens per Megawatt, viết tắt là tokens/MW) là chỉ số hiệu quả năng lượng cốt lõi để đo lường số lượng AI Token mà một trung tâm dữ liệu AI có thể tạo ra với một hạn mức điện năng cố định.

![](https://img.ithome.com/newsuploadfiles/2026/8/708b597f-1302-4a23-9c0d-27d4585e8783.png)

Dẫn lời từ bài đăng trên blog, IT cho biết SemiAnalysis AgentX tập trung đánh giá khối lượng công việc suy luận lập trình tác tử (agent) thông qua 4 chỉ số:

Tính tương tác chuẩn hóa từ đầu đến cuối (end-to-end) được tính từ thời điểm gửi yêu cầu đến khi nhận được Token cuối cùng, phản ánh hiệu suất đầu ra mà người dùng có thể thấy, bao gồm cả thời gian chờ đợi Token đầu tiên.

Tính tương tác tiêu chuẩn chỉ thống kê giai đoạn tạo nội dung từ Token đầu tiên đến Token cuối cùng.

Độ trễ từ đầu đến cuối (end-to-end latency) thống kê tổng thời gian của một yêu cầu đơn lẻ từ khi gửi đi cho đến khi nhận được Token đầu ra cuối cùng.

Độ trễ Token đầu tiên (TTFT) thống kê thời gian từ khi gửi yêu cầu đến khi Token đầu ra đầu tiên xuất hiện.

Trong khối lượng công việc DeepSeek-v4-PRO 1.6T, máy chủ Grace Blackwell GB300 NVL72 đạt lưu lượng trên mỗi megawatt gấp 15 lần so với giải pháp H200 NVL8 Hopper.

![A line graph shows 'NVIDIA Blackwell Delivers 15x Better AI Factory Throughput' with the GB300 NVL72 outperforming the H200 NVL8 across throughput per MW.](https://img.ithome.com/newsuploadfiles/2026/8/5963b18f-a9bf-44d5-9123-0b091c81a620.jpg@s_2,w_820,h_380)

Chi phí trên mỗi triệu Token của Blackwell chỉ bằng khoảng 1/10 so với thế hệ trước, cho phép các đơn vị vận hành hỗ trợ nhiều tác tử hơn với cùng một ngân sách điện năng và cơ sở hạ tầng, hoặc duy trì cùng một dung lượng tác tử với chi phí vận hành thấp hơn.

![A line graph titled 'NVIDIA Blackwell Delivers 10x Lower Token Cost' shows the GB300 NVL72 providing significantly increased interactivity at a lower cost than the H200 NVL8.](https://img.ithome.com/newsuploadfiles/2026/8/2255ca03-8285-49ad-94ef-494c7bfffd0c.jpg@s_2,w_820,h_380)

Trong khi đó, Vera Rubin tiếp tục nâng cao lợi thế này; trên mô hình DeepSeek V4 Pro, lưu lượng trên mỗi megawatt của Vera Rubin NVL72 đạt khoảng 30 lần so với GB300 NVL72.

![](https://img.ithome.com/newsuploadfiles/2026/8/b881bed7-f9d0-4ce2-a6ac-fc9967718c97.jpg@s_2,w_820,h_461)

Chi phí trên mỗi triệu Token của Vera Rubin NVL72 chỉ bằng 1/35 so với GB300 NVL72, cho phép vận hành các tác tử một cách liên tục, quy mô lớn, đáp ứng nhu cầu về các khối lượng công việc đa dạng của khách hàng.

![](https://img.ithome.com/newsuploadfiles/2026/8/8d4240ed-c2dc-4b78-bf52-3f21199d8265.jpg@s_2,w_820,h_461)
