Astera Labs ra mắt bộ điều khiển bộ nhớ Leo X: Tối ưu hóa KV Cache cho AI
Astera Labs giới thiệu dòng Leo X mới, cho phép chuyển tải KV Cache từ GPU sang bộ nhớ ngoài, giúp giảm độ trễ phản hồi đầu tiên tới 62% và tăng tốc độ xử lý token lên 22%.
Astera Labs giới thiệu dòng Leo X mới, cho phép chuyển tải KV Cache từ GPU sang bộ nhớ ngoài, giúp giảm độ trễ phản hồi đầu tiên tới 62% và tăng tốc độ xử lý token lên 22%.
Bằng cách tận dụng CPU để quản lý bộ nhớ thay vì dồn hết tác vụ cho GPU, các mô hình ngôn ngữ lớn có thể tối ưu hóa quy trình tạo token và cải thiện hiệu suất đáng kể.
Chỉ trong một tháng, nhóm phát triển đã đảo ngược thành công firmware AGX trên M4 Mac Mini để viết driver Linux, đạt chuẩn OpenGL ES 3.0 với hiệu năng ấn tượng: Minecraft đạt 200fps và trình duyệt chạy mượt mà.
Bài viết hướng dẫn chi tiết cách sử dụng cuDNN Frontend API để xây dựng đồ thị tính toán, cho phép cuDNN tự động tối ưu hóa và quản lý các kế hoạch thực thi nhằm đạt hiệu suất cao nhất.
Startup Molecular Heart (Phân Tử Chi Tâm) vừa giải quyết bài toán hóc búa trong mô phỏng phân tử, cho phép quan sát phản ứng hóa học ở quy mô lớn với tốc độ và độ chính xác vượt trội.
Tại Hội nghị Năng lực Tính toán 2026, China Mobile Cloud giới thiệu hệ thống suy luận hỗn hợp giúp tăng gấp đôi hiệu suất và tiết kiệm 40% chi phí vận hành cho mô hình DeepSeek V4 Flash.
Một chiếc MacBook cũ đã sử dụng webcam để quan sát màn hình qua gương, tạo vòng lặp phản hồi giúp AI tự động tinh chỉnh và sửa lỗi driver cho GPU AMD Radeon.
Thêm 1 nguồn khác đưa tinCafeF Kinh tế sốNVIDIA vừa giới thiệu dòng card đồ họa RTX PRO 5500 kiến trúc Blackwell dành cho máy trạm, sở hữu 21.760 nhân CUDA và 84GB VRAM GDDR7. Với công suất 600W, sản phẩm được tối ưu hóa cho các tác vụ AI phức tạp, mô phỏng vật lý và đồ họa chuyên sâu.
Dự án mã nguồn mở mới cho phép chạy các ứng dụng CUDA trên GPU AMD thông qua sự kết hợp giữa ZLUDA v6 và AMD HIP SDK, mở ra khả năng tương thích phần cứng linh hoạt hơn cho người dùng Windows.
Bài viết hướng dẫn chi tiết cách tận dụng sức mạnh GPU thông qua NVIDIA cuML và RAPIDS để tối ưu hóa toàn bộ quy trình học máy, từ phân cụm, giải thích mô hình đến suy luận.
Rohan Paul@rohanpaul_aiSatya Nadella revealed Microsoft is getting more than 7x performance gains by repurposing older GPUs…
DịchCEO Satya Nadella tiết lộ Microsoft đã tái sử dụng các cụm GPU cũ để tăng tốc kho dữ liệu Fabric, giúp cải thiện hiệu suất lên hơn 7 lần mà không cần đầu tư phần cứng mới.
Các ngân hàng Trung Quốc đang mở rộng gói tín dụng chuyên biệt cho doanh nghiệp AI, tập trung tài trợ xây dựng trung tâm dữ liệu và mua sắm cụm máy chủ GPU nhằm thúc đẩy hạ tầng công nghệ quốc gia.
SemiAnalysis@SemiAnalysis_On the Day 0 release of DeepSeekv4.1 Flash, NVIDIA vLLM works out of the box with zero issues across…
DịchNVIDIA vLLM đã hỗ trợ hoàn hảo cho cả 6 dòng chip từ H100 đến GB300 ngay khi DeepSeek-V4.1 Flash vừa trình làng, trong khi phía AMD vẫn chưa thể vận hành mô hình này.

Rohan Paul@rohanpaul_aiAgentic AI may be forcing the old computing stack with lot more focus on CPU back into the center of…
DịchCEO Cathie Wood của Ark Invest nhận định rằng khi Agentic AI phát triển, nhu cầu về lập kế hoạch, truy xuất dữ liệu và điều phối sẽ khiến CPU trở nên quan trọng không kém GPU trong các tác vụ AI.
Thị trường máy chủ toàn cầu tăng trưởng mạnh mẽ với doanh thu đạt 166,3 tỷ USD, trong đó máy chủ tích hợp GPU chiếm hơn một nửa thị phần dù sản lượng GPU giảm nhẹ.
Enflame Technology, một trong 'tứ đại gia' GPU Trung Quốc, đã chính thức niêm yết trên sàn STAR với vốn hóa đạt 177,7 tỷ NDT. Công ty huy động hơn 6 tỷ NDT để đẩy mạnh nghiên cứu các thế hệ chip AI tiếp theo.
Chủ tịch Loongson xác nhận card 9A1000 tích hợp AI (40TOPS) sẽ bán ra vào nửa đầu năm tới. Đồng thời, hãng cũng đang phát triển nhân CPU hiệu năng cao thế hệ thứ 6 cho dòng chip Loongson 7000 tương lai.
Thị trường card đồ họa rời (AIB) tăng trưởng 10% so với quý trước, đạt 12,5 triệu đơn vị trong Q2/2026, bất chấp sự sụt giảm mạnh của thị trường CPU máy tính để bàn. Tỷ lệ gắn kèm card rời trên PC đạt mức cao kỷ lục 89%.
Elvis Saravia@omarsar0It's crazy how far small models can be pushed. Robbyant just open-sourced LingBot-World 2.0 Small, …
DịchRobbyant vừa mã nguồn mở LingBot-World 2.0 Small, mô hình thế giới 1.3B có khả năng tạo môi trường tương tác thời gian thực ở độ phân giải 720p/60fps trên GPU tiêu dùng, mở ra hướng đi mới cho việc tối ưu hóa mô hình AI trên phần cứng cá nhân.
Công ty chip AI Enflame Technology dự kiến niêm yết trên sàn chứng khoán Thượng Hải vào ngày 11/9/2026. Với mục tiêu huy động 6,119 tỷ nhân dân tệ, hãng sẽ tập trung phát triển các dòng chip AI thế hệ thứ 5 và 6 để củng cố vị thế trong nhóm 'tứ đại gia' GPU nội địa Trung Quốc.
JD Cloud công bố kế hoạch xây dựng cụm tính toán với 100.000 GPU từ hãng chip nội địa Moore Threads, nhằm hỗ trợ huấn luyện mô hình lớn và phát triển AI thực thể cho các doanh nghiệp.
NVIDIA giới thiệu CUDA Rust, cho phép lập trình viên viết GPU kernel bằng Rust với khả năng kiểm soát lỗi bộ nhớ ngay từ lúc biên dịch, nhờ tận dụng cơ chế quản lý quyền sở hữu của ngôn ngữ này.
Testing Catalog@testingcatalogDuliffusion models are evolving 👀 Inception launched Mercury 2.5 diffusion model and it performs o…
DịchInception vừa trình làng Mercury 2.5, phiên bản nâng cấp với khả năng xử lý thông minh vượt trội 40% so với thế hệ trước, đồng thời đạt tốc độ ấn tượng 1107 tokens/giây trên các dòng GPU NVIDIA phổ biến.

ModelBest OpenBMB@OpenBMBLove seeing MiniCPM5-2B flying on an RTX 3080! Highly responsive agents on older GPUs is exactly the…
DịchMô hình MiniCPM5-2B gây ấn tượng khi chạy trơn tru trên GPU RTX 3080 đời cũ, chứng minh khả năng tối ưu hóa hiệu suất mạnh mẽ cho các tác vụ AI tại biên.
Nguồn tin rò rỉ cho biết NVIDIA dự kiến sử dụng chip GB203 thay vì GB205 cho RTX 5070. Việc cắt giảm thông số trên dòng chip cao cấp hơn này giúp hãng tối ưu hóa sản lượng và cân bằng cung cầu linh kiện.
Bài viết giới thiệu cách vLLM triển khai kỹ thuật giải mã suy đoán trên kiến trúc GPU AMD, giúp tăng tốc độ suy luận cho các mô hình ngôn ngữ lớn mà vẫn đảm bảo độ chính xác.
X.PIN@thexpinChinese GPU maker Moore Threads plunged 20% on Sept. 7 to a record low, pushing its market value bel…
DịchCổ phiếu của nhà sản xuất GPU Trung Quốc Moore Threads giảm mạnh xuống mức thấp kỷ lục sau khi 25,77 triệu cổ phiếu hạn chế chuyển nhượng được mở bán. Dù doanh thu nửa đầu năm 2026 tăng trưởng ấn tượng, áp lực từ việc xả hàng đã khiến giá trị vốn hóa của công ty sụt giảm đáng kể.

Tibo@thsottiauxTibo chia sẻ trải nghiệm sử dụng mô hình Astra chạy trên GPU NVIDIA mỗi sáng, nhấn mạnh vào tư duy tích cực và động lực phát triển công nghệ cá nhân.
Meta FAIR cùng các đại học danh tiếng phát triển mô hình RPMs nhằm dự đoán và xếp hạng các thực nghiệm ML trước khi chạy, giúp tiết kiệm đáng kể tài nguyên GPU bằng cách chỉ thực thi những thí nghiệm tiềm năng nhất.
Bất chấp nhu cầu PC sụt giảm và chi phí linh kiện tăng cao, thị trường GPU rời trong quý 2/2026 vẫn ghi nhận mức tăng trưởng ấn tượng 12,2% so với quý trước, chủ yếu nhờ vào sức tiêu thụ mạnh mẽ từ phân khúc laptop.
Perplexity chia sẻ chi tiết về hạ tầng kỹ thuật tối ưu hóa hiệu suất cho các mô hình nhúng (embedding), giúp tăng tốc độ và giảm chi phí vận hành cho hệ thống tìm kiếm AI.
Các startup đang tận dụng sức mạnh GPU từ dàn máy gaming nhàn rỗi để cho thuê, giúp game thủ tạo ra thu nhập thụ động trong bối cảnh nhu cầu tính toán AI tăng vọt.
Perplexity@perplexity_aiEvery answer in Perplexity starts with embedding and ranking models picking the most relevant result…
DịchPerplexity chia sẻ chi tiết về hạ tầng suy luận hiệu năng cao, giúp tối ưu hóa quá trình chọn lọc và xếp hạng kết quả tìm kiếm thông qua các mô hình nhúng (embedding) tiên tiến.

Aravind Srinivas (Perplexity CEO)@AravSrinivasA deep dive into how Perplexity serves search results at scale: embeddings for ranking, GPU-based mo…
DịchPerplexity chia sẻ kỹ thuật vận hành hạ tầng tìm kiếm, tập trung vào tối ưu hóa mô hình nhúng (embedding), suy luận trên GPU và cân bằng giữa độ trễ với lưu lượng truy cập.
SemiAnalysis@SemiAnalysis_A (popcorn) kernel is a specialized seed from a variety of corn that can burst open and turn inside …
DịchSemiAnalysis giải thích rằng việc tối ưu hóa các dòng mã GPU kernel giúp tận dụng tối đa sức mạnh tính toán của Tensor Core. Ở quy mô của OpenAI, chỉ cần cải thiện vài phần trăm hiệu suất kernel cũng có thể tiết kiệm hàng trăm triệu USD chi phí hạ tầng.

Databricks phân tích cách vượt qua giới hạn của các kernel GPU truyền thống bằng cách tạo ra các kernel chuyên biệt, giúp tối ưu hóa hiệu suất suy luận cho các mô hình AI phức tạp.
Tận dụng sức mạnh GPU từ dàn máy gaming khi không sử dụng, các startup đang tạo ra nền tảng cho thuê tài nguyên tính toán, giúp game thủ kiếm thêm thu nhập từ cơn sốt AI.
Thêm 1 nguồn khác đưa tinCafeF Kinh tế sốMoore Threads công bố GPU 'Lushan' kiến trúc 'Huagang' dự kiến ra mắt cuối năm 2026, hứa hẹn tăng hiệu suất AI gấp 64 lần và hỗ trợ Ray Tracing phần cứng chuẩn DXR.
Emad Mostaque@EMostaqueAstra used 100k GPUs at Stargate Texas With a couple of months to pretrain that makes it the first …
DịchEmad Mostaque tiết lộ Astra đã sử dụng cụm 100.000 GPU tại Stargate Texas để hoàn thành đợt huấn luyện kéo dài hai tháng, đánh dấu cột mốc dự án AI đầu tiên đạt quy mô chi phí 1 tỷ USD.
- một trong 'tứ đại gia' GPU Trung Quốc - vừa công bố kết quả IPO trên sàn STAR Market với giá 142,18 NDT/cổ phiếu. Số vốn huy động được hơn 6,1 tỷ NDT sẽ tập trung phát triển chip AI thế hệ thứ 5 và thứ 6.