01/09

Thứ Ba · 1 tin

22/08

Thứ Bảy · 1 tin
LMSYS: Blog (nhóm Chatbot Arena)
Nghiên cứuĐiểm AI 63/100

Tinh chọnLing-3.0-flash: Tối ưu hóa độ trễ giải mã lên 54% trên 4 GPU Blackwell

Đội ngũ Ant Group và RadixArk đã tối ưu hóa mô hình Ling-3.0-flash, giúp tăng tốc độ giải mã đơn yêu cầu từ 288 lên 606 tok/s và giảm độ trễ TPOT xuống còn 1.53 ms nhờ kiến trúc MoE cải tiến.


Vì sao đáng đọc: Đây là một bước tiến kỹ thuật quan trọng trong việc tối ưu hóa suy luận mô hình MoE trên phần cứng Blackwell, mang lại giá trị thực tiễn cao cho cộng đồng kỹ thuật.
Tổng 2 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (14 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Ling-3.0-flash” | AIHOT.vn