NgànhĐiểm AI 38/100
Tăng tốc huấn luyện mô hình MoE không loại bỏ (dropless) trong JAX với NVIDIA Transformer Engine
NVIDIA tối ưu hóa huấn luyện DeepSeek-V3 trên GB200 bằng Transformer Engine và JAX, giúp tăng hiệu suất từ 103 lên 1.068 TFLOPS/GPU, cải thiện gấp 10,4 lần nhờ giảm nghẽn giao tiếp.