Rohan Paul@rohanpaul_aiNghiên cứu từ Microsoft: Sliding-window vượt trội hơn các biến thể Linear Attention trong suy luận tiết kiệm bộ nhớ
So happy to see this new Microsoft paper. If lower inference memory is the goal, this paper finds t…
DịchNghiên cứu chỉ ra rằng Sliding-window attention (SWA) hiệu quả hơn hầu hết các phương pháp Linear attention khi tối ưu bộ nhớ suy luận, chỉ cần kết hợp cửa sổ nhỏ và 4 token 'sink' đầu tiên.

















