Nghiên cứu chỉ ra hai dạng kích hoạt đặc thù (PAS và ISP) trong các mô hình LLM lai, giúp hiểu rõ cách chúng vận hành và chuyển đổi trạng thái khi kết hợp giữa cơ chế chú ý đầy đủ và chú ý tuyến tính.
Full-bandwidth Transformer cải thiện khả năng suy luận bằng cách truyền trạng thái ẩn từ lớp trên cùng trở lại đầu vào, giúp mô hình tận dụng được các tính toán chuyên sâu thay vì chỉ dựa vào token đã tạo.
Vì sao đáng đọc: Đây là một cải tiến kiến trúc quan trọng, giải quyết điểm nghẽn về luồng thông tin trong các mô hình Transformer hiện nay mà vẫn giữ được tính tương thích với hạ tầng cũ.
Nghiên cứu giới thiệu Power Law Graph Attention (PLGA), một cơ chế chú ý mới thay thế tích vô hướng truyền thống bằng toán tử song tuyến tính học được, giúp tối ưu hóa khả năng biểu diễn và suy luận của các mô hình ngôn ngữ lớn.