Nghiên cứu chỉ ra rằng Sliding Window Attention với cơ chế 'sinks' mang lại hiệu suất ngang bằng hoặc tốt hơn các mô hình Linear Attention, đồng thời giải quyết hiệu quả vấn đề tiêu tốn tài nguyên của kiến trúc Transformer truyền thống.
Gated Recurrent Transformer giải quyết bài toán cân bằng giữa khả năng biểu đạt và bộ nhớ bằng cách sử dụng các khối lặp lại có kiểm soát, cho phép mô hình chuyên biệt hóa dữ liệu đầu vào mà không cần tăng số lượng tham số đáng kể.
WorldToken tối ưu hóa việc học của robot bằng cách hợp nhất dữ liệu đa phương thức thành một 'world token' duy nhất, giúp mô hình Transformer xử lý trình tự hiệu quả hơn. Phương pháp này đạt tỷ lệ thành công ấn tượng 59,45% trên 23 tác vụ RoboCasa phức tạp.
SparsePR giới thiệu phương pháp phân vùng và tái tạo phần dư mới giúp tăng tốc các mô hình Transformer video mà không cần huấn luyện lại, giải quyết hiệu quả sai số từ các toán tử thưa.
DịchBài báo giới thiệu phương pháp huấn luyện mạng RNN thông qua mô hình giáo viên Transformer, giúp tối ưu hóa khả năng biểu diễn trạng thái dự đoán và học giám sát hàm chuyển đổi bộ nhớ.
Anthropic đã phân tách thành công transformer một lớp để chứng minh sự tồn tại của nhiễu trọng số và tác động trực tiếp của chúng đến hiệu suất huấn luyện mô hình.
NAPE là khung học tự giám sát tối giản sử dụng Transformer nhân quả để dự đoán các đoạn âm thanh tiếp theo mà không cần bộ giải mã phức tạp. Phương pháp này đạt hiệu suất vượt trội trên nhiều tác vụ âm thanh và giọng nói, đồng thời có khả năng mở rộng quy mô ấn tượng.
Một nhà phát triển đã tạo ra mô hình Transformer 125M tham số, cho phép iPhone 15 tự động gợi ý nốt nhạc piano theo thời gian thực. Dự án tối ưu hóa dữ liệu MIDI và áp dụng kỹ thuật DPO để đạt hiệu suất ấn tượng, hiện đã ra mắt ứng dụng RollTab miễn phí.
Every co-author of "Attention Is All You Need" has now left Google. Jeff Dean and Sanjay Ghemawat ar…
DịchToàn bộ nhóm tác giả bài báo "Attention Is All You Need" đã rời Google. Sự kiện này cho thấy Google đang chuyển dịch trọng tâm từ phát triển mô hình AI tiên phong sang khai thác hạ tầng TPU và dịch vụ đám mây để tối ưu hóa lợi nhuận.
Some newer efficient LLMs (using "hybrid Transformer") are cutting back on expensive attention layer…
DịchCác mô hình LLM kiến trúc lai sử dụng lớp tuần hoàn giá rẻ thay thế phần lớn lớp Attention, nhưng các lớp Attention còn lại đóng vai trò quyết định. Nghiên cứu chỉ ra sự xuất hiện của các giá trị nội tại cực đại trước các lớp này, ảnh hưởng trực tiếp đến hiệu suất và cấu trúc mô hình.
Thay vì đóng băng trọng số sau khi huấn luyện, Test-time Training cho phép mô hình cập nhật liên tục khi sử dụng, giúp tăng tốc độ suy luận gấp 2.7 lần và mở rộng ngữ cảnh hiệu quả mà không cần huấn luyện lại.
Bài viết phân tích lý do tại sao các mô hình tuần hoàn (recurrent models) thường gặp lỗi khi cố gắng suy nghĩ sâu hơn, đồng thời giải thích cách Transformer hiện nay đang dùng phương pháp 'vừa nói vừa nghĩ' để vượt qua giới hạn tính toán.
Maglev giới thiệu kiến trúc Transformer hồi quy mới sử dụng bộ nhớ cố định, kết hợp ưu điểm của cơ chế chú ý cửa sổ trượt và khả năng huấn luyện song song, giúp cải thiện hiệu suất dự đoán token so với các mô hình truyền thống.
UniSwap là khung làm việc đầu tiên cho phép thay đổi đồng thời diện mạo và giọng nói trong video nói thông qua mô hình Transformer khuếch tán, giúp giữ nguyên nội dung và chuyển động gốc của video.
Full-bandwidth Transformer cải thiện khả năng suy luận bằng cách truyền trạng thái ẩn từ lớp trên cùng trở lại đầu vào, giúp mô hình tận dụng được các tính toán chuyên sâu thay vì chỉ dựa vào token đã tạo.
Vì sao đáng đọc: Đây là một cải tiến kiến trúc quan trọng, giải quyết điểm nghẽn về luồng thông tin trong các mô hình Transformer hiện nay mà vẫn giữ được tính tương thích với hạ tầng cũ.
SCoPE Sightline-Coordinate Positional Encoding for Video Diffusion Transformers model: https://hug...
DịchSCoPE là phương pháp mã hóa vị trí tọa độ Sightline mới, giúp tối ưu hóa khả năng hiểu không gian và tính nhất quán cho các mô hình tạo video dựa trên kiến trúc Transformer.
iFAN giải quyết sự lệch pha giữa quá trình huấn luyện và suy luận trong các mô hình Mask Transformer bằng cách điều chỉnh thứ hạng xác suất và chưng cất tri thức giữa các lớp, giúp cải thiện độ chính xác của phân đoạn hình ảnh.