31/08

Thứ Hai · 1 tin

27/08

Thứ Năm · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Gated Recurrent Transformer: Tối ưu hóa bộ nhớ và hiệu suất cho mô hình ngôn ngữ

Gated Recurrent Transformer giải quyết bài toán cân bằng giữa khả năng biểu đạt và bộ nhớ bằng cách sử dụng các khối lặp lại có kiểm soát, cho phép mô hình chuyên biệt hóa dữ liệu đầu vào mà không cần tăng số lượng tham số đáng kể.

25/08

Thứ Ba · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

WorldToken: Mô hình hóa trình tự ưu tiên thời gian cho học bắt chước ở robot

WorldToken tối ưu hóa việc học của robot bằng cách hợp nhất dữ liệu đa phương thức thành một 'world token' duy nhất, giúp mô hình Transformer xử lý trình tự hiệu quả hơn. Phương pháp này đạt tỷ lệ thành công ấn tượng 59,45% trên 23 tác vụ RoboCasa phức tạp.

24/08

Thứ Hai · 2 tin

22/08

Thứ Bảy · 1 tin

21/08

Thứ Sáu · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 52/100

NAPE: Bước tiến mới trong học tự giám sát cho âm thanh với dự đoán nhúng

NAPE là khung học tự giám sát tối giản sử dụng Transformer nhân quả để dự đoán các đoạn âm thanh tiếp theo mà không cần bộ giải mã phức tạp. Phương pháp này đạt hiệu suất vượt trội trên nhiều tác vụ âm thanh và giọng nói, đồng thời có khả năng mở rộng quy mô ấn tượng.

20/08

Thứ Năm · 1 tin
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Sản phẩmĐiểm AI 52/100

Show HN: Tôi đã huấn luyện Transformer 125 triệu tham số để tự động hoàn thiện piano trên thiết bị

Một nhà phát triển đã tạo ra mô hình Transformer 125M tham số, cho phép iPhone 15 tự động gợi ý nốt nhạc piano theo thời gian thực. Dự án tối ưu hóa dữ liệu MIDI và áp dụng kỹ thuật DPO để đạt hiệu suất ấn tượng, hiện đã ra mắt ứng dụng RollTab miễn phí.

19/08

Thứ Tư · 1 tin
SemiAnalysis@SemiAnalysis_
NgànhĐiểm AI 66/100

Dàn tác giả Transformer rời bỏ Google: Dấu chấm hết cho kỷ nguyên dẫn đầu AI?

Every co-author of "Attention Is All You Need" has now left Google. Jeff Dean and Sanjay Ghemawat ar…

DịchToàn bộ nhóm tác giả bài báo "Attention Is All You Need" đã rời Google. Sự kiện này cho thấy Google đang chuyển dịch trọng tâm từ phát triển mô hình AI tiên phong sang khai thác hạ tầng TPU và dịch vụ đám mây để tối ưu hóa lợi nhuận.

18/08

Thứ Ba · 2 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 27/100

Hiện tượng kích hoạt cực đại trong LLM lai: Điểm nóng trước lớp Attention và sự ổn định giữa các tầng

Some newer efficient LLMs (using "hybrid Transformer") are cutting back on expensive attention layer…

DịchCác mô hình LLM kiến trúc lai sử dụng lớp tuần hoàn giá rẻ thay thế phần lớn lớp Attention, nhưng các lớp Attention còn lại đóng vai trò quyết định. Nghiên cứu chỉ ra sự xuất hiện của các giá trị nội tại cực đại trước các lớp này, ảnh hưởng trực tiếp đến hiệu suất và cấu trúc mô hình.

Tomer Tunguz Blog (phân tích VC)
Hướng dẫnĐiểm AI 48/100

Khi AI tự học trong lúc chạy: Công nghệ Test-time Training thay đổi cuộc chơi về bộ nhớ và chi phí

Thay vì đóng băng trọng số sau khi huấn luyện, Test-time Training cho phép mô hình cập nhật liên tục khi sử dụng, giúp tăng tốc độ suy luận gấp 2.7 lần và mở rộng ngữ cảnh hiệu quả mà không cần huấn luyện lại.

16/08

Chủ Nhật · 1 tin

15/08

Thứ Bảy · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Maglev: Kiến trúc Transformer hồi quy với bộ nhớ cố định giúp tối ưu hóa xử lý chuỗi dài

Maglev giới thiệu kiến trúc Transformer hồi quy mới sử dụng bộ nhớ cố định, kết hợp ưu điểm của cơ chế chú ý cửa sổ trượt và khả năng huấn luyện song song, giúp cải thiện hiệu suất dự đoán token so với các mô hình truyền thống.

14/08

Thứ Sáu · 2 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 92/100

Tinh chọnFull-bandwidth Transformer: Đột phá mới trong kiến trúc mô hình ngôn ngữ

Full-bandwidth Transformer cải thiện khả năng suy luận bằng cách truyền trạng thái ẩn từ lớp trên cùng trở lại đầu vào, giúp mô hình tận dụng được các tính toán chuyên sâu thay vì chỉ dựa vào token đã tạo.


Vì sao đáng đọc: Đây là một cải tiến kiến trúc quan trọng, giải quyết điểm nghẽn về luồng thông tin trong các mô hình Transformer hiện nay mà vẫn giữ được tính tương thích với hạ tầng cũ.

13/08

Thứ Năm · 1 tin
AK@_akhaliq
Nghiên cứuĐiểm AI 30/100

Tencent ARC giới thiệu SCoPE: Mã hóa vị trí Sightline mới cho mô hình Video Diffusion Transformer

SCoPE Sightline-Coordinate Positional Encoding for Video Diffusion Transformers model: https://hug...

DịchSCoPE là phương pháp mã hóa vị trí tọa độ Sightline mới, giúp tối ưu hóa khả năng hiểu không gian và tính nhất quán cho các mô hình tạo video dựa trên kiến trúc Transformer.

12/08

Thứ Tư · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

iFAN: Tối ưu hóa học máy dựa trên suy luận cho mô hình Mask Transformer

iFAN giải quyết sự lệch pha giữa quá trình huấn luyện và suy luận trong các mô hình Mask Transformer bằng cách điều chỉnh thứ hạng xác suất và chưng cất tri thức giữa các lớp, giúp cải thiện độ chính xác của phân đoạn hình ảnh.

Tổng 17 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (35 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Transformer” — Trang 2 | AIHOT.vn