Tối ưu hóa bộ nhớ khi huấn luyện mô hình MoE với ngữ cảnh dài
Nghiên cứu giới thiệu phương pháp mới giúp kiểm soát bốn điểm nghẽn bộ nhớ chính khi huấn luyện mô hình MoE, đảm bảo hiệu suất ổn định ngay cả với ngữ cảnh cực dài và quy mô lớn.
Nghiên cứu giới thiệu phương pháp mới giúp kiểm soát bốn điểm nghẽn bộ nhớ chính khi huấn luyện mô hình MoE, đảm bảo hiệu suất ổn định ngay cả với ngữ cảnh cực dài và quy mô lớn.
Nghiên cứu giới thiệu SpectralShift, phương pháp tối ưu hóa Gated DeltaNet bằng cách điều chỉnh các đặc tính phổ, giúp mô hình xử lý ngữ cảnh dài hiệu quả hơn mà không cần huấn luyện lại từ đầu.
Elvis Saravia@omarsar0This is a brilliant paper. It's of the cleanest long-context agent designs I have seen in the past …
DịchPARSER tách biệt việc đọc và suy luận bằng cách sử dụng các tác tử phụ xử lý song song từng phần dữ liệu, trong khi tác tử chính tổng hợp thông tin và đặt câu hỏi chuyên sâu, giúp tăng hiệu suất cho các mô hình AI ngữ cảnh dài.

Hongming@hongming731Bản tin tổng hợp 10 nội dung AI nổi bật: Alibaba chia sẻ cách triển khai AI Kiến trúc sư vào hệ thống phân tán, Anthropic phân tích tác động của AI đến việc làm và kỹ thuật RLM giúp tối ưu hóa ngữ cảnh dài trong lập trình.
Cùng sự kiện, bài đại diện «25 nhà toán học đạt giải Fields gửi thư ngỏ, căng thẳng giữa OpenAI và giới học thuật leo thang»Nghiên cứu giới thiệu hệ thống mới giúp tăng tốc tạo rollout trong huấn luyện RL bằng cách cải tiến speculative decoding, giải quyết các rào cản về branch attention và pipeline-parallelism khi xử lý ngữ cảnh dài.
Rohan Paul@rohanpaul_aiFor hard long-context tasks, the paper suggests a simple fix: run the model again with its previous …
DịchPhương pháp mới sử dụng dấu vết suy luận làm trạng thái điều kiện, giúp mô hình tập trung vào các điểm trọng yếu trong ngữ cảnh dài, giải quyết triệt để tình trạng bỏ lỡ thông tin quan trọng. Kết quả thử nghiệm cho thấy hiệu suất vượt trội trong 26/27 bài kiểm tra.

DAIR.AI@dair_aiGreat tips on working with reasoning models. Normally you would append what the model figured out a…
DịchNghiên cứu mới đề xuất đặt các bước suy luận trước khối ngữ cảnh dài thay vì để ở cuối, giúp mô hình tận dụng thông tin dẫn dắt để xử lý tài liệu hiệu quả hơn, cải thiện đáng kể độ chính xác.

FlashPrefill V2 hiện thực hóa cơ chế chú ý thưa (sparse attention) cho các dịch vụ LLM ngữ cảnh dài, giúp tăng tốc đáng kể thông qua kỹ thuật giảm sai số và tối ưu hóa phần cứng tương đương FlashAttention-3/4.
SimpleOPD giải quyết các thách thức khi chuyển giao khả năng suy luận từ mô hình ngữ cảnh dài sang mô hình ngữ cảnh ngắn, thông qua việc đồng bộ hóa không gian văn bản và tối ưu hóa quá trình huấn luyện để tránh lỗi độ dài và mất ổn định.
Rohan Paul@rohanpaul_aiSome architecture choices that make transformers cheaper or more stable also make them harder to ext…
DịchNghiên cứu trên 26 mô hình 7B cho thấy các lựa chọn kiến trúc như QK-norm hay Sliding Window khi kết hợp có thể làm suy giảm nghiêm trọng khả năng xử lý ngữ cảnh dài, dù các bài kiểm tra ngắn hạn không thể hiện rõ điều này.
