SpeakerMem-R1 giải quyết các hạn chế của LLM trong việc ghi nhớ hội thoại đa bên bằng cách sử dụng cấu trúc bộ nhớ kênh đôi, giúp phân tách thông tin theo từng cá nhân và nhóm để tái tạo trạng thái hội thoại chính xác hơn.
Functionalizer là khung tiền xử lý mới giúp bảo toàn các biến thể từ vựng (như viết hoa, dấu câu) thông qua mã hóa opcode, giúp giảm kích thước từ vựng mà vẫn giữ nguyên độ chính xác khi giải mã.
Nghiên cứu giới thiệu HEAL, một kỹ thuật phân tách và hiệu chỉnh thông tin ở cấp độ đầu chú ý (attention head) để ngăn chặn ảo giác trong MLLM bằng cách can thiệp vào sự lệch lạc phân phối thông tin.
Srijika là giải pháp tự động tạo phông chữ OpenType cho 9 loại chữ viết Brahmic bằng cách tái tạo kiểu dáng từ các phông mẫu có sẵn, đảm bảo tính nhất quán về cấu trúc phức tạp mà không cần thiết kế lại từ đầu.
Nghiên cứu giới thiệu SpectralShift, phương pháp tối ưu hóa Gated DeltaNet bằng cách điều chỉnh các đặc tính phổ, giúp mô hình xử lý ngữ cảnh dài hiệu quả hơn mà không cần huấn luyện lại từ đầu.
Nghiên cứu giới thiệu phương pháp dùng các 'register tokens' để lưu trữ trạng thái suy luận, giúp mô hình ngôn ngữ khuếch tán duy trì logic mạch lạc khi xử lý văn bản dài mà không cần giữ toàn bộ ngữ cảnh cũ.
Nghiên cứu đề xuất phương pháp huấn luyện mô hình TTS nhỏ gọn bằng cách sử dụng mô hình sao chép giọng nói lớn làm nguồn dữ liệu tổng hợp, giúp tối ưu hóa hiệu năng cho các ngôn ngữ ít tài nguyên như tiếng Thái.
PARSER tách biệt quá trình đọc và suy luận bằng cách sử dụng các sub-agent đọc song song, giúp AI Agent xử lý tài liệu dài hiệu quả hơn, giảm độ trễ và tránh phụ thuộc vào vị trí thông tin.
Vì sao đáng đọc: Giải pháp kỹ thuật sáng tạo giúp tối ưu hóa hiệu suất cho các tác vụ truy vấn phức tạp trên tài liệu dài, có tính ứng dụng cao trong phát triển AI Agent.
10/09
Thứ Năm · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Brain2Semantics2Text tái tạo văn bản từ tín hiệu não MEG bằng cách ánh xạ trực tiếp vào không gian ngữ nghĩa thay vì từng từ, giúp vượt qua rào cản nhiễu tín hiệu và cải thiện độ chính xác khi giải mã câu.
Nghiên cứu giới thiệu phương pháp Self-Listening, cho phép mô hình AI phản hồi chính xác hơn khi bị ngắt lời bằng cách tự lắng nghe lại những gì mình đã phát ra, thay vì chỉ dựa trên dữ liệu văn bản thuần túy.
Nghiên cứu giới thiệu chỉ số OVMI nhằm giải quyết sự thiếu đồng nhất trong đánh giá hiệu suất của các hệ thống BCI, giúp đo lường chính xác khả năng truyền tải thông tin ngôn ngữ của người dùng.
NeoMME là kiến trúc bộ mã hóa Transformer hai chiều nhỏ gọn, hỗ trợ đa ngôn ngữ và hình ảnh, giúp tối ưu hóa hiệu suất cho các tác vụ truy xuất tài liệu mà không cần dùng đến các mô hình ngôn ngữ tạo sinh cồng kềnh.
Tác giả giải thích cách tokenizer hoạt động dựa trên tần suất xuất hiện trong dữ liệu, minh họa bằng việc cụm 3 chữ '' (Mưa sao băng) được mã hóa thành duy nhất 1 token, làm nổi bật sự khác biệt giữa tư duy ngôn ngữ của con người và AI.
Hệ thống mô-đun mới giúp chuyển đổi các bản quét báo cũ thành dữ liệu có cấu trúc, cho phép trích xuất văn bản, phân loại nội dung và nhận diện thực thể ngay trên phần cứng máy trạm thông thường.
Nghiên cứu chỉ ra rằng việc sử dụng đồ thị thực thể và tái viết truy vấn trong RAG đa chặng làm khuếch đại sai sót từ ASR, khiến độ chính xác giảm mạnh hơn so với tìm kiếm thuần túy khi dữ liệu đầu vào bị nhiễu.
Apple giới thiệu phương pháp huấn luyện bán giám sát mới, sử dụng dữ liệu chưa gán nhãn để tối ưu hóa khả năng nhận diện giọng nói pha trộn Trung - Anh thông qua quy trình tinh chỉnh lặp lại.
Nghiên cứu từ ĐH Penn State chỉ ra các hệ thống AI nén ngữ cảnh khiến tỷ lệ tuân thủ chỉ dẫn giảm mạnh. Giải pháp mới dựa trên Qwen3.5-9B giúp khôi phục tỷ lệ giữ lại chỉ dẫn lên hơn 90% mà không cần huấn luyện lại.
Maglev giới thiệu kiến trúc Transformer hồi quy mới sử dụng bộ nhớ cố định, kết hợp ưu điểm của cơ chế chú ý cửa sổ trượt và khả năng huấn luyện song song, giúp cải thiện hiệu suất dự đoán token so với các mô hình truyền thống.
Nghiên cứu đề xuất quy trình kết hợp mô hình ngôn ngữ lớn và dịch máy thần kinh để xử lý chính xác các từ chỉ giới tính, giúp giảm thiểu định kiến giới trong bản dịch tiếng Romania.
Nghiên cứu thực nghiệm cho thấy tinh chỉnh chỉ dẫn (instruction tuning) làm thay đổi độ tin cậy của mô hình nhưng không cải thiện đáng kể độ chính xác, đồng thời gây ra những tác động không đồng nhất lên sự đa dạng từ vựng và khả năng suy luận.