25/09

Thứ Sáu · 1 tin
AK@_akhaliq
Nghiên cứuĐiểm AI 20/100

Cùng sự kiệnNghiên cứu về khả năng khuếch tán của các biến tiềm ẩn chiều cao

On the Diffusibility of High-Dimensional Latents paper: https://huggingface.co/papers/2609.28473

DịchBài báo khoa học này đi sâu phân tích cơ chế và tính khả thi của việc áp dụng mô hình khuếch tán (diffusion) trên các không gian biến tiềm ẩn có số chiều lớn, mở ra hướng đi mới cho việc tối ưu hóa kiến trúc mô hình tạo sinh.

Cùng sự kiện, bài đại diện «Tối ưu hóa khả năng khuếch tán trong không gian tiềm ẩn cao chiều với x0-prediction»

23/09

Thứ Tư · 1 tin

22/09

Thứ Ba · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 45/100

Complex KDA: Tối ưu hóa khả năng biểu đạt của kiến trúc Kimi Delta Attention

Nghiên cứu giới thiệu Complex KDA (CKDA), kỹ thuật kết hợp biến đổi delta-rule với cơ chế cổng kênh để đạt được khả năng xoay 2D mà không cần tăng thứ hạng cập nhật, giúp nâng cao hiệu suất mô hình RNN.

21/09

Thứ Hai · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

MoME: Cơ chế nhúng bộ nhớ hỗn hợp giúp LLM hiểu ngữ cảnh tốt hơn

MoME thay thế các bảng nhúng tĩnh bằng cơ chế hỗn hợp nhiều khe cắm, cho phép mô hình truy xuất thông tin linh hoạt dựa trên ngữ cảnh thay vì chỉ dựa vào từ khóa, giúp cải thiện hiệu suất đáng kể cho các dòng LLM như Llama-3 hay Qwen.

17/09

Thứ Năm · 3 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Fathom: Tối ưu hóa tốc độ giải mã cho KV Cache dung lượng lớn thông qua kỹ thuật đọc chọn lọc

Fathom giới thiệu phương pháp đọc KV cache linh hoạt dựa trên ngân sách bit cho từng truy vấn, giúp tăng tốc độ giải mã lên 1,67 lần ở quy mô 1 triệu token mà vẫn duy trì độ chính xác cao hơn so với các kỹ thuật hiện có.

Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Hướng dẫnĐiểm AI 74/100

Giải mã DeepSeek-V4.1-Flash: Công nghệ nén KV Cache đột phá chỉ với 890 byte mỗi token

Bài viết phân tích kỹ thuật chuyên sâu về DeepSeek-V4.1-Flash, làm rõ cách thức CED và CSA2 tối ưu hóa bộ nhớ KV Cache, đồng thời đánh giá đây là bước nhảy vọt về kiến trúc tương đương thế hệ V5.

14/09

Thứ Hai · 2 tin
Elvis Saravia@omarsar0
NgànhĐiểm AI 43/100

Nghiên cứu của Meta: Mô hình cấp byte vượt mặt mô hình token khi tăng quy mô tính toán

Banger paper from Meta. This work shows that byte-level models start out behind token models and th…

DịchNghiên cứu từ Meta chỉ ra rằng dù ban đầu lép vế, các mô hình cấp byte sẽ vượt trội hơn mô hình token khi tăng tài nguyên tính toán, với dự báo hiệu suất dẫn trước tới 4% nhờ kỹ thuật chuyển đổi logit mới.

13/09

Chủ Nhật · 3 tin
SemiAnalysis@SemiAnalysis_
NgànhĐiểm AI 43/100

Khám phá các ràng buộc toán học và khả năng tổng quát hóa của cơ chế nhúng vị trí (Position Embedding)

Attention has no innate notion of time. Positional embeddings are how language models tell how far a…

DịchBài viết phân tích cách các mô hình ngôn ngữ sử dụng nhúng vị trí để hiểu khoảng cách giữa các token, đồng thời đặt câu hỏi liệu việc nới lỏng các ràng buộc toán học truyền thống có mở ra không gian hàm mới hiệu quả hơn hay không.

MarkTechPost
NgànhĐiểm AI 40/100

Mô hình ngôn ngữ ruồi giấm (FLM): Kết nối bản đồ não bộ vào LLM nhưng không mang lại hiệu quả vượt trội

Fly Language Model (FLM) tích hợp bản đồ kết nối thần kinh của ruồi giấm vào mô hình LiquidAI 1.2B. Kết quả thực nghiệm cho thấy việc bổ sung cấu trúc kết nối này không giúp cải thiện hiệu suất so với các mô hình đối chứng.

12/09

Thứ Bảy · 1 tin
Elvis Saravia@omarsar0
NgànhĐiểm AI 39/100

Looped Flows: Phương pháp huấn luyện mới tối ưu hóa suy luận cho mô hình tuần hoàn

Interesting paper to improve recurrent reasoning. Looped models are great because you get more reas…

DịchLooped Flows giới thiệu cách huấn luyện mô hình tuần hoàn thông qua mục tiêu khử nhiễu cục bộ, giúp các trạng thái ẩn liên kết chặt chẽ và khắc phục hạn chế về dòng chảy gradient. Phương pháp này cải thiện hiệu suất vượt trội trên hầu hết các bài kiểm tra suy luận so với các kiến trúc cũ.

10/09

Thứ Năm · 1 tin
Ma Dongxi NLP@dongxi_nlp
NgànhĐiểm AI 36/100

Cùng sự kiệnDeepSeek-V4.1-Flash: Đột phá tối ưu hóa nén KV Cache

DeepSeek-V4.1-Flash giới thiệu kiến trúc Causal Encoder-Decoder mới, cho phép tạo KV Cache toàn cục trực tiếp từ đầu ra của encoder. Cải tiến này giúp lược bỏ việc xử lý prompt qua toàn bộ các lớp decoder, từ đó tối ưu hóa đáng kể tốc độ tiền xử lý (prefill) cho mô hình.

Cùng sự kiện, tinh chọn hiển thị «DeepSeek ra mắt DeepSeek-V4.1-Flash: Cửa sổ 1M token, tối ưu bộ nhớ KV Cache cực đỉnh»

09/09

Thứ Tư · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnKalman Delta Networks: Mạng bộ nhớ liên kết có khả năng nhận thức độ bất định

Kalman Delta Networks (KDNs) cải tiến cơ chế attention tuyến tính bằng cách áp dụng bộ lọc Kalman để quản lý độ bất định trong bộ nhớ, giúp mô hình tối ưu hóa việc ghi nhớ thông tin dựa trên bằng chứng tích lũy thay vì chỉ dựa vào token hiện tại.


Vì sao đáng đọc: Đây là một bước tiến kỹ thuật quan trọng trong kiến trúc mô hình ngôn ngữ, giải quyết bài toán tối ưu hóa bộ nhớ dài hạn bằng phương pháp toán học xác suất, rất có giá trị cho giới nghiên cứu AI.

08/09

Thứ Ba · 1 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 85/100

Looped Transformer có thực sự mạnh hơn? Câu trả lời từ nghiên cứu của Thanh Hoa và ByteDance

Nghiên cứu SMELT từ Đại học Thanh Hoa và ByteDance giải mã hiệu năng của Looped Transformer bằng cách so sánh công bằng về chi phí tính toán, tham số và KV cache, khẳng định tiềm năng của việc tái sử dụng các lớp mạng thay vì chỉ tăng quy mô mô hình.

02/09

Thứ Tư · 3 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnSafin-1: Đưa tính an toàn vào cốt lõi mô hình thông qua cơ chế tiến hóa trạng thái bộ nhớ

Safin-1 giới thiệu kiến trúc MARCH giúp mô hình tự duy trì trạng thái an toàn nội tại thông qua việc định tuyến bộ nhớ và tiến hóa trạng thái, thay vì phụ thuộc vào các bộ lọc bên ngoài.


Vì sao đáng đọc: Đề xuất hướng tiếp cận mới đầy hứa hẹn về an toàn AI bằng cách tích hợp trực tiếp vào kiến trúc thay vì chỉ dùng hậu kiểm, rất quan trọng cho các tác vụ dài hạn.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 44/100

Nghiên cứu cơ chế phối hợp giữa hiểu và tạo trong mô hình đa phương thức nguyên bản

Nghiên cứu chỉ ra rằng việc tách biệt nhiệm vụ giúp tránh sự suy giảm hiệu năng khi mô hình đa phương thức vừa hiểu vừa tạo ảnh, đồng thời khẳng định mô hình end-to-end vượt trội hơn so với các hệ thống phân tách truyền thống.

01/09

Thứ Ba · 1 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 88/100

Tinh chọnGiải mã bí ẩn 'đỉnh' và 'nền' trong mô hình ngôn ngữ lớn lai: Cách Full Attention định hình lại tính toán

Nghiên cứu từ StartLux và các đại học danh tiếng đã khám phá cách các lớp Full Attention ảnh hưởng đến mô hình lai, xác định hai trạng thái kích hoạt đặc trưng là 'đỉnh trước chú ý' và 'nền giữa các đỉnh', giúp tối ưu hóa hiệu năng cho các kiến trúc LLM thế hệ mới.


Vì sao đáng đọc: Nghiên cứu chuyên sâu về kiến trúc mô hình lai (Hybrid Linear Attention) đang là xu hướng quan trọng để cân bằng hiệu suất và tốc độ, có giá trị cao cho giới kỹ thuật và nghiên cứu AI.

31/08

Thứ Hai · 1 tin

29/08

Thứ Bảy · 1 tin

25/08

Thứ Ba · 1 tin

21/08

Thứ Sáu · 1 tin

19/08

Thứ Tư · 2 tin
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Sản phẩmĐiểm AI 64/100

ModelMap: Công cụ trực quan hóa kiến trúc mô hình AI từ Hugging Face chỉ bằng một cú click

ModelMap cho phép bạn xem sơ đồ cấu trúc động của bất kỳ mô hình nào trên Hugging Face mà không cần tải xuống trọng số. Công cụ hỗ trợ các mô hình phổ biến như Qwen, DeepSeek và Kimi, giúp việc phân tích kiến trúc trở nên trực quan và nhanh chóng.

17/08

Thứ Hai · 1 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 47/100

Kiến trúc mô hình ảnh hưởng thế nào đến khả năng xử lý ngữ cảnh dài của LLM?

Some architecture choices that make transformers cheaper or more stable also make them harder to ext…

DịchNghiên cứu trên 26 mô hình 7B cho thấy các lựa chọn kiến trúc như QK-norm hay Sliding Window khi kết hợp có thể làm suy giảm nghiêm trọng khả năng xử lý ngữ cảnh dài, dù các bài kiểm tra ngắn hạn không thể hiện rõ điều này.

14/08

Thứ Sáu · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 51/100

Từ bằng chứng nguyên tử đến logic tổ hợp: Phương pháp suy luận cấu trúc cho các lựa chọn phức hợp

Khung làm việc mới giúp LLM giải quyết các câu hỏi logic phức tạp bằng cách phân tách lựa chọn thành các thành phần nguyên tử, sau đó sử dụng lập trình tuyến tính để tổng hợp kết quả. Phương pháp này cải thiện đáng kể độ chính xác trên các bộ dữ liệu logic khó.

Tổng 28 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (49 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Kiến trúc mô hình” | AIHOT.vn