Fireworks Research vừa giới thiệu Ember-1, mô hình được tối ưu hóa từ Kimi K3, giúp giảm 40% lượng token tiêu thụ mà vẫn duy trì chất lượng phản hồi tương đương.
JitMem trì hoãn việc xử lý bộ nhớ đến thời điểm truy xuất, cho phép hệ thống tổng hợp dữ liệu tinh gọn phù hợp với từng tác vụ cụ thể, giúp cải thiện đáng kể hiệu suất của các LLM Agent trên nhiều nền tảng thử nghiệm.
Đội ngũ LLM-Core của Xiaomi công bố HySparse2, kiến trúc chú ý thưa (sparse-attention) với cơ chế chia sẻ KV hai cấp, giúp tối ưu hóa hiệu suất cho các mô hình tác nhân MiMo-V3 bằng cách giảm đáng kể khối lượng tính toán khi xử lý ngữ cảnh dài.
Nice paper discussing context trimming for agents. This is a hot topic at the moment, so it might b…
DịchNghiên cứu chỉ ra rằng phương pháp cắt tỉa ngữ cảnh dựa trên giao thức giúp AI Agent duy trì hiệu suất vượt trội (96% thành công) trong các quy trình đa bước, đồng thời tiết kiệm 56% token so với các phương pháp truyền thống.
EM^2Mem là khung bộ nhớ mới giúp liên kết các bằng chứng đa phương thức vào các mốc sự kiện, từ đó cải thiện độ chính xác khi truy vấn video dài và giảm đáng kể chi phí tính toán.
DFlash 2 giúp tăng tốc mô hình Qwen3.8-27B trên MacBook M5 Max lên 70 tok/s, nhanh gấp 4,6 lần so với giải mã tự hồi quy thông thường mà vẫn đảm bảo độ chính xác tuyệt đối.
Nghiên cứu này đề xuất phương pháp đánh giá giá trị biên để cắt tỉa dữ liệu trong các tác nhân nghiên cứu AI, giúp giảm chi phí token và độ trễ mà vẫn đảm bảo chất lượng báo cáo cuối cùng.