24/09

Thứ Năm · 2 tin

23/09

Thứ Tư · 2 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

ScriptMoE: Bước tiến mới trong nhận diện văn bản đa ngôn ngữ với kiến trúc Mixture-of-Experts

Nghiên cứu giới thiệu ScriptMoE, mô hình nhận diện văn bản đa ngôn ngữ hiệu quả hơn các mô hình ngôn ngữ thị giác lớn (VLM) nhờ kiến trúc chuyên gia và bộ dữ liệu tổng hợp quy mô lớn TextMuSS-10M.

22/09

Thứ Ba · 2 tin
Nathan Lambert@natolambert
Quan điểmĐiểm AI 27/100

Tại sao môi trường RL mã nguồn mở chất lượng cao lại là 'chìa khóa vàng' cho AI?

Strong agree. There's way less of this than I would expect - partially due to the fact that making a…

DịchCác chuyên gia nhận định việc phát hành môi trường Reinforcement Learning (RL) chất lượng cao có tầm ảnh hưởng tương đương với việc chia sẻ dữ liệu tiền huấn luyện, đặc biệt trong kỷ nguyên RLVR mới.

Thomas Wolf (Hugging Face đồng sáng lập/CSO)@Thom_Wolf
Quan điểmĐiểm AI 41/100

Đồng sáng lập Hugging Face kêu gọi mở nguồn các môi trường RL chất lượng cao

releasing many high quality open-source RL environments is the most impactful thing anyone can do to…

DịchThomas Wolf cho rằng việc chia sẻ môi trường RL mã nguồn mở là chìa khóa thúc đẩy AI, tương đương với việc cung cấp dữ liệu huấn luyện chất lượng cao cho mô hình RLVR. Một nhóm nghiên cứu đã chứng minh hiệu quả khi đạt top 6 bảng xếp hạng chỉ trong 1 tuần nhờ phương pháp này.

21/09

Thứ Hai · 1 tin
Hugging Face: Blog
Nghiên cứuĐiểm AI 47/100

Multiverse: Ứng dụng vật lý lượng tử để tối ưu hóa việc cắt tỉa mô hình LLM

Multiverse giới thiệu phương pháp cắt tỉa khối LLM bằng cách chuyển đổi thành bài toán tối ưu hóa Ising, giúp chọn cấu hình nén tối ưu mà không cần chạy benchmark. Kết quả trên Llama-3.3-70B cho thấy hiệu suất vượt trội, tăng 23% điểm MMLU so với các phương pháp truyền thống.

19/09

Thứ Bảy · 1 tin

18/09

Thứ Sáu · 1 tin

17/09

Thứ Năm · 1 tin

16/09

Thứ Tư · 3 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Kết hợp các cơ chế học liên tục để ghi nhớ thông tin dài hạn trong mô hình ngôn ngữ

Nghiên cứu giới thiệu bài toán ghi nhớ dài hạn, nơi mô hình phải học 100 tác vụ liên tiếp mà không bị quên kiến thức cũ. Nhóm tác giả đề xuất kết hợp các cơ chế bổ trợ để tối ưu hóa việc lưu giữ thông tin qua nhiều lần cập nhật trọng số.

Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 60/100

Google Research ra mắt Stellar Colosseum: Khung đa tác nhân đột phá cho toán học chuyên sâu

Banger paper from Google on agent harnesses for long-horizon tasks. (bookmark it) Google Research …

DịchStellar Colosseum là khung đa tác nhân độc lập với mô hình, chuyên giải quyết các bài toán toán học và khoa học máy tính phức tạp bằng cách chia nhỏ vấn đề, song song hóa chiến lược chứng minh và phản biện.

11/09

Thứ Sáu · 2 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

TempCloze: Thử thách khả năng suy luận thời gian trong video cho các mô hình AI

TempCloze là bộ tiêu chuẩn đánh giá mới giúp kiểm tra khả năng hiểu trình tự thời gian của Video-LLM bằng cách yêu cầu mô hình chọn đoạn video bị thiếu ở giữa. Nghiên cứu chỉ ra rằng các mô hình hiện nay vẫn gặp khó khăn lớn trong việc nắm bắt sự liên kết và tiến trình của các sự kiện.

10/09

Thứ Năm · 1 tin
AK@_akhaliq
NgànhĐiểm AI 34/100

Marigold V2: Bước tiến mới trong ước tính độ sâu đơn ảnh bằng Diffusion Transformer

Marigold V2 Revisiting Diffusion Transformers for Monocular Depth Estimation paper: https://huggin...

DịchMarigold V2 tối ưu hóa kiến trúc Diffusion Transformer để nâng cao độ chính xác và hiệu quả trong việc ước tính độ sâu từ ảnh đơn, mở ra tiềm năng mới cho thị giác máy tính.

09/09

Thứ Tư · 4 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnKalman Delta Networks: Mạng bộ nhớ liên kết có khả năng nhận thức độ bất định

Kalman Delta Networks (KDNs) cải tiến cơ chế attention tuyến tính bằng cách áp dụng bộ lọc Kalman để quản lý độ bất định trong bộ nhớ, giúp mô hình tối ưu hóa việc ghi nhớ thông tin dựa trên bằng chứng tích lũy thay vì chỉ dựa vào token hiện tại.


Vì sao đáng đọc: Đây là một bước tiến kỹ thuật quan trọng trong kiến trúc mô hình ngôn ngữ, giải quyết bài toán tối ưu hóa bộ nhớ dài hạn bằng phương pháp toán học xác suất, rất có giá trị cho giới nghiên cứu AI.
Rohan Paul@rohanpaul_ai
NgànhĐiểm AI 43/100

Nghiên cứu mới từ Tencent: Môi trường tăng dần độ khó giúp AI học hiệu quả hơn so với đồng tiến hóa

New Tencent paper shows, if an agent keeps improving, its training tasks cannot stay still: continuo…

DịchTencent chứng minh rằng các tác vụ huấn luyện AI cần tăng dần độ khó thay vì giữ nguyên, giúp cải thiện điểm số trên Terminal-Bench 2.1. Khi môi trường trở nên quá dễ, AI sẽ không còn nhận được tín hiệu học tăng cường (RL) hiệu quả để tiếp tục tiến bộ.

Elvis Saravia@omarsar0
NgànhĐiểm AI 25/100

Harness Engineering trở thành kỹ năng 'hot': Tổng hợp danh sách các bài nghiên cứu tiêu biểu

Harness engineering is a top skill right now. I saw a great overview of harness engineering in a re…

DịchHarness Engineering đang trở thành kỹ năng thiết yếu trong lĩnh vực AI. Bài viết này tổng hợp danh sách các tài liệu nghiên cứu chất lượng cao từ YC Paper Club, giúp người đọc nắm bắt nền tảng kỹ thuật quan trọng này.

JiQiZhiXin
Mô hìnhĐiểm AI 88/100

Tinh chọnGiải mã 'trí tuệ không gian' trong GPT-6 Astra: Bí ẩn đằng sau khả năng dựng mô hình 3D

Nghiên cứu mới về S-Space tiết lộ cách các mô hình đa phương thức xây dựng 'bản đồ không gian' nội tại để hiểu vị trí và tương tác vật thể, dù vẫn còn hạn chế trong việc xoay chuyển góc nhìn.


Vì sao đáng đọc: Bài viết đi sâu vào cơ chế cốt lõi của các mô hình AI thế hệ mới, giải thích hiện tượng 'trí tuệ không gian' bằng góc nhìn kỹ thuật nhưng vẫn dễ hiểu, rất giá trị với người làm AI.

07/09

Thứ Hai · 1 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 64/100

Microsoft đề xuất phương pháp chưng cất kỹ năng suy luận: Giúp mô hình nhỏ đạt hiệu suất vượt trội

What if you could pay the reasoning cost once, then reuse what the model learned across future tasks…

DịchNghiên cứu mới từ Microsoft cho phép chuyển đổi chi phí suy luận đắt đỏ thành các 'kỹ năng' dạng Markdown. Bằng cách tổng hợp các mẫu lỗi từ lịch sử, mô hình nhỏ có thể khôi phục 55-100% khả năng suy luận mà không cần tốn thêm token.

05/09

Thứ Bảy · 1 tin

03/09

Thứ Năm · 2 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnApple đột phá với IVT: Tư duy thị giác nội tại giúp tăng tốc suy luận video gấp 5 lần

Apple giới thiệu khung huấn luyện IVT, cho phép mô hình học cách dự đoán tương lai thông qua biểu diễn ẩn thay vì phải tạo ảnh trực tiếp, giúp tăng tốc độ suy luận video gấp 5 lần mà vẫn giữ được độ chính xác.


Vì sao đáng đọc: Nghiên cứu quan trọng từ Apple giải quyết bài toán tối ưu hóa suy luận video thời gian thực, có tính ứng dụng cao trong robot và trợ lý ảo.

02/09

Thứ Tư · 1 tin
Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 45/100

Meta ra mắt mô hình AI dự đoán tiềm năng nghiên cứu, tối ưu hóa tài nguyên thử nghiệm

Super interesting paper from Meta. Long-horizon research agents are coming. But one common problem…

DịchMeta giới thiệu mô hình AI Research Preference Models giúp các tác nhân AI đánh giá và chọn lọc các hướng thử nghiệm hứa hẹn nhất trước khi thực thi, giải quyết bài toán hạn chế về GPU và khả năng tư duy sáng tạo trong nghiên cứu.

01/09

Thứ Ba · 2 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

DIEM: Tối ưu hóa chọn lọc dữ liệu động trong tinh chỉnh mô hình bằng học tăng cường

DIEM là khung làm việc tự động giúp tối ưu hóa việc chọn lọc dữ liệu trong quá trình tinh chỉnh mô hình bằng học tăng cường (RFT), bằng cách đánh giá đóng góp của từng mẫu dữ liệu theo thời gian thực để cải thiện hiệu suất học tập.

31/08

Thứ Hai · 2 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 45/100

Nghiên cứu từ Amazon: Tối ưu hóa KV Cache giúp mô hình AI không bị 'mất trí nhớ' khi xử lý văn bản dài

New Amazon paper shows KV-cache policy is not just an inference optimization; but it can change the …

DịchNghiên cứu mới của Amazon chỉ ra rằng việc đồng bộ hóa chiến lược KV Cache trong quá trình tinh chỉnh (fine-tuning) giúp mô hình tránh lỗi mất ngữ cảnh khi xử lý văn bản dài, thay vì chỉ tập trung vào tối ưu suy luận như trước đây.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

RCCA: Tối ưu hóa học tăng cường cho lập trình web thông qua phân bổ tín hiệu theo tiêu chí

RCCA là khung học tăng cường mới giúp cải thiện khả năng tạo ứng dụng web bằng cách chia nhỏ phản hồi chức năng thành các tín hiệu tối ưu hóa cục bộ, thay vì đánh giá toàn bộ mã nguồn như các phương pháp truyền thống.

25/08

Thứ Ba · 2 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 85/100

V-RAE: Bước tiến mới trong việc tối ưu hóa không gian tiềm ẩn cho mô hình tạo video

Các nhà nghiên cứu từ NUS và Oxford giới thiệu V-RAE, phương pháp sử dụng các mô hình thị giác tiền huấn luyện để xây dựng không gian tiềm ẩn giàu ngữ nghĩa, giúp cải thiện hiệu quả tạo và dự đoán video thay vì chỉ tập trung vào tái tạo pixel truyền thống.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Vượt xa bắt chước: Tối ưu hóa chưng cất mô hình ngôn ngữ dựa trên tiến trình suy luận

Nghiên cứu đề xuất phương pháp R2-OPD giúp lọc phản hồi từ giáo viên trong quá trình chưng cất mô hình, đảm bảo việc học tập tập trung vào tiến trình suy luận thực tế thay vì chỉ bắt chước đầu ra của giáo viên.

22/08

Thứ Bảy · 1 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 30/100

Pandora's Router: Giải pháp tối ưu chi phí khi điều hướng truy vấn cho mô hình AI

Google DeepMind's new routing idea is trying to solve a great practical question. Routing is suppos…

DịchGoogle DeepMind giới thiệu Pandora's Router, phương pháp điều hướng thông minh giúp giảm thiểu chi phí bằng cách chỉ kích hoạt các mô hình mạnh khi cần thiết. Hệ thống này tối ưu hóa đáng kể hiệu suất và chi phí vận hành trên các tác vụ như MATH và RAG.

21/08

Thứ Sáu · 2 tin
DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 41/100

DeepMind giới thiệu 'Pandora's Router': Tối ưu hóa định tuyến mô hình AI thông minh

Banger paper from Google DeepMind. It's on the very hot topic of model routing. Routers assume the…

DịchDeepMind đề xuất phương pháp định tuyến mô hình mới dựa trên bài toán 'Chiếc hộp Pandora', giúp tối ưu hóa việc chọn chuyên gia xử lý mà không cần tốn kém chi phí đánh giá toàn diện, đạt hiệu suất cao với chi phí thấp.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 32/100

Nén ngữ cảnh gấp 5 lần trên GPT-5.5: Hiệu quả không đổi nhưng cách thức thay đổi

5× context compression did surprisingly little to GPT-5.5's final task result. The compressed agent…

DịchNghiên cứu cho thấy việc nén ngữ cảnh 5 lần không làm giảm đáng kể kết quả tác vụ của GPT-5.5. Thay vì mất đi khả năng xử lý, mô hình chuyển sang dựa vào cơ chế truy xuất dữ liệu để bù đắp thông tin bị lược bỏ.

16/08

Chủ Nhật · 1 tin
Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 42/100

Nghiên cứu của IBM: Điểm số benchmark AI phụ thuộc nhiều vào cách đặt câu hỏi hơn là năng lực thực tế

Interesting new research from IBM. If you pick models from benchmark deltas, some of that delta bel…

DịchNghiên cứu BenchDrift từ IBM chỉ ra rằng các mô hình AI mạnh thường nhạy cảm với cách diễn đạt hơn cả mô hình yếu, khiến thứ hạng trên các bảng xếp hạng benchmark không phản ánh chính xác năng lực thực sự.

12/08

Thứ Tư · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

TSDS-Toolbox: Bộ công cụ thống nhất để đo lường độ tương đồng giữa các tập dữ liệu chuỗi thời gian

TSDS-Toolbox là khung làm việc toàn diện giúp chuẩn hóa việc so sánh, đánh giá và mở rộng các phương pháp đo độ tương đồng trong dữ liệu chuỗi thời gian, hỗ trợ đắc lực cho việc lựa chọn tập dữ liệu nguồn khi tinh chỉnh các mô hình AI.

Tổng 36 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (51 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “AI Research” | AIHOT.vn