23/09

Thứ Tư · 1 tin
Perplexity@perplexity_ai
Nghiên cứuĐiểm AI 32/100

Perplexity ứng dụng kỹ thuật tự chưng cất để giảm tỷ lệ lỗi gọi công cụ

New research: We post-trained a Computer model to learn from its own errors using hint-guided self-d…

DịchPerplexity giới thiệu phương pháp tự chưng cất (self-distillation) giúp mô hình máy tính tự học từ sai lầm, qua đó giảm 21,2% tỷ lệ lỗi khi thực hiện các lệnh gọi công cụ trong thực tế.

18/09

Thứ Sáu · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 39/100

Giải mã vai trò của thông tin đặc quyền trong tự chưng cất On-Policy: Nghiên cứu thực nghiệm với AMPLE-Math

Nghiên cứu giới thiệu bộ dữ liệu AMPLE-Math với hơn 5.000 bài toán, giúp phân tách và đánh giá chính xác đóng góp của thông tin đặc quyền trong quá trình tự chưng cất (OPSD) cho mô hình ngôn ngữ.

08/09

Thứ Ba · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Một triệu chứng, ba đòn bẩy: Đánh giá chuyên sâu về kỹ thuật tự chưng cất On-Policy

Nghiên cứu phân tích kỹ thuật tự chưng cất (OPSD) giúp mô hình tự học từ dữ liệu có sẵn mà không cần mô hình giáo viên lớn, đồng thời cảnh báo về rủi ro suy giảm khả năng suy luận do thiên kiến trong quá trình huấn luyện.

07/09

Thứ Hai · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnRISE: Cải thiện mô hình ngôn ngữ thông qua chưng cất chính sách tự suy diễn

RISE là phương pháp mới giúp mô hình tự tạo ra 'giáo viên' từ quá trình huấn luyện RLVR của chính nó. Bằng cách ngoại suy các thay đổi tham số, phương pháp này chuyển đổi các phản hồi thưa thớt thành mục tiêu học tập dày đặc ở cấp độ token mà không cần mô hình bên ngoài.


Vì sao đáng đọc: Đây là một bước tiến kỹ thuật quan trọng trong việc tối ưu hóa hậu huấn luyện (post-training) cho LLM, giải quyết hiệu quả bài toán phụ thuộc vào mô hình giáo viên bên ngoài.

31/08

Thứ Hai · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

DART-SD: Tối ưu hóa tác nhân AI gọi công cụ đa bước qua cấu trúc đồ thị kim cương

DART-SD là khung làm việc mới giúp tác nhân AI học cách gọi công cụ hiệu quả hơn bằng cách thay thế việc bắt chước quỹ đạo tuyến tính bằng phương pháp hiệu chỉnh dựa trên cấu trúc đồ thị, giúp tăng tính linh hoạt và đa dạng trong giải quyết vấn đề.

Tổng 5 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (20 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Tự chưng cất” | AIHOT.vn