New research: We post-trained a Computer model to learn from its own errors using hint-guided self-d…
DịchPerplexity giới thiệu phương pháp tự chưng cất (self-distillation) giúp mô hình máy tính tự học từ sai lầm, qua đó giảm 21,2% tỷ lệ lỗi khi thực hiện các lệnh gọi công cụ trong thực tế.
Nghiên cứu giới thiệu bộ dữ liệu AMPLE-Math với hơn 5.000 bài toán, giúp phân tách và đánh giá chính xác đóng góp của thông tin đặc quyền trong quá trình tự chưng cất (OPSD) cho mô hình ngôn ngữ.
Nghiên cứu phân tích kỹ thuật tự chưng cất (OPSD) giúp mô hình tự học từ dữ liệu có sẵn mà không cần mô hình giáo viên lớn, đồng thời cảnh báo về rủi ro suy giảm khả năng suy luận do thiên kiến trong quá trình huấn luyện.
RISE là phương pháp mới giúp mô hình tự tạo ra 'giáo viên' từ quá trình huấn luyện RLVR của chính nó. Bằng cách ngoại suy các thay đổi tham số, phương pháp này chuyển đổi các phản hồi thưa thớt thành mục tiêu học tập dày đặc ở cấp độ token mà không cần mô hình bên ngoài.
Vì sao đáng đọc: Đây là một bước tiến kỹ thuật quan trọng trong việc tối ưu hóa hậu huấn luyện (post-training) cho LLM, giải quyết hiệu quả bài toán phụ thuộc vào mô hình giáo viên bên ngoài.
DART-SD là khung làm việc mới giúp tác nhân AI học cách gọi công cụ hiệu quả hơn bằng cách thay thế việc bắt chước quỹ đạo tuyến tính bằng phương pháp hiệu chỉnh dựa trên cấu trúc đồ thị, giúp tăng tính linh hoạt và đa dạng trong giải quyết vấn đề.