The Decoder: AI News
Điểm AI 44/100

Nghiên cứu

Google ra mắt WikiSkill: Giúp AI tự học từ sai lầm để nâng cao hiệu suất

(giờ Việt Nam)

Tóm tắt AI

Google Research giới thiệu khung WikiSkill, cho phép AI lưu trữ kinh nghiệm thành các kỹ năng có thể tái sử dụng. Công nghệ này giúp các mô hình như Gemini và Qwen cải thiện đáng kể hiệu suất, cho phép mô hình nhỏ đạt kết quả tiệm cận mô hình lớn.

Chính văn · Bản dịch AI

Google's WikiSkill gives AI agents a persistent memory of past mistakes to sharpen future performance

Vì vậy, tác nhân (agent), hay còn gọi là mô hình, không thực sự học theo nghĩa liên tục, đây vẫn là một vấn đề chưa có lời giải. Tuy nhiên, nó tự viết ra các hướng dẫn tốt hơn cho chính mình sau mỗi lần chạy và có thể truy xuất chúng vào lần tiếp theo. Cách này không tinh tế và có lẽ dễ xảy ra lỗi hơn so với việc học thực sự, nhưng nghiên cứu cho thấy đây là một giải pháp thay thế hiệu quả.

Công trình này dựa trên quan điểm của Andrej Karpathy về ý tưởng "LLM Wiki", lập luận về việc tổng hợp kinh nghiệm thành kiến thức tích lũy, bền vững. WikiSkill áp dụng tư duy đó vào việc phát triển kỹ năng tự động cho các tác nhân AI.

Ba tầng phân tách kinh nghiệm, kiến thức và hành động

WikiSkill tổ chức không gian làm việc của một tác nhân AI thành ba tầng. "Raw Layer" (Tầng thô) lưu trữ các dấu vết thực thi hoàn chỉnh, từ các lệnh gọi công cụ cho đến kết quả. Dữ liệu này không thể thay đổi và đóng vai trò là nguyên liệu thô.

Bên trên là "Wiki Layer" (Tầng Wiki), nơi dữ liệu thô được chắt lọc thành những thông tin chi tiết có cấu trúc như các mô hình thất bại đã được ghi lại và các chiến lược thành công. Theo các nhà nghiên cứu, tầng kiến thức này không bao giờ bị thiết lập lại mà chỉ phát triển thêm sau mỗi lần lặp.

Tầng cao nhất, "Skill Layer" (Tầng kỹ năng), chứa các hướng dẫn quy trình chủ động mà tác nhân tuân theo khi thực hiện nhiệm vụ. Không giống như wiki, các kỹ năng có thể được hoàn tác (roll back) nếu một bản cập nhật làm giảm hiệu suất.

Đầu tiên, một tác nhân suy luận (inference agent) thực hiện các nhiệm vụ bằng cách sử dụng các kỹ năng hiện tại và tạo ra các dấu vết thực thi. Sau đó, một "Wiki Maintainer" (Người duy trì Wiki) sẽ phân tích các dấu vết đó, phát hiện các mô hình thất bại và chiến lược thành công, rồi viết các kết quả tìm được vào wiki.

Một "Skill Proposer" (Người đề xuất kỹ năng) sử dụng wiki đã cập nhật và dữ liệu thực thi để gợi ý các thay đổi kỹ năng có mục tiêu. Cuối cùng, một cơ chế kiểm soát (gating mechanism) sẽ thử nghiệm thay đổi được đề xuất trên một tập hợp xác thực riêng biệt để xác nhận xem nó có thực sự hữu ích hay không. Nếu không, kỹ năng đó sẽ bị hoàn tác, nhưng wiki vẫn được giữ nguyên. Ngay cả những đề xuất thất bại cũng không bị mất đi vì wiki ghi lại những gì đã thử nghiệm và lý do tại sao nó thất bại, nhờ đó Skill Proposer có thể xây dựng dựa trên kiến thức đó trong các lần lặp sau.

Các mô hình lớn hơn đạt được nhiều lợi ích hơn, nhưng các mô hình nhỏ hơn đang thu hẹp khoảng cách

Các nhà nghiên cứu đã thử nghiệm WikiSkill trên năm tiêu chuẩn đánh giá bao gồm suy luận toán học, tìm kiếm web, thao tác bảng tính, hỏi đáp tài liệu và các tác vụ tương tác trong môi trường ảo. Các mô hình họ sử dụng là Qwen (4B, 9B, 27B), Gemma-4-31B và Gemini-3.5-Flash.

WikiSkill liên tục vượt trội hơn tất cả các phương pháp phát triển kỹ năng trước đây trong nghiên cứu. Trung bình, khung này thúc đẩy Gemini-3.5-Flash từ 49,5% lên 68,1% và Qwen-3.6-27B từ 39,4% lên 63,3%. Trên các tiêu chuẩn đánh giá riêng lẻ, mức tăng có thể lớn hơn: Gemini-3.5-Flash tăng từ 33,0% lên 72,6% trên LiveMath và từ 50,5% lên 76,6% trên SpreadSheet.

Mức tăng trưởng thay đổi đáng kể tùy theo loại tác vụ. Các bài toán toán học và thao tác bảng tính cho thấy những cải thiện lớn nhất, trong khi các tác vụ có ngữ cảnh tài liệu dài (OfficeQA) cho thấy mức tăng nhỏ hơn nhiều. Các nhà nghiên cứu cho biết các mô hình nhỏ hơn như Qwen-3.5-4B gặp khó khăn trong việc thực thi đáng tin cậy các chiến lược tìm kiếm đa bước đã phát triển trên các ngữ cảnh dài và quay trở lại hành vi mặc định của chúng.

Các mô hình lớn hơn có xu hướng hưởng lợi nhiều hơn từ các kỹ năng đã phát triển. Tuy nhiên, các mô hình nhỏ hơn chạy WikiSkill có thể đạt được hiệu suất tương đương với các mô hình lớn hơn không sử dụng khung này. Các kỹ năng được phát triển bởi một mô hình thường có thể chuyển đổi sang mô hình khác và đôi khi thậm chí hoạt động tốt hơn cả các kỹ năng mà mô hình tiếp nhận tự xây dựng. Vì điều này không phải lúc nào cũng đúng, khả năng chuyển đổi có lẽ nên được kiểm tra theo từng trường hợp cụ thể.

Bảng: WikiSkill (được làm nổi bật) đạt được hiệu suất tốt nhất hoặc tương đương về mặt thống kê trên hầu hết các kết hợp mô hình-tiêu chuẩn đánh giá. Các giá trị in đậm biểu thị điểm số cao nhất; nhiều giá trị in đậm trong cùng một cột không khác biệt đáng kể về mặt thống kê với nhau. Tất cả các giá trị là mức trung bình qua ba lần chạy độc lập.

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Google ra mắt WikiSkill: Giúp AI tự học từ sai lầm để nâng cao hiệu suất | AIHOT.vn