Nghiên cứu giới thiệu SAEScientist-Bench, bộ tiêu chuẩn đánh giá khả năng của AI trong việc sử dụng Sparse Autoencoders để tự động khám phá và giải mã các đặc trưng bên trong mô hình ngôn ngữ lớn.
Nghiên cứu giới thiệu Sparse Readout Prism (SRP), một phương pháp phân tích mới giúp tách biệt cấu trúc giải mã của mô hình ngôn ngữ khỏi dữ liệu huấn luyện, cho phép hiểu rõ cách các đặc trưng ẩn tạo nên dự đoán thay vì chỉ nhìn vào các token đơn thuần.
Nghiên cứu khám phá cách các mô hình ngôn ngữ truy xuất biến tiềm ẩn khi cần sử dụng linh hoạt. Kết quả cho thấy không có 'cổng kiểm soát' cố định nào, thay vào đó, nhu cầu tác vụ làm tăng khả năng hiển thị của khái niệm thông qua cơ chế Attention.