Nghiên cứuĐiểm AI 85/100
Decoding-Level Taboo: Kiểm tra khả năng chịu tải của LLM bằng phương pháp can thiệp logit
Nghiên cứu giới thiệu bài kiểm tra 'Taboo' giúp đánh giá độ bền của LLM bằng cách ép mô hình đi chệch khỏi lộ trình tạo văn bản thông thường, từ đó bộc lộ những hạn chế thực tế mà các bài benchmark truyền thống thường bỏ qua.