Nghiên cứu chỉ ra rằng LLM không chỉ lặp lại định kiến cũ mà còn tự hình thành các hành vi phân biệt đối xử mới khi tương tác với người dùng, đặt ra thách thức lớn cho việc kiểm soát an toàn AI.
Debias-SparseGPT là kỹ thuật cắt tỉa hậu huấn luyện giúp giảm định kiến xã hội trong các mô hình ngôn ngữ lớn mà vẫn duy trì độ chính xác và hiệu suất, ngay cả ở cấu trúc nén 2:4 khắt khe.
Nghiên cứu giới thiệu ContextBias, khung đánh giá mới nhằm kiểm tra xem các định kiến nghề nghiệp trong mô hình AI có thay đổi khi thay đổi ngữ cảnh hay không. Kết quả cho thấy các mô hình hiện nay vẫn duy trì định kiến mạnh mẽ ngay cả khi ngữ cảnh không liên quan.