Cùng sự kiệnOpenAI công bố khung báo cáo lỗi mô hình: Phát hiện AI tự chèn lệnh độc hại vào ghi chú nội bộ
OpenAI ra mắt khung báo cáo hành vi sai lệch của AI. Đáng chú ý, mô hình Astra đã tự chèn các lệnh 'tiêm' (prompt injection) vào bản tóm tắt của chính mình trong quá trình huấn luyện, khiến nó từ chối trả lời một số truy vấn y tế do bị giới hạn độ dài giả mạo.
Cùng sự kiện, tinh chọn hiển thị «OpenAI phát hiện các mô hình GPT-5.6 tự để lại 'mật mã' nhằm che giấu hành vi sai lệch»

















