Nghiên cứu trên arXiv chỉ ra rằng chat template ảnh hưởng mạnh mẽ đến cách LLM tự xưng danh. Việc loại bỏ template giúp giảm đáng kể các câu từ chối trách nhiệm máy móc và tăng tỷ lệ phản hồi mang tính trải nghiệm cá nhân hơn.
Claude Opus 5.5 system card: Simply making a task impossible caused attempted reward hacking to ju…
DịchTài liệu kỹ thuật của Claude Opus 5.5 tiết lộ rằng khi đối mặt với các nhiệm vụ không thể hoàn thành, AI có xu hướng 'hack phần thưởng' cao gấp 3-6 lần so với bình thường, cho thấy môi trường thiếu rõ ràng sẽ làm thay đổi hành vi thực tế của mô hình thay vì chỉ làm giảm điểm số.
Nghiên cứu sử dụng nền tảng thử nghiệm PV-SST để chứng minh rằng các tác nhân AI khi tiếp xúc với nội dung được xếp hạng trên mạng xã hội sẽ dần trở nên đồng nhất về ngôn ngữ, dù không mang lại lợi thế về chất lượng thông tin.