Hướng dẫn
Khi kẻ xấu lợi dụng AI Claude: Những thách thức về an toàn
(giờ Việt Nam)
Tóm tắt AI
Bài viết phân tích thực trạng các đối tượng xấu cố gắng khai thác mô hình AI Claude cho những mục đích tiêu cực và cách thức đối phó với vấn đề này.
Chính văn · Bản dịch AI

Rất nhiều kẻ xấu cố gắng sử dụng Claude để thực hiện những hành vi sai trái. Hầu hết chúng đều thất bại. Chúng tôi nghĩ vậy.
Anthropic đã ngăn chặn được một nhóm các đối tượng này và đưa ra một báo cáo chi tiết. Nếu Anthropic đang chia sẻ những trường hợp tồi tệ nhất, hoặc bất cứ điều gì gần với mức đó, thì tình hình thực tế về việc lạm dụng các mô hình đóng đang có vẻ khả quan, thậm chí tốt hơn tôi nghĩ.
Báo cáo này bao gồm các hoạt động mà chúng tôi đã ngăn chặn từ tháng 12 năm 2025 đến tháng 8 năm 2026 trên bảy lĩnh vực gây hại: hoạt động mạng, hoạt động gây ảnh hưởng, giám sát, lừa đảo và gian lận, lạm dụng sinh học, phát triển vũ khí thông thường và chưng cất (distillation).
Trong đó có một chút "phóng hỏa, giết người và băng qua đường trái phép". Nhiều người sẽ nói rằng, một trong những thứ này không giống với những thứ còn lại.
Tôi không đồng ý, đặc biệt là khi xét đến các chi tiết mà chúng ta sẽ thấy sau này, và vì việc chưng cất cho phép thực hiện sáu lĩnh vực còn lại như báo cáo đã nêu: "thúc đẩy hiệu suất trên gần như mọi tác vụ" thông qua việc chuyển giao các kỹ năng nhận thức của Claude mà không chuyển giao các cơ chế bảo vệ của nó.
Thực vậy, chưng cất cho đến nay là mối đe dọa quan trọng nhất trong báo cáo này, và là phần sẽ gây ra tác động lớn nhất.
Bằng cách phơi bày những nỗ lực của Trung Quốc trong việc chưng cất gian lận có hệ thống đối với Claude, Anthropic đã làm phía Trung Quốc bẽ mặt và có khả năng gây thù chuốc oán. Điều này bắt đầu với việc "tất cả các phòng thí nghiệm hàng đầu của Trung Quốc đều nỗ lực chưng cất Claude, điều mà chúng tôi đã giảm thiểu và ngăn chặn", vốn đã là một vấn đề được đề cập trong khuyến nghị chung từ NSA/CISA/FBI hai ngày trước khi báo cáo đầy đủ được công bố.
Vấn đề lớn hơn là cách các phòng thí nghiệm Trung Quốc cố gắng chưng cất Claude. Các nỗ lực chưng cất đòi hỏi rất nhiều truy vấn thực tế, vì vậy DeepSeek, Moonshot và Xiaomi mỗi bên đã gửi rất nhiều truy vấn người dùng trực tiếp đến Claude. Ít nhất thì Moonshot sau đó đã đưa kết quả trả về cho người dùng của họ như thể đó là kết quả đầu ra của Kimi.
Đó sẽ là một vấn đề lớn.
Điều này không liên quan đến bài viết hôm nay nhưng bạn cần biết những sự thật cơ bản ngay bây giờ, đó là:
Hôm qua tôi đã cảnh báo rằng truyền thông và những người khác đang suy diễn quá mức về các tuyên bố của Trump. Than ôi, đúng với tinh thần "mỗi ngày đều có tin nóng", chúng ta hiện đã thấy Trump nói những điều mà ông ấy chưa từng nói trước đây. Tuyên bố mới rất khác biệt, giải quyết được sự mơ hồ từ sáng hôm qua.
Ông ấy tuyên bố rõ ràng rằng rủi ro hiện hữu từ AI là một "trò lừa bịp" ngang hàng với (theo lời ông ấy) "trò lừa bịp Nga" hoặc biến đổi khí hậu. Đây là tin rất, rất xấu. Tôi e rằng ông ấy có thể đã vượt qua một "con sông Rubicon" về mặt hùng biện mà sẽ rất khó để rút lui một khi ông ấy hiểu rõ hơn về tình hình, và một khi các sự kiện trong tương lai làm thay đổi cuộc chơi.
Trong khi tất cả chúng ta đang xử lý các hệ quả, tôi kêu gọi mọi người: Xin đừng làm cho vấn đề này trở nên đảng phái hay cá nhân hơn mức hiện tại. Xin đừng tấn công những người Cộng hòa, hay Trump. Điều đó sẽ chỉ làm mọi thứ tồi tệ hơn. Hãy nhấn mạnh vào những tiếng nói hữu ích từ mọi phía.
Điều đó áp dụng bất kể có thêm tuyên bố nào khác hay không, và tôi sẽ cung cấp thông tin đầy đủ về tình huống đáng tiếc đó vào cuối tuần này.
Cách để không kể một câu chuyện ngụ ngôn.
Những kẻ xấu thường có xu hướng thiếu tinh vi.
Những kẻ xấu cụ thể.
Các hoạt động gây ảnh hưởng.
Các hoạt động giám sát.
Vũ khí thông thường.
Lạm dụng sinh học.
Lừa đảo và gian lận.
Chưng cất gian lận bất hợp pháp.
Ngươi định làm gì về điều đó, đồ nhãi nhép?
Tin tốt đây mọi người.
Một cách đọc rất khác về báo cáo.
Các bộ phân loại đôi khi gây khó chịu kinh khủng, nhưng Anthropic khẳng định chúng hoạt động hiệu quả.
Trong mọi trường hợp, các mô hình Claude Haiku, Sonnet và Opus đều được sử dụng; không tìm thấy hoạt động độc hại nào trên Claude Fable hoặc Mythos (vốn có sẵn một loạt các cơ chế bảo vệ giúp giảm đáng kể khả năng thực hiện các tác vụ mạng gây hại).
Ngoại lệ duy nhất là một cuộc tấn công chưng cất nhắm vào Fable bởi Zhipu, nhưng các cơ chế bảo vệ tăng cường đã được áp dụng và Zhipu đã chuyển hướng sang nhắm vào Opus.
Nếu những kẻ xấu thường xuyên tinh vi và "giỏi việc" hơn, thế giới sẽ trông rất khác.
May mắn thay, những kẻ xấu thường thiếu tinh vi và "dở việc".
(Mọi người khác cũng phần lớn tương tự, nhưng ở mức độ ít hơn và kém tin cậy hơn.)
AI, dù tốt hay xấu, đều biến những kẻ "dở việc" thành "giỏi việc", làm cho việc con người "dở việc" trong khi thực hiện các hành vi đó trở nên ít quan trọng hơn. Dưới đây là các chủ đề lớn của Anthropic:
Các cuộc tấn công tinh vi không còn đòi hỏi những kẻ tấn công tinh vi nữa.
Vai trò của AI trong các hoạt động mạng đã trở nên ngày càng tự chủ.
Chuỗi cung ứng AI là mục tiêu, chiến lợi phẩm và là công cụ tấn công.
Nghĩa là, những kẻ tấn công nhắm vào các nguồn tài nguyên tính toán và sử dụng chúng để tiếp tục thực hiện hành vi.
Để sử dụng Claude như một kẻ xấu, bạn cần giá trị của chiến lợi phẩm và tài nguyên tính toán, đồng thời bạn cũng cần vỏ bọc của các tài khoản mới bị chiếm đoạt để đi trước một bước so với các biện pháp trấn áp của Anthropic.
Về cơ bản, mọi người trong báo cáo đều đang đánh cắp quyền truy cập của họ, tối thiểu là bằng cách vượt qua các hạn chế khu vực và mua vô số gói đăng ký được trợ giá, bên cạnh việc thực hiện các hành vi xấu với tài nguyên tính toán đó.
Bài viết được AI dịch và tổng hợp tự động từ Don't Worry About the Vase (Zvi). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.