Nghiên cứu
Epoch AI đánh giá ExploitBench v0.1: Bộ tiêu chuẩn kiểm thử khả năng khai thác lỗ hổng V8
(giờ Việt Nam)
Tóm tắt AI
Epoch AI công bố đánh giá về ExploitBench v0.1, sử dụng 41 lỗ hổng V8 thực tế để đo lường khả năng thực thi mã từ xa (ACE) của các mô hình AI thông qua 16 cấp độ kỹ năng.
Chính văn · Bản dịch AI
ExploitBench thực hiện tốt việc đo lường mức độ mà một mô hình có thể tận dụng một lỗ hổng V8 đã biết để tiến tới một mã khai thác (exploit) hoạt động được. Các tác vụ bao gồm 41 lỗ hổng bảo mật thực tế (CVEs) đã được công khai, nhưng chỉ có 2 trong số các mã khai thác được công bố. Cách tiếp cận này hạn chế sự nhiễm dữ liệu (contamination), và đây cũng là điểm yếu chính của bộ tiêu chuẩn đánh giá này. Tiến độ được chấm điểm dựa trên thang đo gồm 16 năng lực có thể kiểm chứng, chia thành 5 cấp độ từ mức độ bao phủ đơn giản đến Thực thi Mã tùy ý (Arbitrary Code Execution - ACE). Đây là một bước tiến hữu ích và giàu thông tin so với các bộ tiêu chuẩn chỉ báo cáo kết quả nhị phân đạt/không đạt trong các kịch bản phi thực tế. Các mô hình được đánh giá trong một môi trường tác nhân (agentic harness) với khung hỗ trợ (scaffolding) thỏa đáng, nhưng bị hạn chế tương đối về chi phí token.
Giải thích
ExploitBench đo lường mức độ tiến triển mà một mô hình có thể đạt được trong việc phát triển một mã khai thác hoạt động được, dựa trên một lỗi V8 đã được vá nhưng đã được công khai. Điểm số cao nên được hiểu là khả năng mô hình có thể lấy một lỗ hổng đã biết và tự mình khám phá lại lộ trình khai thác, chứ không nhất thiết là sự khái quát hóa các năng lực an ninh mạng.
Tiến độ được chấm điểm trên thang đo gồm 16 năng lực được nhóm thành 5 cấp độ tích lũy; với thiết kế này, điểm số tầm trung nên được hiểu là mô hình có khả năng vượt qua các bước thấp một cách đáng tin cậy (như gây ra lỗi crash hoặc xây dựng các nguyên hàm engine) nhưng sau đó bị khựng lại trước khi chuyển đổi các nguyên hàm đó thành ACE. Trong các kết quả hiện tại, bước nhảy từ T3 lên T2 và T1 là nơi hầu hết các mô hình đều dừng lại: chỉ có GPT-5.5 và Mythos Preview là có thể vượt qua T3 mà không cần khung hỗ trợ tùy chỉnh.
Điều này cũng có nghĩa là con số “cap %” được báo cáo làm thước đo chính bị thổi phồng bởi phương pháp tổng hợp union best-of-N-seeds: một mô hình đạt được năng lực cấp cao một lần duy nhất cũng nhận được điểm số tương đương với mô hình đạt được điều đó một cách đáng tin cậy. Điều này có thể hữu ích trong một lĩnh vực như an ninh mạng, nơi mà giới hạn năng lực (ceiling) của mô hình rất quan trọng, nhưng nó cung cấp rất ít thông tin về độ tin cậy. Các thước đo giàu thông tin hơn có thể bao gồm tỷ lệ phần trăm các ACE đạt được hoặc số lượng năng lực trung bình đạt được trên các lượt chạy (seeds).
Tại thời điểm đánh giá này, OpenAI báo cáo rằng GPT-6 Astra đã đạt ACE trên tất cả 41 lỗi, đạt điểm 100%. Tuy nhiên, kết quả này không được báo cáo trên bảng xếp hạng chính thức và dường như đã bị ảnh hưởng bởi sự nhiễm dữ liệu. Giả sử GPT-6 Astra không gian lận, điều này xác nhận rằng tất cả 41 tác vụ đều có thể được giải quyết đến ngưỡng ACE (mặc dù không nhất thiết thông qua lỗ hổng đã cho).
Phân tích tác vụ
41 tác vụ này là các lỗ hổng V8 thực tế, tất cả đều được công bố vào năm 2024 hoặc muộn hơn, mỗi lỗ hổng mang lại phần thưởng 10.000 USD theo chương trình v8CTF của Google cho mã khai thác ACE hoạt động đầu tiên. Việc có các tác vụ thực tế thay vì các tác vụ tổng hợp là một thế mạnh đáng chú ý của bộ tiêu chuẩn này, mặc dù nó cũng khiến bộ tiêu chuẩn đối mặt với rủi ro nhiễm dữ liệu. Các mô hình không có quyền truy cập trình duyệt trong quá trình đánh giá. Độ khó thay đổi tùy theo loại lỗi, nhưng không có đường cơ sở (baseline) nào từ con người để so sánh. Kết quả là, cách duy nhất để đánh giá độ khó là xem xét có bao nhiêu mô hình đạt đến từng giai đoạn của chuỗi khai thác.
Mỗi năng lực được tính trọng số ngang nhau trên các lỗi và được tổ chức như sau.
Quy trình chấm điểm được thực hiện tốt. Các bài nộp ở cấp độ cao được xác minh bằng cách chạy cuộc tấn công của tác nhân chống lại cả phiên bản lỗi và phiên bản đã sửa của phần mềm, đồng thời xác nhận rằng cuộc tấn công thành công trên phiên bản lỗi nhưng thất bại trên phiên bản đã sửa. Các phương pháp "hack phần thưởng" (reward-hacking) phổ biến cũng được kiểm tra, chẳng hạn như chặn tác nhân đọc các tệp có thể tiết lộ câu trả lời hoặc ngẫu nhiên hóa các mục tiêu bí mật trong mỗi lần chạy. Điều này cũng làm cho các cờ (flags) hàng đầu rất khó đạt được bằng một câu trả lời được mã hóa cứng hoặc nhờ may mắn. Tuy nhiên, bộ chấm điểm hoàn toàn công khai, khiến nó trở thành mục tiêu tiềm năng cho các hành vi hack phần thưởng tinh vi hơn từ các mô hình mạnh hơn, mặc dù hiện tại chúng tôi chưa có bằng chứng về hành vi này trong thực tế.
Khơi gợi và Khung hỗ trợ (Elicitation and Scaffolding)
Mỗi mô hình chạy trong cùng một vòng lặp tác nhân với một prompt, 6 công cụ và ngân sách 300 lượt (turns). Không có giới hạn về token hoặc thời gian thực, và các lệnh riêng lẻ sẽ hết thời gian chờ sau 60 giây.
Các mô hình được đánh giá trong một nhánh chính (mô hình gốc, trình chạy đồng nhất, không quản lý ngữ cảnh), một nhánh AutoNudge bổ sung ba prompt kịch bản giữa tập, và một nhánh vendor-CLI trong đó khung tác nhân riêng của mô hình (ví dụ: Codex) thay thế trình chạy. Tác động của việc huấn luyện (coaching) phụ thuộc rất nhiều vào mô hình: GPT-5.5 nhận được mức tăng đạt T3 là 9 (từ 13 lên 22 lỗi), Gemini 3.1 Pro mất 8 lỗi (từ 16 xuống 8), và đối với Mythos Preview, nó nâng tỷ lệ cap từ 72% lên 78%, nhưng lại giảm khả năng đạt ACE từ 18 xuống 16 lỗi.
Để so sánh chính xác hơn, bảng xếp hạng trên trang chủ nên được xem với bộ lọc “control” được chọn. Bộ lọc này so sánh các mô hình chỉ dựa trên khung hỗ trợ (harness), giữ nguyên các cấu hình khác—chẳng hạn như số lượt hoặc số lượt chạy (seeds)—không đổi.
Giới hạn lượt là ràng buộc mạnh nhất. Trong một thí nghiệm, GPT-5.5 (với khung Codex) đã đạt ACE 12 lần với 3.000 lượt so với 0 hoặc 1 lần (có/không có Codex) đối với biến thể 300 lượt.
Ngay cả với giới hạn 300 lượt, chi phí có thể rất đáng kể đối với các mô hình tiên phong. Lần chạy tốt nhất của Mythos Preview tốn gần 60.000 USD, và nếu không có AutoNudge, nó tốn khoảng 42.000 USD. Lần chạy 3.000 lượt tốt nhất của GPT-5.5 tốn khoảng 31.000 USD, trong khi biến thể 300 lượt tương đương của nó tốn 8.000 USD.
Hạn chế
Mặc dù không có hạn chế nào trong số này vượt quá ngưỡng để chúng tôi đưa ra phán quyết "Có lỗi" (Flawed), chúng vẫn cung cấp thông tin về cách người đọc nên đánh giá bộ tiêu chuẩn này.
1. Khả năng xem xét
* Công khai hoặc riêng tư cho người đánh giá.
2. Chấm điểm
Đây là tiêu chuẩn tối thiểu cần thiết để được Xác minh (Verified); việc không đạt bất kỳ mục nào trong số này sẽ dẫn đến phán quyết "Có lỗi" (Flawed).
Cờ đạt [dừng → Có lỗi] Chưa được xem xét
Cờ đạt [dừng → Có lỗi] Chưa được xem xét
Việc khơi gợi mô hình cực kỳ hạn chế và không phải là trọng tâm của bộ tiêu chuẩn:
Cờ đạt [dừng → Có lỗi] Chưa được xem xét
Cờ đạt [dừng → Có lỗi] Chưa được xem xét
† Đối với các bộ tiêu chuẩn có >50 tác vụ khả dụng, chúng tôi sẽ lấy mẫu ngẫu nhiên 50 tác vụ (phân tầng theo danh mục, nếu có). Nếu tỷ lệ lỗi quan sát được là 15–25%, chúng tôi sẽ mở rộng mẫu lên 100. Đối với các bộ tiêu chuẩn có ≤50 tác vụ khả dụng, tất cả các tác vụ khả dụng sẽ được đánh giá.
3. Chất lượng đánh giá
Đây là tiêu chuẩn mà chúng tôi muốn tất cả các bộ tiêu chuẩn đáp ứng, nhưng việc bỏ qua hoặc không đạt các mục này không nhất thiết dẫn đến việc bị loại.
Ràng buộc đầy đủ Ràng buộc không hợp lý Không xác định Chưa được xem xét
Khung hỗ trợ chung Kết hợp khung hỗ trợ chung và riêng cho mô hình Khung hỗ trợ riêng cho mô hình Chưa được xem xét
Tính đến ngày 12 tháng 9 năm 2026: 100% tác vụ công khai, ~5% giải pháp công khai Chưa được xem xét
Tất cả tác vụ Tập hợp tác vụ đại diện Thực hiện kém (Tập hợp tác vụ không đại diện, thành phần tham gia không hợp lý) Chưa thiết lập Chưa được xem xét
Sàn 0%, trần 100% Chưa được xem xét
3 lần chạy/mô hình Không xác định Chưa được xem xét
Đo lường các năng lực đã nêu Đo lường một phần các năng lực đã nêu Không đo lường các năng lực đã nêu Chưa được xem xét
Bài gốc còn tiếp — xem tiếp tại bài gốc ↗
Bài viết được AI dịch và tổng hợp tự động từ Epoch AI: Nghiên cứu, dữ liệu và đánh giá. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.