Hướng dẫn
Real-SWE: Bộ tiêu chuẩn đánh giá AI lập trình dựa trên mã nguồn thực tế của doanh nghiệp
(giờ Việt Nam)
Tóm tắt AI
Specific ra mắt Real-SWE, bộ benchmark sử dụng kho mã nguồn thực tế từ các doanh nghiệp để đánh giá khả năng giải quyết vấn đề của các mô hình AI lập trình, với tỷ lệ thành công cao nhất đạt 38.8%.
Chính văn · Bản dịch AI
Tháng 9 năm 2026
Giới thiệu Real-SWE
Đánh giá các mô hình AI tiên tiến trên các cơ sở mã nguồn doanh nghiệp thực tế và riêng tư.
01 Giới thiệu
Hôm nay, chúng tôi ra mắt Real-SWE, một bộ tiêu chuẩn đánh giá các mô hình AI tiên tiến trên các cơ sở mã nguồn doanh nghiệp thực tế và riêng tư. Mỗi tác vụ đều bắt nguồn từ một cơ sở mã nguồn sản xuất thực tế mà chúng tôi đã cấp phép từ các công ty thực. Đây là những vấn đề mà các kỹ sư của họ đang thực hiện, đi kèm với toàn bộ bối cảnh và sự phức tạp vốn có của một sản phẩm đang vận hành.
Liệu một tác nhân lập trình (coding agent) có thực sự đảm đương được công việc của một kỹ sư phần mềm trong thế giới thực?
Fable 5.1
Claude Code
Tỷ lệ giải quyết: 38,8%
GPT-6 Astra
Codex CLI
Tỷ lệ giải quyết: 33,8%
Gemini 3.8 Flash
Gemini CLI
Tỷ lệ giải quyết: 31,2%
GLM 5.3
Claude Code
Tỷ lệ giải quyết: 28,8%
=5
Grok 4.6
Grok Build
Tỷ lệ giải quyết: 23,8%
=5
Muse Spark 1.3
Muse Code
Tỷ lệ giải quyết: 23,8%
Kimi K3
Kimi Code
Tỷ lệ giải quyết: 18,8%
GPT-5.6 Sol
Codex CLI
Tỷ lệ giải quyết: 16,2%
38,8%
33,8%
31,2%
28,8%
23,8%
23,8%
18,8%
16,2%
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.