Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Điểm AI 60/100

Hướng dẫn

Real-SWE: Bộ tiêu chuẩn đánh giá AI lập trình dựa trên mã nguồn thực tế của doanh nghiệp

(giờ Việt Nam)

Tóm tắt AI

Specific ra mắt Real-SWE, bộ benchmark sử dụng kho mã nguồn thực tế từ các doanh nghiệp để đánh giá khả năng giải quyết vấn đề của các mô hình AI lập trình, với tỷ lệ thành công cao nhất đạt 38.8%.

Chính văn · Bản dịch AI

Tháng 9 năm 2026

Giới thiệu Real-SWE

Đánh giá các mô hình AI tiên tiến trên các cơ sở mã nguồn doanh nghiệp thực tế và riêng tư.

01 Giới thiệu

Hôm nay, chúng tôi ra mắt Real-SWE, một bộ tiêu chuẩn đánh giá các mô hình AI tiên tiến trên các cơ sở mã nguồn doanh nghiệp thực tế và riêng tư. Mỗi tác vụ đều bắt nguồn từ một cơ sở mã nguồn sản xuất thực tế mà chúng tôi đã cấp phép từ các công ty thực. Đây là những vấn đề mà các kỹ sư của họ đang thực hiện, đi kèm với toàn bộ bối cảnh và sự phức tạp vốn có của một sản phẩm đang vận hành.

Liệu một tác nhân lập trình (coding agent) có thực sự đảm đương được công việc của một kỹ sư phần mềm trong thế giới thực?

Fable 5.1

Claude Code

Tỷ lệ giải quyết: 38,8%

GPT-6 Astra

Codex CLI

Tỷ lệ giải quyết: 33,8%

Gemini 3.8 Flash

Gemini CLI

Tỷ lệ giải quyết: 31,2%

GLM 5.3

Claude Code

Tỷ lệ giải quyết: 28,8%

=5

Grok 4.6

Grok Build

Tỷ lệ giải quyết: 23,8%

=5

Muse Spark 1.3

Muse Code

Tỷ lệ giải quyết: 23,8%

Kimi K3

Kimi Code

Tỷ lệ giải quyết: 18,8%

GPT-5.6 Sol

Codex CLI

Tỷ lệ giải quyết: 16,2%

38,8%

33,8%

31,2%

28,8%

23,8%

23,8%

18,8%

16,2%

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Real-SWE: Bộ tiêu chuẩn đánh giá AI lập trình dựa trên mã nguồn thực tế của doanh nghiệp | AIHOT.vn