# Real-SWE: Bộ tiêu chuẩn đánh giá AI lập trình dựa trên mã nguồn thực tế của doanh nghiệp

- Nguồn: Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
- Thời gian phát hành: 2026-09-13 08:18 (giờ Việt Nam)
- Điểm AI: 60/100
- Link AIHOT.vn: https://aihot.vn/items/3d824f686ba56403
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmtz5c0hd0ujmroup4uua5duy
- Link gốc: https://withspecific.com/benchmarks/real-swe

## Tóm tắt AI

Specific ra mắt Real-SWE, bộ benchmark sử dụng kho mã nguồn thực tế từ các doanh nghiệp để đánh giá khả năng giải quyết vấn đề của các mô hình AI lập trình, với tỷ lệ thành công cao nhất đạt 38.8%.

## Thân bài

Tháng 9 năm 2026

### Giới thiệu Real-SWE

Đánh giá các mô hình AI tiên tiến trên các cơ sở mã nguồn doanh nghiệp thực tế và riêng tư.

### 01 Giới thiệu

Hôm nay, chúng tôi ra mắt Real-SWE, một bộ tiêu chuẩn đánh giá các mô hình AI tiên tiến trên các cơ sở mã nguồn doanh nghiệp thực tế và riêng tư. Mỗi tác vụ đều bắt nguồn từ một cơ sở mã nguồn sản xuất thực tế mà chúng tôi đã cấp phép từ các công ty thực. Đây là những vấn đề mà các kỹ sư của họ đang thực hiện, đi kèm với toàn bộ bối cảnh và sự phức tạp vốn có của một sản phẩm đang vận hành.

Liệu một tác nhân lập trình (coding agent) có thực sự đảm đương được công việc của một kỹ sư phần mềm trong thế giới thực?

Fable 5.1

Claude Code

Tỷ lệ giải quyết: 38,8%

GPT-6 Astra

Codex CLI

Tỷ lệ giải quyết: 33,8%

Gemini 3.8 Flash

Gemini CLI

Tỷ lệ giải quyết: 31,2%

GLM 5.3

Claude Code

Tỷ lệ giải quyết: 28,8%

=5

Grok 4.6

Grok Build

Tỷ lệ giải quyết: 23,8%

=5

Muse Spark 1.3

Muse Code

Tỷ lệ giải quyết: 23,8%

Kimi K3

Kimi Code

Tỷ lệ giải quyết: 18,8%

GPT-5.6 Sol

Codex CLI

Tỷ lệ giải quyết: 16,2%

38,8%

33,8%

31,2%

28,8%

23,8%

23,8%

18,8%

16,2%
