# RealSWE: Đánh giá thực tế khả năng lập trình của các AI Agent

- Nguồn: Hugging Face Daily Papers
- Thời gian phát hành: 2026-09-02 07:00 (giờ Việt Nam)
- Điểm AI: 85/100
- Link AIHOT.vn: https://aihot.vn/items/a21434c4368c5b3e
- Link gốc: https://arxiv.org/abs/2608.27831

## Tóm tắt AI

Nghiên cứu chỉ ra sự khác biệt lớn giữa các bài kiểm tra lập trình hiện nay và yêu cầu thực tế của người dùng. RealSWE được giới thiệu để đánh giá AI Agent dựa trên các tình huống lập trình tự nhiên, ít cấu trúc và mang tính đời thường hơn.

## Thân bài

Xem PDF HTML (thử nghiệm)

DOI do arXiv cấp thông qua DataCite

### Lịch sử gửi bài

Từ: Gyuhyeong Kim [xem email] [v1] Thứ Sáu, 28 tháng 8 năm 2026 01:57:58 UTC (1,025 KB) [v2] Thứ Hai, 31 tháng 8 năm 2026 12:23:59 UTC (1,025 KB)
