Rohan Paul@rohanpaul_aiNghiên cứuĐiểm AI 36/100
SWE-bench Science: Thách thức mới cho AI trong việc giải quyết các lỗi logic khoa học
Coding agents fix the symptom you show them far more often than the defect underneath. Agents are g…
DịchSWE-bench Science cho thấy các AI lập trình hiện nay dù giỏi sửa lỗi kỹ thuật nhưng vẫn yếu trong việc khôi phục logic khoa học cốt lõi. Điểm nghẽn nằm ở khả năng kiểm chứng thực tế thay vì chỉ dựa vào kiến thức lý thuyết.
