Tinh chọnClawBench: Khi các siêu AI 'bó tay' trước những tác vụ thực tế trên web
Nghiên cứu mới từ TIGER Lab cho thấy các mô hình hàng đầu như Claude, GPT và Gemini đều thất bại thảm hại khi thực hiện các tác vụ thực tế trên web, với tỷ lệ thành công chỉ đạt khoảng 33%.





















