Announcing Artificial Analysis Capability Indices v1.1, updated with stronger domain tuning, combini…
DịchArtificial Analysis cập nhật chỉ số năng lực v1.1, kết hợp dữ liệu O*NET để đo lường hiệu suất AI trong 6 lĩnh vực chuyên môn như tài chính, luật và y tế dựa trên Intelligence Index v4.3.
One of the downsides in AI getting so good is that it is getting harder to demonstrate its strengths…
DịchSự tiến bộ vượt bậc của AI khiến ranh giới giữa ưu và nhược điểm trở nên mờ nhạt. Người dùng cần có kiến thức chuyên môn sâu mới có thể nhận diện được những hạn chế tinh vi mà các mô hình hiện đại đang che giấu.
Now that METR long horizons is effectively saturated (Epoch found pre-Fable agents could do 18 weeks…
DịchKhi các chuẩn đo lường như METR, Frontier Math và ARC-AGI dần trở nên quá dễ dàng với AI, giới chuyên gia đang đặt câu hỏi về các chỉ số mới để đánh giá tốc độ phát triển thực sự của trí tuệ nhân tạo.
Is the @METR_Evals long horizons measure effectively saturated? No updates to the most famous graph…
DịchCác chỉ số đánh giá dài hạn của METR dường như đã chững lại từ tháng 5, trong khi các nghiên cứu mới cho thấy AI hiện nay đã có khả năng xử lý khối lượng công việc kéo dài hơn 18 tuần trong môi trường kiểm soát.
What are the big questions about AI capabilities that govern the impact AI will have on the world? I…
DịchGreg H. Burnham từ Epoch AI phân tích những thách thức then chốt quyết định tác động của AI đối với thế giới, đồng thời làm rõ cách các bộ tiêu chuẩn đánh giá của họ giúp giải quyết những vấn đề này.