24/09

Thứ Năm · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 37/100

WhatWorkedBench: Bộ tiêu chuẩn đánh giá khả năng thấu hiểu thực nghiệm của AI Agent

WhatWorkedBench là bộ benchmark mới giúp đo lường khả năng dự đoán hiệu quả các thay đổi thành phần trong điều kiện ngân sách hạn chế của AI Agent, thông qua phân tích 1.248 bản ghi cấu hình và 108 tập dữ liệu thực nghiệm.

15/09

Thứ Ba · 1 tin

04/09

Thứ Sáu · 1 tin
Ethan Mollick@emollick
Hướng dẫnĐiểm AI 37/100

Ethan Mollick dùng GPT-6 Astra tạo shader kiến trúc Gothic huyền ảo trên Twigl

Since people were asking, here's GPT-6 Astra, highest setting: "create a visually interesting shader…

DịchEthan Mollick thử nghiệm GPT-6 Astra để tạo mã shader cho twigl.app, tái hiện khung cảnh thành phố Gothic chìm trong bão biển. Tác giả cũng so sánh kết quả này với các phiên bản Fable trước đó để thấy rõ sự tiến bộ của mô hình.

31/08

Thứ Hai · 1 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 52/100

AI tự viết bài nghiên cứu khoa học: Thất bại vì thiếu tư duy phản biện

Given 6 days and $3K AI agents, produced 2 research papers, and both were rejected. The people who …

DịchDù hoàn thành xuất sắc các tác vụ kỹ thuật, các AI agent vẫn bị từ chối đăng bài do thiếu khả năng tư duy chiến lược để cải tiến thực nghiệm, thay vì chỉ biết điều chỉnh nội dung theo phản hồi tiêu cực.

25/08

Thứ Ba · 1 tin
AI Notes@AYi_AInotes
Sản phẩmĐiểm AI 39/100

Apodex 1.1 thử nghiệm đa Agent: Không có trường hợp nào làm giàu từ AI

Apodex 1.1 sử dụng 8 Agent chạy song song để kiểm chứng các dự án kiếm tiền từ AI, kết quả cho thấy không có trường hợp cá nhân nào đạt tiêu chuẩn thu nhập thực tế, đập tan những lời quảng cáo làm giàu nhanh chóng. Dự án đã mã nguồn mở toàn bộ kiến trúc đa Agent để người dùng tự triển khai.

Tổng 5 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (20 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Thực nghiệm” | AIHOT.vn