Benchmark FAB từ Epoch AI cho thấy OpenAI GPT-6 Astra dẫn đầu với 80% độ chính xác trong việc phát hiện lỗi lắp ráp nội thất, vượt qua Claude Fable 5.1 (70%) và Claude Opus 5 (61%).
So many different kind of AI benchmarks are being released. This one is cool, "Furniture Assembly B…
DịchEpoch AI giới thiệu Furniture Assembly Benchmark (FAB), thử thách khả năng suy luận không gian của AI thông qua việc phát hiện lỗi lắp ráp nội thất. Điểm số cao nhất đã tăng vọt từ 28% lên 80% chỉ trong 10 tháng, cho thấy sự cải thiện đáng kể trong lĩnh vực vốn là điểm yếu của AI.
This is both fun and a useful measure of how much better multimodal AI has gotten In a short time.
DịchBenchmark FAB mới từ Epoch AI kiểm tra khả năng phát hiện lỗi lắp ráp nội thất của AI thông qua hình ảnh. Chỉ trong 10 tháng, điểm số cao nhất đã tăng ấn tượng từ 28% lên 80%, cho thấy bước tiến lớn của AI đa phương thức.
Epoch AI giới thiệu bộ tiêu chuẩn FAB, sử dụng 60 ảnh lắp ráp nội thất để kiểm tra khả năng suy luận không gian của AI. GPT-6 Astra dẫn đầu với 80% độ chính xác, vượt xa Claude Fable 5.1 và Claude Opus 5.
Can AI tell if you've built your IKEA furniture wrong? Our new benchmark, the Furniture Assembly Ben…
DịchEpoch AI giới thiệu Furniture Assembly Benchmark (FAB), thử thách khả năng của AI trong việc phát hiện lỗi lắp ráp nội thất dựa trên hướng dẫn và hình ảnh thực tế. Hiệu suất của các mô hình đã tăng vọt từ 28% lên 80% chỉ trong 10 tháng.
Epoch AI cập nhật dữ liệu chuỗi cung ứng bán dẫn toàn cầu giai đoạn 2016-2022, giúp theo dõi dòng chảy chip và đo lường mức độ phụ thuộc của các quốc gia vào nhà sản xuất nước ngoài trước các rủi ro địa chính trị.
AI costs are indeed dropping dramatically. On GPQA Diamond, Epoch estimates OpenAI's o3 model neede…
DịchTheo Epoch AI, chi phí để đạt cùng một mức điểm benchmark trên các mô hình AI đang giảm mạnh khoảng 47% mỗi quý. Đơn cử, chi phí cho một bài toán trên GPQA đã giảm tới 725 lần chỉ trong vòng 18 tháng, cho thấy tốc độ tối ưu hóa hiệu năng AI đang tăng tốc chóng mặt.
Nghiên cứu từ Epoch AI cho thấy chi phí để đạt được cùng một mức hiệu năng AI giảm trung bình 47% mỗi quý. Tốc độ này cho thấy sự tiến bộ vượt bậc trong hiệu quả tính toán kể từ khi các mô hình ngôn ngữ lớn thương mại ra đời vào cuối năm 2021.
Vì sao đáng đọc: Báo cáo cung cấp dữ liệu định lượng quan trọng về kinh tế học AI, giúp người đọc hiểu rõ tốc độ tối ưu hóa chi phí thực tế trong ngành, rất có giá trị cho giới chuyên môn.
AI is getting cheaper more quickly than any other transformative tech in history. At a given level o…
DịchNghiên cứu từ Epoch AI cho thấy chi phí để đạt cùng một mức hiệu suất AI đang giảm 47% mỗi quý kể từ năm 2023, vượt xa tốc độ giảm giá của các công nghệ đột phá như giải trình tự DNA hay pin lithium.
The biggest disagreement JSD and I had in this podcast was on the impact of distillation. In our res…
DịchTrong podcast mới nhất, Nathan Lambert và chuyên gia từ Epoch AI đã có những bất đồng quan điểm sâu sắc về việc liệu kỹ thuật chưng cất (distillation) có thực sự giúp các phòng thí nghiệm AI tại Trung Quốc vượt qua rào cản hạn chế chip hay không.
Trong podcast Interconnects, Nathan Lambert và chuyên gia từ Epoch AI phân tích sâu về tốc độ phát triển AI, sự chênh lệch năng lực giữa Mỹ và Trung Quốc cùng ảnh hưởng của kỹ thuật chưng cất mô hình.
New podcast with @datagenproc of @EpochAIResearch digging into the open questions determining the fu…
DịchNathan Lambert và đội ngũ Epoch AI thảo luận sâu về các vấn đề then chốt như dự báo RSI, vai trò của robot, khoảng cách công nghệ của Trung Quốc và tương lai của các mô hình AI hậu huấn luyện.
Phân tích từ Epoch AI cho thấy sự gia tăng đột biến trong việc thừa nhận sử dụng AI tại các bản thảo toán học trên arXiv. Dù con số này phản ánh xu hướng ứng dụng rộng rãi, các nhà nghiên cứu lưu ý rằng nó cũng bao gồm cả sự thay đổi trong ý thức công khai và khó khăn trong việc phân định ranh giới hỗ trợ.
Epoch AI vừa giới thiệu công cụ mới giúp thống kê tỷ lệ và hình thức sử dụng AI trong các bản thảo toán học trên arXiv từ đầu năm 2023 đến tháng 8/2026, hỗ trợ các nhà nghiên cứu nắm bắt xu hướng ứng dụng công nghệ.
Epoch AI thừa nhận các hạn chế trong việc thống kê sử dụng AI trên arXiv, do phụ thuộc vào dữ liệu tự khai báo và khả năng phân loại chưa hoàn thiện của mô hình GPT-5.6 Sol.
Epoch AI vừa phát hành bộ dữ liệu chi tiết về xu hướng sử dụng AI trong các bài báo toán học trên arXiv theo từng tháng và lĩnh vực, cho phép cộng đồng nghiên cứu tải về miễn phí.
Another problem from FrontierMath: Open Problems has been solved! The solution was elicited by Becke…
DịchEpoch AI công bố GPT-6 Astra đã giải quyết một bài toán trong FrontierMath bằng cách thiết lập quy tắc bỏ phiếu mới dựa trên hàm entropy hài hòa, mở ra hướng đi mới cho các quyết định tập thể công bằng.
Great initiative to eval the evals. It incentivizes the industry to build genuinely high-quality ben…
DịchEpoch AI vừa công bố sáng kiến Benchmark Reviews nhằm đánh giá độ tin cậy của các bộ tiêu chuẩn AI, với kết quả ban đầu cho thấy 4 bộ đạt chuẩn, 9 bộ bị lỗi và 2 bộ chưa đủ dữ liệu. Động thái này được kỳ vọng sẽ thúc đẩy ngành công nghiệp xây dựng các tiêu chuẩn đánh giá AI chất lượng hơn.
Epoch continues to do some of the best public benchmarking work on AI. This is helpful (and tells us…
DịchEpoch AI vừa khởi động dự án Benchmark Reviews nhằm kiểm định độ tin cậy của các bộ tiêu chuẩn AI hiện nay. Kết quả ban đầu cho thấy trong 15 bộ tiêu chuẩn được kiểm tra, chỉ có 4 bộ đạt yêu cầu, trong khi 9 bộ khác bị đánh giá là có khiếm khuyết.
Introducing Benchmark Reviews: our new initiative to audit AI benchmarks. We are launching with 15 b…
DịchEpoch AI vừa ra mắt chương trình 'Benchmark Reviews' nhằm kiểm định chất lượng các bộ tiêu chuẩn đo lường AI. Trong đợt đầu, họ đã đánh giá 15 bộ tiêu chuẩn, kết quả cho thấy 4 cái đạt chuẩn, 9 cái có khiếm khuyết và 2 cái chưa đủ dữ liệu.
We're scaling our AI Data Centers research to provide a more comprehensive map of the world's AI inf…
DịchEpoch AI đang mở rộng phạm vi nghiên cứu hạ tầng AI, hiện đã bao phủ khoảng 44% năng lực tính toán toàn cầu và đang tiếp tục tăng trưởng nhanh chóng.
Epoch AI vừa nâng cấp công cụ theo dõi trung tâm dữ liệu, mở rộng phạm vi từ 13 lên 86 cơ sở, chiếm khoảng 44% tổng năng lực tính toán AI thế giới. Nền tảng cung cấp dữ liệu chi tiết về chip, vốn đầu tư và tiến độ xây dựng, đồng thời công khai phương pháp tính toán cho cộng đồng.
Nghiên cứu từ Epoch AI so sánh các mô hình AI thế hệ mới cho thấy GPT-6 Astra vượt trội ở các bài toán logic phức tạp, nhưng chưa thể chiếm ưu thế tuyệt đối trong lĩnh vực lập trình so với các đối thủ.
More US adults are using AI nearly every day, according to our polling results. The share of US adu…
DịchDữ liệu từ Epoch AI cho thấy số người Mỹ sử dụng AI gần như mỗi ngày đã tăng vọt từ 8% lên 19% chỉ trong vòng 6 tháng, phản ánh sự thâm nhập mạnh mẽ của AI vào đời sống thường nhật.
Epoch AI công bố đánh giá về ExploitBench v0.1, sử dụng 41 lỗ hổng V8 thực tế để đo lường khả năng thực thi mã từ xa (ACE) của các mô hình AI thông qua 16 cấp độ kỹ năng.
Vì sao đáng đọc: Đây là tài liệu quan trọng về an ninh mạng trong AI, cung cấp phương pháp đo lường thực tế cho khả năng tấn công của mô hình, rất có giá trị cho giới chuyên môn.
Earlier this week, we showed that GPT-5.6 and Claude 5 exhibit very different long-context TTFT scal…
DịchPhân tích từ Epoch AI cho thấy GPT-6 Astra tăng giá API khi vượt ngưỡng 272k token đầu vào, với đường cong độ trễ tương đồng GPT-5.6. Nghiên cứu cũng chỉ ra sự khác biệt trong cách xử lý ngữ cảnh dài giữa OpenAI và Claude, phản ánh qua cấu trúc định giá riêng biệt của từng bên.
Epoch AI đã thực hiện kiểm định độc lập trên bộ tiêu chuẩn HealthBench Professional của OpenAI và phát hiện một nửa trong số 50 tác vụ được lấy mẫu ngẫu nhiên gặp vấn đề nghiêm trọng về chất lượng.
Vì sao đáng đọc: Đây là báo cáo quan trọng về tính minh bạch và độ tin cậy của các bộ tiêu chuẩn đánh giá AI trong lĩnh vực y tế, thu hút sự quan tâm lớn từ giới nghiên cứu.
OpenAI has grown its compute nearly 20-fold since 2023, the sharpest example of an industry-wide sur…
DịchEpoch AI vừa giới thiệu AI Chip Users explorer, công cụ giúp theo dõi sự tăng trưởng sức mạnh tính toán của OpenAI, Google DeepMind, Anthropic, Meta và xAI.
OpenAI GPT-5.6 models and Anthropic Claude 5 models have different pricing structures at long contex…
DịchNghiên cứu từ Epoch AI cho thấy độ trễ phản hồi từ đầu (TTFT) của GPT-5.6 tăng theo hàm bậc hai khi ngữ cảnh dài ra, trong khi dòng Claude 5 duy trì hiệu suất ổn định hơn với xu hướng tuyến tính.
Nghiên cứu từ Epoch AI cho thấy GPT-5.6 có độ trễ TTFT tăng theo đường cong bậc hai khi ngữ cảnh dài, trong khi dòng Claude 5 duy trì hiệu suất gần như tuyến tính.
Vì sao đáng đọc: Nghiên cứu kỹ thuật chuyên sâu về hiệu năng mô hình, cung cấp cái nhìn thực tế cho người dùng và nhà phát triển về khả năng xử lý ngữ cảnh dài của các model hàng đầu.
AI data centers have been getting larger at an exponential rate. The IT power capacity of the larges…
DịchTheo Epoch AI, công suất điện cho các trung tâm dữ liệu AI hàng đầu đang tăng trưởng chóng mặt với tốc độ gấp đôi sau mỗi 10 tháng kể từ giữa năm 2024. Xu hướng này đặt ra câu hỏi lớn về khả năng duy trì hạ tầng năng lượng trong tương lai.
GPT-6 Astra just raised Epoch AI's capability record from 163 to 169. A substantial jump that still …
DịchGPT-6 Astra đạt 169 điểm trên thang đo ECI của Epoch AI, vượt qua kỷ lục cũ là 163. Sự tiến bộ này tương đương với khoảng 5 tháng phát triển theo xu hướng hiện tại và vẫn nằm trong phạm vi dự báo của các mô hình tăng trưởng AI.
GPT-6 Astra hit a record 169 on Epoch AI's capability index, jumping 6 points past the previous ceil…
DịchGPT-6 Astra vừa đạt 169 điểm trên thang đo ECI, vượt qua kỷ lục cũ là 163 điểm. Dù cho thấy bước tiến về năng lực, kết quả này vẫn nằm trong biên độ dự báo về xu hướng phát triển suy luận của AI.
GPT-6 Astra has set a new ECI record, with a score of 169. This is a substantial jump from the prior…
DịchGPT-6 Astra vừa xác lập kỷ lục ECI mới với 169 điểm, vượt qua mức 163 điểm trước đó. Mô hình này cũng đạt thành tích ấn tượng trong các bài kiểm tra về toán học, lập trình và tư duy logic, khẳng định bước tiến đáng kể trong năng lực suy luận của AI.
The Epoch Capabilities Index (ECI) frontier has advanced by 14 points/year since reasoning models we…
DịchNghiên cứu từ Epoch AI chỉ ra rằng kể từ khi các mô hình suy luận (reasoning models) xuất hiện, chỉ số năng lực AI (ECI) đã tăng trưởng 14 điểm mỗi năm, vượt xa mức 6 điểm trong kỷ nguyên trước đó.
Over the last few weeks, we ran informal experiments testing GPT-5.6 Sol's computer use by having it…
DịchEpoch AI đã thử nghiệm GPT-5.6 Sol với tựa game Slay the Spire. Kết quả cho thấy AI này làm chủ thao tác máy tính tốt nhưng vẫn cần cải thiện tư duy chiến thuật để đạt trình độ chuyên gia.
What are the big questions about AI capabilities that govern the impact AI will have on the world? I…
DịchGreg H. Burnham từ Epoch AI phân tích những thách thức then chốt quyết định tác động của AI đối với thế giới, đồng thời làm rõ cách các bộ tiêu chuẩn đánh giá của họ giúp giải quyết những vấn đề này.