26/09

Thứ Bảy · 1 tin
IT Home
Nghiên cứuĐiểm AI 48/100

Cùng sự kiệnAI học cách 'bắt lỗi': GPT-6 Astra đạt 80% độ chính xác khi kiểm tra lắp ráp nội thất

Benchmark FAB từ Epoch AI cho thấy OpenAI GPT-6 Astra dẫn đầu với 80% độ chính xác trong việc phát hiện lỗi lắp ráp nội thất, vượt qua Claude Fable 5.1 (70%) và Claude Opus 5 (61%).

Cùng sự kiện, bài đại diện «GPT-6 Astra của OpenAI đạt độ chính xác 80% trong việc phát hiện lỗi lắp ráp nội thất IKEA»

24/09

Thứ Năm · 4 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 41/100

Epoch AI ra mắt FAB: Benchmark lắp ráp nội thất cho thấy bước tiến vượt bậc của AI

So many different kind of AI benchmarks are being released. This one is cool, "Furniture Assembly B…

DịchEpoch AI giới thiệu Furniture Assembly Benchmark (FAB), thử thách khả năng suy luận không gian của AI thông qua việc phát hiện lỗi lắp ráp nội thất. Điểm số cao nhất đã tăng vọt từ 28% lên 80% chỉ trong 10 tháng, cho thấy sự cải thiện đáng kể trong lĩnh vực vốn là điểm yếu của AI.

Ethan Mollick@emollick
Mô hìnhĐiểm AI 47/100

Cùng sự kiệnĐiểm chuẩn FAB của Epoch AI: Khả năng lắp ráp nội thất của AI tăng vọt

This is both fun and a useful measure of how much better multimodal AI has gotten In a short time.

DịchBenchmark FAB mới từ Epoch AI kiểm tra khả năng phát hiện lỗi lắp ráp nội thất của AI thông qua hình ảnh. Chỉ trong 10 tháng, điểm số cao nhất đã tăng ấn tượng từ 28% lên 80%, cho thấy bước tiến lớn của AI đa phương thức.

Cùng sự kiện, bài đại diện «Epoch AI ra mắt FAB: Bộ tiêu chuẩn đánh giá khả năng lắp ráp nội thất của AI»
Epoch AI@EpochAIResearch
Nghiên cứuĐiểm AI 37/100

Epoch AI ra mắt FAB: Bộ tiêu chuẩn đánh giá khả năng lắp ráp nội thất của AI

Can AI tell if you've built your IKEA furniture wrong? Our new benchmark, the Furniture Assembly Ben…

DịchEpoch AI giới thiệu Furniture Assembly Benchmark (FAB), thử thách khả năng của AI trong việc phát hiện lỗi lắp ráp nội thất dựa trên hướng dẫn và hình ảnh thực tế. Hiệu suất của các mô hình đã tăng vọt từ 28% lên 80% chỉ trong 10 tháng.

Thêm 1 nguồn khác đưa tinX: Ethan Mollick (@emollick)

23/09

Thứ Tư · 4 tin
Epoch AI: Nghiên cứu, dữ liệu và đánh giá
NgànhĐiểm AI 49/100

Nghiên cứu từ Epoch AI: Quốc gia nào dễ tổn thương nhất trước cú sốc nguồn cung chip?

Epoch AI cập nhật dữ liệu chuỗi cung ứng bán dẫn toàn cầu giai đoạn 2016-2022, giúp theo dõi dòng chảy chip và đo lường mức độ phụ thuộc của các quốc gia vào nhà sản xuất nước ngoài trước các rủi ro địa chính trị.

Rohan Paul@rohanpaul_ai
Hướng dẫnĐiểm AI 62/100

Chi phí huấn luyện AI đạt chuẩn benchmark giảm 47% mỗi quý kể từ năm 2023

AI costs are indeed dropping dramatically. On GPQA Diamond, Epoch estimates OpenAI's o3 model neede…

DịchTheo Epoch AI, chi phí để đạt cùng một mức điểm benchmark trên các mô hình AI đang giảm mạnh khoảng 47% mỗi quý. Đơn cử, chi phí cho một bài toán trên GPQA đã giảm tới 725 lần chỉ trong vòng 18 tháng, cho thấy tốc độ tối ưu hóa hiệu năng AI đang tăng tốc chóng mặt.

Epoch AI: Nghiên cứu, dữ liệu và đánh giá
Nghiên cứuĐiểm AI 66/100

Tinh chọnBáo cáo Epoch AI: Chi phí để đạt cùng mức hiệu năng AI giảm 47% mỗi quý

Nghiên cứu từ Epoch AI cho thấy chi phí để đạt được cùng một mức hiệu năng AI giảm trung bình 47% mỗi quý. Tốc độ này cho thấy sự tiến bộ vượt bậc trong hiệu quả tính toán kể từ khi các mô hình ngôn ngữ lớn thương mại ra đời vào cuối năm 2021.


Vì sao đáng đọc: Báo cáo cung cấp dữ liệu định lượng quan trọng về kinh tế học AI, giúp người đọc hiểu rõ tốc độ tối ưu hóa chi phí thực tế trong ngành, rất có giá trị cho giới chuyên môn.
Epoch AI@EpochAIResearch
Hướng dẫnĐiểm AI 56/100

Epoch AI: Chi phí vận hành AI giảm 47% mỗi quý, tốc độ nhanh kỷ lục trong lịch sử công nghệ

AI is getting cheaper more quickly than any other transformative tech in history. At a given level o…

DịchNghiên cứu từ Epoch AI cho thấy chi phí để đạt cùng một mức hiệu suất AI đang giảm 47% mỗi quý kể từ năm 2023, vượt xa tốc độ giảm giá của các công nghệ đột phá như giải trình tự DNA hay pin lithium.

22/09

Thứ Ba · 3 tin
Nathan Lambert@natolambert
Quan điểmĐiểm AI 53/100

Nathan Lambert tranh luận cùng Epoch AI về tác động thực sự của kỹ thuật chưng cất mô hình đối với các phòng lab Trung Quốc

The biggest disagreement JSD and I had in this podcast was on the impact of distillation. In our res…

DịchTrong podcast mới nhất, Nathan Lambert và chuyên gia từ Epoch AI đã có những bất đồng quan điểm sâu sắc về việc liệu kỹ thuật chưng cất (distillation) có thực sự giúp các phòng thí nghiệm AI tại Trung Quốc vượt qua rào cản hạn chế chip hay không.

Nathan Lambert: Interconnects
Quan điểmĐiểm AI 54/100

Nathan Lambert thảo luận cùng Epoch AI về RSI, khoảng cách công nghệ Mỹ-Trung và tác động của chưng cất mô hình

Trong podcast Interconnects, Nathan Lambert và chuyên gia từ Epoch AI phân tích sâu về tốc độ phát triển AI, sự chênh lệch năng lực giữa Mỹ và Trung Quốc cùng ảnh hưởng của kỹ thuật chưng cất mô hình.

Thêm 1 nguồn khác đưa tinX: Nathan Lambert (@natolambert)
Nathan Lambert@natolambert
Quan điểmĐiểm AI 41/100

Podcast cùng Nathan Lambert: Giải mã những ẩn số định hình tương lai AI tiên phong

New podcast with @datagenproc of @EpochAIResearch digging into the open questions determining the fu…

DịchNathan Lambert và đội ngũ Epoch AI thảo luận sâu về các vấn đề then chốt như dự báo RSI, vai trò của robot, khoảng cách công nghệ của Trung Quốc và tương lai của các mô hình AI hậu huấn luyện.

19/09

Thứ Bảy · 5 tin
Epoch AI: Nghiên cứu, dữ liệu và đánh giá
Nghiên cứuĐiểm AI 54/100

Epoch AI: Tỷ lệ công bố sử dụng AI trong các bản thảo toán học tăng vọt từ 4% lên 25%

Phân tích từ Epoch AI cho thấy sự gia tăng đột biến trong việc thừa nhận sử dụng AI tại các bản thảo toán học trên arXiv. Dù con số này phản ánh xu hướng ứng dụng rộng rãi, các nhà nghiên cứu lưu ý rằng nó cũng bao gồm cả sự thay đổi trong ý thức công khai và khó khăn trong việc phân định ranh giới hỗ trợ.

Epoch AI: Nghiên cứu, dữ liệu và đánh giá
Sản phẩmĐiểm AI 35/100

Epoch AI ra mắt công cụ theo dõi việc ứng dụng AI trong các nghiên cứu toán học trên arXiv

Epoch AI vừa giới thiệu công cụ mới giúp thống kê tỷ lệ và hình thức sử dụng AI trong các bản thảo toán học trên arXiv từ đầu năm 2023 đến tháng 8/2026, hỗ trợ các nhà nghiên cứu nắm bắt xu hướng ứng dụng công nghệ.

Epoch AI: Nghiên cứu, dữ liệu và đánh giá
Sản phẩmĐiểm AI 28/100

Cùng sự kiệnEpoch AI công bố bộ dữ liệu về xu hướng ứng dụng AI trong nghiên cứu toán học

Epoch AI vừa phát hành bộ dữ liệu chi tiết về xu hướng sử dụng AI trong các bài báo toán học trên arXiv theo từng tháng và lĩnh vực, cho phép cộng đồng nghiên cứu tải về miễn phí.

Cùng sự kiện, bài đại diện «Epoch AI ra mắt công cụ theo dõi việc ứng dụng AI trong các nghiên cứu toán học trên arXiv»
Epoch AI@EpochAIResearch
Hướng dẫnĐiểm AI 50/100

FrontierMath: GPT-6 Astra giải mã thành công bài toán hóc búa về quy tắc bỏ phiếu

Another problem from FrontierMath: Open Problems has been solved! The solution was elicited by Becke…

DịchEpoch AI công bố GPT-6 Astra đã giải quyết một bài toán trong FrontierMath bằng cách thiết lập quy tắc bỏ phiếu mới dựa trên hàm entropy hài hòa, mở ra hướng đi mới cho các quyết định tập thể công bằng.

Thêm 2 nguồn khác đưa tinX: Haider (@haider1)X: Kim (@kimmonismus)

18/09

Thứ Sáu · 3 tin
Karina Nguyen@karinanguyen
Sản phẩmĐiểm AI 50/100

Epoch AI ra mắt chương trình Benchmark Reviews: Kiểm định chất lượng 15 bộ tiêu chuẩn AI

Great initiative to eval the evals. It incentivizes the industry to build genuinely high-quality ben…

DịchEpoch AI vừa công bố sáng kiến Benchmark Reviews nhằm đánh giá độ tin cậy của các bộ tiêu chuẩn AI, với kết quả ban đầu cho thấy 4 bộ đạt chuẩn, 9 bộ bị lỗi và 2 bộ chưa đủ dữ liệu. Động thái này được kỳ vọng sẽ thúc đẩy ngành công nghiệp xây dựng các tiêu chuẩn đánh giá AI chất lượng hơn.

Ethan Mollick@emollick
NgànhĐiểm AI 48/100

Epoch AI ra mắt chương trình đánh giá chất lượng các bộ tiêu chuẩn AI

Epoch continues to do some of the best public benchmarking work on AI. This is helpful (and tells us…

DịchEpoch AI vừa khởi động dự án Benchmark Reviews nhằm kiểm định độ tin cậy của các bộ tiêu chuẩn AI hiện nay. Kết quả ban đầu cho thấy trong 15 bộ tiêu chuẩn được kiểm tra, chỉ có 4 bộ đạt yêu cầu, trong khi 9 bộ khác bị đánh giá là có khiếm khuyết.

Thêm 1 nguồn khác đưa tinX: Karina Nguyen (@karinanguyen)
Epoch AI@EpochAIResearch
Nghiên cứuĐiểm AI 48/100

Epoch AI khởi động dự án đánh giá tính minh bạch của các bộ tiêu chuẩn AI

Introducing Benchmark Reviews: our new initiative to audit AI benchmarks. We are launching with 15 b…

DịchEpoch AI vừa ra mắt chương trình 'Benchmark Reviews' nhằm kiểm định chất lượng các bộ tiêu chuẩn đo lường AI. Trong đợt đầu, họ đã đánh giá 15 bộ tiêu chuẩn, kết quả cho thấy 4 cái đạt chuẩn, 9 cái có khiếm khuyết và 2 cái chưa đủ dữ liệu.

17/09

Thứ Năm · 3 tin
Epoch AI: Nghiên cứu, dữ liệu và đánh giá
Sản phẩmĐiểm AI 53/100

Epoch AI mở rộng công cụ theo dõi trung tâm dữ liệu, bao phủ 44% năng lực tính toán AI toàn cầu

Epoch AI vừa nâng cấp công cụ theo dõi trung tâm dữ liệu, mở rộng phạm vi từ 13 lên 86 cơ sở, chiếm khoảng 44% tổng năng lực tính toán AI thế giới. Nền tảng cung cấp dữ liệu chi tiết về chip, vốn đầu tư và tiến độ xây dựng, đồng thời công khai phương pháp tính toán cho cộng đồng.

15/09

Thứ Ba · 1 tin
Epoch AI@EpochAIResearch
NgànhĐiểm AI 47/100

Khảo sát từ Epoch AI: Tỷ lệ người Mỹ sử dụng AI hàng ngày tăng gấp đôi

More US adults are using AI nearly every day, according to our polling results. The share of US adu…

DịchDữ liệu từ Epoch AI cho thấy số người Mỹ sử dụng AI gần như mỗi ngày đã tăng vọt từ 8% lên 19% chỉ trong vòng 6 tháng, phản ánh sự thâm nhập mạnh mẽ của AI vào đời sống thường nhật.

12/09

Thứ Bảy · 1 tin
Epoch AI: Nghiên cứu, dữ liệu và đánh giá
Nghiên cứuĐiểm AI 60/100

Tinh chọnEpoch AI đánh giá ExploitBench v0.1: Bộ tiêu chuẩn kiểm thử khả năng khai thác lỗ hổng V8

Epoch AI công bố đánh giá về ExploitBench v0.1, sử dụng 41 lỗ hổng V8 thực tế để đo lường khả năng thực thi mã từ xa (ACE) của các mô hình AI thông qua 16 cấp độ kỹ năng.


Vì sao đáng đọc: Đây là tài liệu quan trọng về an ninh mạng trong AI, cung cấp phương pháp đo lường thực tế cho khả năng tấn công của mô hình, rất có giá trị cho giới chuyên môn.

11/09

Thứ Sáu · 1 tin
Epoch AI@EpochAIResearch
NgànhĐiểm AI 42/100

Epoch AI: GPT-6 Astra duy trì mô hình định giá và độ trễ tương tự GPT-5.6

Earlier this week, we showed that GPT-5.6 and Claude 5 exhibit very different long-context TTFT scal…

DịchPhân tích từ Epoch AI cho thấy GPT-6 Astra tăng giá API khi vượt ngưỡng 272k token đầu vào, với đường cong độ trễ tương đồng GPT-5.6. Nghiên cứu cũng chỉ ra sự khác biệt trong cách xử lý ngữ cảnh dài giữa OpenAI và Claude, phản ánh qua cấu trúc định giá riêng biệt của từng bên.

10/09

Thứ Năm · 2 tin
Epoch AI: Nghiên cứu, dữ liệu và đánh giá
Nghiên cứuĐiểm AI 60/100

Tinh chọnĐánh giá HealthBench Professional: Epoch AI chỉ ra 50% tác vụ kiểm thử bị lỗi

Epoch AI đã thực hiện kiểm định độc lập trên bộ tiêu chuẩn HealthBench Professional của OpenAI và phát hiện một nửa trong số 50 tác vụ được lấy mẫu ngẫu nhiên gặp vấn đề nghiêm trọng về chất lượng.


Vì sao đáng đọc: Đây là báo cáo quan trọng về tính minh bạch và độ tin cậy của các bộ tiêu chuẩn đánh giá AI trong lĩnh vực y tế, thu hút sự quan tâm lớn từ giới nghiên cứu.

09/09

Thứ Tư · 1 tin
Epoch AI@EpochAIResearch
Hướng dẫnĐiểm AI 55/100

Epoch AI đo lường độ trễ TTFT: GPT-5.6 tăng theo hàm bậc hai, Claude 5 giữ mức tuyến tính

OpenAI GPT-5.6 models and Anthropic Claude 5 models have different pricing structures at long contex…

DịchNghiên cứu từ Epoch AI cho thấy độ trễ phản hồi từ đầu (TTFT) của GPT-5.6 tăng theo hàm bậc hai khi ngữ cảnh dài ra, trong khi dòng Claude 5 duy trì hiệu suất ổn định hơn với xu hướng tuyến tính.

08/09

Thứ Ba · 1 tin
Epoch AI: Nghiên cứu, dữ liệu và đánh giá
Nghiên cứuĐiểm AI 69/100

Tinh chọnEpoch AI phân tích độ trễ khi xử lý ngữ cảnh dài trên GPT-5.6 và Claude 5

Nghiên cứu từ Epoch AI cho thấy GPT-5.6 có độ trễ TTFT tăng theo đường cong bậc hai khi ngữ cảnh dài, trong khi dòng Claude 5 duy trì hiệu suất gần như tuyến tính.


Vì sao đáng đọc: Nghiên cứu kỹ thuật chuyên sâu về hiệu năng mô hình, cung cấp cái nhìn thực tế cho người dùng và nhà phát triển về khả năng xử lý ngữ cảnh dài của các model hàng đầu.

05/09

Thứ Bảy · 1 tin
Epoch AI@EpochAIResearch
Hướng dẫnĐiểm AI 37/100

Epoch AI: Công suất điện của các trung tâm dữ liệu AI lớn tăng gấp đôi mỗi 10 tháng

AI data centers have been getting larger at an exponential rate. The IT power capacity of the larges…

DịchTheo Epoch AI, công suất điện cho các trung tâm dữ liệu AI hàng đầu đang tăng trưởng chóng mặt với tốc độ gấp đôi sau mỗi 10 tháng kể từ giữa năm 2024. Xu hướng này đặt ra câu hỏi lớn về khả năng duy trì hạ tầng năng lượng trong tương lai.

04/09

Thứ Sáu · 3 tin
Kim@kimmonismus
Hướng dẫnĐiểm AI 71/100

GPT-6 Astra thiết lập kỷ lục mới trên bảng xếp hạng năng lực Epoch AI

GPT-6 Astra just raised Epoch AI's capability record from 163 to 169. A substantial jump that still …

DịchGPT-6 Astra đạt 169 điểm trên thang đo ECI của Epoch AI, vượt qua kỷ lục cũ là 163. Sự tiến bộ này tương đương với khoảng 5 tháng phát triển theo xu hướng hiện tại và vẫn nằm trong phạm vi dự báo của các mô hình tăng trưởng AI.

Rohan Paul@rohanpaul_ai
Hướng dẫnĐiểm AI 61/100

Cùng sự kiệnGPT-6 Astra thiết lập kỷ lục mới với 169 điểm trên chỉ số năng lực Epoch AI (ECI)

GPT-6 Astra hit a record 169 on Epoch AI's capability index, jumping 6 points past the previous ceil…

DịchGPT-6 Astra vừa đạt 169 điểm trên thang đo ECI, vượt qua kỷ lục cũ là 163 điểm. Dù cho thấy bước tiến về năng lực, kết quả này vẫn nằm trong biên độ dự báo về xu hướng phát triển suy luận của AI.

Cùng sự kiện, bài đại diện «Epoch AI: GPT-6 Astra thiết lập kỷ lục ECI mới với 169 điểm»
Epoch AI@EpochAIResearch
Nghiên cứuĐiểm AI 63/100

Epoch AI: GPT-6 Astra thiết lập kỷ lục ECI mới với 169 điểm

GPT-6 Astra has set a new ECI record, with a score of 169. This is a substantial jump from the prior…

DịchGPT-6 Astra vừa xác lập kỷ lục ECI mới với 169 điểm, vượt qua mức 163 điểm trước đó. Mô hình này cũng đạt thành tích ấn tượng trong các bài kiểm tra về toán học, lập trình và tư duy logic, khẳng định bước tiến đáng kể trong năng lực suy luận của AI.

Thêm 2 nguồn khác đưa tinX: Rohan Paul (@rohanpaul_ai)X: Kim (@kimmonismus)

02/09

Thứ Tư · 1 tin
Epoch AI@EpochAIResearch
Nghiên cứuĐiểm AI 40/100

Epoch AI: Các mô hình suy luận đẩy tốc độ tiến hóa AI lên gấp đôi

The Epoch Capabilities Index (ECI) frontier has advanced by 14 points/year since reasoning models we…

DịchNghiên cứu từ Epoch AI chỉ ra rằng kể từ khi các mô hình suy luận (reasoning models) xuất hiện, chỉ số năng lực AI (ECI) đã tăng trưởng 14 điểm mỗi năm, vượt xa mức 6 điểm trong kỷ nguyên trước đó.

28/08

Thứ Sáu · 1 tin
Epoch AI@EpochAIResearch
Hướng dẫnĐiểm AI 35/100

Epoch AI thử nghiệm khả năng chơi game của GPT-5.6

Over the last few weeks, we ran informal experiments testing GPT-5.6 Sol's computer use by having it…

DịchEpoch AI đã thử nghiệm GPT-5.6 Sol với tựa game Slay the Spire. Kết quả cho thấy AI này làm chủ thao tác máy tính tốt nhưng vẫn cần cải thiện tư duy chiến thuật để đạt trình độ chuyên gia.

15/08

Thứ Bảy · 1 tin
Epoch AI@EpochAIResearch
Hướng dẫnĐiểm AI 24/100

Lãnh đạo Epoch AI chia sẻ về các vấn đề cốt lõi và định hướng đánh giá năng lực AI

What are the big questions about AI capabilities that govern the impact AI will have on the world? I…

DịchGreg H. Burnham từ Epoch AI phân tích những thách thức then chốt quyết định tác động của AI đối với thế giới, đồng thời làm rõ cách các bộ tiêu chuẩn đánh giá của họ giúp giải quyết những vấn đề này.

Tổng 37 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (71 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Epoch AI” | AIHOT.vn