24/09

Thứ Năm · 2 tin
Arena@arena
Hướng dẫnĐiểm AI 67/100

Cùng sự kiệnClaude Opus 5.5 (Max) thống trị bảng xếp hạng Code Arena: WebDev với chi phí rẻ hơn 60%

ICYMI: Claude Opus 5.5 (Max) landed #1 in the Code Arena: WebDev with a price 60% lower than the nex…

DịchClaude Opus 5.5 (Max) vừa giành vị trí dẫn đầu bảng xếp hạng Code Arena: WebDev với mức giá chỉ 16 USD/triệu token, rẻ hơn 60% so với đối thủ GPT-6 Astra (Max).

Cùng sự kiện, tinh chọn hiển thị «Anthropic giải mã lý do Claude Opus 5.5 là lựa chọn tối ưu cho lập trình với ngữ cảnh dài»
Artificial Analysis@ArtificialAnlys
Hướng dẫnĐiểm AI 69/100

Đã có đại diệnMiMo-V2.6-Pro, Claude Opus 5.5 và GPT-6 Luna/Sol thiết lập chuẩn mực mới về hiệu năng và chi phí AI

The Intelligence Index vs Cost per Task Pareto frontier shifted this week with the releases of MiMo-…

DịchArtificial Analysis cho biết sự ra mắt của MiMo-V2.6-Pro, Claude Opus 5.5 cùng bộ đôi GPT-6 Luna và Sol đã thay đổi đáng kể biểu đồ Pareto về chỉ số thông minh so với chi phí trên mỗi tác vụ, với 11 điểm dữ liệu mới được thiết lập.

Cùng sự kiện, tinh chọn hiển thị «Anthropic giải mã lý do Claude Opus 5.5 là lựa chọn tối ưu cho lập trình với ngữ cảnh dài»

23/09

Thứ Tư · 5 tin
Rohan Paul@rohanpaul_ai
Hướng dẫnĐiểm AI 62/100

Chi phí huấn luyện AI đạt chuẩn benchmark giảm 47% mỗi quý kể từ năm 2023

AI costs are indeed dropping dramatically. On GPQA Diamond, Epoch estimates OpenAI's o3 model neede…

DịchTheo Epoch AI, chi phí để đạt cùng một mức điểm benchmark trên các mô hình AI đang giảm mạnh khoảng 47% mỗi quý. Đơn cử, chi phí cho một bài toán trên GPQA đã giảm tới 725 lần chỉ trong vòng 18 tháng, cho thấy tốc độ tối ưu hóa hiệu năng AI đang tăng tốc chóng mặt.

Elon Musk@elonmusk
Mô hìnhĐiểm AI 42/100

Grok 4.7: Mô hình nhỏ nhưng hiệu năng ấn tượng với chi phí tối ưu

Interesting. Grok 4.7 is performing fairly well for a smallish model.

DịchGrok 4.7 đạt kết quả 94% trong bài kiểm tra Next.js, bám sát các mô hình hàng đầu như Opus 5.5 và GPT 6 Sol, trong khi có chi phí vận hành rẻ hơn từ 2 đến 7 lần.

Diễn biến sự kiện · 24 bài →Thêm 6 nguồn khác đưa tinX: Arena (@arena)X: Hongming (@hongming731)IT HomeX: karminski (@karminski3)MarkTechPostX: Alexandr Wang (Scale AI nhà sáng lập/Meta Giám đốc AI) (@alexandr_wang)
Rohan Paul@rohanpaul_ai
Mô hìnhĐiểm AI 43/100

So sánh hiệu năng GPT-6 Sol, Grok 4.7 và các mô hình AI trong việc tạo dựng bối cảnh Star Wars

Very interesting experiments by @thehypedotnews gpt-6 sol vs grok 4.7 vs gpt-6 astra vs muse spark…

DịchThử nghiệm tạo file HTML cho bối cảnh Star Wars cho thấy GPT-6 Sol dẫn đầu về tốc độ (nhanh gấp đôi), trong khi Muse Spark 1.3 tối ưu nhất về chi phí. Tất cả các mô hình đều hoàn thành tốt nhiệm vụ với tổng chi phí thấp.

Epoch AI: Nghiên cứu, dữ liệu và đánh giá
Nghiên cứuĐiểm AI 66/100

Tinh chọnBáo cáo Epoch AI: Chi phí để đạt cùng mức hiệu năng AI giảm 47% mỗi quý

Nghiên cứu từ Epoch AI cho thấy chi phí để đạt được cùng một mức hiệu năng AI giảm trung bình 47% mỗi quý. Tốc độ này cho thấy sự tiến bộ vượt bậc trong hiệu quả tính toán kể từ khi các mô hình ngôn ngữ lớn thương mại ra đời vào cuối năm 2021.


Vì sao đáng đọc: Báo cáo cung cấp dữ liệu định lượng quan trọng về kinh tế học AI, giúp người đọc hiểu rõ tốc độ tối ưu hóa chi phí thực tế trong ngành, rất có giá trị cho giới chuyên môn.
Boris Cherny@bcherny
Mô hìnhĐiểm AI 71/100

Đã có đại diệnTrải nghiệm thực tế Claude Opus 5.5: Nhanh hơn Fable 5.1 và tiết kiệm chi phí tới 51%

Opus 5.5 is a really good model. It's been my daily driver the last few weeks. We had Opus 5.5 and …

DịchBoris Cherny từ Anthropic cho biết Claude Opus 5.5 vượt trội hơn Fable 5.1 trong tác vụ chuyển đổi mã nguồn từ C sang Rust với tốc độ nhanh hơn và chi phí vận hành thấp hơn đáng kể.

Cùng sự kiện, tinh chọn hiển thị «Claude Opus 5.5 chính thức có mặt trên OpenRouter: Đỉnh cao mới về lập trình và khả năng tự hành»

22/09

Thứ Ba · 2 tin
Haider@haider1
Mô hìnhĐiểm AI 30/100

Cùng sự kiệnCursorBench 4.0: Cuộc đua hiệu năng và chi phí giữa các mô hình AI hàng đầu

this is absurd actually CursorBench 4.0: grok 4.7 xhigh: 46.3% - $6.01/task fable 5.1 medium: 46.8…

DịchCursorBench 4.0 cho thấy sự bứt phá ấn tượng của Grok 4.7 xhigh với tỷ lệ thành công 46,3% ở mức giá tối ưu, vượt qua cả GPT-5.6 sol max trong bài kiểm tra lập trình.

Cùng sự kiện, tinh chọn hiển thị «Đánh giá Grok 4.7: Lọt Top 4 bảng xếp hạng trí tuệ, năng lực lập trình bứt phá mạnh mẽ»

18/09

Thứ Sáu · 3 tin
Mustafa Suleyman (Microsoft AI CEO)@mustafasuleyman
Mô hìnhĐiểm AI 48/100

MAI-Image-2.6: Thiết lập chuẩn mực mới về hiệu năng và chi phí tạo ảnh AI

Best quality-price performance in the world for image gen! 🔥

DịchMAI-Image-2.6 cùng các mô hình mới như Muse Image và GPT Images 2.5 đang tạo ra bước ngoặt lớn, giúp việc tạo ảnh chất lượng cao trở nên nhanh chóng và tiết kiệm chi phí hơn bao giờ hết.

Artificial Analysis@ArtificialAnlys
Mô hìnhĐiểm AI 39/100

Muse Image và các mô hình mới: Cuộc đua tối ưu chi phí và tốc độ tạo ảnh AI

Generating high-quality images is cheaper and faster than ever. Muse Image, MAI-Image-2.6 and GPT Im…

DịchSự xuất hiện của Muse Image, MAI-Image-2.6 và GPT Images 2.5 đang thiết lập chuẩn mực mới, giúp việc tạo ảnh chất lượng cao trở nên nhanh chóng và tiết kiệm chi phí hơn bao giờ hết.

17/09

Thứ Năm · 1 tin

13/09

Chủ Nhật · 1 tin

12/09

Thứ Bảy · 1 tin
Tibo@thsottiaux
NgànhĐiểm AI 35/100

Astra khắc phục lỗi hiệu năng và reset hạn mức sử dụng cho người dùng

Hi Astra users. A reset and a quick update on quality issues that have been posted around. Working …

DịchĐội ngũ Astra đã xử lý các lỗi kỹ thuật gây gián đoạn trải nghiệm, bao gồm vấn đề về tần suất kích hoạt kỹ năng và quản lý ngữ cảnh. Hiệu năng hệ thống hiện đã được cải thiện đáng kể và hạn mức sử dụng của người dùng sẽ được đặt lại trước nửa đêm nay.

11/09

Thứ Sáu · 1 tin
OpenAI Developers@OpenAIDevs
NgànhĐiểm AI 24/100

Đánh giá hiệu năng GPT-Live-1: Chuẩn mực mới cho trợ lý giọng nói chuyên nghiệp

How does GPT-Live-1 perform on the benchmarks that matter most for production voice agents? We focu…

DịchGPT-Live-1 được kiểm chứng qua các tiêu chí khắt khe như khả năng hoàn thành tác vụ, hội thoại đa vòng, tốc độ phản hồi và gọi hàm công cụ, khẳng định vị thế trong ứng dụng thực tế.

10/09

Thứ Năm · 2 tin
SemiAnalysis@SemiAnalysis_
NgànhĐiểm AI 35/100

Nhà khoa học trưởng Nvidia đánh giá cao bộ tiêu chuẩn đo lường InferenceX của SemiAnalysis

Nvidia Chief Scientist Bill Dally: "What everyone is showing, acutally did see some slides on this a…

DịchTrong buổi tọa đàm tại Bảo tàng Lịch sử Máy tính, nhà khoa học trưởng của Nvidia, Bill Dally, đã dành lời khen ngợi cho bộ tiêu chuẩn InferenceX của SemiAnalysis vì khả năng cung cấp chính xác những dữ liệu mà thị trường đang thực sự quan tâm.

09/09

Thứ Tư · 2 tin
Epoch AI@EpochAIResearch
Hướng dẫnĐiểm AI 55/100

Epoch AI đo lường độ trễ TTFT: GPT-5.6 tăng theo hàm bậc hai, Claude 5 giữ mức tuyến tính

OpenAI GPT-5.6 models and Anthropic Claude 5 models have different pricing structures at long contex…

DịchNghiên cứu từ Epoch AI cho thấy độ trễ phản hồi từ đầu (TTFT) của GPT-5.6 tăng theo hàm bậc hai khi ngữ cảnh dài ra, trong khi dòng Claude 5 duy trì hiệu suất ổn định hơn với xu hướng tuyến tính.

08/09

Thứ Ba · 1 tin

04/09

Thứ Sáu · 4 tin
Rohan Paul@rohanpaul_ai
Hướng dẫnĐiểm AI 61/100

Cùng sự kiệnGPT-6 Astra thiết lập kỷ lục mới với 169 điểm trên chỉ số năng lực Epoch AI (ECI)

GPT-6 Astra hit a record 169 on Epoch AI's capability index, jumping 6 points past the previous ceil…

DịchGPT-6 Astra vừa đạt 169 điểm trên thang đo ECI, vượt qua kỷ lục cũ là 163 điểm. Dù cho thấy bước tiến về năng lực, kết quả này vẫn nằm trong biên độ dự báo về xu hướng phát triển suy luận của AI.

Cùng sự kiện, bài đại diện «Epoch AI: GPT-6 Astra thiết lập kỷ lục ECI mới với 169 điểm»
Emad Mostaque@EMostaque
Hướng dẫnĐiểm AI 21/100

Emad Mostaque dự báo AI thế hệ mới sẽ nhanh và rẻ gấp 100 lần vào năm tới

Next year frontier models are going to one shot everything 100x faster & cheaper than they are …

DịchCựu CEO Stability AI dự đoán các mô hình tiên tiến sẽ sớm đạt hiệu suất vượt trội, thực hiện mọi tác vụ chỉ trong một lần xử lý với chi phí và tốc độ tối ưu gấp 100 lần hiện tại.

Epoch AI@EpochAIResearch
Nghiên cứuĐiểm AI 63/100

Epoch AI: GPT-6 Astra thiết lập kỷ lục ECI mới với 169 điểm

GPT-6 Astra has set a new ECI record, with a score of 169. This is a substantial jump from the prior…

DịchGPT-6 Astra vừa xác lập kỷ lục ECI mới với 169 điểm, vượt qua mức 163 điểm trước đó. Mô hình này cũng đạt thành tích ấn tượng trong các bài kiểm tra về toán học, lập trình và tư duy logic, khẳng định bước tiến đáng kể trong năng lực suy luận của AI.

Thêm 2 nguồn khác đưa tinX: Rohan Paul (@rohanpaul_ai)X: Kim (@kimmonismus)
Alexandr Wang (Scale AI nhà sáng lập/Meta Giám đốc AI)@alexandr_wang
Hướng dẫnĐiểm AI 20/100

Scale AI: Muse Spark 1.3 thiết lập chuẩn mực mới trên bảng xếp hạng Artificial Analysis

this is a good graph

DịchAlexandr Wang, nhà sáng lập Scale AI, vừa chia sẻ biểu đồ cho thấy mô hình Muse Spark 1.3 đạt hiệu suất vượt trội trên đường biên Pareto của Artificial Analysis, khẳng định vị thế cạnh tranh mạnh mẽ trong lĩnh vực AI.

03/09

Thứ Năm · 2 tin
Alexandr Wang (Scale AI nhà sáng lập/Meta Giám đốc AI)@alexandr_wang
Hướng dẫnĐiểm AI 22/100

Alexandr Wang đánh giá cao hiệu năng vượt trội của Muse Spark 1.3 so với Fable 5.1

pretty good from muse spark 1.3

DịchNhà sáng lập Scale AI chia sẻ bài kiểm tra cho thấy Muse Spark 1.3 hoàn thành tác vụ chỉ trong 1 phút với chi phí gần như bằng 0, trong khi Fable 5.1 mất tới 70 phút và tốn 13 USD cho cùng một yêu cầu.

02/09

Thứ Tư · 3 tin
Yuchen Jin@Yuchenj_UW
Hướng dẫnĐiểm AI 46/100

GLM-5.3 trên Databricks đạt tốc độ 310 tok/s, dẫn đầu về hiệu năng suy luận

GLM-5.3 at 310 tok/s! Databricks inference is #1 in both speed and latency, again. On our internal…

DịchTheo đánh giá từ Yuchen Jin, GLM-5.3 trên nền tảng Databricks đạt tốc độ 310 tok/s với độ trễ cực thấp, vượt trội so với các đối thủ. Mô hình này cũng được đánh giá là mã nguồn mở mạnh nhất về khả năng lập trình, cạnh tranh trực tiếp với Fable 5 và Opus 4.8.

Kim@kimmonismus
Hướng dẫnĐiểm AI 32/100

Fable 5.1 gây sốt với điểm benchmark vượt kỳ vọng, thách thức các ông lớn AI

Fable 5.1 benchmarls are insane. Ngl, i did not expect such jumps. Terminal-Bench 4.0, Science-Ben…

DịchKOL @kimmonismus chia sẻ kết quả benchmark ấn tượng của Fable 5.1 trên các nền tảng như Terminal-Bench 4.0 và HLE, vượt xa các đối thủ như Opus 5 và GPT-5.6 Sol, tạo áp lực lớn lên OpenAI và Astra.

01/09

Thứ Ba · 1 tin
Rohan Paul@rohanpaul_ai
Hướng dẫnĐiểm AI 49/100

So sánh hiệu năng OpenClaw 2.0 và Hermes Agent trên nền tảng GLM 5.3

OpenClaw 2.0 vs Hermes experiment by @atomicbot_ai is a good example of why the model alone tells yo…

DịchThử nghiệm từ Rohan Paul cho thấy OpenClaw 2.0 và Hermes Agent có sự khác biệt rõ rệt về cơ chế tự kiểm tra và tối ưu hóa tài nguyên khi thực hiện tác vụ tạo kịch bản phim trên GLM 5.3.

31/08

Thứ Hai · 1 tin

28/08

Thứ Sáu · 1 tin
Artificial Analysis@ArtificialAnlys
Hướng dẫnĐiểm AI 52/100

Agnes 2.5 Pro Beta bứt phá với chỉ số thông minh đạt 49 điểm

Agnes AI's Agnes 2.5 Pro Beta scores 49 on the Artificial Analysis Intelligence Index, up 9 points f…

DịchPhiên bản Agnes 2.5 Pro Beta ghi nhận bước tiến lớn với chỉ số thông minh đạt 49 điểm, nhờ khả năng tác vụ tự hành (Agentic) cải thiện vượt bậc, dù tiêu tốn gấp đôi lượng token so với bản tiền nhiệm.

27/08

Thứ Năm · 1 tin
Artificial Analysis@ArtificialAnlys
Mô hìnhĐiểm AI 67/100

Cùng sự kiệnRa mắt GLM-5.3-Flash: Đỉnh cao mới về hiệu năng trên chi phí

GLM-5.3-Flash scores 57 on the Artificial Analysis Intelligence Index. At $0.09 Cost per Task, it si…

Dịchvừa trình làng GLM-5.3-Flash với 320B tham số, đạt 57 điểm trên bảng xếp hạng Artificial Analysis. Mô hình này gây ấn tượng mạnh khi sở hữu hiệu năng ngang ngửa các đối thủ lớn như GPT-5.6 Terra nhưng với chi phí vận hành tối ưu hơn.

Cùng sự kiện, tinh chọn hiển thị «Zhipu ra mắt GLM-5.3-Flash: Mô hình đa phương thức mạnh mẽ với chi phí cực thấp»

26/08

Thứ Tư · 1 tin

23/08

Chủ Nhật · 1 tin

21/08

Thứ Sáu · 1 tin
Artificial Analysis@ArtificialAnlys
Sản phẩmĐiểm AI 50/100

Artificial Analysis ra mắt Chỉ số Độ chính xác Endpoint: Hiệu suất dao động từ 73% đến 100%

Another fantastic evening at our latest Inference, Measured event in San Francisco. We explored how …

DịchTại sự kiện Inference, Measured, Artificial Analysis đã công bố Chỉ số Độ chính xác Endpoint, đánh giá các nhà cung cấp AI dựa trên ba tiêu chí so với mô hình tự lưu trữ. Kết quả cho thấy các yếu tố kỹ thuật như nén KV-cache và giới hạn ngữ cảnh ảnh hưởng đáng kể đến chất lượng thực tế.

19/08

Thứ Tư · 1 tin
Artificial Analysis@ArtificialAnlys
Sản phẩmĐiểm AI 44/100

Ra mắt nền tảng Optima: Tự thiết lập bài kiểm tra hiệu năng mô hình AI

Last week we launched Optima, a new platform for benchmarking models on your own workloads and compa…

DịchNền tảng Optima mới cho phép người dùng tự chạy các bài kiểm tra hiệu năng trên chính khối lượng công việc của mình, giúp so sánh chính xác tốc độ, chi phí và chất lượng giữa các mô hình AI.

15/08

Thứ Bảy · 1 tin
Artificial Analysis@ArtificialAnlys
Hướng dẫnĐiểm AI 65/100

DeepSeek V4 Pro 0813 ra mắt: Giá tăng 264% nhưng hiệu năng cải thiện không đáng kể

DeepSeek V4 Pro 0813 scores 53 on the Artificial Analysis Intelligence Index, 8 points above April's…

DịchDeepSeek vừa trình làng mô hình flagship V4 Pro 0813 với điểm số 53 trên Artificial Analysis, chỉ nhỉnh hơn phiên bản V4 Flash 0731 đúng 1 điểm dù mức giá tăng vọt.

Thêm 1 nguồn khác đưa tinX: Kim (@kimmonismus)
Tổng 39 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (52 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “hiệu năng AI” | AIHOT.vn