26/09

Thứ Bảy · 2 tin
Hongming@hongming731
NgànhĐiểm AI 44/100

CEO Stripe chia sẻ về Claude Code: 600 lần commit từ AI chỉ có 1 lần phải hoàn tác

CEO Stripe Patrick Collison cho biết một kỹ sư đã thực hiện hơn 600 commit hoàn toàn bằng AI với tỷ lệ lỗi cực thấp, đồng thời duy trì độ ổn định hệ thống ở mức 5.5 số 9. Ngoài ra, OpenRouter sau khi về tay Stripe đã đạt quy mô xử lý 10 nghìn tỷ token mỗi ngày.

Arena@arena
Nghiên cứuĐiểm AI 67/100

Đã có đại diệnGPT-6 Sol (Max) thiết lập chuẩn mực mới trên Agent Arena với hiệu suất tăng 7,7%

GPT-6 Sol (Max) by @OpenAI has reshaped the Agent Arena Pareto frontier with a +7.7% net improvement…

DịchOpenAI vừa đưa GPT-6 Sol (Max) vào bảng xếp hạng Agent Arena. Mô hình này đạt mức cải thiện ròng 7,7% dựa trên hơn 4.000 phiên hội thoại thực tế, xếp hạng 6 với chi phí trung bình 0,75 USD mỗi tác vụ.

Cùng sự kiện, tinh chọn hiển thị «Arena ra mắt thử nghiệm GPT-6 Sol và GPT-6 Luna, chuẩn bị công bố bảng xếp hạng»

24/09

Thứ Năm · 3 tin
The Decoder: AI News
Quan điểmĐiểm AI 66/100

Cùng sự kiệnChi phí hiệu năng AI giảm kỷ lục: Mỗi năm rẻ đi 13 lần, hiệu suất thuật toán tăng gấp 3

Nghiên cứu từ Epoch AI cho thấy chi phí để đạt cùng một mức hiệu năng AI giảm trung bình 47% mỗi quý. Đặc biệt, các mô hình như GPT-5.6 dự kiến sẽ đạt hiệu suất vượt trội với chi phí thấp hơn gấp nhiều lần so với các thế hệ tiền nhiệm.

Cùng sự kiện, tinh chọn hiển thị «Arena ra mắt thử nghiệm GPT-6 Sol và GPT-6 Luna, chuẩn bị công bố bảng xếp hạng»
Artificial Analysis@ArtificialAnlys
Hướng dẫnĐiểm AI 68/100

Đã có đại diệnClaude Opus 5.5 dẫn đầu bảng xếp hạng Coding Agent, nhưng chi phí mỗi tác vụ tăng lên 13,04 USD

Claude Opus 5.5 is the new #1 in the Artificial Analysis Coding Agent Index, with gains across all t…

DịchTheo đánh giá từ Artificial Analysis, Claude Opus 5.5 đã vươn lên vị trí số 1 trên Coding Agent Index với 66 điểm, nhờ hiệu suất vượt trội trong các bài kiểm tra lập trình chuyên sâu, dù đi kèm với mức chi phí vận hành cao hơn đáng kể.

Cùng sự kiện, tinh chọn hiển thị «Anthropic giải mã lý do Claude Opus 5.5 là lựa chọn tối ưu cho lập trình với ngữ cảnh dài»
Ethan Mollick@emollick
NgànhĐiểm AI 39/100

Chi phí đạt chuẩn trong các bài kiểm tra Toán và Khoa học AI đang giảm mạnh

This is a really important graph showing the cost of achieving 25% or 75% scores in various hard mat…

DịchBiểu đồ mới cho thấy chi phí để AI đạt điểm số cao trong các bài kiểm tra toán học và khoa học khó đang giảm chóng mặt, trong khi năng lực lại tăng lên. Điều này cho thấy việc tối ưu hóa chi phí cho một giải pháp cụ thể hiện nay có thể là tầm nhìn ngắn hạn.

23/09

Thứ Tư · 1 tin
Nathan Lambert@natolambert
Quan điểmĐiểm AI 35/100

Opus đứng đầu bảng xếp hạng AI: Liệu có phải là 'cỗ máy đốt token'?

Whenever I see a model top this chart, it's normally a bit of a red flag. Would love to be proven wr…

DịchViệc Opus chiếm lĩnh vị trí dẫn đầu gây ra nhiều hoài nghi khi mô hình này tiêu tốn lượng token khổng lồ cho mỗi tác vụ. Nhiều chuyên gia cho rằng chính sự kém hiệu quả này là lý do khiến nhà phát triển phải giảm giá dịch vụ.

19/09

Thứ Bảy · 1 tin
JiQiZhiXin
Sản phẩmĐiểm AI 88/100

Tinh chọnFable 5.1 vượt xa con người nhưng đắt gấp 2.5 lần: NeoCognition tính toán hiệu quả thực tế của AI Agent

NeoCognition ra mắt ApprenticeBench, bài kiểm tra mô phỏng môi trường làm việc thực tế cho AI Agent. Kết quả cho thấy Fable 5.1 và Astra vượt qua con người về hiệu suất xử lý công việc, đặt ra bài toán về chi phí và khả năng tự thích nghi của AI trong doanh nghiệp.


Vì sao đáng đọc: Bài viết cung cấp góc nhìn thực tế về hiệu suất AI trong môi trường doanh nghiệp thay vì chỉ dựa vào các bảng xếp hạng lý thuyết, rất hữu ích cho người làm công nghệ.

18/09

Thứ Sáu · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Không chỉ là số lượng: Chiến lược tạo ứng viên ảnh hưởng đến hiệu suất và năng lượng của LLM

Nghiên cứu chỉ ra rằng việc tăng số lượng phản hồi (N) giúp cải thiện khả năng suy luận của LLM, nhưng cách thức thực thi (batching) mới là yếu tố quyết định đến chi phí năng lượng và hiệu suất hệ thống.

16/09

Thứ Tư · 1 tin
Ethan Mollick@emollick
NgànhĐiểm AI 27/100

Mô hình phân loại nhanh: Giải pháp thay thế LLM hiệu quả và tiết kiệm

This is an excellent demo of an AI model designed to rapidly classify information according to decis…

DịchMột bản demo ấn tượng về mô hình AI chuyên biệt giúp phân loại thông tin dựa trên quy tắc quyết định. Dù không tạo văn bản như LLM, mô hình này vượt trội về tốc độ và chi phí, hứa hẹn là công cụ tối ưu cho các hệ thống xử lý dữ liệu quy mô lớn.

11/09

Thứ Sáu · 1 tin
Elvis Saravia@omarsar0
NgànhĐiểm AI 47/100

Sakana AI ra mắt Fugu Max và Fugu Ultra v2: Đột phá mới trong tối ưu hóa mô hình AI

I am extremely bullish on the Pareto frontier of collective intelligence. While everyone works on …

DịchSakana AI giới thiệu Fugu Max và Fugu Ultra v2, hai giải pháp tối ưu hóa giúp đạt hiệu suất đỉnh cao trong các tác vụ phức tạp với chi phí token cực thấp mà không cần phụ thuộc vào các mô hình ngoại lai.

10/09

Thứ Năm · 2 tin
Elvis Saravia@omarsar0
NgànhĐiểm AI 31/100

GPT-6 Astra: Tối ưu hóa hiệu suất và chi phí trong quy trình làm việc AI

Better models don't automatically mean smaller AI bills. Sometimes they mean you finally have a rea…

DịchGPT-6 Astra giúp hiện thực hóa các quy trình phức tạp chỉ với một lần phản hồi. Thay vì chỉ nhìn vào chi phí token, doanh nghiệp nên tập trung vào việc tối đa hóa kết quả thực tế đạt được trong cùng một ngân sách.

08/09

Thứ Ba · 1 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 68/100

Nghiên cứu của Microsoft: Hiệu suất của LLM Agent giảm mạnh khi thực hiện các tác vụ dài

New Microsoft paper. Long agent runs expose failures that short benchmarks miss. Agents can look rel…

DịchNghiên cứu mới từ Microsoft chỉ ra rằng các LLM Agent mất khả năng xử lý khi số bước thực hiện tăng lên, với tỷ lệ thành công giảm từ gần 100% xuống còn 0-33% ở bước thứ 16. Vấn đề nằm ở số lượng bước thay vì độ dài ngữ cảnh, đòi hỏi các giải pháp kiểm soát lỗi theo từng giai đoạn.

06/09

Chủ Nhật · 1 tin

04/09

Thứ Sáu · 1 tin
Kim@kimmonismus
Hướng dẫnĐiểm AI 71/100

GPT-6 Astra thiết lập kỷ lục mới trên bảng xếp hạng năng lực Epoch AI

GPT-6 Astra just raised Epoch AI's capability record from 163 to 169. A substantial jump that still …

DịchGPT-6 Astra đạt 169 điểm trên thang đo ECI của Epoch AI, vượt qua kỷ lục cũ là 163. Sự tiến bộ này tương đương với khoảng 5 tháng phát triển theo xu hướng hiện tại và vẫn nằm trong phạm vi dự báo của các mô hình tăng trưởng AI.

03/09

Thứ Năm · 1 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 52/100

Nghiên cứu DuMateBench: Khung Agent quyết định tới 27% hiệu suất của cùng một mô hình AI

New Stanford and other top research lab paper shows that the framework around an LLM can change agen…

DịchDuMateBench giới thiệu bộ tiêu chuẩn đánh giá AI Agent qua 200 tác vụ thực tế phức tạp, từ lập trình đến sáng tạo nội dung, giúp đo lường khả năng xử lý lỗi và môi trường thực tế của các mô hình.

02/09

Thứ Tư · 1 tin

29/08

Thứ Bảy · 3 tin
Rohan Paul@rohanpaul_ai
Hướng dẫnĐiểm AI 26/100

Tầng tác tử quan trọng hơn mô hình: Atomic Agent giúp GLM 5.3 tối ưu hiệu suất với chi phí cực thấp

Another example that the harness, more than the model itself, decides how far intelligence actually …

DịchAtomic Agent là lớp tác tử độc lập giúp GLM 5.3 cải thiện kết quả đáng kể chỉ với 0,77 USD chi phí phát sinh, chứng minh tầm quan trọng của kiến trúc tác tử so với việc chỉ dựa vào sức mạnh mô hình thuần túy.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 42/100

Đánh giá AI trong tác vụ dài hạn: Các mô hình hàng đầu chỉ đạt 27,3% hiệu suất con người

This paper is a brutal reality check for long-horizon AI. Give an agent a year of interconnected dec…

DịchNghiên cứu trên 8 mô hình AI hàng đầu cho thấy khả năng thực hiện các tác vụ kéo dài của chúng còn rất hạn chế, với kết quả tốt nhất chỉ đạt 27,3% so với năng suất trung bình của con người.

Aravind Srinivas (Perplexity CEO)@AravSrinivas
Hướng dẫnĐiểm AI 32/100

CEO Perplexity: Công cụ tìm kiếm của chúng tôi tối ưu nhất ở mọi mức độ tính toán

perplexity is the best at search at any level of compute, agnostic of how much compute the competito…

DịchCEO Aravind Srinivas khẳng định Perplexity dẫn đầu bảng xếp hạng Artificial Analysis nhờ hiệu suất vượt trội và chi phí suy luận thấp nhất thị trường, chỉ từ 0,028 USD mỗi tác vụ.

25/08

Thứ Ba · 2 tin
OpenRouter@OpenRouter
Hướng dẫnĐiểm AI 27/100

Ox Alpha gây sốt: Xử lý 8 nghìn tỷ token mỗi ngày chỉ sau 5 ngày ra mắt

Ox Alpha, the stealth frontier model that went live five days ago on OpenRouter, has attracted much …

DịchMô hình Ox Alpha vừa tạo nên cơn sốt trên OpenRouter khi đạt lưu lượng xử lý 8 nghìn tỷ token/ngày chỉ sau 5 ngày. Cộng đồng đang thảo luận sôi nổi với hơn 16,6 nghìn tỷ token được phân tích qua hàng ngàn tin nhắn.

opencode@opencode
NgànhĐiểm AI 29/100

Ox Alpha gây ấn tượng với khả năng xử lý 26 nghìn tỷ token chỉ trong 4 ngày

26T tokens of Ox Alpha in 4 days

DịchOx Alpha vừa thiết lập cột mốc ấn tượng khi xử lý khối lượng dữ liệu khổng lồ lên tới 26 nghìn tỷ token chỉ trong vòng 4 ngày, cho thấy bước tiến lớn về hiệu suất tính toán.

Thêm 1 nguồn khác đưa tinX: OpenRouter (@OpenRouter)

24/08

Thứ Hai · 1 tin
Tibo@thsottiaux
Hướng dẫnĐiểm AI 24/100

Năm 2026: Doanh nghiệp ưu tiên tối ưu hóa hiệu suất và độ tin cậy của mô hình AI

2026 is the year companies start seriously caring about model efficiency and reliability as it becom…

DịchKhi AI trở thành hạ tầng cốt lõi vào năm 2026, các doanh nghiệp sẽ chuyển trọng tâm sang việc nâng cao hiệu suất vận hành và đảm bảo độ tin cậy cho các mô hình AI.

22/08

Thứ Bảy · 1 tin

21/08

Thứ Sáu · 1 tin

19/08

Thứ Tư · 1 tin
Rohan Paul@rohanpaul_ai
Hướng dẫnĐiểm AI 36/100

Thử nghiệm lập trình 3D: DeepSeek-V4-Pro tiêu tốn lượng token gấp 48 lần Muse

This 3D coding test by @thehypedotnews found DeepSeek-V4-Pro-0813 used 48X more tokens than Muse Spa…

DịchTrong thử nghiệm xây dựng 3D, DeepSeek-V4-Pro-0813 tiêu tốn hơn 20 triệu token, gấp 48 lần so với Muse Spark 1.2, với chi phí 4,57 USD và thời gian xử lý hơn 91 phút.

18/08

Thứ Ba · 1 tin
Ethan Mollick@emollick
Hướng dẫnĐiểm AI 49/100

Thiếu tính biến dị sáng tạo: Rào cản lớn nhất của các mô hình AI hiện nay

And variance! The AI labs need to be thinking more about variance when considering creative tasks. T…

DịchViệc khó tạo ra các biến thể sáng tạo đa dạng đang hạn chế đáng kể giá trị thực tiễn của AI trong giải quyết vấn đề và các công việc đòi hỏi tư duy sáng tạo.

17/08

Thứ Hai · 1 tin
OpenAI Developers@OpenAIDevs
Hướng dẫnĐiểm AI 27/100

Bí quyết tối ưu chi phí và hiệu suất cho AI Agent với GPT-5.6

What are startups learning from building cost-effective agents with GPT-5.6? We worked with teams a…

DịchKhám phá cách các startup tận dụng GPT-5.6 để xây dựng AI Agent thông minh hơn, giúp xử lý các tác vụ phức tạp với chi phí vận hành tối ưu thông qua việc cải thiện suy luận và gọi công cụ.

16/08

Chủ Nhật · 2 tin
Rohan Paul@rohanpaul_ai
Hướng dẫnĐiểm AI 43/100

Grok 4.6 vượt mặt GPT-5.6 Sol về hiệu suất chi phí trong lập trình

Grok 4.6 beat GPT-5.6 Sol on agentic loop efficiency, spending $13.11 versus $20.18 across the same …

DịchGrok 4.6 hoàn thành các tác vụ lập trình với chi phí 13,11 USD, thấp hơn đáng kể so với 20,18 USD của GPT-5.6 Sol, đồng thời tối ưu hóa tốt hơn về thời gian và số lượng token nhờ tận dụng bộ nhớ đệm.

Thêm 3 nguồn khác đưa tinX: Elon Musk (@elonmusk, xAI)X: OpenAI Developers (@OpenAIDevs)X: karminski (@karminski3)

13/08

Thứ Năm · 1 tin
Ethan Mollick@emollick
Hướng dẫnĐiểm AI 47/100

Ethan Mollick: Giá trị thực của AI nằm ở độ chính xác của các tác nhân tự hành

I think this will turn out to be wrong, and not just because I suspect there are greater returns to …

DịchEthan Mollick cho rằng giá trị kinh tế của AI không nằm ở chatbot mà ở các tác nhân tự hành (agents). Khi độ chính xác tăng lên, khả năng xử lý các tác vụ phức tạp sẽ tăng theo cấp số nhân, tạo ra giá trị vượt xa dự đoán của nhiều chuyên gia.

Tổng 31 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (48 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “hiệu suất AI” | AIHOT.vn