14/08

Thứ Sáu · 68 tin
cb_doge@cb_doge
Hướng dẫnĐiểm AI 26/100

Cùng sự kiệnGrok 4.6 soán ngôi đầu bảng xếp hạng Realm Tax

Grok 4.6 wins again. 🏆 Grok 4.6 is #1 on micro1's Realm Tax benchmark with a 57.9% Best@3 score, b…

DịchGrok 4.6 vừa thiết lập cột mốc mới khi dẫn đầu bài kiểm tra Realm Tax (micro1) với điểm số Best@3 đạt 57.9%, vượt qua hàng loạt đối thủ sừng sỏ như Claude, GPT và Gemini.

Cùng sự kiện, bài đại diện «Grok 4.6 chính thức dẫn đầu bảng xếp hạng GDPVal-AA»
Databricks: Blog
Sản phẩmĐiểm AI 42/100

Unity AI Gateway ra mắt tính năng định tuyến thông minh: Giảm 30% chi phí vận hành AI mà vẫn giữ nguyên chất lượng

Databricks giới thiệu tính năng định tuyến thông minh trên Unity AI Gateway, giúp tự động tối ưu hóa việc lựa chọn mô hình cho các tác vụ lập trình, từ đó cắt giảm hơn 30% chi phí suy luận mà không làm giảm hiệu suất.

Artificial Analysis@ArtificialAnlys
Mô hìnhĐiểm AI 72/100

Cùng sự kiệnGoogle ra mắt Gemini 3.7 Flash: Đỉnh cao mới về tốc độ và hiệu năng

Google has released Gemini 3.7 Flash, improving 4 points over Gemini 3.6 Flash and reaching the Inte…

DịchGoogle vừa trình làng Gemini 3.7 Flash, đạt 56 điểm trên bảng xếp hạng Artificial Analysis. Phiên bản này thiết lập chuẩn mực mới khi cân bằng hoàn hảo giữa sức mạnh trí tuệ và tốc độ phản hồi siêu nhanh.

Cùng sự kiện, tinh chọn hiển thị «Google DeepMind ra mắt Gemini 3.7 Flash: Bước tiến đột phá cho lập trình và tác vụ AI Agent»
Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 37/100

Harness-IF: Phương pháp định lượng mức độ tuân thủ quy tắc của AI Agent

If you write rules in an AGENTS.md, this one is worth your time. When a coding agent follows your r…

DịchHarness-IF đánh giá khả năng tuân thủ các quy tắc trong AGENTS.md của AI Agent bằng cách loại bỏ các yếu tố ngẫu nhiên. Kết quả cho thấy độ chính xác thực tế thấp hơn dự đoán, đồng thời khẳng định hệ thống và chỉ dẫn người dùng luôn được ưu tiên hơn mô tả công cụ.

Sherwin Wu@sherwinwu
Sản phẩmĐiểm AI 43/100

Cerebras ra mắt GPT-5.6 Sol Ultrafast: Tốc độ siêu khủng 750 tokens/giây

GPT-5.6 Sol Ultrafast is here!! 750 tokens per second honestly feels instantaneous for most worklo…

DịchCerebras giới thiệu chế độ Sol Ultrafast với tốc độ 750 tokens/giây, nhanh gấp 14 lần thông thường. Mô hình này hoàn thành bài kiểm tra 'Humanity's Last Exam' chỉ trong hơn 11 giờ, vượt xa hiệu suất của Claude Fable 5 với độ chính xác tương đương.

cb_doge@cb_doge
Hướng dẫnĐiểm AI 42/100

Cùng sự kiệnGrok 4.6 soán ngôi đầu bảng xếp hạng GPQA Diamond

Grok 4.6 wins again. 👑 Grok 4.6 takes the #1 spot on GPQA Diamond with a score of 94.9%, beating G…

DịchGrok 4.6 vừa thiết lập cột mốc mới với 94,9% điểm số trên GPQA Diamond, vượt qua hàng loạt đối thủ sừng sỏ như GPT-5.6, Gemini 3.1 Pro và Claude Opus 5 để dẫn đầu thị trường.

Cùng sự kiện, bài đại diện «Grok 4.6 chính thức dẫn đầu bảng xếp hạng GDPVal-AA»

13/08

Thứ Năm · 45 tin
Artificial Analysis@ArtificialAnlys
Sản phẩmĐiểm AI 60/100

Artificial Analysis ra mắt Optima: Nền tảng tùy chỉnh đánh giá hiệu năng AI

We're launching Optima. Now anyone can create a custom benchmark for their use case, leveraging Arti…

DịchOptima cho phép người dùng xây dựng bộ tiêu chuẩn đánh giá riêng dựa trên dữ liệu cá nhân hoặc HuggingFace, giúp so sánh chính xác chi phí, tốc độ và hiệu suất giữa các mô hình AI hàng đầu để tối ưu hóa lựa chọn.

Thêm 1 nguồn khác đưa tinThe Decoder: AI News
SiliconFlow@SiliconFlowAI
Sản phẩmĐiểm AI 67/100

Tinh chọnAlibaba ra mắt mô hình mã nguồn mở Qwen3.8-2.4T-A95B, SiliconFlow hỗ trợ ngay lập tức

🚀 Day-0 Support! @Alibaba_Qwen has open-sourced Qwen3.8-2.4T-A95B - and it's now live on SiliconFlo…

DịchAlibaba vừa công bố mô hình Qwen3.8-2.4T-A95B với 2,4 nghìn tỷ tham số, tập trung vào lập trình và tác vụ thông minh. SiliconFlow đã tích hợp sẵn API với mức giá cạnh tranh cho người dùng.

Diễn biến sự kiện · 6 bài →Thêm 5 nguồn khác đưa tinX: Qwen (@Alibaba_Qwen)X: Rohan Paul (@rohanpaul_ai)IT HomeX: Clément Delangue (Hugging Face CEO) (@ClementDelangue)Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)

Vì sao đáng đọc: Đây là bước tiến lớn trong lĩnh vực mô hình ngôn ngữ lớn mã nguồn mở, có tác động trực tiếp đến cộng đồng lập trình và phát triển ứng dụng AI tại Việt Nam.
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 36/100

Toàn cảnh rủi ro từ LLM: Phân loại 5 giai đoạn nguy hại trong vòng đời mô hình

This study builds a simple map of all the main ways large language models can cause harm. Using abo…

DịchNghiên cứu tổng hợp từ 200 tài liệu đã xây dựng bản đồ phân loại rủi ro toàn diện cho LLM, từ khâu dữ liệu đầu vào, quá trình vận hành đến các tác động xã hội, đồng thời đề xuất chiến lược phòng thủ đa tầng.

AI Notes@AYi_AInotes
Mô hìnhĐiểm AI 67/100

Cùng sự kiệnDeepSeek-V4-Pro ra mắt: Hiệu năng đỉnh cao với chi phí vận hành cực thấp

DeepSeek vừa trình làng phiên bản V4-Pro 0813 với khả năng xử lý tác vụ Agent ngang hàng các mô hình hàng đầu, đặc biệt là sự bứt phá ngoạn mục của DeepSWE từ 12.8 lên 62.7 điểm.

Cùng sự kiện, bài đại diện «DeepSeek chính thức ra mắt phiên bản V4 Pro»
Testing Catalog@testingcatalog
Mô hìnhĐiểm AI 52/100

Cùng sự kiệnDeepSeek-V4-Pro ra mắt: Nâng cấp mạnh mẽ cho tác vụ Agent

DeepSeek announced DeepSeek-V4-Pro! The model is now available on DeepSeek Chat under "Expert Mode…

DịchDeepSeek vừa trình làng DeepSeek-V4-Pro với khả năng tùy chỉnh cường độ suy luận linh hoạt và hỗ trợ chuẩn OpenAI Responses API, tối ưu hóa đặc biệt cho các tác vụ lập trình.

Cùng sự kiện, bài đại diện «DeepSeek chính thức ra mắt phiên bản V4 Pro»
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

SkillZip: Nén đồ thị bảo toàn hợp đồng cho thư viện kỹ năng AI có khả năng mở rộng

SkillZip là khung trừu tượng hóa thủ tục giúp nén các thư viện kỹ năng của AI dưới dạng đồ thị, cho phép tái sử dụng hiệu quả các đoạn mã mà vẫn đảm bảo tính thực thi và khả năng mở rộng trong bối cảnh hạn chế của LLM.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 35/100

Nghiên cứu từ DeepMind: LLM có thể suy luận, nhưng khó lòng 'phát minh' ra thuyết tương đối

Could a language model derive General Relativity yet still be unable to invent it? This Google Deep…

DịchDeepMind chỉ ra rằng LLM gặp khó khăn trong việc tạo ra các đột phá khoa học như thuyết tương đối vì thiếu khả năng 'suy luận ngược' (abduction). Dù giỏi xử lý dữ liệu, mô hình ngôn ngữ vẫn bị giới hạn bởi cơ chế nén dữ liệu thay vì tư duy sáng tạo vượt bậc.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 47/100

Ready Cohorts: Tối ưu hóa GPU cho LLM Agent bằng cách giảm thiểu độ trễ giao tiếp

Nghiên cứu giới thiệu phương pháp 'ready-cohort' nhằm xác định ranh giới thực thi trên GPU cho các tác nhân LLM, giúp giữ quyết định tại thiết bị và tăng tốc độ xử lý lên tới 2,39 lần so với cách tiếp cận truyền thống.

Francois Chollet@fchollet
NgànhĐiểm AI 54/100

ARC Prize 2024: Bước tiến đột phá của kỹ thuật huấn luyện tại thời điểm kiểm thử (TTT)

Test-time training was popularized during the ARC Prize 2024 competition, after being explored in pa…

DịchFrançois Chollet đánh giá cao tiềm năng của TTT khi giúp ARC Prize 2024 đạt mức tăng trưởng kỷ lục lên 55,5%. Đây được xem là bước nhảy vọt lớn nhất về khả năng tổng quát hóa của AI kể từ khi học trong ngữ cảnh (in-context learning) xuất hiện.

Rohan Paul@rohanpaul_ai
Mô hìnhĐiểm AI 52/100

Cùng sự kiệnDeepSeek-V4-Pro: Hiệu năng tiệm cận GPT-5.6 với chi phí rẻ hơn 31 lần

DeepSeek-V4-Pro (Max) is expected to shift the Pareto frontier DeepSeek-V4-Pro (Max) reached 1607 i…

DịchDeepSeek-V4-Pro đạt 1607 điểm trên Code Arena, chỉ kém GPT-5.6 15 điểm nhưng có giá thành chỉ bằng 1/31. Với mức giá 0,435 USD/triệu token, mô hình này đang định nghĩa lại tiêu chuẩn hiệu năng trên giá thành trong phân khúc cao cấp.

Cùng sự kiện, bài đại diện «DeepSeek chính thức ra mắt phiên bản V4 Pro»
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnMô hình hóa tác nhân AI 'bình dân': Giả lập xã hội LLM quy mô lớn ngay trên laptop

Nghiên cứu đề xuất phương pháp thay thế các tác nhân LLM phức tạp bằng mô hình tham số thấp, cho phép giả lập xã hội hàng nghìn tác nhân trên máy tính cá nhân mà vẫn đảm bảo độ chính xác về hành vi vĩ mô.


Vì sao đáng đọc: Giải pháp đột phá giúp giảm chi phí tính toán cho các mô phỏng xã hội AI phức tạp, có tính ứng dụng cao cho giới nghiên cứu và phát triển hệ thống đa tác nhân.
Rohan Paul@rohanpaul_ai
Mô hìnhĐiểm AI 52/100

Cùng sự kiệnMô hình MoE mã nguồn mở Qwen3.8-2.4T-A95B chính thức có mặt trên HuggingFace

So Qwen3.8-2.4T-A95B, the 2.4T-parameter open-weight mixture-of-experts model dropped on Huggingface…

DịchQwen3.8-2.4T-A95B, mô hình ngôn ngữ lớn kiến trúc MoE với 2,4 nghìn tỷ tham số, vừa được phát hành mã nguồn mở trên nền tảng HuggingFace.

Cùng sự kiện, tinh chọn hiển thị «Alibaba ra mắt mô hình mã nguồn mở Qwen3.8-2.4T-A95B, SiliconFlow hỗ trợ ngay lập tức»
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Ảo tưởng về công cụ thị giác: Đánh giá nhân quả khả năng 'tư duy bằng hình ảnh' của LLM

Nghiên cứu chỉ ra rằng các thao tác thị giác như cắt/phóng ảnh trong LLM đa phương thức thường không cải thiện hiệu suất đáng kể mà lại gây tốn kém tài nguyên. Tác giả đề xuất mô hình đồ thị nhân quả để kiểm chứng liệu các công cụ này có thực sự hỗ trợ tư duy hay chỉ là sự ngẫu nhiên.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Liệu AI có giữ vững kịch bản? Đánh giá khả năng duy trì tính nhất quán trong kể chuyện tương tác

Nghiên cứu giới thiệu NCP-Bench, bộ tiêu chuẩn đánh giá khả năng duy trì tính logic và nhất quán của LLM khi đối mặt với các tình huống kể chuyện tương tác phức tạp, nơi AI thường gặp khó khăn trong việc bám sát kịch bản gốc.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

NeuPAT: Tối ưu hóa phân bổ độ dẻo thần kinh giúp mô hình đa phương thức giữ vững khả năng ngôn ngữ

NeuPAT là phương pháp mới giúp bảo vệ các neuron quan trọng trong LLM khi huấn luyện đa phương thức, ngăn chặn tình trạng suy giảm khả năng ngôn ngữ vốn có bằng cách phân bổ mức độ cập nhật linh hoạt cho từng neuron.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 61/100

ToolHazard: Khung tổng hợp môi trường đối kháng giúp kiểm thử bảo mật cho AI Agent

ToolHazard là khung làm việc tự động tạo ra các môi trường giả lập có trạng thái để tấn công và kiểm thử lỗ hổng của AI Agent, giúp phát hiện các điểm yếu trong quy trình làm việc phức tạp và khả năng thực thi tác vụ dài hạn.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 54/100

Spark-to-Paper: Giải pháp tự động viết bài nghiên cứu khoa học thông qua các kỹ năng mô-đun

Spark-to-Paper tích hợp 13 kỹ năng có thể kết hợp vào các trợ lý lập trình để tự động hóa quy trình viết bài nghiên cứu từ đầu đến cuối, đạt độ chính xác trích dẫn 99,5% với chi phí tối ưu.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 92/100

Tinh chọnAn toàn cho AI Agent: Tại sao cần chuyển dịch sang cơ chế kiểm soát thời gian thực?

Thay vì chỉ dựa vào huấn luyện mô hình, bài viết đề xuất an toàn cho AI Agent cần được thực thi thông qua các hợp đồng thời gian thực, bao gồm cơ chế ngăn chặn hành vi nguy hiểm và yêu cầu bằng chứng xác thực cho mọi tác vụ.


Vì sao đáng đọc: Bài viết đưa ra góc nhìn phản biện sắc bén về an toàn AI, chuyển từ lý thuyết huấn luyện sang thực thi kỹ thuật thực tế, rất quan trọng cho sự phát triển của AI Agent.
Elon Musk@elonmusk
Hướng dẫnĐiểm AI 36/100

Cùng sự kiệnGrok 4.6 chính thức dẫn đầu bảng xếp hạng đánh giá của Databricks

Grok 4.6 reaches #1 on @databricks

DịchElon Musk xác nhận mô hình Grok 4.6 của xAI đã vươn lên vị trí số 1 trên bảng xếp hạng hiệu năng của Databricks, khẳng định bước tiến vượt bậc về năng lực xử lý.

Cùng sự kiện, bài đại diện «Grok 4.6 chính thức dẫn đầu bảng xếp hạng GDPVal-AA»
cb_doge@cb_doge
Hướng dẫnĐiểm AI 42/100

Cùng sự kiệnGrok 4.6 chính thức soán ngôi đầu bảng xếp hạng suy luận InferenceEval

Grok 4.6 takes the #1 spot on InferenceEval 🔥 🥇 Grok 4.6 - 46.9% 🥈 GPT-5.6 Sol - 44.1% 🥉 Opus 5…

DịchGrok 4.6 vừa vươn lên dẫn đầu bảng xếp hạng InferenceEval với 46,9% điểm số, vượt qua GPT-5.6 Sol và Opus 5. Phiên bản này cho thấy bước tiến vượt bậc trong khả năng giải quyết các tác vụ lập trình và suy luận thực tế.

Cùng sự kiện, bài đại diện «Grok 4.6 chính thức dẫn đầu bảng xếp hạng GDPVal-AA»
cb_doge@cb_doge
Hướng dẫnĐiểm AI 37/100

Cùng sự kiệnGrok 4.6 soán ngôi đầu bảng xếp hạng trí tuệ nhân tạo pháp lý Harvey

Grok 4.6 is officially #1 on the Harvey Legal Agent Benchmark 🥇 It scored 22.0% on realistic, mult…

DịchGrok 4.6 chính thức dẫn đầu bảng xếp hạng Harvey với 22% điểm số trong các tác vụ pháp lý đa bước, vượt xa các đối thủ như Fable 5 và phiên bản tiền nhiệm Grok 4.5.

Cùng sự kiện, bài đại diện «Grok 4.6 chính thức dẫn đầu bảng xếp hạng GDPVal-AA»
cb_doge@cb_doge
Hướng dẫnĐiểm AI 28/100

Cùng sự kiệnGrok 4.6 soán ngôi đầu bảng xếp hạng OfficeQA Pro, vượt mặt GPT-5.6

Grok 4.6 ranks #1 on OfficeQA Pro with 63.2% accuracy, outperforming Opus 5, Fable 5, and GPT-5.6 So…

DịchGrok 4.6 vừa thiết lập cột mốc mới trên OfficeQA Pro với độ chính xác 63,2%, vượt qua các đối thủ sừng sỏ như Opus 5 và GPT-5.6 trong việc xử lý tài liệu văn phòng thực tế.

Cùng sự kiện, bài đại diện «Grok 4.6 chính thức dẫn đầu bảng xếp hạng GDPVal-AA»
Eric Zakariasson@ericzakariasson
Hướng dẫnĐiểm AI 18/100

Cùng sự kiệnTổng hợp video so sánh hiệu năng Grok 4.5 và 4.6

here are sevent grok 4.5 vs 4.6 comparison videos! age of empires clone

DịchBộ sưu tập 7 video so sánh trực quan sự khác biệt giữa Grok 4.5 và 4.6, bao gồm cả thử nghiệm mô phỏng trò chơi Đế chế (Age of Empires).

Cùng sự kiện, tinh chọn hiển thị «Cursor hợp tác cùng SpaceXAI ra mắt Grok 4.6: Bước tiến mới trong lập trình AI»
Nathan Lambert@natolambert
Hướng dẫnĐiểm AI 17/100

Shoggoth: Biểu tượng văn hóa và ẩn dụ sâu sắc trong giới huấn luyện AI

I made a short video covering the history of Shoggoths, as used as a post-training meme and also dee…

DịchNathan Lambert chia sẻ về nguồn gốc của 'Shoggoth' - một meme kinh điển trong cộng đồng hậu huấn luyện AI, đồng thời là ẩn dụ đầy ám ảnh về bản chất của các mô hình ngôn ngữ hiện đại.

Đã tải 40 tin

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (44 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “llm” — Trang 31 | AIHOT.vn