24/08

Thứ Hai · 20 tin
NVIDIA Blog
Sản phẩmĐiểm AI 45/100

NVIDIA nâng cấp Vera Rubin cho hệ thống AI Agent, Groq 3 LPX chính thức đi vào sản xuất

NVIDIA mở rộng khả năng tạo token tốc độ cao trên nền tảng Vera Rubin NVL72 để tối ưu cho các hệ thống AI Agent. Đồng thời, hệ thống Groq 3 LPX đã được đưa vào sản xuất hàng loạt, tập trung vào sự phối hợp toàn diện giữa hạ tầng thay vì chỉ dựa vào sức mạnh đơn lẻ của chip.

Thêm 1 nguồn khác đưa tinIT Home
NVIDIA Blog
Sản phẩmĐiểm AI 63/100

Tinh chọnNVIDIA Vera Rubin NVL72 thiết lập chuẩn mực mới: Hiệu suất xử lý AI Agent tăng gấp 30 lần

Dữ liệu từ NVIDIA cho thấy Vera Rubin NVL72 giúp tăng lưu lượng xử lý trên mỗi megawatt lên gấp 30 lần và giảm chi phí trên mỗi triệu token xuống 35 lần so với thế hệ GB300 NVL72.

Thêm 1 nguồn khác đưa tinJiqizhixin

Vì sao đáng đọc: Tin tức quan trọng về phần cứng thế hệ mới của NVIDIA, tác động trực tiếp đến chi phí vận hành và hiệu suất của các hệ thống AI Agent quy mô lớn.
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 37/100

DataSpace: Benchmark mới cho thấy AI Agent chỉ đạt độ chính xác 66,34% trong xử lý dữ liệu phức tạp

A strong LLM does not automatically make a reliable data agent: DataSpace shows that the harness, cr…

DịchDataSpace đánh giá khả năng phân tích dữ liệu đa nguồn của AI Agent. Kết quả cho thấy ngay cả mô hình mạnh nhất cũng chỉ đạt 66,34% độ chính xác, đồng thời nhấn mạnh tầm quan trọng của việc tối ưu hóa framework điều khiển.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 42/100

Meta công bố EvoHarness-RL: Đưa Qwen3-8B đạt hiệu suất 96.9% trong tác vụ ALFWorld

New Meta paper says giving an agent more memory and tools is not enough if the agent never learns wh…

DịchNghiên cứu mới từ Meta giới thiệu EvoHarness-RL, phương pháp huấn luyện RL giúp AI tự quyết định thời điểm dùng công cụ thay vì truy cập liên tục, giúp Qwen3-8B tăng vọt hiệu suất giải quyết tác vụ phức tạp.

Xiaobei@frxiaobei
Hướng dẫnĐiểm AI 53/100

Bản chất của kỹ thuật Agent: Là hệ thống phân tán, không phải kỹ thuật viết Prompt

Tác giả khẳng định thách thức lớn nhất của Agent không nằm ở Prompt mà ở độ tin cậy của hệ thống. Việc xây dựng Agent thực chất là giải quyết các bài toán về trạng thái, tính đồng nhất và khả năng quan sát trong hệ thống phân tán.

Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 39/100

NVIDIA giới thiệu ACES: Phương pháp mới đánh giá kỹ năng của AI Agent

Very interesting new paper from NVIDIA. (bookmark it) It takes a closer look at evaluating agent s…

DịchNVIDIA đề xuất ACES, phương pháp đánh giá hiệu suất AI Agent bằng cách so sánh kết quả thực hiện nhiệm vụ giữa việc có và không có hỗ trợ kỹ năng chuyên biệt. Nghiên cứu cho thấy ACES giúp đo lường chính xác hơn về hiệu quả hành vi so với các phương pháp chấm điểm truyền thống.

Xiaobei@frxiaobei
Hướng dẫnĐiểm AI 49/100

Bài học từ lỗi AI Agent: Đừng nhầm lẫn đầu ra của mô hình với trạng thái hệ thống

Hai sự cố AI Agent cho thấy sai lầm khi coi kết quả từ LLM là trạng thái thực tế. Cần tách biệt logic suy luận của AI với mã nguồn xác định để xử lý dữ liệu, tránh việc bỏ sót thông báo quan trọng do lỗi diễn giải.

AI Notes@AYi_AInotes
Hướng dẫnĐiểm AI 41/100

DeepSeek V4-Flash-Vision-Exp: Giải pháp thay thế Claude Code với chi phí cực rẻ

DeepSeek ra mắt mô hình đa phương thức V4-Flash-Vision-Exp với hiệu năng tiệm cận Claude Opus-4.8 nhưng chi phí chỉ 0,22 USD/triệu token. Kết hợp với mã nguồn mở Harness, đây là lựa chọn thay thế hoàn hảo cho Claude Code giúp tối ưu đáng kể chi phí lập trình AI.

SemiAnalysis@SemiAnalysis_
Nghiên cứuĐiểm AI 64/100

Benchmark AgentX: Liệu 'hào sâu' CUDA có giữ vững vị thế trong suy luận AI Agent?

AgentX - InferenceXv3: Does CUDA Moat Hold up in Agentic Inferencing? $3 Million USD dataset open s…

DịchAgentX giới thiệu bộ dữ liệu 3 triệu USD với ngữ cảnh 1 triệu token, tối ưu hóa KVCache cho AI Agent đạt hiệu suất trên 95% trên các nền tảng phần cứng mạnh mẽ như GB300 và MI355.

Tomer Tunguz Blog (phân tích VC)
Hướng dẫnĐiểm AI 62/100

Tinh chọnAI Agent nên 'sống' bao lâu là tối ưu?

Việc để AI Agent chạy quá lâu dễ gây suy giảm khả năng tập trung và rủi ro bảo mật. Giải pháp là thiết lập vòng đời 24 giờ cho trợ lý cá nhân, sử dụng các sub-agent chuyên biệt cho tác vụ ngắn hạn và chỉ lưu trữ các tùy chỉnh quan trọng vào cuối ngày.


Vì sao đáng đọc: Bài viết đưa ra góc nhìn thực tiễn và giải pháp kỹ thuật cụ thể cho vấn đề quản lý bộ nhớ của AI Agent, rất hữu ích cho người dùng và lập trình viên.
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 36/100

Active Inference: Giải pháp giúp AI tự quyết định khi nào cần nạp thêm dữ liệu

AI agents have an expensive problem: when a request is missing information, they either guess too ea…

DịchNghiên cứu mới đề xuất cơ chế Active Inference giúp AI tự đánh giá chi phí và lợi ích trước khi thực hiện các thao tác như tìm kiếm hay gọi công cụ, giúp tối ưu hóa hiệu suất và độ chính xác thay vì thực hiện tự động.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 27/100

MerchantBench: Đánh giá khả năng vận hành kinh doanh dài hạn của các tác nhân AI

Most agent benchmarks end after one task, but running a store doesn't, and that's where these agents…

DịchMerchantBench thử thách các tác nhân AI quản lý cửa hàng trực tuyến trong một năm, từ chọn sản phẩm đến quản lý dòng tiền. Kết quả cho thấy nhiều AI đạt điểm cao nhưng thực tế đã ngừng hoạt động từ sớm, làm nổi bật lỗ hổng trong tính nhất quán dài hạn của các mô hình hiện nay.

Testing Catalog@testingcatalog
Sản phẩmĐiểm AI 32/100

Perplexity thử nghiệm tính năng tùy chỉnh mức độ xử lý cho AI Agent

Perplexity is working on a new granular effort selector for Perplexity Computer. Being able to run…

DịchPerplexity đang phát triển bộ chọn mức độ nỗ lực cho Perplexity Computer, cho phép người dùng tối ưu hóa hiệu suất và tiết kiệm hạn mức sử dụng (credits) khi thực hiện các tác vụ đơn giản.

Simon Willison Blog
Hướng dẫnĐiểm AI 31/100

Drew Breunig: Bảo mật AI Agent với môi trường thực thi cô lập và chiến lược tối ưu chi phí LLM

Drew Breunig cảnh báo về tính tự chủ của AI Agent và đề xuất dùng Teleport để bảo mật. Ông cũng khuyên doanh nghiệp nên ưu tiên các mô hình hiệu quả như Opus hay GLM thay vì các model đắt đỏ để tối ưu hóa chi phí lập trình.

JiQiZhiXin
Nghiên cứuĐiểm AI 88/100

Tinh chọnPlayWorld: Bước tiến mới trong đánh giá mô hình thế giới thông qua AI Agent

Nhóm nghiên cứu từ HKU và các đối tác giới thiệu PlayWorld, một chuẩn đánh giá mới cho phép AI Agent 'trải nghiệm' mô hình thế giới để kiểm chứng tính nhất quán hình học và logic tương tác thay vì chỉ dựa vào các chuỗi hành động cố định.


Vì sao đáng đọc: Đề tài mang tính thực tiễn cao trong việc giải quyết bài toán đánh giá mô hình thế giới (world models), vốn đang là xu hướng quan trọng trong phát triển AI thế hệ mới.

23/08

Chủ Nhật · 21 tin
DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 23/100

Điểm tin nghiên cứu AI tuần qua: Đột phá về kỹ năng và cơ chế 'quên' của AI Agent

The Top AI Papers of the Week (August 17 - 23): - SocialRL - Strategy Lock-In - Agent Lightning v1….

DịchTổng hợp các nghiên cứu AI tiêu biểu từ 17-23/8, tập trung vào tối ưu hóa kỹ năng cho AI Agent, cơ chế phân cấp trí nhớ và giải quyết các nút thắt trong điều khiển hệ thống thông minh.

DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 31/100

Điểm tin AI tuần này: Đột phá huấn luyện Agent và giải mã nút thắt kỹ năng

Microsoft giới thiệu Agent Lightning v1.0 giúp tích hợp Agent vào học tăng cường mà không cần viết lại code, đồng thời cải thiện đáng kể hiệu suất mô hình Qwen3.5-9B. Ngoài ra, các nghiên cứu mới còn giải quyết tình trạng quá tải kỹ năng và đề xuất phương pháp đo lường hiện tượng 'quên' trong mô hình AI.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 36/100

Bộ dữ liệu GitSkills: Gần một nửa trong 3,8 triệu tệp kỹ năng trên GitHub là bản sao

A public GitHub now holds 3.8 million agent skill files. And finds that over half of the agent skil…

DịchPhân tích từ bộ dữ liệu GitSkills cho thấy hơn 50% trong 3,8 triệu tệp kỹ năng AI trên GitHub là bản sao trùng lặp, gây rủi ro về bảo mật và khó khăn trong việc cập nhật các bản vá lỗi từ tác giả gốc.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 37/100

Chi phí ẩn của AI Agent: Mỗi kỹ năng tiêu tốn 50-280 token trong prompt

Agents shouldn't pay rent for skills they rarely use. Right now, the only way to give an agent a sk…

DịchNghiên cứu chỉ ra rằng việc cài đặt kỹ năng cho AI Agent làm tăng vĩnh viễn dung lượng prompt từ 50-280 token/kỹ năng. Thay vì nạp tất cả, chuyên gia khuyên chỉ nên giữ lại các kỹ năng thiết yếu và gọi các kỹ năng khác theo nhu cầu để tối ưu hiệu suất.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 32/100

Microsoft ThinkingBox: Giải pháp đánh giá độ tin cậy thực tế cho AI Agent

Very relevant Microsoft paper on agent reliability. Succeeding once and being reliable are not the…

DịchMicrosoft chỉ ra rằng tỷ lệ thành công đơn lẻ không phản ánh độ tin cậy của AI Agent. Họ giới thiệu ThinkingBox, môi trường sandbox kiểm tra khả năng thực thi tác vụ thực tế trên hệ thống backend thay vì chỉ dựa vào phản hồi của AI.

AI Notes@AYi_AInotes
Hướng dẫnĐiểm AI 46/100

Dữ liệu OpenRouter: AI Agent chính thức vượt mặt con người về tiêu thụ Token

Dữ liệu mới từ OpenRouter cho thấy lượng Token tiêu thụ bởi AI Agent đã tăng gấp 14 lần kể từ tháng 2, hiện cao gấp 5 lần so với người dùng cá nhân. Sự bùng nổ này đánh dấu bước ngoặt khi nền kinh tế AI bắt đầu vận hành độc lập, không còn phụ thuộc vào giới hạn chú ý của con người.

The Decoder: AI News
Hướng dẫnĐiểm AI 56/100

AI đang trở thành khách hàng lớn nhất của chính mình: Lưu lượng token của AI Agent trên OpenRouter tăng vọt 14 lần

Dữ liệu từ OpenRouter cho thấy lưu lượng token của AI Agent đã tăng gấp 14 lần, vượt xa mức tăng trưởng từ người dùng con người. Sự bùng nổ này chủ yếu nhờ vào việc tối ưu hóa bộ nhớ đệm (caching), đánh dấu bước ngoặt khi AI bắt đầu tự tiêu thụ tài nguyên tính toán của chính nó.

Rohan Paul@rohanpaul_ai
Hướng dẫnĐiểm AI 44/100

AI Agent tiêu thụ token gấp 5 lần con người: Vị thế đàm phán của OpenRouter bị đe dọa

Agents are consuming tokens at nearly 5x the human rate, while their usage has exploded ~14X since F…

DịchKhi AI Agent chiếm ưu thế về lưu lượng token và phụ thuộc vào bộ nhớ đệm (cache) để tối ưu chi phí, khả năng ép giá nhà cung cấp của OpenRouter thông qua việc chuyển đổi dịch vụ đang dần mất đi hiệu quả.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 35/100

Nghiên cứu từ Thanh Hoa & Cornell: ACID-Agent ngăn chặn 'nhiễm độc' bộ nhớ cho AI

New Tsinghua + cornell study shows Agent memory can turn a recoverable mistake into a persistent one…

DịchNghiên cứu đề xuất ACID-Agent, áp dụng nguyên lý giao dịch cơ sở dữ liệu để ngăn AI lưu trữ các lỗi sai vào bộ nhớ dài hạn. Hệ thống chỉ ghi lại những kết quả đã qua kiểm chứng, giúp tăng độ tin cậy khi AI vận hành lâu dài.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 30/100

Nghiên cứu Stanford: Tranh luận giữa các AI Agent giúp cải thiện độ chính xác

New Stanford paper found that letting AI agents argue with each other and makes them more certain. …

DịchNghiên cứu từ Stanford cho thấy việc để các AI Agent tranh luận giúp tăng độ chính xác trong giải toán, nhưng cũng làm lộ rõ xu hướng thiên kiến chính trị. Các nhà phát triển cần theo dõi sự dịch chuyển quan điểm của nhóm thay vì chỉ tập trung vào điểm số hiệu năng.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 27/100

Task-CoEvolve: Tối ưu hóa chi phí đánh giá AI Agent bằng phương pháp chọn lọc bài kiểm tra thích ứng

Most of the tests used to grade an AI agent are a waste of money. A new University of Tokyo paper c…

DịchNghiên cứu từ Đại học Tokyo giới thiệu Task-CoEvolve, phương pháp giúp cắt giảm 67-80% chi phí đánh giá AI Agent bằng cách chỉ tập trung vào các bài kiểm tra có độ phân hóa cao, thay vì chạy toàn bộ tập dữ liệu dư thừa.

Lee Robinson@leerob
Hướng dẫnĐiểm AI 47/100

Làm sao để tin tưởng AI tự động thực hiện tác vụ? Giải pháp thiết kế tối ưu

How can you trust @Bots to operate autonomously? This is something we've carefully designed. First…

DịchLee Robinson chia sẻ cách cân bằng giữa tự động hóa và kiểm soát: sử dụng LLM để rà soát hành động, thiết lập quy tắc chặn các thao tác nguy hiểm và yêu cầu phê duyệt thủ công khi cần thiết.

TechCrunch: AI
Sản phẩmĐiểm AI 47/100

Startup của cựu nhân viên DeepMind ra mắt AI Faraday, vượt mặt Claude và GPT trong nghiên cứu khoa học

Inherent vừa huy động 50 triệu USD và giới thiệu Faraday, một AI agent dựa trên mô hình Qwen 27B, có khả năng tái lập các nghiên cứu khoa học vượt trội hơn cả Claude Opus và GPT-5.5 nhờ kỹ năng 'tư duy nghiên cứu' được rèn luyện qua học tăng cường.

Greg Brockman@gdb
Hướng dẫnĐiểm AI 28/100

Tốc độ bùng nổ của AI Agent: Xử lý hơn 10 tỷ token mỗi tuần

agentic adoption has been super fast, easy to forget how far the field has come

DịchSự phát triển của AI Agent đang tăng tốc chóng mặt. Nếu như một năm trước, việc xử lý 10 tỷ token mỗi năm đã là một cột mốc đáng nể, thì nay con số này đã được thực hiện chỉ trong một tuần.

Kim@kimmonismus
Hướng dẫnĐiểm AI 41/100

Năm 2026: Kỷ nguyên của AI Agent với lượng tiêu thụ token gấp 5 lần con người

If you need one final proof that 2026 is the year of agents, here you have it. 2025 was the year o…

DịchSau năm 2025 tập trung vào suy luận, 2026 chính thức trở thành năm của AI Agent. Dữ liệu từ a16z cho thấy các tác nhân AI hiện tiêu thụ lượng token gấp 5 lần con người, tăng trưởng mạnh mẽ gấp 14 lần chỉ trong vài tháng.

Thêm 1 nguồn khác đưa tinX: Rohan Paul (@rohanpaul_ai)
DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 47/100

Microsoft ra mắt Thinkingbox: Bộ tiêu chuẩn đánh giá độ tin cậy của AI Agent

Banger paper from Microsoft. It's on agent reliability in real business workflows. (bookmark it) …

DịchMicrosoft giới thiệu Thinkingbox, môi trường sandbox giúp kiểm tra độ tin cậy của AI Agent trong các quy trình kinh doanh thực tế với hơn 500 kịch bản từ bán lẻ đến bảo hiểm. Công cụ này tập trung đánh giá trạng thái hệ thống thay vì chỉ dựa vào phản hồi văn bản.

Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
NgànhĐiểm AI 52/100

MCP công bố lộ trình mới: Tập trung vào giao thức thông minh, truyền tải HTTP và bảo mật doanh nghiệp

Lộ trình mới của MCP tập trung vào 5 ưu tiên chính, bao gồm chuẩn hóa Tasks, tối ưu hóa truyền tải HTTP, tăng cường bảo mật định danh cho AI Agent và cải thiện trải nghiệm cho nhà phát triển SDK.

22/08

Thứ Bảy · 19 tin
Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 35/100

Tối ưu hóa truy vấn: Thiết lập hàm mục tiêu cho ngữ cảnh của AI Agent

What a fascinating paper on AI agents. A lot of the issues we see with AI agents today revolve arou…

DịchNghiên cứu mới đề xuất phương pháp 'Đặt câu hỏi tối ưu' giúp AI Agent giảm thiểu ảo giác và chi phí bằng cách coi việc thu thập ngữ cảnh là quá trình suy luận chủ động, cho phép đo lường hiệu suất thực tế so với mức tối ưu lý thuyết.

Đã tải 40 tin

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (89 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “AI agent” — Trang 30 | AIHOT.vn