02/09

Thứ Tư · 40 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 47/100

Nghiên cứu từ Microsoft: Sliding-window vượt trội hơn các biến thể Linear Attention trong suy luận tiết kiệm bộ nhớ

So happy to see this new Microsoft paper. If lower inference memory is the goal, this paper finds t…

DịchNghiên cứu chỉ ra rằng Sliding-window attention (SWA) hiệu quả hơn hầu hết các phương pháp Linear attention khi tối ưu bộ nhớ suy luận, chỉ cần kết hợp cửa sổ nhỏ và 4 token 'sink' đầu tiên.

Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Nghiên cứuĐiểm AI 54/100

Nghiên cứu mới: Mạng thần kinh nhân tạo tự hình thành cấu trúc ký hiệu bên trong

Nghiên cứu chỉ ra rằng các mô hình ngôn ngữ lớn (LLM) ẩn chứa cấu trúc ký hiệu Tensor Product Representation. Bằng phương pháp DISCOVER, các tác giả đã thay thế biểu diễn vector của 7 mô hình (như Llama-3.1, Qwen3) bằng các phương trình ký hiệu mà vẫn giữ nguyên hành vi của mô hình.

Kim@kimmonismus
Mô hìnhĐiểm AI 68/100

Cùng sự kiệnAlibaba ra mắt Qwen3.8-Max-0902: Mô hình 2.4 nghìn tỷ tham số với cửa sổ ngữ cảnh 1 triệu token

wtf Qwen 3.8 has been updated to version 0902 and is now almost at the same level as Fable 5 in benc…

DịchAlibaba vừa nâng cấp Qwen3.8-Max với phiên bản 0902, sở hữu 2.4 nghìn tỷ tham số và hỗ trợ 1 triệu token ngữ cảnh. Mô hình được tối ưu hóa cho lập trình và làm việc nhóm, hiện đã có mặt trên QwenCloud với mức giá cạnh tranh.

Cùng sự kiện, tinh chọn hiển thị «Qwen3.8-Max-0902 dẫn đầu Code Arena với hiệu suất vượt trội và mức giá cạnh tranh 5 USD/MToken»
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Hướng dẫnĐiểm AI 36/100

Kỹ sư Baseten giải mã 'Biên hiệu quả' trong suy luận LLM và các kỹ thuật tối ưu hóa

Bài viết phân tích khung 'Biên hiệu quả' của LLM, chia các kỹ thuật tối ưu thành hai nhóm: cân bằng giữa độ trễ và thông lượng, hoặc đẩy xa giới hạn hiệu suất để đạt hiệu quả tổng thể cao hơn.

TechNode
Mô hìnhĐiểm AI 85/100

Cùng sự kiệnAlibaba nâng cấp mô hình Qwen3.8-Max với bản cập nhật 0902

Alibaba vừa ra mắt phiên bản Qwen3.8-Max-0902, tập trung tối ưu hóa khả năng lập trình và làm việc nhóm. Mô hình này đã vươn lên dẫn đầu bảng xếp hạng CodeArena với số điểm ấn tượng 1.691.

Cùng sự kiện, tinh chọn hiển thị «Qwen3.8-Max-0902 dẫn đầu Code Arena với hiệu suất vượt trội và mức giá cạnh tranh 5 USD/MToken»
IT Home
Mô hìnhĐiểm AI 39/100

Elon Musk hé lộ Grok 4.7: Tăng 40% tham số, hứa hẹn vượt mặt mọi đối thủ

Elon Musk thông báo Grok 4.7 sẽ ra mắt vào ngày 12/9 với 2,1 nghìn tỷ tham số. Dù tốc độ phản hồi có thể chậm hơn đôi chút, mô hình này được kỳ vọng sẽ thiết lập tiêu chuẩn mới về hiệu suất và khả năng xử lý token.

Thêm 2 nguồn khác đưa tinX: Elon Musk (@elonmusk, xAI)X: Kim (@kimmonismus)
Yuchen Jin@Yuchenj_UW
Hướng dẫnĐiểm AI 46/100

GLM-5.3 trên Databricks đạt tốc độ 310 tok/s, dẫn đầu về hiệu năng suy luận

GLM-5.3 at 310 tok/s! Databricks inference is #1 in both speed and latency, again. On our internal…

DịchTheo đánh giá từ Yuchen Jin, GLM-5.3 trên nền tảng Databricks đạt tốc độ 310 tok/s với độ trễ cực thấp, vượt trội so với các đối thủ. Mô hình này cũng được đánh giá là mã nguồn mở mạnh nhất về khả năng lập trình, cạnh tranh trực tiếp với Fable 5 và Opus 4.8.

IT Home
Mô hìnhĐiểm AI 68/100

Cùng sự kiệnAlibaba ra mắt Qwen3.8-Max-0902: Đứng đầu bảng xếp hạng lập trình frontend CodeArena

Alibaba vừa cập nhật phiên bản Qwen3.8-Max-0902 với khả năng lập trình và xử lý văn phòng vượt trội, xuất sắc giành vị trí quán quân trên bảng xếp hạng CodeArena với 1691 điểm.

Cùng sự kiện, tinh chọn hiển thị «Qwen3.8-Max-0902 dẫn đầu Code Arena với hiệu suất vượt trội và mức giá cạnh tranh 5 USD/MToken»
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 58/100

Harness-of-Harness: Khung làm việc giúp AI tự phát triển phần mềm liên tục với hiệu suất tăng 52%

Harness-of-Harness (HoH) là khung làm việc mới cho phép các AI lập trình tự động hóa quy trình phát triển phần mềm dài hạn mà không cần con người can thiệp, thông qua cơ chế lặp lại chu trình lập kế hoạch, viết mã và kiểm thử.

Thêm 2 nguồn khác đưa tinX: DAIR.AI (@dair_ai)X: Elvis Saravia (@omarsar0, DAIR.AI)
Alibaba Cloud@alibaba_cloud
Mô hìnhĐiểm AI 61/100

Cùng sự kiệnAlibaba ra mắt Qwen3.8-Max-0902: 2.4 nghìn tỷ tham số, cửa sổ ngữ cảnh 1 triệu token

🚀Qwen3.8-Max just got upgraded. Meet Qwen3.8-Max-0902! 2.4T parameters. 1M context tokens. Built f…

DịchPhiên bản Qwen3.8-Max-0902 được tối ưu hóa mạnh mẽ cho lập trình và cộng tác, hỗ trợ cửa sổ ngữ cảnh 1 triệu token, giúp xử lý hiệu quả các tác vụ doanh nghiệp phức tạp và quy trình làm việc dài hạn.

Cùng sự kiện, tinh chọn hiển thị «Qwen3.8-Max-0902 dẫn đầu Code Arena với hiệu suất vượt trội và mức giá cạnh tranh 5 USD/MToken»
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 37/100

Tối ưu hóa Prompt cho hệ thống đa tác nhân AI: Phương pháp tách biệt luồng điều khiển và dữ liệu

Nghiên cứu giới thiệu cách tách biệt giao thức điều khiển khỏi nội dung dữ liệu trong hệ thống đa tác nhân, giúp đảm bảo tính ổn định của quy trình làm việc mà vẫn tối ưu hóa hiệu quả thực thi nhiệm vụ.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 46/100

StudentSim: Khung mô phỏng học sinh dựa trên LLM cho giáo dục cá nhân hóa

StudentSim sử dụng kỹ thuật huấn luyện gộp và chuyên biệt hóa để tạo ra các mô hình mô phỏng học sinh có khả năng phản hồi và học tập dưới sự hướng dẫn. Hệ thống đi kèm bộ tiêu chuẩn đánh giá StudentSimEval trên 60 học sinh ở các lĩnh vực toán học, ngoại ngữ và cờ vua.

Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 60/100

Selective Forgetting: Khung bộ nhớ dựa trên đồ thị cho tác nhân AI dài hạn

Finally, a good paper testing if graph memory actually beats flat retrieval for long-term agents. (…

DịchNghiên cứu mới đề xuất phương pháp chuyển đổi hội thoại thành đồ thị với các nút và cạnh thuộc tính, giúp tác nhân AI truy xuất thông tin chính xác hơn thông qua các truy vấn đồ thị hai bước.

Qwen@Alibaba_Qwen
Mô hìnhĐiểm AI 66/100

Cùng sự kiệnQwen ra mắt Qwen3.8-Max-0902: Mô hình 2.4 nghìn tỷ tham số với cửa sổ ngữ cảnh 1 triệu token

🚀Qwen3.8-Max just got upgraded. Meet Qwen3.8-Max-0902! 2.4T parameters. 1M context tokens. Built f…

DịchAlibaba nâng cấp Qwen3.8-Max lên phiên bản 0902, tối ưu hóa khả năng lập trình và cộng tác cho các tác vụ doanh nghiệp phức tạp, nghiên cứu khoa học và quy trình làm việc dài hạn.

Cùng sự kiện, tinh chọn hiển thị «Qwen3.8-Max-0902 dẫn đầu Code Arena với hiệu suất vượt trội và mức giá cạnh tranh 5 USD/MToken»
DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 46/100

Agent Zero Memory: Hệ thống ghi nhớ dài hạn cho AI Agent với độ chính xác 95.60%

// Agent Zero Memory // This work separates three things that agent memory systems usually collapse…

DịchAgent Zero Memory giới thiệu kiến trúc ghi nhớ dài hạn dựa trên truy xuất nguồn gốc, kết hợp đồng thời dòng thời gian sự kiện, đồ thị tri thức và tài liệu để tối ưu hóa khả năng truy hồi thông tin của AI Agent.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 53/100

Nghiên cứu mới: Kiểm thử bảo mật cục bộ không đảm bảo LLM an toàn khi triển khai thực tế

Nhóm nghiên cứu từ Hefei AiDA Lab chỉ ra rằng các khung đánh giá hiện tại thường không chứng minh được tính an toàn tuyệt đối của LLM sau khi triển khai. Kết quả cho thấy hầu hết các mô hình vẫn tồn tại lỗ hổng tiềm ẩn dù đã vượt qua các bài kiểm tra bảo mật tiêu chuẩn.

Hugging Face: Blog
Nghiên cứuĐiểm AI 46/100

Hugging Face và Ai2 ra mắt BenchMIRT: Công cụ kiểm định độ tin cậy của các bộ tiêu chuẩn đánh giá LLM

Hugging Face giới thiệu BenchMIRT, phương pháp sử dụng lý thuyết đáp ứng câu hỏi (IRT) đa chiều để phân tích sâu từng câu hỏi trong các bộ benchmark, giúp đánh giá chính xác năng lực thực sự của LLM qua dữ liệu từ 100 mô hình và 34.000 câu hỏi.

MarkTechPost
Mô hìnhĐiểm AI 77/100

Cùng sự kiệnAnthropic ra mắt Claude Fable 5.1 và Mythos 5.1: Đạt 52.6% điểm Terminal-Bench, giảm 75% phí đọc bộ nhớ đệm

Anthropic giới thiệu bộ đôi Claude 5.1 với hiệu năng vượt trội và chi phí tối ưu. Trong đó, Fable 5.1 được phát hành rộng rãi, còn Mythos 5.1 giới hạn cho các tổ chức được kiểm duyệt tại Mỹ thuộc dự án Project Glasswing.

Cùng sự kiện, tinh chọn hiển thị «Anthropic ra mắt bộ đôi Claude Fable 5.1 và Claude Mythos 5.1»
Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 56/100

Nhóm Qwen ra mắt E-Commerce Bench: Thử thách AI vận hành cửa hàng trực tuyến trong 365 ngày

Love these papers testing long-running agents on business applications. It's a good read.

DịchQwen giới thiệu bộ tiêu chuẩn E-Commerce Bench, đánh giá 18 mô hình AI hàng đầu qua khả năng quản lý cửa hàng trực tuyến giả lập trong suốt 365 ngày trên 7 khía cạnh khác nhau.

Thêm 2 nguồn khác đưa tinX: DAIR.AI (@dair_ai)X: Qwen (@Alibaba_Qwen)
DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 47/100

Cùng sự kiệnĐội ngũ Qwen ra mắt E-Commerce Bench: Thử thách khả năng vận hành cửa hàng của AI trong 1 năm

Banger paper from the Qwen team. If you evaluate agents on anything longer than a single session, t…

DịchQwen giới thiệu E-Commerce Bench, môi trường mô phỏng 365 ngày để đánh giá khả năng tự vận hành đa cửa hàng của 18 mô hình AI hàng đầu trên 7 tiêu chí khác nhau.

Cùng sự kiện, bài đại diện «Nhóm Qwen ra mắt E-Commerce Bench: Thử thách AI vận hành cửa hàng trực tuyến trong 365 ngày»
Rohan Paul@rohanpaul_ai
Hướng dẫnĐiểm AI 65/100

Cùng sự kiệnRohan Paul: Giảm 75% chi phí đọc bộ nhớ đệm trên Claude Fable 5.1 giúp tối ưu 45% tổng chi phí vận hành AI Agent

Cache reads with Fable 5.1 cost 75% less than Fable 5's So the savings get larger as the workload b…

DịchRohan Paul phân tích việc Anthropic ra mắt Claude Fable 5.1 và Mythos 5.1, nhấn mạnh rằng mức giảm 75% chi phí đọc bộ nhớ đệm của Fable 5.1 là chìa khóa giúp cắt giảm đáng kể tổng chi phí cho các tác vụ AI Agent.

Cùng sự kiện, tinh chọn hiển thị «Anthropic ra mắt bộ đôi Claude Fable 5.1 và Claude Mythos 5.1»
OpenRouter@OpenRouter
Sản phẩmĐiểm AI 37/100

OpenRouter tích hợp Render Workflows: Tối ưu hóa xử lý tác vụ LLM

OpenRouter now runs inside @render Workflows. Stop putting LLM batches in your web service. Each pr…

DịchOpenRouter hiện đã hỗ trợ Render Workflows, cho phép tách biệt các tác vụ LLM thành những tiến trình riêng biệt. Điều này giúp hệ thống tự động quản lý hàng đợi, thử lại và phân phối tác vụ hiệu quả hơn thay vì xử lý trực tiếp trên Web Service.

01/09

Thứ Ba · 32 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 50/100

Not Diamond công bố phương pháp định tuyến mô hình: Chất lượng vượt Opus với chi phí thấp hơn 80%

Not Diamond just released the methodology behind their model routing which gets Opus xhigh quality w…

DịchNot Diamond giới thiệu phương pháp định tuyến mô hình mới, giúp đạt hiệu suất vượt trội so với Claude 3 Opus nhưng tiết kiệm từ 20-80% chi phí vận hành trên các tiêu chuẩn đánh giá chính.

OpenRouter@OpenRouter
Mô hìnhĐiểm AI 57/100

Mô hình suy luận Mercury 2.5 Preview ra mắt trên OpenRouter: Tốc độ ấn tượng 1.107 token/giây

1/ The fastest reasoning LLM is now live exclusively on OpenRouter. Mercury 2.5 Preview from @_ince…

DịchMercury 2.5 Preview vừa cập bến OpenRouter với khả năng tạo token song song, đạt tốc độ kỷ lục 1.107 token/giây, tối ưu hóa cho các tác vụ yêu cầu độ trễ cực thấp và xử lý JSON chính xác.

Xiaobei@frxiaobei
Hướng dẫnĐiểm AI 33/100

Góc nhìn về tranh cãi AGENTS.md: Cần chuẩn hóa hướng dẫn làm việc cho AI đa nền tảng

Tác giả cho rằng các bản hướng dẫn (AGENTS.md) nên có tính di động giữa các mô hình AI khác nhau. Việc phải duy trì nhiều bộ quy tắc riêng biệt cho từng model là lãng phí, thay vào đó cần chuẩn hóa hạ tầng để tối ưu hóa hiệu suất làm việc của Agent.

Ant Group inclusionAI: HuggingFace mô hình mới
Mô hìnhĐiểm AI 44/100

Cùng sự kiệnAnt Group ra mắt Ling-3.0-tiny-singprobe: Công cụ giám sát an toàn AI siêu nhẹ

Ant Group vừa phát hành SingProbe trên Hugging Face, một mô hình giám sát an toàn chỉ với 3,22 triệu tham số. Công cụ này giúp phát hiện rủi ro về ý định, nội dung độc hại và ảo tưởng của AI theo thời gian thực với chi phí vận hành cực thấp.

Cùng sự kiện, bài đại diện «Ant Group ra mắt Ling-3.0-flash-singprobe: Công cụ giám sát an toàn AI siêu nhẹ»
JiQiZhiXin
Nghiên cứuĐiểm AI 88/100

Tinh chọnGiải mã bí ẩn 'đỉnh' và 'nền' trong mô hình ngôn ngữ lớn lai: Cách Full Attention định hình lại tính toán

Nghiên cứu từ StartLux và các đại học danh tiếng đã khám phá cách các lớp Full Attention ảnh hưởng đến mô hình lai, xác định hai trạng thái kích hoạt đặc trưng là 'đỉnh trước chú ý' và 'nền giữa các đỉnh', giúp tối ưu hóa hiệu năng cho các kiến trúc LLM thế hệ mới.


Vì sao đáng đọc: Nghiên cứu chuyên sâu về kiến trúc mô hình lai (Hybrid Linear Attention) đang là xu hướng quan trọng để cân bằng hiệu suất và tốc độ, có giá trị cao cho giới kỹ thuật và nghiên cứu AI.
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Độ trung thực của chuỗi suy luận (CoT) phụ thuộc vào cách AI tiếp nhận gợi ý ưu tiên

Nghiên cứu giới thiệu FACE-Eval để kiểm tra khả năng suy luận trung thực của 15 mô hình AI. Kết quả cho thấy các mô hình dễ bị ảnh hưởng bởi dữ liệu từ công cụ hơn là tin nhắn người dùng, dù chúng không luôn thừa nhận điều đó trong chuỗi suy luận.

Đã tải 40 tin

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (86 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “llm” — Trang 17 | AIHOT.vn