15/09

Thứ Ba · 29 tin
Elvis Saravia@omarsar0
NgànhĐiểm AI 39/100

Tự xây dựng Agent Harness: Bí quyết cắt giảm chi phí Token hiệu quả

If you build your own harness, you can drive that cost down even further. Out-of-the-box agent harn…

DịchThay vì dùng các bộ khung (harness) cồng kềnh, việc tự xây dựng hệ thống tối giản giúp giảm đáng kể chi phí token thông qua tối ưu hóa prompt, gọi công cụ thông minh và kiểm soát luồng dữ liệu chặt chẽ.

Elvis Saravia@omarsar0
Hướng dẫnĐiểm AI 59/100

Hướng dẫn xây dựng Agent Harness từ con số 0 của Elvis Saravia

On building an agent harness from scratch. Got so many questions about where to get started. My sh…

DịchElvis Saravia từ DAIR.AI chia sẻ lộ trình xây dựng khung điều khiển (harness) cho AI Agent, tập trung vào việc thiết lập mô-đun LLM, công cụ và vòng lặp ReAct bằng Python hoặc TypeScript.

14/09

Thứ Hai · 42 tin
SiliconFlow@SiliconFlowAI
Mô hìnhĐiểm AI 66/100

Tinh chọnSiliconFlow ra mắt mô hình mã nguồn mở Hy4: 770 tỷ tham số, hỗ trợ cửa sổ ngữ cảnh 1 triệu token

The hottest open-source models on OpenRouter. Now live on SiliconFlow. 🔥 Meet Hy4 preview: 770B tot…

DịchSiliconFlow vừa phát hành mô hình Hy4 (bản preview) với 770 tỷ tham số, hỗ trợ 1 triệu token ngữ cảnh và giấy phép Apache 2.0, tối ưu cho lập trình và phân tích dữ liệu phức tạp.


Vì sao đáng đọc: Đây là bước tiến quan trọng trong hệ sinh thái mô hình mở với quy mô tham số lớn và khả năng xử lý ngữ cảnh dài, rất hữu ích cho cộng đồng lập trình viên.
Elvis Saravia@omarsar0
NgànhĐiểm AI 43/100

Nghiên cứu của Meta: Mô hình cấp byte vượt mặt mô hình token khi tăng quy mô tính toán

Banger paper from Meta. This work shows that byte-level models start out behind token models and th…

DịchNghiên cứu từ Meta chỉ ra rằng dù ban đầu lép vế, các mô hình cấp byte sẽ vượt trội hơn mô hình token khi tăng tài nguyên tính toán, với dự báo hiệu suất dẫn trước tới 4% nhờ kỹ thuật chuyển đổi logit mới.

DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 62/100

Nghiên cứu GAUGE từ Amazon: Khi nào không nên tin tưởng vào LLM Judge để đánh giá AI Agent?

Great paper from Amazon. In discusses when not to trust LLM judges for agent evaluation. (bookmark…

DịchAmazon chỉ ra rằng việc dùng LLM làm giám khảo (LLM judge) thường gây hiểu lầm: 57,5% cuộc hội thoại được đánh giá 'hài lòng' thực tế lại thất bại trong việc hoàn thành nhiệm vụ, đồng thời độ chính xác của phương pháp này giảm mạnh khi so sánh các AI có năng lực tương đương.

Elvis Saravia@omarsar0
NgànhĐiểm AI 27/100

Thói quen sử dụng AI: Tại sao các mô hình cũ vẫn là lựa chọn hàng đầu?

It turns out I've been pacing for months. For day-to-day work, I still use a mix of Opus 5, GPT-5.6…

DịchDù nhiều mô hình AI thế hệ mới ra đời, người dùng vẫn ưu tiên kết hợp các phiên bản cũ như Opus 5 hay GPT-5.6 cho công việc hàng ngày nhờ tính ổn định và khả năng tùy biến cao.

Testing Catalog@testingcatalog
NgànhĐiểm AI 37/100

Grok 4.8 sắp hoàn thiện: Mô hình 2,5 nghìn tỷ tham số với kiến trúc C++ mới

SPACEXAI 🔥: Grok 4.8 will be a 2.5T-parameter model built on a new C++ software stack, and Elon Mus…

DịchElon Musk xác nhận Grok 4.8 với 2,5 nghìn tỷ tham số sẽ hoàn tất huấn luyện trong tuần này và bắt đầu giai đoạn học tăng cường (RL). Mô hình này sử dụng nền tảng phần mềm C++ hoàn toàn mới, hứa hẹn hiệu năng vượt trội so với phiên bản 4.6 hiện tại.

WeChat: Xiaohongshu Tech (dots.llm)
Mô hìnhĐiểm AI 68/100

Tinh chọnTiểu Hồng Thư mã nguồn mở Iris: Mô hình Search Agent vượt trội ở phân khúc 35B và 397B

Đội ngũ AllSpark của Tiểu Hồng Thư vừa công bố mã nguồn mở cho Iris, mô hình Search Agent chuyên dụng. Hiện tại, trọng số và mã đánh giá đã được phát hành, các dữ liệu huấn luyện sẽ sớm được cập nhật.

Diễn biến sự kiện · 2 bài →Thêm 1 nguồn khác đưa tinThe Decoder: AI News

Vì sao đáng đọc: Đây là bước tiến đáng chú ý từ một nền tảng lớn như Tiểu Hồng Thư trong lĩnh vực Search Agent, mang lại giá trị thực tiễn cao cho cộng đồng nghiên cứu AI.
karminski@karminski3
NgànhĐiểm AI 29/100

Nhìn lại hành trình DeepSeek R1: Từ tư duy chuyên sâu đến bước đột phá của các mô hình nhỏ

DeepSeek R1 đã chứng minh hiệu suất vượt trội khi chưng cất tư duy vào các mô hình nhỏ như Qwen, cho thấy khả năng giải quyết vấn đề tăng vọt theo ngân sách suy luận. Bài viết cũng gợi nhắc sự kiện thú vị khi Ollama đưa các phiên bản chưng cất này đến gần hơn với người dùng cá nhân.

Ant Group inclusionAI: HuggingFace mô hình mới
NgànhĐiểm AI 45/100

Cùng sự kiệnAnt Group ra mắt Qwen3.5-0.8B-singprobe: Công cụ giám sát an toàn AI siêu nhẹ

Ant Group giới thiệu Qwen3.5-0.8B-singprobe, một bộ dò an toàn dạng luồng với tham số cực nhỏ (2.23M), giúp phát hiện ý định độc hại và ảo tưởng của AI theo thời gian thực với chi phí tính toán tối thiểu.

Cùng sự kiện, bài đại diện «Ant Group ra mắt Qwen3.5-9B-singprobe: Công cụ giám sát an toàn AI siêu nhẹ»
Ant Group inclusionAI: HuggingFace mô hình mới
NgànhĐiểm AI 46/100

Cùng sự kiệnAnt Group ra mắt MiniMax-M2.7-singprobe: Công cụ giám sát an toàn AI thời gian thực

Ant Group giới thiệu MiniMax-M2.7-singprobe, một lớp bảo vệ tích hợp giúp đánh giá rủi ro về ý định, nội dung độc hại và ảo giác ngay trong quá trình tạo token với chi phí vận hành cực thấp.

Cùng sự kiện, bài đại diện «Ant Group ra mắt GLM-5.3-singprobe: Công cụ kiểm soát an toàn AI theo thời gian thực»
Ant Group inclusionAI: HuggingFace mô hình mới
NgànhĐiểm AI 44/100

Cùng sự kiệnAnt Group ra mắt Hy3-singprobe: Công cụ giám sát an toàn AI thời gian thực

Ant Group giới thiệu Hy3-singprobe, công cụ giám sát dựa trên mô hình Hy3 của Tencent giúp phát hiện ý đồ xấu, nội dung không an toàn và ảo giác trên từng token với chi phí vận hành cực thấp (dưới 0,5%).

Cùng sự kiện, bài đại diện «Ant Group ra mắt Qwen3.5-9B-singprobe: Công cụ giám sát an toàn AI siêu nhẹ»
Ant Group inclusionAI: HuggingFace mô hình mới
NgànhĐiểm AI 42/100

Cùng sự kiệnAnt Group ra mắt GLM-5.2-singprobe: Công cụ giám sát an toàn thời gian thực cho mô hình AI

Ant Group giới thiệu GLM-5.2-singprobe, một lớp bảo vệ tích hợp giúp đánh giá rủi ro về ý định truy vấn, nội dung độc hại và ảo tưởng ngay trong quá trình tạo token với chi phí vận hành cực thấp.

Cùng sự kiện, bài đại diện «Ant Group ra mắt Qwen3.5-9B-singprobe: Công cụ giám sát an toàn AI siêu nhẹ»
Ant Group inclusionAI: HuggingFace mô hình mới
NgànhĐiểm AI 46/100

Cùng sự kiệnAnt Group ra mắt SingProbe: Công cụ bảo mật thời gian thực cho mô hình Llama-3.2

Ant Group giới thiệu SingProbe, giải pháp bảo mật tích hợp dựa trên Llama-3.2-1B giúp phát hiện rủi ro về ý định, nội dung độc hại và ảo tưởng ngay trong quá trình tạo token với chi phí hiệu năng cực thấp.

Cùng sự kiện, bài đại diện «Ant Group ra mắt Qwen3.5-9B-singprobe: Công cụ giám sát an toàn AI siêu nhẹ»
Ant Group inclusionAI: HuggingFace mô hình mới
NgànhĐiểm AI 46/100

Cùng sự kiệnAnt Group ra mắt SingProbe: Công cụ kiểm soát an toàn AI dựa trên DeepSeek-V4-Flash

Ant Group giới thiệu SingProbe, giải pháp kiểm soát an toàn AI thời gian thực tận dụng trạng thái ẩn của mô hình DeepSeek-V4-Flash, giúp tối ưu hóa hiệu suất với chi phí giải mã cực thấp dưới 0,5%.

Cùng sự kiện, bài đại diện «Ant Group ra mắt SingProbe: Công cụ kiểm soát an toàn AI dựa trên Gemma-2»
Ant Group inclusionAI: HuggingFace mô hình mới
NgànhĐiểm AI 46/100

Cùng sự kiệnAnt Group ra mắt SingProbe: Công cụ kiểm soát an toàn AI dựa trên Qwen3.5-122B

Ant Group giới thiệu SingProbe, hệ thống rào chắn bảo mật tích hợp trực tiếp vào mô hình Qwen3.5-122B, giúp đánh giá an toàn theo thời gian thực với chi phí giải mã cực thấp, dưới 0,5%.

Cùng sự kiện, bài đại diện «Ant Group ra mắt SingProbe: Công cụ kiểm soát an toàn AI hiệu năng cao dựa trên Qwen3.6»
Ant Group inclusionAI: HuggingFace mô hình mới
NgànhĐiểm AI 42/100

Cùng sự kiệnAnt Group ra mắt SingProbe: Công cụ giám sát an toàn AI thời gian thực dựa trên GPT-OSS-20B

SingProbe là giải pháp bảo mật tích hợp giúp đánh giá rủi ro về ý định truy vấn, nội dung độc hại và ảo giác ngay trong quá trình tạo token với chi phí vận hành cực thấp (dưới 0,5%).

Cùng sự kiện, bài đại diện «Ant Group ra mắt Qwen3.5-9B-singprobe: Công cụ giám sát an toàn AI siêu nhẹ»
Ant Group inclusionAI: HuggingFace mô hình mới
NgànhĐiểm AI 44/100

Cùng sự kiệnAnt Group ra mắt Step-3.7-Flash-singprobe: Công cụ giám sát an toàn AI siêu nhẹ

Ant Group giới thiệu Step-3.7-Flash-singprobe, một bộ dò an toàn chỉ 8.13M tham số giúp phát hiện ý định độc hại và ảo tưởng của AI theo thời gian thực với chi phí vận hành cực thấp.

Cùng sự kiện, bài đại diện «Ant Group ra mắt SingProbe: Công cụ giám sát an toàn AI siêu nhẹ cho mô hình GPT-OSS»
Ant Group inclusionAI: HuggingFace mô hình mới
NgànhĐiểm AI 44/100

Cùng sự kiệnAnt Group ra mắt SingProbe: Công cụ kiểm soát an toàn thời gian thực dựa trên Qwen3.5

Ant Group giới thiệu SingProbe, hệ thống bảo mật tích hợp trên nền tảng Qwen3.5-397B, cho phép đánh giá an toàn theo từng token với chi phí giải mã cực thấp, dưới 0,5%.

Cùng sự kiện, bài đại diện «Ant Group ra mắt GLM-5.3-singprobe: Công cụ kiểm soát an toàn AI theo thời gian thực»
Ant Group inclusionAI: HuggingFace mô hình mới
NgànhĐiểm AI 43/100

Cùng sự kiệnAnt Group ra mắt SingProbe: Công cụ kiểm soát an toàn AI dựa trên mô hình Gemma-2-27B

Ant Group giới thiệu SingProbe, giải pháp bảo mật thời gian thực tích hợp trực tiếp vào mô hình Gemma, giúp đánh giá an toàn từng token với chi phí vận hành cực thấp, dưới 0,5%.

Cùng sự kiện, bài đại diện «Ant Group ra mắt SingProbe: Công cụ kiểm soát an toàn AI dựa trên Gemma-2»
Ant Group inclusionAI: HuggingFace mô hình mới
NgànhĐiểm AI 45/100

Cùng sự kiệnAnt Group ra mắt Qwen3.8-27B-singprobe: Công cụ giám sát an toàn AI theo thời gian thực

Ant Group giới thiệu Qwen3.8-27B-singprobe, một lớp bảo vệ tích hợp giúp đánh giá an toàn theo từng token dựa trên trạng thái ẩn của mô hình, với chi phí vận hành cực thấp dưới 0,5%.

Cùng sự kiện, bài đại diện «Ant Group ra mắt GLM-5.3-singprobe: Công cụ kiểm soát an toàn AI theo thời gian thực»
Ant Group inclusionAI: HuggingFace mô hình mới
NgànhĐiểm AI 44/100

Cùng sự kiệnAnt Group ra mắt SingProbe: Công cụ kiểm soát an toàn AI hiệu suất cao dựa trên Qwen3.5

Ant inclusionAI giới thiệu SingProbe, bộ dò an toàn dạng luồng dựa trên Qwen3.5-35B-A3B, giúp đánh giá bảo mật theo thời gian thực với chi phí giải mã cực thấp, dưới 0,5%.

Cùng sự kiện, bài đại diện «Ant Group ra mắt SingProbe: Công cụ kiểm soát an toàn AI hiệu năng cao dựa trên Qwen3.6»
Ant Group inclusionAI: HuggingFace mô hình mới
NgànhĐiểm AI 42/100

Cùng sự kiệnAnt Group ra mắt Qwen3-8B-singprobe: Công cụ giám sát an toàn AI hiệu năng cao

Ant Group giới thiệu Qwen3-8B-singprobe, mô hình giám sát luồng giúp phát hiện ý định độc hại và ảo tưởng của AI theo thời gian thực với chi phí tính toán cực thấp, dưới 0,5%.

Cùng sự kiện, bài đại diện «Ant Group ra mắt SingProbe: Công cụ giám sát AI siêu nhẹ dựa trên Qwen3.5-4B»
Ant Group inclusionAI: HuggingFace mô hình mới
NgànhĐiểm AI 44/100

inclusionAI ra mắt SingProbe: Công cụ kiểm soát an toàn mô hình AI siêu nhẹ

SingProbe là công cụ kiểm soát an toàn dựa trên mô hình Gemma-4-26B, với tham số chỉ 5.67M giúp tối ưu hóa hiệu suất mà không làm chậm quá trình suy luận. Công cụ này hỗ trợ phát hiện ảo tưởng và rủi ro bảo mật, tương thích tốt với SGLang và vLLM.

Ant Group inclusionAI: HuggingFace mô hình mới
NgànhĐiểm AI 48/100

Cùng sự kiệnAnt Group ra mắt Qwen3.5-27B-singprobe: Công cụ kiểm soát an toàn AI thời gian thực

Ant Group giới thiệu mô hình Qwen3.5-27B-singprobe, sử dụng trạng thái ẩn của mô hình gốc để đánh giá ý định, độ an toàn và rủi ro ảo tưởng của AI trên từng token với chi phí vận hành cực thấp.

Cùng sự kiện, bài đại diện «Ant Group ra mắt SingProbe: Công cụ kiểm soát an toàn AI dựa trên Gemma-2»
AI Notes@AYi_AInotes
NgànhĐiểm AI 38/100

Nhà sáng lập Kimi: Từ bỏ giải trí để dồn lực cho Scaling Law và năng lực suy luận

Dương Thực Lân (Yang Zhilin) chia sẻ lý do Kimi loại bỏ mảng giải trí để tập trung vào các tác vụ tri thức chuyên sâu. Ông khẳng định Scaling Law là cốt lõi, đồng thời nhấn mạnh khả năng suy luận dài hạn mới là chìa khóa thực sự thay vì chỉ là cửa sổ ngữ cảnh dài.

Ma Dongxi NLP@dongxi_nlp
Mô hìnhĐiểm AI 58/100

Cùng sự kiệnDeepSeek ra mắt DeepSeek-V4.1-Flash: Đột phá kiến trúc CED tối ưu bộ nhớ KV cache

DeepSeek-V4.1-Flash là mô hình MoE đa phương thức 552B tham số, sử dụng kiến trúc CED và kỹ thuật FP4 giúp giảm dung lượng KV cache xuống mức cực thấp, hỗ trợ ngữ cảnh lên tới 1 triệu token với hiệu suất vượt trội.

Cùng sự kiện, tinh chọn hiển thị «DeepSeek ra mắt DeepSeek-V4.1-Flash: Cửa sổ 1M token, tối ưu bộ nhớ KV Cache cực đỉnh»
karminski@karminski3
NgànhĐiểm AI 27/100

Tranh cãi về cường độ suy luận trên DeepSeek-V4.1-Flash: Nên chọn 'Max' hay 'High'?

Người dùng tranh luận về việc thiết lập cường độ suy luận trên DeepSeek-V4.1-Flash. Trong khi một số cho rằng cài đặt này không ảnh hưởng hiệu suất, tác giả dẫn chứng nghiên cứu DeepSeek-R1-Zero để khẳng định thời gian suy luận càng dài, năng lực giải quyết vấn đề càng cao.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnPLC-DPO: Tối ưu hóa ưu tiên bằng cách hiệu chỉnh nhãn hậu nghiệm cho dữ liệu nhiễu

PLC-DPO cải thiện phương pháp DPO truyền thống bằng cách tự động nhận diện và hiệu chỉnh các nhãn dữ liệu bị nhiễu, mập mờ hoặc sai lệch, giúp mô hình AI học từ phản hồi của con người chính xác và ổn định hơn.


Vì sao đáng đọc: Đây là cải tiến quan trọng cho kỹ thuật DPO vốn đang phổ biến, giải quyết trực tiếp vấn đề dữ liệu phản hồi kém chất lượng trong huấn luyện mô hình ngôn ngữ lớn.
Đã tải 40 tin

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (56 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “LLM” — Trang 9 | AIHOT.vn