20/08

Thứ Năm · 27 tin
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Hướng dẫnĐiểm AI 57/100

Kỷ nguyên của phần mềm mở rộng: Khi LLM thay đổi cách chúng ta tùy biến ứng dụng

LLM đang biến 'phần mềm nhỏ' (Small Software) thành hiện thực, cho phép người dùng tùy biến ứng dụng qua ngôn ngữ tự nhiên với chi phí thấp và bảo mật cao nhờ công nghệ sandbox hiện đại.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 36/100

RAG bị tấn công đầu độc: Hiện tượng 'sụp đổ chú ý' khiến mô hình tự tin thái quá

RAG poisoning can make a model more confident, which is exactly why confidence-based detectors can f…

DịchNghiên cứu mới chỉ ra rằng việc đầu độc dữ liệu RAG khiến mô hình trở nên quá tự tin và tập trung sai lệch vào tài liệu độc hại. Việc giám sát phân bổ chú ý thay vì chỉ dựa vào độ tin cậy của câu trả lời có thể giúp phát hiện sớm các cuộc tấn công này.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 47/100

Khung BenchDrift của IBM: Cách diễn đạt khiến điểm số LLM biến động tới 74,7%

A model can know the answer and still fail because you asked the same question differently. New IBM…

DịchIBM giới thiệu BenchDrift, khung đánh giá cho thấy việc thay đổi cách đặt câu hỏi có thể làm điểm số LLM chênh lệch tới 74,7%. Ngay cả với các mô hình mạnh, 18,5% câu trả lời đúng vẫn bị mất đi khi diễn đạt lại dù ý nghĩa không đổi.

Elvis Saravia@omarsar0
Sản phẩmĐiểm AI 63/100

TrueForge: Framework mã nguồn mở giúp tối ưu 75% chi phí vận hành AI Agent

New open-source agent harness just landed! I got early access to TrueForge by TrueFoundry and have …

DịchTrueFoundry vừa ra mắt TrueForge, framework mã nguồn mở cho phép triển khai AI Agent cục bộ với chi phí thấp hơn 75%. Công cụ hỗ trợ đa dạng các mô hình từ OpenAI, Anthropic đến các đại diện Việt Nam và quốc tế như Kimi, GLM và DeepSeek.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 52/100

LEGO-RL: Khung học tăng cường nguyên bản cho các tác nhân lập trình AI

LEGO-RL là khung làm việc mới giúp tối ưu hóa các tác nhân lập trình AI mà không cần can thiệp vào luồng điều khiển, giải quyết triệt để các vấn đề về lỗi môi trường, thao túng phần thưởng và sự thiếu nhất quán giữa huấn luyện và suy luận.

19/08

Thứ Tư · 29 tin
DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 37/100

Giải mã chi phí AI Agent: Không phải LLM, chính các thành phần phụ mới gây trễ hệ thống

Great paper if you are building production-grade agents. It's a good way to understand what is actu…

DịchNghiên cứu từ DAIR.AI chỉ ra rằng trong các ứng dụng AI Agent thực tế, các thành phần ngoài LLM thường là nguyên nhân chính gây độ trễ. Các giải pháp tối ưu hóa như dịch vụ nhận diện tác vụ và bộ nhớ đệm có thể cải thiện đáng kể hiệu suất và giảm tài nguyên hệ thống.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 43/100

PTXBench: Đánh giá và tối ưu hóa nhân GPU cho LLM bằng mã PTX đặc thù kiến trúc

PTXBench là bộ benchmark mới đánh giá khả năng tối ưu hóa nhân GPU của LLM thông qua mã PTX trên H100 và B200. Kết quả cho thấy các mô hình hiện nay vẫn gặp khó khăn trong việc đạt hiệu suất tương đương với các thư viện chuyên dụng, đặc biệt là trong các tác vụ Attention phức tạp.

Ant Ling@AntLingAGI
Mô hìnhĐiểm AI 53/100

Ant Group mở mã nguồn 6 checkpoint mô hình nền tảng Ling-3.0

🧵 We've open-sourced 6 Base Model checkpoints for Ling-3.0-tiny & Ling-3.0-flash, covering pre-trai…

DịchAnt Group vừa công bố 6 checkpoint cho các mô hình Ling-3.0-tiny và Ling-3.0-flash, bao gồm các giai đoạn tiền huấn luyện và hợp nhất trọng số WSM. Đây là nguồn tài nguyên hữu ích cho cộng đồng để thử nghiệm chiến lược huấn luyện liên tục và tối ưu hóa mô hình.

Rohan Paul@rohanpaul_ai
Mô hìnhĐiểm AI 51/100

Ra mắt mô hình mã nguồn mở Ornith-1.5: Vượt mặt Claude 3 Opus trên nhiều bảng xếp hạng

Another brilliant open-source model release. Ornith-1.5, a family of open-source LLMs spanning 9B D…

DịchDòng mô hình Ornith-1.5 vừa trình làng với ba phiên bản (9B, 35B, 397B), trong đó bản 397B gây ấn tượng mạnh khi vượt qua Claude 3 Opus trên các bài kiểm tra chuyên sâu như SWE-bench và Terminal-Bench.

Thêm 1 nguồn khác đưa tinX: Testing Catalog (@testingcatalog)
Elon Musk@elonmusk
Hướng dẫnĐiểm AI 31/100

Cùng sự kiệnGrok 4.6 soán ngôi đầu bảng xếp hạng AI y tế MedAgentBench

Grok 4.6 is #1 on healthcare questions

DịchGrok 4.6 vừa thiết lập kỷ lục mới trên MedAgentBench với tỷ lệ chính xác 95,9%, vượt qua GPT-5.6 Sol trong các tác vụ chẩn đoán và xử lý hồ sơ bệnh án phức tạp.

Cùng sự kiện, bài đại diện «Grok 4.6 soán ngôi đầu bảng xếp hạng AI Agent, ngang hàng với Claude Opus 5 Max»
Apple Machine Learning Research
Nghiên cứuĐiểm AI 52/100

Nghiên cứu từ Apple: Phân tích đa chiều về hành vi giống người của các mô hình ngôn ngữ lớn (LLM)

Đội ngũ nghiên cứu của Apple đã phân tích cách LLM thể hiện cảm xúc và thiết lập ranh giới với người dùng. Nghiên cứu cung cấp cái nhìn sâu sắc giúp các nhà phát triển kiểm soát hành vi giống người của AI một cách hiệu quả.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnGiải mã kỹ năng của AI Agent: Tại sao chúng hiệu quả và khi nào thì thất bại?

Nghiên cứu phân tích sâu về cách các gói kỹ năng (skills) hỗ trợ LLM Agent, đồng thời chỉ ra những giới hạn và nguyên nhân thất bại thông qua thực nghiệm định lượng và phân tích quỹ đạo hành động.


Vì sao đáng đọc: Bài báo cung cấp cái nhìn thực tế và có hệ thống về cơ chế hoạt động của AI Agent, rất hữu ích cho các kỹ sư đang tối ưu hóa hiệu suất mô hình trong thực tế.
WeChat: Khazix
Hướng dẫnĐiểm AI 41/100

Tang Jie (Zhipu AI) bàn về Scaling Law: GLM-5.3 là bước tiến trong tối ưu hóa mô hình

Nhà sáng lập Zhipu AI khẳng định Scaling Law không chỉ nằm ở số lượng tham số mà còn là sự kết hợp giữa dữ liệu, tính toán và cấu trúc. GLM-5.3 cho thấy xu hướng chuyển dịch từ việc chạy đua quy mô sang tìm kiếm cấu trúc tối ưu cho suy luận dài hạn.

Thêm 4 nguồn khác đưa tinX: Thomas Wolf (Hugging Face đồng sáng lập/CSO) (@Thom_Wolf)Latent SpaceX: Tang Jie (@jietang)X: Ma Dongxi NLP (@dongxi_nlp)
Ma Dongxi NLP@dongxi_nlp
Mô hìnhĐiểm AI 44/100

Tang Jie bàn về Scaling Law: Thử nghiệm hậu huấn luyện trên GLM-5.3

Tang Jie phản biện Scaling Law, khẳng định hiệu năng không chỉ phụ thuộc vào số lượng tham số mà còn ở dữ liệu và tối ưu hóa hậu huấn luyện. Thử nghiệm trên GLM-5.3 cho thấy chỉ cần tinh chỉnh RL trong một tháng đã mang lại bước tiến lớn mà không cần thay đổi kiến trúc.

Thêm 1 nguồn khác đưa tinLatent Space
Tang Jie@jietang
Mô hìnhĐiểm AI 56/100

Cùng sự kiệnTang Jie chia sẻ về Scaling Law: Thử nghiệm hậu huấn luyện trên GLM-5.3

Thoughts About Scaling Law Scaling, but not only of parameters. Every model release now ends with t…

DịchTang Jie khẳng định Scaling Law không chỉ nằm ở quy mô tham số mà còn ở dữ liệu và tính toán. Thử nghiệm GLM-5.3 cho thấy việc tối ưu hóa hậu huấn luyện (RL) giúp cải thiện hiệu suất vượt trội mà không cần thay đổi kiến trúc hay tăng tham số.

Cùng sự kiện, bài đại diện «Tang Jie (Zhipu AI) bàn về Scaling Law: GLM-5.3 là bước tiến trong tối ưu hóa mô hình»
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Sản phẩmĐiểm AI 66/100

Agent Lightning v1.0: Bước tiến mới trong huấn luyện tác nhân AI bằng học tăng cường

Agent Lightning v1.0 là khung làm việc nhẹ giúp tối ưu hóa tác nhân AI qua học tăng cường (RL). Chỉ với 6.000 mẫu huấn luyện, công cụ này đã giúp Qwen3.5-9B tăng điểm số trên SWE-bench Verified từ 41,8% lên 56,4%.

Ethan Mollick@emollick
Hướng dẫnĐiểm AI 36/100

Đánh giá thực tế: Qwen 27B vẫn chưa thể soán ngôi các mô hình AI hàng đầu

Qwen 27B is really good local model but, when you use it, it is immediately absolutely and obviously…

DịchDù là một mô hình chạy cục bộ ấn tượng, Qwen 27B vẫn bộc lộ hạn chế rõ rệt trong các tác vụ phức tạp và điều khiển tác nhân (agent) so với các đối thủ đầu bảng. Người dùng nên tự kiểm chứng qua các bài benchmark thực tế thay vì chỉ nhìn vào thông số.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 44/100

aDSL: Bước tiến mới trong tạo nội dung 3D bằng hệ thống đa tác nhân

Nghiên cứu giới thiệu aDSL, ngôn ngữ chuyên dụng giúp AI chuyển đổi ý tưởng thành mã lập trình 3D chính xác thông qua cơ chế phản hồi lặp lại, vượt trội hơn các mô hình LLM hiện tại trong việc tạo hình khối và cấu trúc phức tạp.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 51/100

Agentic ESOpt: Đột phá tinh chỉnh tác nhân LLM với chi phí GPU cực thấp

Agentic ESOpt là khung tinh chỉnh toàn tham số dựa trên chiến lược tiến hóa, cho phép tối ưu hóa các tác nhân LLM mà chỉ cần bộ nhớ GPU ở mức suy luận, vượt trội hơn hẳn các phương pháp học tăng cường truyền thống.

Aravind Srinivas (Perplexity CEO)@AravSrinivas
Sản phẩmĐiểm AI 39/100

CEO Perplexity hết lời khen ngợi khung RL mã nguồn mở Miles v0.1

Important contribution!

DịchMiles v0.1 là khung RL mã nguồn mở tối ưu cho LLM và mô hình đa phương thức, giúp giải quyết bài toán khó trong huấn luyện và hiệu suất phần cứng. Dự án đã được kiểm chứng trên các mô hình hàng đầu như DeepSeek V4 và Qwen 3.8.

SemiAnalysis@SemiAnalysis_
Sản phẩmĐiểm AI 31/100

RadixArk ra mắt Miles v0.1: Khung huấn luyện tăng cường mã nguồn mở cho LLM

Congrats RadixArk on the launch! https://x.com/radixark/status/2089746481339384068

DịchRadixArk giới thiệu Miles v0.1, khung học tăng cường tối ưu cho LLM và mô hình đa phương thức, giúp giải quyết bài toán khó trong huấn luyện và hiệu suất phần cứng. Dự án đã được kiểm chứng trên các mô hình hàng đầu như DeepSeek V4 và Qwen.

Artificial Analysis@ArtificialAnlys
Hướng dẫnĐiểm AI 65/100

Cùng sự kiệnGLM-5.3 ra mắt: Ngang hàng Kimi K3, xác lập vị thế mô hình mã nguồn mở mạnh nhất

GLM-5.3 achieves 60 on the Artificial Analysis Intelligence Index, on par with Kimi K3 and up 7 poin…

DịchZhipu AI vừa trình làng GLM-5.3 với 60 điểm trên bảng xếp hạng Artificial Analysis, ngang bằng Kimi K3. Mô hình MoE này hỗ trợ cửa sổ ngữ cảnh 1M tokens, chi phí vận hành tối ưu hơn và sẽ sớm được phát hành mã nguồn mở theo giấy phép MIT.

Cùng sự kiện, tinh chọn hiển thị «Ra mắt GLM-5.3: Đạt 60 điểm chỉ số thông minh AA, dẫn đầu nhóm mô hình mã nguồn mở»
DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 47/100

Nén ngữ cảnh AI: Liệu có thực sự tiết kiệm chi phí như lời đồn?

Does your context compactor actually save anything? If you built or tuned one, this one is worth yo…

DịchNghiên cứu mới từ DAIR.AI chỉ ra rằng việc nén ngữ cảnh có thể làm tăng đáng kể số lần truy xuất và thời gian xử lý của AI, khiến chi phí ẩn tăng cao thay vì tiết kiệm như kỳ vọng.

MiniMax@MiniMax_AI
Sản phẩmĐiểm AI 26/100

MiniMax chúc mừng SGLang/RadixArk ra mắt khung huấn luyện tăng cường Miles v0.1

Congrats to our long-term partner SGLang/RadixArk on the launch of Miles v0.1! 🎉 From M-Series to …

DịchMiniMax chúc mừng đối tác chiến lược SGLang/RadixArk phát hành Miles v0.1, khung mã nguồn mở hỗ trợ huấn luyện mô hình ngôn ngữ và đa phương thức, đã được kiểm chứng trên các dòng model tiên tiến như Kimi, DeepSeek và MiniMax.

Thêm 1 nguồn khác đưa tinX: SemiAnalysis (@SemiAnalysis_)
Tomer Tunguz Blog (phân tích VC)
Hướng dẫnĐiểm AI 55/100

Cùng sự kiệnQwen3.8-27B: Mô hình chạy trên laptop vượt mặt các siêu AI trên bảng xếp hạng

Qwen3.8-27B gây ấn tượng mạnh khi dẫn đầu bảng xếp hạng Artificial Analysis với 52 điểm, vượt qua cả các mô hình mã nguồn mở khổng lồ, chứng minh sức mạnh vượt trội của các mô hình tối ưu cho thiết bị cá nhân.

Cùng sự kiện, bài đại diện «Mô hình Qwen3.8-27B đã có thể chạy mượt mà trên laptop nhờ Atomic Chat»

18/08

Thứ Ba · 40 tin
Đã tải 40 tin

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (51 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “LLM” — Trang 26 | AIHOT.vn