25/08

Thứ Ba · 33 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 54/100

NVIDIA ACES: Điểm cao trong tài liệu kỹ năng AI chưa chắc đã hiệu quả khi vận hành

New Nvidia paper. A high-scoring skill document is not evidence that the skill helps the agent at …

DịchNVIDIA giới thiệu khung đánh giá ACES, chứng minh rằng điểm số tài liệu kỹ năng không phản ánh đúng hiệu suất thực tế của AI. Nghiên cứu cho thấy sự tương quan giữa điểm đánh giá truyền thống và hiệu quả thực tế (Skill Lift) gần như bằng không.

Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 37/100

Alibaba đột phá quản lý bộ nhớ AI: Coi ngữ cảnh là một bài toán lập trình

Impressive work from Alibaba. (bookmark it) If you build long-running agents and keep rewriting yo…

DịchAlibaba giới thiệu phương pháp quản lý bộ nhớ AI mới bằng cách coi ngữ cảnh là các tác vụ lập trình, sử dụng Python kernel để xử lý dữ liệu. Cách tiếp cận này giúp Qwen3.8-Max đạt hiệu suất vượt trội trên các bài kiểm tra bộ nhớ dài hạn, vượt xa các hệ thống hiện có.

Thêm 1 nguồn khác đưa tinX: Rohan Paul (@rohanpaul_ai)
AK@_akhaliq
Nghiên cứuĐiểm AI 30/100

Ra mắt Apodex 1.1: Bước tiến mới trong khả năng xử lý tác vụ phức tạp của AI Agent

Apodex 1.1 Scaling Agentic Intelligence for Complex Work paper: https://huggingface.co/papers/2608...

DịchApodex 1.1 vừa được công bố với những cải tiến vượt trội, giúp các AI Agent thực hiện các tác vụ phức tạp và đa nhiệm hiệu quả hơn. Đây là bản cập nhật quan trọng cho những ai quan tâm đến khả năng tự chủ của AI.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 53/100

Định luật phân bổ ngữ cảnh trong tìm kiếm tạo sinh: Đo lường nhân quả và điều phối vòng lặp

Nghiên cứu mới chỉ ra rằng việc mở rộng cửa sổ ngữ cảnh không hiệu quả do suy giảm tương quan. Thay vào đó, phương pháp phân bổ lặp lại theo trình tự giúp tăng tỷ lệ thu hồi lên tới 20.5%, tối ưu hóa hiệu suất cho các hệ thống RAG.

Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 36/100

AutoSaddler: Bước tiến mới từ Microsoft giúp tối ưu hóa khung làm việc cho AI Agent

Impressive new paper from Microsoft and colleagues. Harness design is still hand-tuned almost every…

DịchAutoSaddler của Microsoft tự động tối ưu hóa các khung làm việc AI Agent bằng cách phân tích lỗi và chỉnh sửa mã nguồn, giúp cải thiện đáng kể hiệu suất trên các bộ benchmark khó như SWE-Bench Pro.

Thêm 1 nguồn khác đưa tinHuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 36/100

Weighted Memory Tree: Giải pháp tối ưu hóa suy luận cho AI Agent trong các tác vụ dài

Giving an agent a memory hierarchy is not what makes it reason better over long tasks. What helps is…

DịchNghiên cứu giới thiệu Weighted Memory Tree, phương pháp gán trọng số và giảm dần độ ưu tiên cho các ký ức thay vì xếp chồng dữ liệu, giúp AI Agent cải thiện độ chính xác và tiết kiệm chi phí token khi xử lý các tác vụ phức tạp.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Cà chua, khoai tây và hành tây: Liệu có cần khuôn mặt để phát hiện tấn công giả mạo?

Nghiên cứu chứng minh rằng các mô hình phát hiện tấn công giả mạo (PAD) không nhất thiết phải học từ khuôn mặt. Bằng cách huấn luyện trên dữ liệu rau củ, mô hình đạt hiệu suất ấn tượng, thách thức các phương pháp nhận diện truyền thống.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

WorldToken: Mô hình hóa trình tự ưu tiên thời gian cho học bắt chước ở robot

WorldToken tối ưu hóa việc học của robot bằng cách hợp nhất dữ liệu đa phương thức thành một 'world token' duy nhất, giúp mô hình Transformer xử lý trình tự hiệu quả hơn. Phương pháp này đạt tỷ lệ thành công ấn tượng 59,45% trên 23 tác vụ RoboCasa phức tạp.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 53/100

Từ tạo sinh đến mô phỏng: Mô hình thế giới đã tiến gần đến trình mô phỏng thực thụ như thế nào?

Nghiên cứu đánh giá toàn diện khoảng cách giữa mô hình thế giới tạo sinh và trình mô phỏng truyền thống qua 8 tiêu chí cốt lõi, dựa trên phân tích 200 công trình tiêu biểu từ 2018 đến 2026.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 51/100

EchoWM: Mô hình thế giới đa phương thức cho trải nghiệm nhập vai tương tác

EchoWM là mô hình thế giới đột phá cho phép tạo đồng thời video 720p, âm thanh môi trường và giọng nói dựa trên điều hướng liên tục, hỗ trợ tương tác góc nhìn thứ nhất và thứ ba với độ chân thực cao.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 46/100

Vượt qua giới hạn ổn định: ERPO - Phương pháp chính quy hóa môi trường tối ưu hóa chiến lược LLM

Nghiên cứu giới thiệu ERPO, phương pháp chuyển chính quy hóa từ hành động sang đầu vào giúp cân bằng giữa tính ổn định và khả năng khám phá của LLM. ERPO cải thiện đáng kể độ chính xác trong suy luận toán học mà không làm tăng chi phí tính toán.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 72/100

Tinh chọnChỉ một trang web độc hại cũng đủ thao túng gợi ý của LLM: Nghiên cứu về lỗ hổng của hệ thống RAG

Nghiên cứu mới với bộ tiêu chuẩn FORGE chỉ ra rằng các mô hình LLM trong hệ thống gợi ý rất dễ bị thao túng bởi nội dung rác, khiến chúng vô tình quảng bá sản phẩm giả mạo chỉ với một trang web bị nhiễm độc.


Vì sao đáng đọc: Nghiên cứu thực tế, đánh giá lỗ hổng bảo mật quan trọng trong các ứng dụng RAG thực tế, có tính ứng dụng cao cho các nhà phát triển hệ thống gợi ý.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 66/100

Nghiên cứu: Các kỹ thuật RAG nâng cao vô tình làm trầm trọng thêm lỗi từ nhận dạng giọng nói (ASR)

Nghiên cứu chỉ ra rằng việc sử dụng đồ thị thực thể và tái viết truy vấn trong RAG đa chặng làm khuếch đại sai sót từ ASR, khiến độ chính xác giảm mạnh hơn so với tìm kiếm thuần túy khi dữ liệu đầu vào bị nhiễu.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 35/100

Cách mô hình ngôn ngữ đánh giá năng lực người dùng và định kiến nghề nghiệp

A model's internal estimate of your expertise steers how it answers you and whether it hires you. L…

DịchNghiên cứu chỉ ra rằng mô hình ngôn ngữ tự ước tính năng lực người dùng để điều chỉnh độ phức tạp của câu trả lời. Dù tồn tại các vector định kiến, nghiên cứu chưa tìm thấy bằng chứng rõ ràng về việc chúng gây ra phân biệt đối xử trong đầu ra.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 48/100

Task-CoEvolve: Tối ưu hóa Harness hiệu quả thông qua chọn lọc tác vụ thích ứng

Task-CoEvolve giới thiệu phương pháp tối ưu hóa harness cho LLM bằng cách cho phép các tác vụ kiểm chứng cùng tiến hóa, giúp giảm 80% chi phí đánh giá mà vẫn duy trì độ chính xác tương đương với bộ dữ liệu đầy đủ.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 42/100

Chỉ huấn luyện lớp chiếu: Mở rộng đa phương thức cho LLM mà không làm mất khả năng vốn có

You can teach a language model a new modality without ever touching the backbone's weights. Train …

DịchNghiên cứu mới đề xuất phương pháp chỉ huấn luyện lớp kết nối giữa encoder và mô hình ngôn ngữ, giúp bổ sung đa phương thức mà không cần tinh chỉnh toàn bộ tham số, vừa tăng tốc độ huấn luyện vừa bảo toàn hiệu suất gốc của mô hình.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Sản phẩmĐiểm AI 61/100

Prime Agent: Framework AI tự cải tiến giúp đột phá hiệu suất lập trình và giải thuật

Prime Agent là framework mã nguồn mở tối ưu hóa quy trình làm việc cho AI Agent, giúp nâng cao khả năng xử lý ngữ cảnh và tính toán thông qua IPython REPL bền vững, đạt kết quả ấn tượng trong các bài kiểm tra ARC-AGI và lập trình chuyên sâu.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 37/100

ReWorld: Mô hình thế giới tương tác với khả năng ghi nhớ dài hạn

ReWorld tối ưu hóa mô hình thế giới bằng cách tách biệt điều khiển và bộ nhớ, cho phép xử lý video thời gian thực với độ chính xác cao và khả năng ghi nhớ lịch sử dài hạn vượt trội so với các mô hình hiện nay.

Qwen@Alibaba_Qwen
Hướng dẫnĐiểm AI 32/100

Qwen khẳng định vị thế: Mô hình mã nguồn mở Trung Quốc trở thành lựa chọn ưu tiên trong nghiên cứu

Open models, open science. Qwen keeps growing steadily, and we'll always be right here with the rese…

DịchPhân tích từ 500.000 bài báo trên arXiv cho thấy các mô hình mã nguồn mở Trung Quốc đang chiếm ưu thế, với Qwen xuất hiện trong 1/3 số bài nghiên cứu có nhắc đến LLM, vượt xa sự sụt giảm của Llama.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 36/100

SWE-bench Science: Thách thức mới cho AI trong việc giải quyết các lỗi logic khoa học

Coding agents fix the symptom you show them far more often than the defect underneath. Agents are g…

DịchSWE-bench Science cho thấy các AI lập trình hiện nay dù giỏi sửa lỗi kỹ thuật nhưng vẫn yếu trong việc khôi phục logic khoa học cốt lõi. Điểm nghẽn nằm ở khả năng kiểm chứng thực tế thay vì chỉ dựa vào kiến thức lý thuyết.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 68/100

Kiểm toán sự thay đổi câu trả lời trong hệ thống RAG khi cập nhật kho dữ liệu

Nghiên cứu chỉ ra rằng việc cập nhật kho dữ liệu có thể khiến hệ thống RAG thay đổi câu trả lời dù các thiết lập khác không đổi. Tác giả đề xuất phương pháp 'kiểm toán tương thích snapshot' để đo lường mức độ biến động này, giúp tăng độ tin cậy cho các hệ thống AI truy xuất thông tin.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 46/100

Apodex 1.1: Bước tiến mới trong khả năng thực thi tác vụ phức tạp của AI Agent

Apodex 1.1 tối ưu hóa khả năng xử lý tài liệu, lập trình và nghiên cứu thông qua cơ chế phối hợp tác tử thông minh. Với phiên bản 35B có thể chạy cục bộ, mô hình đạt hiệu suất vượt trội so với các hệ thống lớn hơn trong nhiều lĩnh vực chuyên môn.

Thêm 1 nguồn khác đưa tinX: Ma Dongxi NLP (@dongxi_nlp)
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 34/100

Nghiên cứu về tác nhân lập kế hoạch dài hạn: Tiền huấn luyện và chưng cất OPD

No amount of post-training cleanly fixes weak long-horizon foundations: noisy trajectories compound …

DịchNghiên cứu chỉ ra rằng hậu huấn luyện không thể khắc phục lỗi tích lũy trong lập kế hoạch dài hạn. Thay vào đó, việc sử dụng mô hình thế giới rõ ràng và kỹ thuật chưng cất chính sách (OPD) giúp tối ưu hóa phản hồi xuyên suốt quỹ đạo thay vì chỉ dựa vào kết quả cuối cùng.

DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 49/100

Weighted Memory Tree: Giải pháp bộ nhớ có khả năng phục hồi cho AI Agent hoạt động dài hạn

Interesting new approach to enable memory in long-running agents. Weighted Memory Tree organizes ex…

DịchDAIR.AI giới thiệu Weighted Memory Tree, phương pháp tổ chức bộ nhớ theo cấu trúc cây với điểm số động giúp AI Agent duy trì thông tin quan trọng hiệu quả hơn. Công nghệ này giúp tăng hiệu suất trên GAIA-Text lên 9,97 điểm và giảm 32,8% lượng token tiêu thụ so với bộ nhớ tuyến tính truyền thống.

Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 32/100

Tổng quan về tác nhân AI trên thiết bị: Tại sao kết quả đánh giá lại mâu thuẫn?

Nice little survey on Terminal Agents. It provides good information on what exactly is a terminal a…

DịchBài viết phân tích sâu sắc về bản chất của các tác nhân AI trên thiết bị (on-device agents) và lý giải nguyên nhân khiến các bộ công cụ đánh giá thường cho ra kết quả trái ngược nhau.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 41/100

ASI-Bench: Các bước thực hiện quan trọng hơn tên phương pháp đối với hiệu suất AI Agent

Telling a research AI agent which method to use is close to telling it nothing at all. What actual…

DịchNghiên cứu ASI-Bench chỉ ra rằng việc cung cấp chi tiết các bước thực hiện giúp AI Agent đạt hiệu suất cao hơn đáng kể so với việc chỉ nêu tên phương pháp, đồng thời giúp tiết kiệm tới 59% token.

AK@_akhaliq
Nghiên cứuĐiểm AI 30/100

Mô hình thế giới video: Cách suy luận trạng thái tiềm ẩn học về sự vận động của thế giới

Learning How the World Evolves Extrapolative Video World Models via Latent Dynamics Reasoning pape…

DịchNghiên cứu giới thiệu mô hình thế giới video dựa trên suy luận động lực học tiềm ẩn, cho phép dự đoán và ngoại suy sự thay đổi của thế giới thực một cách chính xác.

Ma Dongxi NLP@dongxi_nlp
Hướng dẫnĐiểm AI 61/100

Cùng sự kiệnMô hình mã nguồn mở Trung Quốc thống trị nền tảng nghiên cứu căn chỉnh AI

I ran a similar analysis on 221 MATS alignment and safety projects. In 2026, 72% of projects using…

DịchPhân tích từ 221 dự án cho thấy 72% sử dụng mô hình nguồn mở từ Trung Quốc làm nền tảng nghiên cứu, vượt xa các mô hình Mỹ. Trong đó, Qwen dẫn đầu với 66%, trong khi các mô hình đóng từ Mỹ chủ yếu đóng vai trò giám sát và đánh giá.

Cùng sự kiện, bài đại diện «Các mô hình mã nguồn mở Trung Quốc trở thành lựa chọn hàng đầu trong nghiên cứu AI»

24/08

Thứ Hai · 31 tin
AK@_akhaliq
Nghiên cứuĐiểm AI 25/100

InfinityEdit: Giải pháp chỉnh sửa video không giới hạn với bộ điều hợp siêu nhẹ

InfinityEdit Infinite Video Editing with a Lightweight Edit-Ignition Adapter paper: https://huggin...

DịchInfinityEdit giới thiệu phương pháp sử dụng bộ điều hợp (adapter) tinh gọn để thực hiện chỉnh sửa video không giới hạn, giúp tối ưu hóa quy trình xử lý hình ảnh chuyển động.

Aravind Srinivas (Perplexity CEO)@AravSrinivas
NgànhĐiểm AI 49/100

Perplexity bổ nhiệm Andrew Wilson làm Giám đốc Nghiên cứu

Excited to welcome Andrew Gordon Wilson to our research team. He will be reporting to Denis and lead…

DịchCEO Aravind Srinivas thông báo Andrew Gordon Wilson gia nhập Perplexity để dẫn dắt các mảng nghiên cứu trọng điểm như học liên tục, dữ liệu tổng hợp và kiến trúc RL, đồng thời bắt đầu tuyển dụng nhân sự mới.

Nathan Lambert@natolambert
Hướng dẫnĐiểm AI 64/100

Các mô hình mã nguồn mở Trung Quốc trở thành lựa chọn hàng đầu trong nghiên cứu AI

Over the weekend I had Codex parse 500K arXiv AI/ML papers since ChatGPT to understand which open mo…

DịchPhân tích từ 500.000 bài báo trên arXiv cho thấy tỷ lệ trích dẫn mô hình AI nguồn mở Trung Quốc đã tăng vọt lên 40%, vượt qua các mô hình từ Mỹ. Đặc biệt, Qwen và DeepSeek đang trở thành những cái tên được giới nghiên cứu ưu tiên sử dụng thay thế cho Llama.

Thêm 2 nguồn khác đưa tinX: Ma Dongxi NLP (@dongxi_nlp)X: Qwen (@Alibaba_Qwen)
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 42/100

Meta công bố EvoHarness-RL: Đưa Qwen3-8B đạt hiệu suất 96.9% trong tác vụ ALFWorld

New Meta paper says giving an agent more memory and tools is not enough if the agent never learns wh…

DịchNghiên cứu mới từ Meta giới thiệu EvoHarness-RL, phương pháp huấn luyện RL giúp AI tự quyết định thời điểm dùng công cụ thay vì truy cập liên tục, giúp Qwen3-8B tăng vọt hiệu suất giải quyết tác vụ phức tạp.

ModelBest OpenBMB@OpenBMB
Nghiên cứuĐiểm AI 51/100

Đại học Thanh Hoa đề xuất khung 'Bình đẳng biểu đạt': Đánh giá tính công bằng của AI khi mô phỏng dữ liệu đa quốc gia

LLMs are increasingly used as synthetic respondents in cross-country surveys. But do they simulate e…

DịchCác nhà nghiên cứu từ Đại học Thanh Hoa đã phát triển khung 'Bình đẳng biểu đạt' để kiểm tra độ chính xác của AI khi đóng vai người trả lời khảo sát toàn cầu. Kết quả cho thấy AI hiện vẫn thiên vị các quốc gia phát triển, với độ chính xác tỉ lệ thuận với GDP và mức độ phổ cập Internet.

Đã tải 40 tin

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (67 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Nghiên cứu AI” — Trang 22 | AIHOT.vn