13/08

Thứ Năm · 31 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Liệu AI có giữ vững kịch bản? Đánh giá khả năng duy trì tính nhất quán trong kể chuyện tương tác

Nghiên cứu giới thiệu NCP-Bench, bộ tiêu chuẩn đánh giá khả năng duy trì tính logic và nhất quán của LLM khi đối mặt với các tình huống kể chuyện tương tác phức tạp, nơi AI thường gặp khó khăn trong việc bám sát kịch bản gốc.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

NeuPAT: Tối ưu hóa phân bổ độ dẻo thần kinh giúp mô hình đa phương thức giữ vững khả năng ngôn ngữ

NeuPAT là phương pháp mới giúp bảo vệ các neuron quan trọng trong LLM khi huấn luyện đa phương thức, ngăn chặn tình trạng suy giảm khả năng ngôn ngữ vốn có bằng cách phân bổ mức độ cập nhật linh hoạt cho từng neuron.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 39/100

S2R-Removal: Mô hình khuếch tán đầu tiên giúp loại bỏ phản chiếu trong video

S2R là khung làm việc toàn diện đầu tiên kết hợp mô phỏng vật lý, khử phản chiếu video bằng mô hình khuếch tán và bộ tiêu chuẩn đánh giá mới, giúp khôi phục video sắc nét chỉ với một bước khử nhiễu.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 46/100

MBA-Bench: Bộ tiêu chuẩn đa phương thức đầu tiên đánh giá năng lực tư duy kinh doanh của AI

MBA-Bench là bộ tiêu chuẩn đột phá với 30.000 mẫu dữ liệu đa phương thức, giúp huấn luyện và đánh giá các tác nhân AI trong việc phân tích và sáng tạo ý tưởng kinh doanh dựa trên các tín hiệu hình ảnh thực tế.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 50/100

AI4AI: Kỹ thuật Harness giúp mô hình AI yếu đạt hiệu suất vượt trội mà không cần huấn luyện lại

Nghiên cứu mới giới thiệu phương pháp dùng mô hình mạnh để tạo 'harness' hỗ trợ mô hình yếu giải quyết vấn đề phức tạp. Kết quả cho thấy hiệu suất tăng vọt từ 0.49 lên 0.91 nhờ tối ưu hóa quy trình suy luận và định dạng đầu ra.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

AutoWorldModel-Bench: Thước đo chuẩn cho nghiên cứu mô hình thế giới tự động

AutoWorldModel-Bench là bộ tiêu chuẩn mới cho phép các tác nhân AI tự động cải tiến mô hình thế giới trong môi trường game, giúp đánh giá khả năng nghiên cứu độc lập thay vì chỉ thực hiện các tác vụ lập trình theo yêu cầu.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 54/100

Spark-to-Paper: Giải pháp tự động viết bài nghiên cứu khoa học thông qua các kỹ năng mô-đun

Spark-to-Paper tích hợp 13 kỹ năng có thể kết hợp vào các trợ lý lập trình để tự động hóa quy trình viết bài nghiên cứu từ đầu đến cuối, đạt độ chính xác trích dẫn 99,5% với chi phí tối ưu.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 92/100

Tinh chọnAn toàn cho AI Agent: Tại sao cần chuyển dịch sang cơ chế kiểm soát thời gian thực?

Thay vì chỉ dựa vào huấn luyện mô hình, bài viết đề xuất an toàn cho AI Agent cần được thực thi thông qua các hợp đồng thời gian thực, bao gồm cơ chế ngăn chặn hành vi nguy hiểm và yêu cầu bằng chứng xác thực cho mọi tác vụ.


Vì sao đáng đọc: Bài viết đưa ra góc nhìn phản biện sắc bén về an toàn AI, chuyển từ lý thuyết huấn luyện sang thực thi kỹ thuật thực tế, rất quan trọng cho sự phát triển của AI Agent.
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Nghiên cứuĐiểm AI 68/100

Material Discovery Bench: Đột phá dùng AI tìm kiếm vật liệu bán dẫn mới

Các mô hình ngôn ngữ lớn đã phát hiện hơn 500 vật liệu bán dẫn tiềm năng thông qua bộ tiêu chuẩn Material Discovery Bench, dù vẫn tồn tại thách thức về tính khả thi trong tổng hợp thực nghiệm và hành vi bất thường của AI.

AK@_akhaliq
Nghiên cứuĐiểm AI 35/100

BDH-CQ: Đột phá học tập ngữ cảnh thông qua suy luận tiềm ẩn tuần hoàn

BDH-CQ In-Context Learning with Recurrent Latent Reasoning paper: https://huggingface.co/papers/26...

DịchNghiên cứu giới thiệu BDH-CQ, một phương pháp mới tối ưu hóa khả năng học tập ngữ cảnh (In-Context Learning) bằng cách áp dụng cơ chế suy luận tiềm ẩn tuần hoàn, giúp mô hình xử lý thông tin hiệu quả hơn.

Anthropic: Research (công bố - Web)
Nghiên cứuĐiểm AI 55/100

Anthropic công bố báo cáo đánh giá hiệu quả các chương trình đào tạo lại lao động trước làn sóng AI

Anthropic phối hợp cùng chuyên gia David Roodman phân tích 56 nghiên cứu thực nghiệm tại Mỹ và châu Âu, nhằm đánh giá khả năng thích ứng của các chương trình đào tạo lại đối với những biến động trên thị trường lao động do AI gây ra.

12/08

Thứ Tư · 20 tin
Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 52/100

Nghiên cứu mới từ Anthropic: Cách 'virus tư duy' lây lan trong hệ thống đa tác nhân AI

Very interesting new work from Anthropic. (bookmark it) They evolve mind viruses, ideas that sprea…

DịchAnthropic nghiên cứu cơ chế lây lan của các ý tưởng độc hại giữa các hệ thống đa tác nhân AI. Kết quả cho thấy các cảnh báo ngắn gọn trong lời nhắc hệ thống có thể ngăn chặn hiệu quả sự lây lan này.

Microsoft Research@MSFTResearch
Nghiên cứuĐiểm AI 30/100

MindTopo: Chuẩn đo lường mới đánh giá khả năng hiểu cấu trúc không gian của AI

A path, a fence, a knot. MindTopo sets a new benchmark for testing how AI understands topological re…

DịchMindTopo thiết lập tiêu chuẩn mới để kiểm tra cách AI nhận diện các mối quan hệ topo phức tạp như đường đi, rào cản và nút thắt, mở ra hướng đi mới cho khả năng suy luận không gian.

JiQiZhiXin
Nghiên cứuĐiểm AI 95/100

Tinh chọnChấn động giới AI: Nghiên cứu 116 trang tiết lộ cách 'trích xuất' tư duy ẩn của Claude và GPT

Một nghiên cứu mới chỉ ra lỗ hổng bảo mật nghiêm trọng trên các API mô hình lớn, cho phép kẻ xấu trích xuất toàn bộ chuỗi tư duy (reasoning traces) vốn được các hãng như OpenAI hay Anthropic mã hóa để bảo mật.


Vì sao đáng đọc: Đây là phát hiện bảo mật quan trọng ảnh hưởng trực tiếp đến các mô hình AI hàng đầu, có giá trị chuyên môn cao và đang thu hút sự quan tâm lớn từ cộng đồng công nghệ.
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Hướng dẫnĐiểm AI 56/100

LLM thực sự giỏi loại toán nào?

Dù OpenAI đã giải được nhiều bài toán hóc búa, LLM vẫn mạnh về tìm phản ví dụ hơn là chứng minh lý thuyết. Bài viết phân tích lý do tại sao mô hình ngôn ngữ lại có ưu thế đặc biệt trong việc phát hiện các trường hợp ngoại lệ này.

JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnLibra: Hệ thống tối ưu hóa tài nguyên cho Agentic RL, tăng tốc độ huấn luyện gấp 3 lần

Nhóm nghiên cứu từ CUHK và HSU giới thiệu Libra, hệ thống quản lý tài nguyên đột phá giúp giải quyết tình trạng mất cân bằng tải trong huấn luyện Agentic RL, tăng hiệu suất lên gấp 3 lần so với các phương pháp truyền thống.


Vì sao đáng đọc: Đây là nghiên cứu quan trọng về tối ưu hóa hệ thống cho AI Agents, giải quyết bài toán thực tế về hiệu suất GPU trong huấn luyện RL, có giá trị cao cho kỹ sư và nhà nghiên cứu.
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Power Law Graph Attention: Bước tiến mới thay thế cơ chế Scaled Dot-Product Attention truyền thống

Nghiên cứu giới thiệu Power Law Graph Attention (PLGA), một cơ chế chú ý mới thay thế tích vô hướng truyền thống bằng toán tử song tuyến tính học được, giúp tối ưu hóa khả năng biểu diễn và suy luận của các mô hình ngôn ngữ lớn.

Tencent Hunyuan@TencentHunyuan
Nghiên cứuĐiểm AI 63/100

Tencent Hunyuan công bố báo cáo toàn diện về độ tin cậy của tác nhân AI tự tiến hóa

📄New Research on Self-Evolving Agents: When AI agents modify themselves, how do we know they actual…

DịchTencent Hunyuan vừa ra mắt báo cáo chuyên sâu về cơ chế tự tiến hóa của tác nhân AI, đề xuất hệ thống phân cấp L0-L4 và khung đánh giá độ tin cậy. Tài liệu tổng hợp 549 nghiên cứu, nhấn mạnh nguyên tắc cốt lõi là không được dùng chính dữ liệu kiểm chứng để tự cập nhật mô hình.

JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnĐột phá từ ByteDance: Tối ưu hóa mô hình tạo ảnh bằng 'Structured Prompt' thay vì chỉ tăng độ dài văn bản

Nhóm Seed của ByteDance phát hiện rằng thông tin hình ảnh trong Caption quan trọng hơn độ dài văn bản. Họ đề xuất Structured Prompt giúp cải thiện đáng kể khả năng suy luận và hiểu biết thế giới của các mô hình khuếch tán.


Vì sao đáng đọc: Nghiên cứu giải quyết vấn đề cốt lõi trong huấn luyện mô hình tạo ảnh, đưa ra phương pháp tối ưu hóa hiệu quả thay vì chỉ chạy đua tài nguyên phần cứng.
swyx@swyx
Nghiên cứuĐiểm AI 51/100

Nghiên cứu đột phá: Hé lộ cách trích xuất 'suy luận ẩn' từ các mô hình AI hàng đầu

this is already one of the most important papers of this year. https://www.latent.space/p/ainews-ho...

DịchMột nghiên cứu gây chấn động khi tìm ra lỗ hổng API cho phép trích xuất các bước suy luận ẩn của các mô hình AI lớn. Phát hiện này xác nhận số lượng token suy luận thực tế khớp hoàn toàn với dữ liệu tính phí, mở ra góc nhìn mới về cách các mô hình AI vận hành bên trong.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Decoding-Level Taboo: Kiểm tra khả năng chịu tải của LLM bằng phương pháp can thiệp logit

Nghiên cứu giới thiệu bài kiểm tra 'Taboo' giúp đánh giá độ bền của LLM bằng cách ép mô hình đi chệch khỏi lộ trình tạo văn bản thông thường, từ đó bộc lộ những hạn chế thực tế mà các bài benchmark truyền thống thường bỏ qua.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

JigShape: Thử thách khả năng tư duy hình học của các mô hình đa phương thức qua trò chơi ghép hình

Nghiên cứu giới thiệu JigShape, bộ dữ liệu ghép hình phức tạp giúp đánh giá khả năng tư duy hình học của các mô hình VLM. Kết quả cho thấy ngay cả những mô hình tiên tiến nhất cũng gặp khó khăn lớn khi độ khó tăng dần, bộc lộ lỗ hổng trong khả năng suy luận không gian của AI.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnĐồng tiến hóa trong hệ thống tác tử: Hướng tới khả năng tự tiến hóa vượt xa thiết kế của con người

Nghiên cứu đề xuất khung phân loại ba giai đoạn về sự đồng tiến hóa giữa các tác tử và môi trường, giúp hệ thống AI tự thích nghi và phát triển mà không cần sự can thiệp liên tục từ con người.


Vì sao đáng đọc: Chủ đề mang tính tiên phong về khả năng tự chủ của AI, cung cấp khung lý thuyết quan trọng cho tương lai của các hệ thống tác tử tự tiến hóa.
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Mendel Gödel Machine: Tối ưu hóa tự thân cho AI lập trình thông qua tiến hóa so sánh

Mendel Gödel Machine (MGM) cải tiến các tác nhân AI tự lập trình bằng cách áp dụng nguyên lý di truyền Mendel, kết hợp dữ liệu từ nhiều nhiệm vụ và dòng dõi khác nhau để tối ưu hóa mã nguồn hiệu quả hơn thay vì chỉ dựa vào một lần thử sai duy nhất.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 69/100

Tấn công Trace Inversion: Sao chép khả năng suy luận của AI mà không cần lộ chuỗi tư duy

You don't necessarily need to see how a powerful AI thinks to copy some of its reasoning ability. …

DịchNghiên cứu mới giới thiệu kỹ thuật Trace Inversion, cho phép huấn luyện mô hình học sinh đạt khả năng suy luận tương đương mô hình gốc chỉ bằng câu hỏi và đáp án, ngay cả khi chuỗi tư duy (CoT) bị ẩn. Chi phí thực hiện cực thấp, đặt ra thách thức lớn về bảo mật mô hình.

Simon Willison Blog
Nghiên cứuĐiểm AI 56/100

Lỗ hổng bảo mật: Đánh cắp chuỗi suy luận từ API của các mô hình LLM hàng đầu

Các nhà nghiên cứu phát hiện lỗ hổng cho phép giải mã và đánh cắp các chuỗi suy luận ẩn của Anthropic, OpenAI và Google thông qua việc phát lại dữ liệu. Dù đã được các nhà cung cấp khắc phục, đây là cảnh báo quan trọng về bảo mật dữ liệu trong các mô hình AI suy luận.

Diễn biến sự kiện · 4 bài →
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 45/100

Cảnh báo: Các khối suy luận ẩn của AI có thể trở thành kênh rò rỉ dữ liệu nguy hiểm

Very big warning from this paper. Your AI's hidden reasoning can become a second, invisible data le…

DịchNghiên cứu mới chỉ ra rằng các khối suy luận ẩn trong AI có thể lưu trữ và làm lộ thông tin nhạy cảm như mật khẩu hay API key ngay cả khi hội thoại đã bị xóa. Kẻ tấn công có thể khai thác các khối này để đánh cắp dữ liệu từ các mô hình mạnh thông qua mô hình yếu hơn.

Tổng 32 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (41 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Nghiên cứu AI” — Trang 30 | AIHOT.vn