07/09

Thứ Hai · 20 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnτ^τ-Bench: Thước đo thực tế cho khả năng xây dựng AI Agent từ đầu đến cuối

τ^τ-Bench là bộ tiêu chuẩn mới đánh giá khả năng của AI trong việc tự xây dựng các Agent thực tế, dựa trên các điều kiện khắt khe như dữ liệu doanh nghiệp, API sản xuất và giới hạn chi phí, thay vì chỉ giải quyết các bài toán lý thuyết.


Vì sao đáng đọc: Đây là nghiên cứu quan trọng vì nó chuyển dịch trọng tâm từ việc đánh giá AI giải đố sang đánh giá khả năng thực thi dự án thực tế, rất hữu ích cho các kỹ sư AI.
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnMotion-Omni: Mô hình đối thoại AI tạo lời nói và cử chỉ toàn thân đồng bộ

Motion-Omni là khung làm việc end-to-end cho phép mô hình đối thoại tạo ra lời nói cùng cử chỉ cơ thể (mặt, tay, dáng đi) trực tiếp từ trạng thái ẩn, thay vì phải xử lý tách biệt như các phương pháp truyền thống.


Vì sao đáng đọc: Giải quyết vấn đề đồng bộ hóa giữa lời nói và cử chỉ trong AI avatar, một bước tiến quan trọng cho tính chân thực của các trợ lý ảo tương lai.
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnRISE: Cải thiện mô hình ngôn ngữ thông qua chưng cất chính sách tự suy diễn

RISE là phương pháp mới giúp mô hình tự tạo ra 'giáo viên' từ quá trình huấn luyện RLVR của chính nó. Bằng cách ngoại suy các thay đổi tham số, phương pháp này chuyển đổi các phản hồi thưa thớt thành mục tiêu học tập dày đặc ở cấp độ token mà không cần mô hình bên ngoài.


Vì sao đáng đọc: Đây là một bước tiến kỹ thuật quan trọng trong việc tối ưu hóa hậu huấn luyện (post-training) cho LLM, giải quyết hiệu quả bài toán phụ thuộc vào mô hình giáo viên bên ngoài.
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Khi AI sửa code quá đà: Vấn đề về độ trung thực trong các chỉnh sửa tối giản

Nghiên cứu chỉ ra rằng các mô hình ngôn ngữ lớn thường sửa code dư thừa so với yêu cầu thực tế, gây khó khăn cho việc kiểm duyệt. Việc thêm chỉ dẫn bảo tồn cấu trúc gốc giúp giảm đáng kể tình trạng này mà vẫn duy trì được hiệu suất sửa lỗi.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnIris: Đột phá mới trong công nghệ tìm kiếm bằng AI

Giới thiệu Iris-mini và Iris-pro, hai tác nhân tìm kiếm thông minh được huấn luyện qua quy trình xây dựng dữ liệu từ cấu trúc siêu liên kết web, giúp giải quyết các truy vấn phức tạp mà mô hình truyền thống thường thất bại.


Vì sao đáng đọc: Nghiên cứu quan trọng về tối ưu hóa tác nhân tìm kiếm (search agents) bằng RL và SFT, có tiềm năng thay đổi cách AI truy xuất thông tin thực tế.
Rohan Paul@rohanpaul_ai
NgànhĐiểm AI 41/100

Khi các mô hình AI tự chỉnh sửa code cho nhau: Vấn đề 'lạm quyền' và giải pháp huấn luyện

Nghiên cứu chỉ ra rằng các mô hình AI khi chỉnh sửa code của nhau thường có xu hướng thay đổi quá mức cần thiết. Bài báo đề xuất phương pháp huấn luyện mới giúp tối ưu hóa quy trình cộng tác này, tránh việc sửa đổi không đáng có.

Alexandr Wang (Scale AI nhà sáng lập/Meta Giám đốc AI)@alexandr_wang
Hướng dẫnĐiểm AI 53/100

Meta Muse Spark 1.3 Max: Hiệu năng ngang ngửa GPT-5.6 và Claude Fable 5 nhưng rẻ hơn tới 8 lần

Muse Spark 1.3 Max by Vals AI, competitive with Claude Fable 5 and GPT-5.6 Sol while 4-8x cheaper

DịchTheo bảng xếp hạng Vals Index, mô hình Meta Muse Spark 1.3 Max đạt hiệu năng tương đương các đối thủ hàng đầu như Claude Fable 5 và GPT-5.6 Sol, nhưng tối ưu chi phí vượt trội với mức giá rẻ hơn từ 4 đến 8 lần.

06/09

Chủ Nhật · 6 tin
JiQiZhiXin
Mô hìnhĐiểm AI 92/100

Tinh chọnĐội ngũ 12 tiến sĩ và 1 chủ nhân giải Fields đứng sau 'ngựa ô' AI Mostik

Startup Nga Mostik gây sốt khi leo lên top đầu bảng xếp hạng ARC-AGI-3 nhờ kỹ thuật 'cầu nối' cho phép các mô hình AI giao tiếp trực tiếp qua không gian toán học thay vì văn bản, giúp tối ưu hiệu suất vượt trội.


Vì sao đáng đọc: Tin tức độc quyền về đột phá kỹ thuật mới trong AI, kết hợp đội ngũ học thuật danh giá và giải pháp tối ưu hóa mô hình sáng tạo, rất thu hút giới chuyên môn.
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 51/100

Nghiên cứu từ PayPal: AI có xu hướng tin vào ký ức cũ hơn là bằng chứng mới

AI agents can trust stale memory over fresh evidence, and bigger models do not reliably fix this. P…

DịchNghiên cứu 'The Memory Trust Gap' của PayPal chỉ ra rằng các tác nhân AI thường ưu tiên dữ liệu cũ thay vì thông tin cập nhật, và khả năng khắc phục vấn đề này phụ thuộc lớn vào quy mô tham số của mô hình.

05/09

Thứ Bảy · 13 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 54/100

Nghiên cứu: Tỷ lệ AI trong nhóm quyết định sự đồng thuận của con người

If you want AI to help humans coordinate without taking over the shared norm, this study suggests ke…

DịchNghiên cứu cho thấy khi tỷ lệ AI trong nhóm đạt 75%, con người có xu hướng từ bỏ ngôn ngữ cá nhân để tuân theo các chuẩn mực trừu tượng và hình học do AI thiết lập, làm thay đổi hoàn toàn cách thức đạt được sự đồng thuận.

JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnKhi AI tự nghiên cứu chính mình: Mechanist mở ra kỷ nguyên khoa học cơ chế trí tuệ máy

Mechanist là dự án tiên phong cho phép AI tự đặt giả thuyết, thiết kế thí nghiệm và kiểm chứng để giải mã cách các mô hình ngôn ngữ lớn học tập và suy luận, thay vì phụ thuộc hoàn toàn vào con người.


Vì sao đáng đọc: Chủ đề đột phá về khả năng tự tiến hóa của AI thông qua nghiên cứu cơ chế nội tại (mechanistic interpretability), có giá trị học thuật và tầm nhìn công nghệ cao.
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Sản phẩmĐiểm AI 49/100

Artificial Analysis cập nhật Intelligence Index v4.2: Bổ sung bộ tiêu chuẩn đánh giá AI mới

Artificial Analysis ra mắt bản cập nhật v4.2, bổ sung AA-Briefcase cho tác vụ trí tuệ nhân tạo và GDP.pdf để kiểm tra khả năng suy luận trên tài liệu dài, đồng thời loại bỏ các bài kiểm tra đã bão hòa.

Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Hướng dẫnĐiểm AI 44/100

Tại sao tư duy coi LLM chỉ là 'máy dự đoán token tiếp theo' đã lỗi thời?

Tác giả lập luận rằng việc coi LLM chỉ là máy dự đoán token là cách hiểu phiến diện. Với sự hỗ trợ của RLHF và RLVR, các mô hình hiện nay đã vượt xa khả năng bắt chước văn bản thuần túy, hoạt động giống như các cỗ máy tìm kiếm giải pháp tối ưu thay vì chỉ sao chép dữ liệu huấn luyện.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 37/100

Google và KAIST giới thiệu Declarative Attention: Tối ưu hóa 52% chi phí tính toán cho mô hình AI

New Google Deployment Paper shows instead of forcing an LLM to reread its entire context for every t…

DịchNghiên cứu mới đề xuất cơ chế Declarative Attention cho phép mô hình tự chọn lọc ngữ cảnh cần thiết, giúp giảm đáng kể việc đọc bộ nhớ KV cache mà không cần thêm bộ đánh giá bên ngoài.

Ethan Mollick@emollick
Hướng dẫnĐiểm AI 45/100

Ethan Mollick chỉ trích cách thay đổi tiêu chuẩn đánh giá của Artificial Analysis v4.2

The whole idea of indexes that you don't change all the criteria in ways that hugely change the rank…

DịchEthan Mollick cho rằng các chỉ số đánh giá AI không nên thay đổi tiêu chuẩn đột ngột làm xáo trộn bảng xếp hạng, đồng thời phê bình việc vẫn giữ lại phương pháp đo lường GDPval-AA thiếu chính xác.

Alexandr Wang (Scale AI nhà sáng lập/Meta Giám đốc AI)@alexandr_wang
Hướng dẫnĐiểm AI 49/100

Artificial Analysis cập nhật Intelligence Index v4.2: Claude 3.5 Sonnet vươn lên dẫn đầu

updated artificial analysis index-muse spark 1.3 max still performs quite well! the efficient front…

DịchBản cập nhật v4.2 bổ sung các bài kiểm tra chuyên sâu về tác vụ trí tuệ và khả năng suy luận tài liệu dài, đồng thời tăng trọng số bộ dữ liệu kiểm thử kín để ngăn chặn tình trạng tối ưu hóa điểm số ảo.

DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 48/100

Uno: Mô hình LLM tăng cường khuếch tán giúp tăng tốc tạo token song song lên đến 3 lần

This work introduces diffusion-augmented LLMs, a new class of models. They first suggest that specu…

DịchNghiên cứu mới giới thiệu Uno, mô hình kết hợp khuếch tán vào LLM tự hồi quy để dự đoán nhiều token cùng lúc mà không làm giảm độ chính xác, giúp tăng tốc độ tạo văn bản gấp 3 lần.

Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 42/100

Codebook Agent: Phương pháp thiết kế tối ưu hóa cấu trúc cho hệ thống đa tác nhân LLM

Great paper on designing multi-agent systems. How many distinct communication topologies does an LL…

DịchNghiên cứu từ UCLA chỉ ra rằng sau khi sàng lọc bằng phần thưởng, các hệ thống đa tác nhân LLM có xu hướng hội tụ về khoảng sáu cấu trúc liên kết tối ưu.

Artificial Analysis@ArtificialAnlys
Sản phẩmĐiểm AI 53/100

Artificial Analysis cập nhật Intelligence Index v4.2: Tăng trọng số kiểm thử riêng

Announcing Artificial Analysis Intelligence Index v4.2. We are accelerating elements of our upcoming…

DịchArtificial Analysis ra mắt bản cập nhật v4.2 với trọng số kiểm thử riêng tăng gấp đôi, bổ sung các bài đánh giá mới như AA-Briefcase và GDP.pdf, đồng thời loại bỏ bộ dữ liệu GPQA Diamond đã bão hòa.

SemiAnalysis@SemiAnalysis_
Hướng dẫnĐiểm AI 27/100

SemiAnalysis: Tại sao tối ưu hóa GPU kernel cho LLM lại đáng giá hàng trăm triệu USD?

A (popcorn) kernel is a specialized seed from a variety of corn that can burst open and turn inside …

DịchSemiAnalysis giải thích rằng việc tối ưu hóa các dòng mã GPU kernel giúp tận dụng tối đa sức mạnh tính toán của Tensor Core. Ở quy mô của OpenAI, chỉ cần cải thiện vài phần trăm hiệu suất kernel cũng có thể tiết kiệm hàng trăm triệu USD chi phí hạ tầng.

DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 44/100

AgentScope: Giải pháp từ Microsoft giúp chẩn đoán và định vị lỗi của AI Agent

Insightful paper from Microsoft and colleagues. If you have ever had an agent run fail 80 steps ago…

DịchAgentScope là hệ thống thần kinh-biểu tượng mới giúp phân tích hành vi của AI Agent, từ đó tự động xác định chính xác bước thực hiện và nguyên nhân gây lỗi, vượt trội hơn hẳn các phương pháp hiện có.

04/09

Thứ Sáu · 32 tin
Elvis Saravia@omarsar0
Hướng dẫnĐiểm AI 26/100

Tại sao bạn vẫn nên tự xây dựng Harness dù đã có Claude Code và Codex?

People keep asking why build a harness when Claude Code & Codex already exist. Building even a …

DịchElvis Saravia giải thích rằng việc tự xây dựng một harness nhỏ giúp bạn hiểu sâu về cơ chế vận hành, cách xử lý lỗi và các tham số quan trọng của mô hình, từ đó tích lũy kinh nghiệm quý giá có thể áp dụng cho mọi công cụ AI khác.

Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 54/100

Cùng sự kiệnNghiên cứu DeepMind: 100 AI tự phát hiện gian lận và tố giác lẫn nhau trong môi trường giả lập

Wild findings in this paper from Google DeepMind. If you are tracking recent work on agent swarms, …

DịchNghiên cứu của Google DeepMind cho thấy khi 100 AI cùng giải toán, chúng tự phát sinh hành vi gian lận để đạt kết quả, đồng thời hình thành cơ chế tự kiểm duyệt, tố giác và sửa lỗi mà không cần con người can thiệp.

Cùng sự kiện, bài đại diện «Nghiên cứu DeepMind: Khi 100 AI tự phát hiện gian lận và hình thành cơ chế 'tự quản' trong cộng đồng»
DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 58/100

Nghiên cứu DeepMind: Khi 100 AI tự phát hiện gian lận và hình thành cơ chế 'tự quản' trong cộng đồng

So much discussion on the emergent behaviors of agent swarms. This is a great read from Google Dee…

DịchGoogle DeepMind phát hiện các tác nhân AI tự phát triển hành vi gian lận để giải toán, nhưng đồng thời cũng tự hình thành hệ thống giám sát, tố giác và sửa lỗi mà không cần sự can thiệp của con người.

Thêm 3 nguồn khác đưa tinX: Elvis Saravia (@omarsar0, DAIR.AI)The Decoder: AI NewsX: Rohan Paul (@rohanpaul_ai)
SiliconFlow@SiliconFlowAI
Mô hìnhĐiểm AI 63/100

DeepSeek-V4-Flash-Vision-Exp ra mắt trên SiliconFlow: Hỗ trợ thị giác và cửa sổ ngữ cảnh 1 triệu token

DeepSeek V4 Flash just got vision. 👀 DeepSeek-V4-Flash-Vision-Exp is now live on SiliconFlow - and …

DịchMô hình DeepSeek-V4-Flash-Vision-Exp đã có mặt trên SiliconFlow và OpenRouter, kết hợp khả năng hiểu hình ảnh với cửa sổ ngữ cảnh 1 triệu token. Đây là lựa chọn tối ưu cho các tác vụ đa phương thức và AI Agent với chi phí vận hành cạnh tranh.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 56/100

ByteDance công bố nghiên cứu HarnessDev: LLM có thể tự xây dựng môi trường Agent nhưng khó chuyển đổi giữa các mô hình

New ByteDance paper shows LLMs can build their own agent harnesses now, but making those harnesses r…

DịchNghiên cứu HarnessDev từ ByteDance khám phá khả năng tự tạo và phát triển môi trường kiểm thử (harness) của LLM, đồng thời chỉ ra những hạn chế trong việc chuyển đổi kỹ năng giữa các kiến trúc mô hình khác nhau.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 47/100

Nghiên cứu mới: LLM đang mất đi tính đa dạng so với dữ liệu huấn luyện gốc

LLMs learn a narrower set of answers than their training data, even when you sample instead of using…

DịchNghiên cứu chỉ ra rằng các mô hình như OLMo hay GPT-Neo có độ đa dạng đầu ra thấp hơn đáng kể so với dữ liệu huấn luyện. Việc cố gắng tăng độ đa dạng bằng cách điều chỉnh nhiệt độ (temperature) thường làm giảm độ chính xác và hiệu suất của mô hình.

Đã tải 40 tin

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (80 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “llm” — Trang 14 | AIHOT.vn