08/09

Thứ Ba · 28 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnEMNLP 2026: Dự đoán càng giống thật, AI Agent càng dễ sai? Giải pháp từ 'Nhất quán hành vi'

Nghiên cứu chỉ ra rằng việc ép mô hình thế giới mô phỏng giống hệt thực tế có thể gây tác dụng ngược. Thay đổi mục tiêu huấn luyện từ 'nhất quán trạng thái' sang 'nhất quán hành vi' giúp giảm đáng kể tỷ lệ sai sót khi đánh giá AI Agent trong môi trường giả lập.


Vì sao đáng đọc: Bài viết mang tính đột phá về phương pháp luận trong huấn luyện AI Agent, thách thức tư duy truyền thống về mô hình thế giới, rất có giá trị cho cộng đồng nghiên cứu.
Alibaba Cloud@alibaba_cloud
NgànhĐiểm AI 21/100

Hội nghị Apsara 2026: Lãnh đạo SAP chia sẻ về cách AI Agent định hình doanh nghiệp tự vận hành

The next phase for AI involves transforming capabilities into tangible real-world value. At #ApsaraC…

DịchTại hội nghị Apsara 2026, lãnh đạo cấp cao của SAP thảo luận về việc ứng dụng AI Agent để chuyển đổi mô hình vận hành, giúp doanh nghiệp đạt được sự tự chủ và tối ưu hóa giá trị thực tiễn.

ModelBest OpenBMB@OpenBMB
NgànhĐiểm AI 35/100

MiniCPM5-2B lập kỷ lục: Xử lý 32 quy trình đối soát phức tạp chỉ trong 67,8 giây

This is MiniCPM5-2B doing real work as local agents 🚀Huge thanks to MiniCPM Ambassador @aijoey - 3…

DịchMô hình MiniCPM5-2B chứng minh hiệu suất vượt trội khi phối hợp cùng 32 tác nhân (agent) để tự động hóa quy trình đối soát hóa đơn và thanh toán, thực hiện 232 lệnh gọi công cụ chỉ trong chưa đầy 70 giây.

WeChat: Baidu AI Cloud (ERNIE)
NgànhĐiểm AI 26/100

Baidu Smart Cloud tại Hội nghị Tính toán: Hạ tầng AI bước vào kỷ nguyên 'cung ứng quy mô lớn'

Baidu Smart Cloud khẳng định hạ tầng điện toán cần nâng cấp toàn diện để đáp ứng kỷ nguyên Agent. Các giải pháp như cụm siêu máy tính Tianchi và nền tảng Baige đã đạt chứng nhận sản xuất thực tế, sẵn sàng cho việc triển khai quy mô lớn.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 53/100

Nghiên cứu mới: Phương pháp RAE đánh giá chính xác khả năng truy xuất kỹ năng của AI Agent

A skill-enabled agent can look better overall while performing worse on the exact tasks where it ret…

DịchCác nhà nghiên cứu từ Đại học Soongsil chỉ ra rằng cách đánh giá AI Agent hiện nay thường bị sai lệch. Họ đề xuất phương pháp RAE để đo lường thực chất hiệu quả của việc truy xuất kỹ năng, giúp khắc phục các hạn chế trong các bài kiểm tra truyền thống.

vLLM Blog chính thức
Hướng dẫnĐiểm AI 63/100

Tinh chọnvLLM kết hợp AgentX: Tối ưu hóa toàn diện cho các tác vụ suy luận AI Agent thực tế

Đội ngũ vLLM công bố giải pháp tối ưu hóa cho tải công việc AI Agent dựa trên benchmark AgentX, giúp DeepSeek V4 Pro đạt hiệu suất 83K tokens/GPU-giây trên hệ thống GB300.


Vì sao đáng đọc: Đội ngũ vLLM chia sẻ phương pháp tối ưu hóa toàn diện và các bài học kinh nghiệm từ thực tế, giúp người đọc hiểu cách điều chỉnh chiến lược song song theo kiến trúc mô hình.
Rohan Paul@rohanpaul_ai
NgànhĐiểm AI 50/100

Kỹ năng quan trọng hơn bộ nhớ quy trình: Chìa khóa nằm ở việc chắt lọc kinh nghiệm

Agent skills work for a very specific reason: they turn messy past experience into a clean procedure…

DịchNghiên cứu cho thấy việc chắt lọc kinh nghiệm thành các kỹ năng (SKILL.md) giúp AI đạt hiệu suất cao hơn 6,06% so với việc lưu trữ chi tiết quy trình. Thay vì mở rộng bộ nhớ, các tác nhân AI tự cải tiến cần tập trung vào khả năng đúc kết và áp dụng kinh nghiệm hiệu quả hơn.

DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 52/100

Nghiên cứu τ^τ-Bench: Claude 3.5 Opus chỉ đạt 23,9% khi tự xây dựng AI Agent, trong khi con người đạt 82,2%

Really strong benchmark paper on coding agents. Claude Opus 5 running under Claude Code passes 23.9…

DịchSierra và ĐH Princeton ra mắt τ^τ-Bench, bộ tiêu chuẩn đánh giá khả năng tự xây dựng AI Agent của các mô hình ngôn ngữ. Kết quả cho thấy khoảng cách lớn giữa AI và chuyên gia con người trong việc thiết lập hệ thống chăm sóc khách hàng thực tế.

DAIR.AI@dair_ai
NgànhĐiểm AI 45/100

Tổng quan phê bình về AI Agent: Từ mô hình ngôn ngữ đến hệ thống hành động thực tế

// From Language Models to World-Acting Systems // A critical review of agentic AI, and a framework…

DịchDAIR.AI đề xuất khung đánh giá mới cho AI Agent, chỉ ra rằng khả năng kết nối hành động đang phát triển mạnh hơn so với độ tin cậy và tính tự chủ. Báo cáo cũng cảnh báo về rủi ro chi phí và lỗi phối hợp trong các hệ thống đa tác tử.

07/09

Thứ Hai · 21 tin
DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 59/100

Nghiên cứu từ LinkedIn: Liệu bộ nhớ của AI Agent có còn hiệu quả sau khi nâng cấp mô hình?

Brilliant paper from LinkedIn. (bookmark it) I have been saying that memory is one of the most cha…

DịchNghiên cứu của LinkedIn phân tích khả năng duy trì bộ nhớ của các AI Agent khi thay đổi mô hình đọc/ghi, thông qua thử nghiệm trên 48 kịch bản lịch sử tổng hợp để đánh giá tính tương thích.

IT Home
NgànhĐiểm AI 26/100

Lịch trình Hội nghị Nhà phát triển Honor 2026: MagicOS 11 với AI Agent chính thức ra mắt ngày 15/9

Hội nghị nhà phát triển Honor 2026 sẽ diễn ra vào ngày 15/9 tại Thâm Quyến, tâm điểm là sự kiện ra mắt MagicOS 11 - hệ điều hành di động đầu tiên ứng dụng AI Agent cấp hệ thống, cùng hàng loạt cải tiến về hiệu năng, giao diện và trải nghiệm người dùng.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 61/100

Hiện tượng 'Trí nhớ thảm họa': Tại sao các tệp chỉ dẫn AI như CLAUDE.md ngày càng phình to?

New term "catastrophic remembering" CLAUDE.md has a ratchet problem: instructions are easy to add a…

DịchNghiên cứu trên 1.867 kho lưu trữ cho thấy các tệp chỉ dẫn AI tăng trưởng trung bình 226% do các lệnh cũ không được xóa bỏ. Giải pháp gắn kèm chú thích về bối cảnh giúp giảm đáng kể lượng từ thừa mà vẫn duy trì hiệu suất mô hình.

Xiaobei@frxiaobei
Hướng dẫnĐiểm AI 62/100

OpenAI tiết lộ: Coding Agent đang thay đổi hoàn toàn cách thức nghiên cứu nội bộ

Nghiên cứu từ OpenAI cho thấy mỗi nhân viên đang tiêu tốn hơn 600 USD tài nguyên suy luận mỗi ngày, với trung bình 3,1 'ngày làm việc' của AI hỗ trợ cho mỗi nhà nghiên cứu, đánh dấu sự bùng nổ trong hiệu suất làm việc.

Diễn biến sự kiện · 4 bài →
AI Notes@AYi_AInotes
Hướng dẫnĐiểm AI 64/100

Cùng sự kiệnJakub Pachocki (OpenAI) cảnh báo về 'Trí tuệ ngoài hành tinh' và cuộc đua AI Agent

Giám đốc khoa học của OpenAI chia sẻ góc nhìn về tương lai AI, đồng thời nhấn mạnh sự cấp bách của việc kiểm soát và căn chỉnh khi các AI Agent đang phát triển vượt tầm kiểm soát.

Cùng sự kiện, tinh chọn hiển thị «OpenAI cảnh báo về thách thức kiểm soát AI: Khi khả năng giám sát suy luận (CoT) dần mất hiệu lực»
QbitAI
Mô hìnhĐiểm AI 88/100

Tinh chọnGPT-6 không chỉ có Astra: Kết quả thử nghiệm Sol cho thấy tốc độ nhanh gấp 6 lần

Dự án Sol của OpenAI đang gây chú ý với tốc độ vượt trội, đồng thời hé lộ văn hóa làm việc mới khi mỗi nhà nghiên cứu tại đây hiện đang quản lý tới 3 trợ lý AI.


Vì sao đáng đọc: Tin tức độc quyền về dự án mới của OpenAI và thay đổi trong quy trình làm việc của các kỹ sư AI có tính thời sự cao, thu hút sự quan tâm lớn từ cộng đồng công nghệ.
JiQiZhiXin
NgànhĐiểm AI 95/100

Cùng sự kiệnOpenAI công bố lộ trình: AI sẽ tự nghiên cứu hoàn toàn vào năm 2028

OpenAI vừa tiết lộ dữ liệu nội bộ cho thấy các AI Agent đang đảm nhận phần lớn công việc nghiên cứu, với tỷ lệ 3 AI hỗ trợ cho mỗi nhà nghiên cứu, hướng tới mục tiêu tự động hóa hoàn toàn quy trình phát triển AI vào năm 2028.

Cùng sự kiện, tinh chọn hiển thị «OpenAI công bố báo cáo tăng tốc nghiên cứu: Đạt mục tiêu thực tập sinh AI, hướng tới nhà nghiên cứu tự động vào 2028»
JiQiZhiXin
Nghiên cứuĐiểm AI 95/100

Tinh chọnMicrosoftArgus: AI Agent tự chủ giải quyết bài toán toán học 20 năm tuổi sau 1.548 giờ nghiên cứu

Microsoft cùng các đối tác giới thiệu Argus, hệ thống Agent đột phá có khả năng tự vận hành nghiên cứu dài hạn trong hàng nghìn giờ mà không cần con người can thiệp liên tục, đánh dấu bước tiến từ 'thực thi' sang 'tự ra quyết định' trong AI.


Vì sao đáng đọc: Đây là bước tiến quan trọng trong lĩnh vực AI Agent, giải quyết bài toán 'tự chủ dài hạn' vốn là điểm yếu của các mô hình hiện nay, có tính ứng dụng thực tiễn cao trong nghiên cứu khoa học.
AI Notes@AYi_AInotes
Hướng dẫnĐiểm AI 57/100

Đừng nhồi nhét kỹ năng cho AI Agent: Cách tối ưu hóa hiệu suất bằng 'kiểm toán' prompt

Việc lạm dụng plugin và kỹ năng khiến AI Agent bị quá tải ngữ cảnh, làm giảm hiệu suất phản hồi. Tác giả chia sẻ prompt giúp lọc bỏ các kỹ năng dư thừa, chỉ giữ lại những công cụ cốt lõi để tối ưu hóa khả năng xử lý của mô hình.

Rohan Paul@rohanpaul_ai
Hướng dẫnĐiểm AI 59/100

Rohan Paul: 'Thời gian thực thi' là thước đo mới đánh giá năng lực AI Agent

I think "time horizon" is becoming one of the more useful ways to talk about agent capability. At O…

DịchRohan Paul cho rằng thời gian thực thi là chỉ số quan trọng để đo lường AI Agent. Dữ liệu từ OpenAI cho thấy tỷ lệ thành công giảm mạnh từ 86% (nhiệm vụ 15 phút) xuống còn 16% khi kéo dài lên 64-128 giờ.

Rohan Paul@rohanpaul_ai
Hướng dẫnĐiểm AI 60/100

Cùng sự kiệnOpenAI đạt cột mốc mới: AI tự động hóa giúp tăng tốc độ thực nghiệm lên gấp 1,6 lần

One of AI's biggest effects on research, researchers can test far more ideas. OpenAI's experiment v…

DịchOpenAI vừa công bố hệ thống 'thực tập sinh nghiên cứu tự động' có khả năng thực hiện các tác vụ phức tạp dưới sự giám sát của con người. Hệ thống này giúp tăng tốc độ thực nghiệm của mỗi nhà nghiên cứu lên gấp 1,6 lần so với mức cơ sở năm 2025.

Cùng sự kiện, tinh chọn hiển thị «OpenAI công bố báo cáo tăng tốc nghiên cứu: Đạt mục tiêu thực tập sinh AI, hướng tới nhà nghiên cứu tự động vào 2028»
Rohan Paul@rohanpaul_ai
Hướng dẫnĐiểm AI 81/100

Cùng sự kiệnOpenAI đạt cột mốc mới: AI tự động hóa đạt hiệu suất gấp 3,1 lần nhân sự thực tập

OpenAI just officially said it has reached its "automated research intern" milestone. i.e. a human…

DịchOpenAI công bố dữ liệu cho thấy các tác nhân AI của họ hiện có thể thực hiện các nhiệm vụ nghiên cứu phức tạp với tốc độ gấp 3,1 lần so với con người. Đây được xem là bước tiến quan trọng trong việc ứng dụng AI vào quy trình nghiên cứu tự động.

Cùng sự kiện, tinh chọn hiển thị «OpenAI công bố báo cáo tăng tốc nghiên cứu: Đạt mục tiêu thực tập sinh AI, hướng tới nhà nghiên cứu tự động vào 2028»

06/09

Chủ Nhật · 2 tin
OpenAI: Tin chính thức (RSS - lọc nội dung doanh nghiệp/khách hàng)
Hướng dẫnĐiểm AI 82/100

Tinh chọnOpenAI công bố báo cáo tăng tốc nghiên cứu: Đạt mục tiêu thực tập sinh AI, hướng tới nhà nghiên cứu tự động vào 2028

OpenAI tiết lộ đã đạt mục tiêu tạo ra thực tập sinh nghiên cứu AI có khả năng thực hiện các nhiệm vụ phức tạp dưới sự hướng dẫn của con người, đồng thời đặt lộ trình phát triển nhà nghiên cứu AI tự động hoàn toàn vào tháng 3 năm 2028.

Diễn biến sự kiện · 8 bài →Thêm 7 nguồn khác đưa tinJiqizhixinThe Decoder: AI NewsX: Rohan Paul (@rohanpaul_ai)X: AI Safety Memes (@AISafetyMemes)Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)X: Noam Brown (@polynoamial)X: Kim (@kimmonismus)

Vì sao đáng đọc: OpenAI tiết lộ dữ liệu nội bộ về tác động của coding agent đối với công việc nghiên cứu và tiến độ RSI, giúp độc giả nắm bắt hiện trạng tự động hóa tại các phòng thí nghiệm hàng đầu.
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 51/100

DisCo: Phương pháp chưng cất kho lưu trữ GitHub thành kỹ năng, giúp AI đạt 72.89% trên MLE-bench

Very useful insight in this paper. AI agents may be wasting huge amounts of effort rediscovering t…

DịchNghiên cứu DisCo giới thiệu cách chuyển đổi kho lưu trữ GitHub và tài liệu kỹ thuật thành các 'kỹ năng' tinh gọn, giúp AI tự chủ trong việc chọn công cụ và xử lý lỗi, từ đó nâng cao đáng kể hiệu suất giải quyết tác vụ thực tế.

05/09

Thứ Bảy · 18 tin
Đã tải 40 tin

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (57 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “AI agent” — Trang 19 | AIHOT.vn