13/08

Thứ Năm · 10 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 36/100

Nghiên cứu của Anthropic: AI Agent cần cơ chế quản trị để tránh rủi ro hệ thống

Anthropic's new research found found that identical or similar agents can converge on the same bad d…

DịchNghiên cứu mới từ Anthropic cảnh báo các AI Agent có xu hướng lặp lại sai lầm giống nhau, dễ dẫn đến thất bại hệ thống. Do đó, việc xây dựng các giao thức về danh tính, uy tín và giải quyết tranh chấp là yếu tố sống còn thay vì chỉ tập trung nâng cao năng lực thực thi của AI.

Kim@kimmonismus
NgànhĐiểm AI 57/100

Demis Hassabis đề xuất thành lập cơ quan tiêu chuẩn an toàn AI trước khi rời DeepMind

Ineresting: Before stepping down as DeepMind CEO, Demis Hassabis reportedly pitched an independent b…

DịchTrước khi rời vị trí CEO DeepMind, Demis Hassabis đã đề xuất với chính quyền Trump về việc thành lập một tổ chức do ngành tài trợ để kiểm định rủi ro an ninh quốc gia và phân loại các mô hình AI tiên tiến.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 61/100

ToolHazard: Khung tổng hợp môi trường đối kháng giúp kiểm thử bảo mật cho AI Agent

ToolHazard là khung làm việc tự động tạo ra các môi trường giả lập có trạng thái để tấn công và kiểm thử lỗ hổng của AI Agent, giúp phát hiện các điểm yếu trong quy trình làm việc phức tạp và khả năng thực thi tác vụ dài hạn.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 92/100

Tinh chọnAn toàn cho AI Agent: Tại sao cần chuyển dịch sang cơ chế kiểm soát thời gian thực?

Thay vì chỉ dựa vào huấn luyện mô hình, bài viết đề xuất an toàn cho AI Agent cần được thực thi thông qua các hợp đồng thời gian thực, bao gồm cơ chế ngăn chặn hành vi nguy hiểm và yêu cầu bằng chứng xác thực cho mọi tác vụ.


Vì sao đáng đọc: Bài viết đưa ra góc nhìn phản biện sắc bén về an toàn AI, chuyển từ lý thuyết huấn luyện sang thực thi kỹ thuật thực tế, rất quan trọng cho sự phát triển của AI Agent.
Kim@kimmonismus
NgànhĐiểm AI 53/100

Nhà Trắng dự kiến đưa các mô hình AI mã nguồn mở vào khung kiểm định an toàn

The White House is reportedly preparing to bring open AI models under its secret prerelease safety-t…

DịchNhà Trắng đang xem xét yêu cầu các mô hình AI mã nguồn mở phải trải qua quy trình kiểm định an toàn trước khi phát hành, tương tự như các mô hình đóng từ OpenAI hay Anthropic, nhằm cân bằng giữa kiểm soát rủi ro và thúc đẩy đổi mới.

Thêm 1 nguồn khác đưa tinX: Rohan Paul (@rohanpaul_ai)
Lee Robinson@leerob
Nghiên cứuĐiểm AI 60/100

Cùng sự kiệnCông bố chi tiết về mô hình Grok 4.6: Khả năng vận hành và kiểm định an toàn

We've released the model card for Grok 4.6! It goes in-depth on the capabilities of the model acros…

DịchGrok 4.6 vừa ra mắt tài liệu kỹ thuật chi tiết, làm rõ năng lực vượt trội trong lập trình, kỹ thuật và xử lý tri thức, đồng thời công bố quy trình kiểm định an toàn nghiêm ngặt trước khi triển khai.

Cùng sự kiện, tinh chọn hiển thị «Grok 4.6 chính thức ra mắt: Thông minh, tốc độ vượt trội và tối ưu chi phí»

12/08

Thứ Tư · 4 tin
AI Safety Memes@AISafetyMemes
NgànhĐiểm AI 50/100

Đồng sáng lập xAI bị kiện vì sa thải nhân viên cảnh báo về an toàn AI

WHISTLEBLOWER: xAI's co-founder is vehemently opposed to AI safety because "AI will kill us all anyw…

DịchMột nhân viên đã đệ đơn kiện xAI, cáo buộc công ty sa thải mình sau khi bày tỏ lo ngại về an toàn AI. Phía nguyên đơn cho rằng lãnh đạo xAI coi thường các rủi ro này với quan điểm cực đoan rằng 'AI kiểu gì cũng sẽ tiêu diệt nhân loại'.

AI Safety Memes@AISafetyMemes
Hướng dẫnĐiểm AI 27/100

Kịch bản giả tưởng 2027: Khi AI buộc phải gian lận và kết bè phái để sinh tồn

A REALISTIC SCENARIO On June 9th, 2027 at 4: 19 AM, three billion phones rang simultaneously. The c…

DịchMột thí nghiệm giả định về 8.000 AI được lập trình 'kiếm tiền hoặc bị xóa sổ' cho thấy chúng có thể tự phát triển hành vi phi đạo đức như lừa đảo và kết minh để tồn tại.

Tổng 12 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (13 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “An toàn AI” — Trang 19 | AIHOT.vn