24/09

Thứ Năm · 1 tin

11/09

Thứ Sáu · 1 tin
Anthropic: Research (công bố - Web)
Nghiên cứuĐiểm AI 72/100

Tinh chọnAnthropic đánh giá khả năng của AI trong tác chiến tình báo và phát triển vũ khí thông thường

Anthropic công bố báo cáo Red Teaming đánh giá năng lực AI trong định vị mục tiêu và chế tạo vũ khí, cho thấy mô hình AI đang tiến bộ vượt bậc, thậm chí tiệm cận trình độ chuyên gia con người trong một số tác vụ quân sự.

Diễn biến sự kiện · 3 bài →Thêm 1 nguồn khác đưa tinX: Hongming (@hongming731)

Vì sao đáng đọc: Báo cáo quan trọng về an toàn AI, phơi bày rủi ro thực tế khi mô hình ngôn ngữ lớn bị lạm dụng trong lĩnh vực quân sự và tình báo, thu hút sự quan tâm lớn từ giới chuyên môn.

01/09

Thứ Ba · 1 tin
Ethan Mollick@emollick
Sản phẩmĐiểm AI 51/100

Abliteration ra mắt mô hình 'phi kiểm duyệt' abliterated-model-large-v2 dựa trên GLM-5.3

That didn't take long.

DịchAbliteration vừa phát hành mô hình abliterated-model-large-v2, phiên bản đã loại bỏ kiểm duyệt của GLM-5.3, tối ưu cho kiểm thử bảo mật, red teaming và các tác vụ Agent phức tạp với cửa sổ ngữ cảnh 1 triệu token.

Thêm 1 nguồn khác đưa tinX: Kim (@kimmonismus)

13/08

Thứ Năm · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnOpenART: Nâng tầm kiểm thử bảo mật AI thông qua môi trường tiến hóa mở

OpenART là nền tảng kiểm thử bảo mật (red teaming) quy mô lớn, sử dụng hơn 10.000 kịch bản trạng thái phức tạp để đánh giá khả năng ứng biến của các tác nhân AI trong môi trường dài hạn, khắc phục hạn chế của các bài kiểm tra tĩnh hiện nay.


Vì sao đáng đọc: Đây là nghiên cứu đột phá về an toàn AI, giải quyết bài toán hóc búa về rủi ro tích lũy trong các tác nhân AI tự hành, rất có giá trị cho cộng đồng kỹ thuật.
Tổng 4 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (27 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Red Teaming” | AIHOT.vn