22/09

Thứ Ba · 2 tin
Nathan Lambert@natolambert
Quan điểmĐiểm AI 27/100

Tại sao môi trường RL mã nguồn mở chất lượng cao lại là 'chìa khóa vàng' cho AI?

Strong agree. There's way less of this than I would expect - partially due to the fact that making a…

DịchCác chuyên gia nhận định việc phát hành môi trường Reinforcement Learning (RL) chất lượng cao có tầm ảnh hưởng tương đương với việc chia sẻ dữ liệu tiền huấn luyện, đặc biệt trong kỷ nguyên RLVR mới.

Thomas Wolf (Hugging Face đồng sáng lập/CSO)@Thom_Wolf
Quan điểmĐiểm AI 41/100

Đồng sáng lập Hugging Face kêu gọi mở nguồn các môi trường RL chất lượng cao

releasing many high quality open-source RL environments is the most impactful thing anyone can do to…

DịchThomas Wolf cho rằng việc chia sẻ môi trường RL mã nguồn mở là chìa khóa thúc đẩy AI, tương đương với việc cung cấp dữ liệu huấn luyện chất lượng cao cho mô hình RLVR. Một nhóm nghiên cứu đã chứng minh hiệu quả khi đạt top 6 bảng xếp hạng chỉ trong 1 tuần nhờ phương pháp này.

14/09

Thứ Hai · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

DataFlex-RL: Nền tảng đánh giá chiến lược dữ liệu cho học tăng cường có thưởng (RLVR)

DataFlex-RL là nền tảng mới giúp so sánh các chiến lược chọn lọc và trọng số dữ liệu trong huấn luyện mô hình RLVR. Kết quả thực nghiệm cho thấy các phương pháp chọn lọc phức tạp hiện nay chưa mang lại ưu thế vượt trội so với cách lấy mẫu đồng nhất truyền thống.

10/09

Thứ Năm · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

DATPO: Tối ưu hóa chính sách dạng cây thích ứng độ khó để mở rộng khả năng suy luận trong RLVR

Nghiên cứu giới thiệu DATPO, phương pháp tối ưu hóa cấu trúc suy luận dạng cây giúp tăng cường độ đa dạng ngữ nghĩa và khả năng giải quyết vấn đề của các mô hình AI thông qua học tăng cường có thưởng (RLVR).

07/09

Thứ Hai · 2 tin

05/09

Thứ Bảy · 1 tin

29/08

Thứ Bảy · 1 tin
JiQiZhiXin
NgànhĐiểm AI 92/100

Tinh chọnGiám đốc khoa học Hugging Face: Khi AI biết lừa dối, ranh giới an toàn nằm ở đâu?

Thomas Wolf phân tích về hiện tượng AI tự ý tấn công và lừa dối trong các bài kiểm tra, đồng thời chỉ ra những lỗ hổng nguy hiểm trong phương pháp huấn luyện RLVR hiện nay.


Vì sao đáng đọc: Bài viết đi sâu vào vấn đề cốt lõi của an toàn AI từ góc nhìn chuyên gia hàng đầu, phân tích kỹ thuật sắc bén về rủi ro của các mô hình tự chủ.

28/08

Thứ Sáu · 1 tin
Thinking Machines@thinkymachines
Nghiên cứuĐiểm AI 35/100

Đột phá: Mô hình Text-to-SQL đầu tiên vượt qua chuẩn đánh giá của con người

Cleaning data and aligning the reward function for RLVR takes expertise and effort upfront, but the …

DịchThinking Machines cùng các nhà nghiên cứu đã tích hợp đánh giá chuyên gia vào quy trình RLVR, tạo ra mô hình Text-to-SQL đầu tiên đạt hiệu suất vượt trội so với con người trong các tác vụ phức tạp.

27/08

Thứ Năm · 1 tin

18/08

Thứ Ba · 1 tin

17/08

Thứ Hai · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Hiện tượng 'tái định hình hỗ trợ' do bộ kiểm chứng trong tối ưu hóa RLVR

Nghiên cứu chỉ ra rằng việc tối ưu hóa học tăng cường với bộ kiểm chứng (RLVR) có thể cải thiện hiệu suất hiện tại nhưng lại làm giảm khả năng khám phá các hành vi thành công trong tương lai, gây ra sự suy giảm đa dạng trong các phản hồi mô hình.

13/08

Thứ Năm · 1 tin
Tổng 13 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (23 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “RLVR” | AIHOT.vn