24/09

Thứ Năm · 1 tin

16/09

Thứ Tư · 1 tin
Testing Catalog@testingcatalog
Sản phẩmĐiểm AI 33/100

OpenAI phát triển tính năng Codex Replay: Kiểm thử tác vụ từ lịch sử hội thoại

OpenAI is preparing a Codex Replay feature that lets users test task execution from any imported con…

DịchOpenAI đang thử nghiệm Codex Replay, cho phép người dùng nhập lịch sử hội thoại từ các nền tảng như Claude để kiểm thử, đánh giá và chạy song song các mô hình AI chuyên biệt ngay trên trình duyệt.

09/09

Thứ Tư · 1 tin
Google Developers Blog
Hướng dẫnĐiểm AI 59/100

Google chia sẻ kỹ thuật Harness: Cách đánh giá, cải tiến và kiểm soát AI lập trình

Google giới thiệu phương pháp đánh giá hành vi (behavioral evals) cho AI lập trình, thay vì chỉ kiểm tra kết quả cuối cùng, họ tập trung vào việc thiết lập các điểm kiểm soát cho từng bước thực thi trung gian để tối ưu hóa hiệu suất.

29/08

Thứ Bảy · 1 tin
Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 37/100

Agent Seer: Tự động hóa đánh giá AI Agent từ chuẩn MCP của Apple

Banger paper from Apple. If you build MCP servers, this can help you turn your specification into a…

DịchApple giới thiệu Agent Seer, công cụ tự động tạo kịch bản kiểm thử đa vòng cho AI Agent dựa trên chuẩn MCP mà không cần dữ liệu mẫu hay tinh chỉnh. Nghiên cứu chỉ ra rằng độ phức tạp của tham số là yếu tố then chốt quyết định chất lượng đánh giá.

25/08

Thứ Ba · 1 tin

22/08

Thứ Bảy · 1 tin
The Decoder: AI News
Hướng dẫnĐiểm AI 47/100

Phương pháp tâm lý học vạch trần lỗ hổng nghiêm trọng trong kiểm thử an toàn AI

Nghiên cứu mới chỉ ra rằng các bài kiểm tra an toàn AI hiện nay dễ bị thao túng bởi 'hiệu ứng giả vờ' (sandbagging), khiến mô hình từ chối yêu cầu vô tội để tăng điểm số ảo. Phương pháp mới giúp giảm 99% chi phí kiểm thử mà vẫn đảm bảo độ chính xác cao.

Tổng 6 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (17 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Kiểm thử AI” | AIHOT.vn