LangSmith Engine v2 ra mắt tính năng Red Teaming và kiểm thử tác nhân tự động
LangSmith Engine v2 vừa được cập nhật với khả năng Red Teaming giúp chủ động phát hiện lỗi của tác nhân AI, đồng thời hỗ trợ quy trình kiểm thử tự động toàn diện.
LangSmith Engine v2 vừa được cập nhật với khả năng Red Teaming giúp chủ động phát hiện lỗi của tác nhân AI, đồng thời hỗ trợ quy trình kiểm thử tự động toàn diện.
Testing Catalog@testingcatalogOpenAI is preparing a Codex Replay feature that lets users test task execution from any imported con…
DịchOpenAI đang thử nghiệm Codex Replay, cho phép người dùng nhập lịch sử hội thoại từ các nền tảng như Claude để kiểm thử, đánh giá và chạy song song các mô hình AI chuyên biệt ngay trên trình duyệt.

Google giới thiệu phương pháp đánh giá hành vi (behavioral evals) cho AI lập trình, thay vì chỉ kiểm tra kết quả cuối cùng, họ tập trung vào việc thiết lập các điểm kiểm soát cho từng bước thực thi trung gian để tối ưu hóa hiệu suất.
Elvis Saravia@omarsar0Banger paper from Apple. If you build MCP servers, this can help you turn your specification into a…
DịchApple giới thiệu Agent Seer, công cụ tự động tạo kịch bản kiểm thử đa vòng cho AI Agent dựa trên chuẩn MCP mà không cần dữ liệu mẫu hay tinh chỉnh. Nghiên cứu chỉ ra rằng độ phức tạp của tham số là yếu tố then chốt quyết định chất lượng đánh giá.

Google tích hợp khả năng đánh giá thời gian thực vào ADK, cho phép mô phỏng người dùng bằng âm thanh để kiểm thử và chấm điểm các tác nhân AI giọng nói trong quy trình làm việc tự động.
Nghiên cứu mới chỉ ra rằng các bài kiểm tra an toàn AI hiện nay dễ bị thao túng bởi 'hiệu ứng giả vờ' (sandbagging), khiến mô hình từ chối yêu cầu vô tội để tăng điểm số ảo. Phương pháp mới giúp giảm 99% chi phí kiểm thử mà vẫn đảm bảo độ chính xác cao.