Nghiên cứu giới thiệu phương pháp phân tích đột biến để đo lường hiệu quả của các bộ kiểm thử (oracle) cho nhân GPU, phát hiện ra rằng các giao thức hiện tại bỏ sót gần 17% lỗi, đặc biệt là các lỗi về độ chính xác số thực.
Cựu lãnh đạo AI Agent tại Zapier đã phát triển bộ công cụ kiểm thử đối kháng song song dựa trên Jev, cho phép chạy hàng trăm trình duyệt không giao diện để phát hiện lỗi giao diện với chi phí cực thấp.
Nice work from Adobe. It's standard practice to store a fixed reference answer for every eval case….
DịchCác nhà nghiên cứu tại Adobe đề xuất sử dụng hàm Python làm đáp án tham chiếu cho các bài kiểm tra AI Agent. Cách tiếp cận này cho phép đáp án thay đổi linh hoạt theo dữ liệu thực tế, giúp phát hiện lỗi ngay lập tức khi API thượng nguồn có thay đổi.
GPT-6 Astra helps @cognition's Devin back up "it works" with tests before the team ships.
DịchOpenAI sử dụng GPT-6 Astra để hỗ trợ đội ngũ Cognition thực hiện các bài kiểm thử, đảm bảo khả năng vận hành ổn định cho AI lập trình Devin trước khi chính thức phát hành.
GPT-6 Astra in Codex is helping test code end to end at @perplexity_ai. @randomjohnnyh uses it to b…
DịchGPT-6 Astra đang được Perplexity ứng dụng để xây dựng bộ kiểm thử và mô phỏng phản hồi API, giúp tối ưu hóa quy trình kiểm tra sự phối hợp giữa các thành phần trong hệ thống.
PlannerForge là khung làm việc dựa trên LLM giúp hợp nhất toàn bộ quy trình kiểm thử xe tự lái, từ tạo kịch bản, đánh giá đến tối ưu hóa hệ thống, thay thế các công cụ rời rạc hiện nay.
I've lost entire weeks writing mock Salesforce endpoints just to test one agent flow. because most…
DịchState Machines ra mắt hạ tầng thử nghiệm cho phép tái tạo môi trường doanh nghiệp phức tạp, hỗ trợ chạy song song hàng ngàn trạng thái độc lập. Công cụ này giúp các AI Agent duy trì trạng thái xuyên suốt quy trình làm việc, đảm bảo tính nhất quán và khả năng đánh giá cho các tác vụ đa bước.
Bài viết phân tích thực trạng các AI Agent hiện nay trong việc áp dụng kiểm thử khi tạo mã nguồn, đồng thời chỉ ra khoảng cách lớn giữa hiệu suất thực tế và kỳ vọng lý tưởng.
if you're new to using pstack, don't forget to run /create-verification-skill! it creates a high qua…
Dịchpstack bổ sung bộ kỹ năng mới giúp AI Agent tự động tạo và duy trì bản đồ tính năng (feature map), cho phép chúng điều hướng và kiểm thử ứng dụng như người dùng thật một cách liên tục.
Sự bùng nổ của mã nguồn do AI tạo ra đặt ra thách thức lớn cho khâu kiểm chứng. Bài viết phân tích tầm quan trọng ngày càng tăng của việc xác thực mã nguồn và những định hướng tương lai trong quy trình phát triển phần mềm.
LangSmith Preview Builds cho phép đội ngũ kỹ thuật kiểm thử các thay đổi của AI Agent trong môi trường giả lập thực tế ngay trên nhánh Pull Request, giúp giảm thiểu rủi ro trước khi đưa vào vận hành chính thức.
Sự kết hợp giữa AI và Antithesis đã giúp tái hiện thành công lỗi WAL-Reset tồn tại suốt 14 năm trong SQLite chỉ sau 15 phút, một kỳ tích mà trước đây các kỹ sư phải mất nhiều tháng mới giải quyết được.
ToolHazard là khung làm việc tự động tạo ra các môi trường giả lập có trạng thái để tấn công và kiểm thử lỗ hổng của AI Agent, giúp phát hiện các điểm yếu trong quy trình làm việc phức tạp và khả năng thực thi tác vụ dài hạn.
Blacksmith vừa huy động thành công 45 triệu USD, nâng định giá lên 550 triệu USD nhờ giải pháp tự động hóa kiểm thử phần mềm cho hơn 5.000 khách hàng. Công ty dự định mở rộng hệ sinh thái công cụ hỗ trợ lập trình viên tối ưu quy trình phát triển và triển khai mã nguồn.