finally finished a full SlopCodeBench run against GLM 5.3, Sol 5.6, and Astra (Fable 5.1 results com…
DịchDex Horthy đã hoàn tất bài kiểm tra SlopCodeBench trên các mô hình mới. Kết quả cho thấy Astra vượt trội hơn GPT-5.5 nhưng không đáng kể, trong khi Sol gây bất ngờ với điểm số thấp hơn dự kiến do xu hướng 'mất kiểm soát' ở chế độ tư duy cao.
DịchDex Horthy chia sẻ bản cập nhật mới nhất của SlopCodeBench với lời mỉa mai "đây mới là slop thực thụ", đồng thời xác nhận mô hình Astra đã được đưa vào danh sách đánh giá.
Dex Horthy từ HumanLayer thông báo Astra đã được tích hợp vào SlopCodeBench, hứa hẹn mang đến những đánh giá mới về khả năng lập trình của các mô hình AI.
Dex Horthy từ HumanLayer bắt đầu thử nghiệm toàn diện bộ benchmark SlopCodeBench trên nền tảng Fabl, hứa hẹn mang lại những đánh giá chuyên sâu về hiệu năng mô hình.
DịchDex Horthy từ HumanLayer vừa giới thiệu Slopcodebench, một bộ tiêu chuẩn đánh giá mới nơi các mô hình Fable và GLM đang thể hiện hiệu suất vượt trội.