24/09

Thứ Năm · 1 tin

17/09

Thứ Năm · 2 tin
Kim@kimmonismus
Mô hìnhĐiểm AI 50/100

Ra mắt mô hình ẩn danh Union Alpha: Vượt mặt GPT-5.6 Sol trong các bài kiểm tra lập trình

Here we go again: a new stealth model scores 74% on DeepSWE, beating GPT-5.6 Sol and most other mode…

DịchMô hình Union Alpha vừa xuất hiện với điểm số DeepSWE đạt 74%, vượt qua GPT-5.6 Sol trong các bài test lập trình thực tế như Terminal-Bench 2.1. Với chi phí tối ưu hơn, mô hình này đang gây chú ý và được dự đoán đến từ một đội ngũ phát triển tại Trung Quốc.

03/09

Thứ Năm · 2 tin
Testing Catalog@testingcatalog
Mô hìnhĐiểm AI 60/100

Cùng sự kiệnMeta ra mắt Muse Spark 1.3 và DeepSWE 1.1: Vượt mặt GPT-5.6 và Opus 5

META 🔥: Muse Spark 1.3 has been officially announced, and it scored above GPT-5.6 and Opus 5 on Dee…

DịchMeta vừa phát hành Muse Spark 1.3 với khả năng lập trình và xử lý tác vụ thông minh vượt trội, đồng thời giới thiệu DeepSWE 1.1 với hiệu suất dẫn đầu thị trường cùng mức giá cực kỳ cạnh tranh.

Cùng sự kiện, bài đại diện «Meta ra mắt Muse Spark 1.3: Nâng cấp mạnh mẽ khả năng lập trình và tác tử AI»
Kim@kimmonismus
Mô hìnhĐiểm AI 30/100

Cùng sự kiệnMuse Spark 1.3 thiết lập kỷ lục mới với 75.4% trên bảng xếp hạng DeepSWE v1.1

wtf Muse Spark 1.3 It has achieved first place in DeepSWE with 75.4%, even ahead of GPT-5.6 Sol and …

DịchMuse Spark 1.3 vừa chính thức ra mắt, đạt điểm số kỷ lục 75.4% trên benchmark lập trình DeepSWE v1.1, vượt qua các đối thủ mạnh như GPT 5.6 Sol và Opus 5, đồng thời ghi nhận hiệu suất ấn tượng trên các bài kiểm tra MRCR và Terminal-Bench.

Cùng sự kiện, bài đại diện «Meta ra mắt Muse Spark 1.3, tích hợp vào Muse Code và Meta Model API»

02/09

Thứ Tư · 3 tin
Kim@kimmonismus
Hướng dẫnĐiểm AI 36/100

Gemini 3.8 Flash đạt 73% điểm DeepSWE, gây tranh luận sôi nổi về chiến lược giá

Gemini 3.8 Flash: 73% on DeepSWE at very good pricing! Google was cooking! Exciting for Gemini 4 Pro

DịchMô hình Gemini 3.8 Flash ghi dấu ấn với 73% điểm trong bài kiểm tra DeepSWE, đồng thời khơi gợi nhiều thảo luận từ cộng đồng về mô hình định giá đầy cạnh tranh của Google.

Thêm 1 nguồn khác đưa tinX: Hongming (@hongming731)

23/08

Chủ Nhật · 1 tin
Kim@kimmonismus
Hướng dẫnĐiểm AI 35/100

Mô hình bí ẩn Ox Alpha đạt hiệu suất ngang ngửa GPT-5.6 Sol mid trong bài kiểm tra DeepSWE

Ox Alpha has now been fully tested against the DeepSWE set by @davis7. Overall, it's performing mor…

DịchMô hình Ox Alpha gây chú ý khi đạt 63% trong bài kiểm tra DeepSWE, cho thấy khả năng lập trình mạnh mẽ. Nếu đây thực sự là GLM-5.3 Flash, khả năng chạy cục bộ trên DGX Spark sẽ tạo ra lợi thế lớn về chi phí.

21/08

Thứ Sáu · 1 tin
Kim@kimmonismus
Hướng dẫnĐiểm AI 35/100

Mô hình AI bí ẩn gây sốt khi đạt hơn 80% điểm trong bài kiểm tra DeepSWE

Wtf! Ben ran this mystery model through 10 DeepSWE tasks and it scored over 80%, versus 65% for Fabl…

DịchMột mô hình AI chưa rõ danh tính vừa gây bất ngờ lớn khi đạt hơn 80% điểm trong 10 tác vụ DeepSWE, vượt xa các đối thủ như Fable (65%) và GPT-5.6-sol (52%). Cộng đồng đang đồn đoán đây có thể là một sản phẩm mới từ các công ty AI hàng đầu Trung Quốc như GLM hoặc Kimi.

Tổng 10 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (26 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “DeepSWE” | AIHOT.vn