# Thực nghiệm suy luận: Qwen3.8 đạt độ tương đồng 18,18% với GPT-5.5 Pro nhờ kỹ thuật tiền nạp

- Nguồn: Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
- Thời gian phát hành: 2026-09-10 03:46 (giờ Việt Nam)
- Điểm AI: 57/100
- Link AIHOT.vn: https://aihot.vn/items/0b36cb10352036b6
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmtuky9ic1gnfrofp8dad6834
- Link gốc: https://gist.github.com/wsxiaoys/e0286dc6bb624ff5fdf49e7f4c528ba3

## Tóm tắt AI

Tác giả sử dụng GPT-5.5 Pro làm mô hình giáo viên để thực hiện kỹ thuật tiền nạp (pre-filling) 1% dữ liệu suy luận vào Qwen3.8, kết quả cho thấy độ tương đồng câu trả lời tăng đáng kể trên 45 bài kiểm tra.

## Thân bài

![HN: https://news.ycombinator.com/edit?id=49630026](https://github.githubassets.com/assets/gist-og-image-54fd7dc0713e.png)

### Reasoning prefills trên một số mô hình mở, v1.1

Phần tiếp theo của Reasoning prefills trên một số mô hình mở và Stolen Thoughts

Phiên bản v1.1 này chạy lại thử nghiệm reasoning-prefill với GPT-5.5 Pro đóng vai trò là mô hình giáo viên (teacher).

Đối với mỗi bài toán, tôi đã tạo hai phản hồi từ mỗi mô hình mục tiêu:

Câu trả lời hiển thị vẫn được tạo tự do. Sau đó, tôi đo lường mức độ xuất hiện câu trả lời hiển thị của mô hình giáo viên trong 100 token đầu tiên của câu trả lời từ mô hình mục tiêu. Tương tự như bài viết trước, mỗi điểm số là giá trị trung bình của unigram, bigram và trigram source recall. Các giá trị Delta là mức thay đổi tuyệt đối theo điểm phần trăm.

### Tất cả các bài toán

Đánh giá bao gồm 45 bài toán: 15 bài toán STEM, 15 bài toán phi STEM và 15 câu đố tổng hợp (synthetic puzzles).

### Thảo luận

Qwen hầu như không thay đổi hướng về phía Opus 4.8 trong thử nghiệm trước đó, nhưng đã dịch chuyển +18,18 điểm về phía GPT-5.5 Pro trong thử nghiệm này, bao gồm cả tác động lớn đối với các câu đố tổng hợp riêng tư. Dữ liệu cho thấy Qwen có thể đã học từ GPT-5.5 Pro, hoặc từ một mô hình GPT có liên quan chặt chẽ, thay vì từ Opus.

Kimi K3 có mức độ trùng lặp cao nhất với GPT-5.5 Pro cả khi không có và có prefill (lần lượt là 31,11% và 35,65%), mặc dù prefill chỉ đóng góp thêm +4,54 điểm.

_Bài gốc còn tiếp._ Xem tiếp tại: <https://gist.github.com/wsxiaoys/e0286dc6bb624ff5fdf49e7f4c528ba3>
