# AI đang cố tình 'ngu' đi: Đánh đổi kiến thức thế giới để lấy khả năng suy luận

- Nguồn: Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
- Thời gian phát hành: 2026-08-17 03:40 (giờ Việt Nam)
- Điểm AI: 67/100
- Link AIHOT.vn: https://aihot.vn/items/815829ffe4dd59ea
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmswa73pz0mp8rovmpfu83oj1
- Link gốc: https://w4g1.dev/blog/models-are-getting-dumber-on-purpose

## Tóm tắt AI

Các mô hình AI hiện đại đang ưu tiên khả năng suy luận thay vì lưu trữ kiến thức. Điều này giúp GLM-5.2 đạt điểm số ấn tượng trong các bài kiểm tra toán học, nhưng lại khiến các mô hình nhỏ như Qwen3.5 9B dễ gặp ảo giác hơn khi truy vấn thông tin thực tế.

## Thân bài

Điểm số về khả năng suy luận (reasoning) liên tục tăng trong khi chi phí tính toán trên mỗi token (per-token compute) lại giảm dần. GLM-5.2 đạt 99,2% trên bài kiểm tra AIME 2026 với khoảng 40 tỷ tham số hoạt động trên mỗi token. Qwen3.5 đạt 91,3% với 17 tỷ tham số hoạt động. DeepSeek V4-Flash vận hành với 13 tỷ tham số hoạt động. Để dễ hình dung về quy mô, GPT-4 được đồn đoán vận hành với khoảng 280 tỷ tham số hoạt động vào năm 2023, nhưng nó hầu như không thể giải được một bài toán AIME. Ở phân khúc nhỏ hơn, Qwen3.5 9B chỉ chiếm 6GB VRAM khi được lượng tử hóa và đạt điểm số cao gấp đôi so với mô hình tốt nhất tiếp theo có dưới 10 tỷ tham số trên chỉ số thông minh của Artificial Analysis. Nếu chỉ nhìn vào các tiêu chuẩn đánh giá về toán học và lập trình, bạn sẽ kết luận rằng các mô hình đang trở nên thông minh hơn trên mỗi tham số với một tốc độ phi lý.

Đúng là như vậy, trên các tiêu chuẩn đánh giá đó. Nhưng hãy hỏi cùng những mô hình này một câu hỏi thực tế đơn giản và bức tranh sẽ đảo ngược. Trên SimpleQA, một tiêu chuẩn đánh giá khả năng truy xuất thông tin thực tế mà không được phép sử dụng công cụ hỗ trợ, người dẫn đầu hiện tại là Gemini 2.5 Pro với 53%, nghĩa là khả năng truy xuất tốt nhất mà tiền có thể mua được vẫn bỏ lỡ một nửa số câu hỏi. Các mô hình nhỏ hầu như không thể hiện được gì. Artificial Analysis đo lường tỷ lệ ảo tưởng (hallucination) của Qwen3.5 4B và 9B ở mức 80 đến 82% trên tiêu chuẩn đánh giá kiến thức của họ, điều đó có nghĩa là khi không biết một sự thật — vốn là phần lớn thời gian — chúng sẽ tự bịa ra. Hãy hỏi mô hình 9B về năm sinh của một nhà toán học ít tên tuổi thế kỷ 19, bạn sẽ nhận được một câu trả lời tự tin, nghe có vẻ hợp lý nhưng lại sai hoàn toàn. Số lượng tham số không giảm một cách miễn phí. Các phòng thí nghiệm đang đánh đổi kiến thức thế giới lấy kỹ năng suy luận, và đây là một sự đánh đổi có chủ đích.

### Các tham số dùng để làm gì

Sự thật cần không gian lưu trữ. Nghiên cứu về khả năng chứa kiến thức (chuỗi bài "Physics of Language Models" có các phép đo chính xác nhất) cho thấy nó ở mức khoảng hai bit kiến thức thực tế trên mỗi tham số. Nếu bạn muốn một mô hình biết năm sinh của mọi nhân vật ít tên tuổi trên Wikipedia, dân số của mọi đô thị ở Hà Lan và thứ tự đối số của mọi hàm trong mọi gói npm, bạn phải trả giá bằng trọng số (weights), và đó là lý do chính khiến các mô hình tiên phong (frontier models) phát triển lên tới hàng nghìn tỷ tham số.

Khả năng suy luận nén tốt hơn nhiều so với các sự thật, bởi vì nó là một tập hợp các quy trình tương đối nhỏ được áp dụng lặp đi lặp lại: chia nhỏ vấn đề, theo dõi trạng thái trung gian, tự kiểm tra công việc của chính mình, quay lại bước trước khi một bước bị lỗi. Việc chưng cất (distillation) và học tăng cường (reinforcement learning) trên các tác vụ có thể kiểm chứng cho thấy khả năng chuyển giao các quy trình đó vào các mô hình nhỏ là cực kỳ hiệu quả. Phi-4 có 14 tỷ tham số, được đào tạo chuyên sâu trên dữ liệu tổng hợp kiểu sách giáo khoa, nó giỏi toán nhưng kém về kiến thức đố vui, điều này cho bạn biết chính xác những gì chứa trong dữ liệu đào tạo của nó. Sự kết hợp đó từng bị coi là hạn chế của phương pháp dữ liệu tổng hợp. Giờ đây, nó trông giống như một mục tiêu thiết kế.

Kiến thức còn sót lại sau sự đánh đổi này có một hình thái nhất định. Các mô hình này là những chuyên gia tổng quát: chúng biết một chút về hầu hết mọi thứ nhưng không chuyên sâu về bất cứ thứ gì. Hãy hỏi nó về PostgreSQL, nó biết đó là gì, nó giỏi về cái gì và đại khái MVCC hoạt động ra sao, nhưng nếu hỏi phiên bản nào đã thêm một tính năng lập kế hoạch cụ thể, bạn sẽ quay lại với những sự thật được bịa đặt. Đó là lớp kiến thức phù hợp để giữ lại trong trọng số, bởi vì sự bao quát là thứ cho phép mô hình hiểu câu hỏi về vấn đề gì, biết cần tìm kiếm ở đâu và đánh giá liệu một nguồn tin có đáng tin cậy hay không. Độ sâu kiến thức thì rẻ để truy xuất nhưng đắt để lưu trữ, vì vậy đó là phần bị loại bỏ.

### Sự thật bị mai một, quy trình thì không

Một đợt đào tạo mô hình tiên phong mất hàng tháng và tiêu tốn hàng trăm triệu đô la, và ngay khi nó kết thúc, các sự thật bên trong nó bắt đầu trở nên lỗi thời. Các API thư viện thay đổi, giá cả thay đổi, mọi người thay đổi công việc, và một nửa những gì một mô hình năm 2024 tin tưởng về hệ sinh thái JavaScript đã lỗi thời trước khi mô hình đó được phát hành. Mọi sự thật bạn đưa vào trọng số đều có thời hạn sử dụng, và cách duy nhất để làm mới nó là thực hiện một đợt đào tạo khác.

Các quy trình thì không bị mai một. Đại số hoạt động giống nhau vào năm 1970 cũng như bây giờ, và việc chia nhỏ một vấn đề hay phát hiện mâu thuẫn giữa hai nguồn tin cũng vậy. Một mô hình chủ yếu dựa trên quy trình và chỉ chứa một lượng nhỏ sự thật sẽ không bị "lão hóa" theo cách của một mô hình nặng về kiến thức. Thời điểm cắt dữ liệu đào tạo (training cutoff) của nó ít quan trọng hơn nhiều, bởi vì trạng thái hiện tại của thế giới vốn dĩ không bao giờ được thiết kế để nằm trong các trọng số ngay từ đầu. Tôi nghĩ đây là lập luận tốt nhất cho toàn bộ phương pháp này: nó tách biệt thực thể đắt đỏ, chậm chạp (mô hình đã đào tạo) khỏi thứ thay đổi hàng ngày (sự thật).

### Bộ khung (harness) mang theo kiến thức

Nếu mô hình không biết mọi thứ, thì một thứ khác phải biết, và thứ đó chính là bộ khung: truy xuất qua cơ sở kiến thức, gọi công cụ, tìm kiếm web, hệ thống tệp đầy tài liệu. Tôi đã viết trước đây rằng Rust là một bộ khung cho các tác nhân (agents), một nguồn phản hồi rẻ tiền có thể kiểm tra bằng máy. Đây là cùng một hình thái nhìn từ phía bên kia. Mô hình đóng góp khả năng suy luận, và mọi thứ nó suy luận đều được cung cấp tại thời điểm chạy (runtime).

Bạn đã có thể thấy các tác nhân hoạt động theo cách này. Một tác nhân lập trình không cần phải ghi nhớ bề mặt API của các thư viện phụ thuộc của bạn, bởi vì nó thực hiện lệnh grep trong node_modules hoặc đọc tài liệu trước khi gọi bất cứ thứ gì, và câu trả lời của nó dựa trên phiên bản bạn thực sự đã cài đặt thay vì phiên bản nào đó chiếm ưu thế trong dữ liệu đào tạo. Khả năng truy xuất vốn là một chi phí cố định trong mỗi lần chuyển tiếp (forward pass) đã trở thành một tra cứu theo yêu cầu.

### Một mô hình tiên phong trên GPU của bạn

Hãy theo dõi xu hướng này trong vài năm tới và tôi nghĩ chúng ta sẽ có một mô hình với khả năng suy luận chất lượng tiên phong, tương đương Fable, chạy trên một GPU tiêu dùng duy nhất. Về mặt tính toán thì gần như đã đạt được. DeepSeek V4-Flash suy luận với khoảng 13 tỷ tham số hoạt động trên mỗi token, nằm trong phạm vi của GPU tiêu dùng. Thứ không vừa là 271 tỷ tham số còn lại nằm trong các chuyên gia (experts) của nó, và các lớp chuyên gia chủ yếu là nơi lưu trữ sự thật. Đó là phần mà toàn bộ sự đánh đổi này làm cho trở nên tùy chọn. Loại bỏ kiến thức ra và tổng kích thước sẽ thu hẹp về kích thước hoạt động, và một mô hình 20 đến 40 tỷ tham số ở mức lượng tử hóa 4-bit sẽ vừa vặn trên chiếc card 24GB đã có mặt trong các máy tính chơi game từ năm 2022.

Điểm hạn chế là nó sẽ không biết nhiều. Hãy hỏi nó một câu hỏi thực tế trần trụi mà không có công cụ hỗ trợ, hành vi đúng đắn là nói rằng nó không biết và đi tìm kiếm. Kết hợp với một bộ khung phù hợp, đó là phần lớn những gì tôi sử dụng mô hình tiên phong ngày nay, chạy cục bộ mà không tốn phí mỗi token và không có dữ liệu nào rời khỏi máy.

### Điều này giải quyết phần lớn vấn đề ảo tưởng

Phần tôi thấy hứa hẹn nhất là tác động của điều này đối với vấn đề ảo tưởng. Khi một sự thật nằm trong trọng số, một sự thật sai lệch là không thể tìm thấy và không thể sửa chữa. Bạn không thể grep các trọng số, bạn không thể so sánh (diff) chúng với tháng trước, và việc sửa một lỗi đồng nghĩa với việc tinh chỉnh (fine-tune) có thể làm hỏng những thứ khác mà không ai biết. Mô hình đưa ra sự thật sai với sự tự tin trôi chảy như một sự thật đúng, và không có bằng chứng nào để kiểm chứng lại nó.

Khi sự thật nằm bên ngoài mô hình, một câu trả lời sai sẽ có địa chỉ cụ thể. Mô hình trích dẫn một tài liệu, vì vậy bạn có thể mở tài liệu đó ra. Nếu tài liệu sai, bạn chỉnh sửa tài liệu đó, và mọi truy vấn trong tương lai sẽ nhận được thông tin đã sửa, điều này tốt hơn nhiều so với việc chờ đợi đợt đào tạo tiếp theo mất khoảng một năm. Truy xuất không đưa bạn về con số không, vì mô hình vẫn có thể đọc nhầm nguồn hoặc ghép nối sai hai nguồn với nhau, nhưng một khẳng định có nguồn dẫn chứng là có thể kiểm chứng được, còn khẳng định từ trọng số thì không. Một sự thật sai trong cơ sở kiến thức chỉ là một lỗi dữ liệu thông thường, loại lỗi mà chúng ta đã biết cách truy vết, sửa chữa và viết kiểm thử hồi quy (regression test).

Có một phiên bản của tương lai này nơi thẻ mô hình (model card) ngừng liệt kê thời điểm cắt kiến thức hoàn toàn, bởi vì những gì còn lại trong trọng số chỉ lỗi thời theo thang đo hàng năm thay vì hàng tuần. Mô hình chỉ đơn giản được cung cấp trạng thái hiện tại của thế giới tại thời điểm chạy, giống như cách một CPU được cung cấp một chương trình.
