# Phòng thí nghiệm AI Thượng Hải ra mắt mô hình quyết định đa phương thức Intern-Decision

- Nguồn: InternLM
- Thời gian phát hành: 2026-09-25 06:37 (giờ Việt Nam)
- Điểm AI: 20/100
- Link AIHOT.vn: https://aihot.vn/items/f3d958e67b5763d6
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmui9g6b20ah0rov0fn1ir7vt
- Link gốc: https://github.com/InternLM/Intern-Decision

## Tóm tắt AI

Dự án InternLM vừa công bố Intern-Decision, một mô hình AI tập trung vào khả năng ra quyết định đa phương thức tốc độ cao. Hiện tại, các thông số kỹ thuật chi tiết và lộ trình phát hành vẫn chưa được công bố cụ thể.

## Thân bài

![GitHub - InternLM/Intern-Decision: Fast multi-modal decision model](https://opengraph.githubassets.com/4d1de2c8a5ae84a32def3e4f174932ae4c07b3897353f3f1a575db3e76d42532/InternLM/Intern-Decision)

[🎮 Bản demo](https://huggingface.co/spaces/internlm/intern-decision) · [🤗 Trọng số mô hình](https://huggingface.co/collections/internlm/intern-decision)

· [Giao diện dữ liệu](https://github.com/InternLM/Intern-Decision/blob/main/docs/DATA.md) · [Tái lập đánh giá](https://github.com/InternLM/Intern-Decision/blob/main/docs/EVALUATION.md)

Intern-Decision chuyển đổi một trạng thái, các hình ảnh tùy chọn và nhiều câu hỏi có định dạng thành các quyết định kèm theo xác suất. Mô hình tinh chỉnh phần ngôn ngữ nền tảng của Qwen3.5 trong khi đóng băng vision tower và projector. Các loại câu hỏi được hỗ trợ bao gồm lựa chọn (choice), chấm điểm (score) và noul (có/không).

Bản phát hành này bao gồm quá trình huấn luyện, hai backend suy luận, chấm điểm benchmark, hiệu chuẩn nhiệt độ (temperature calibration) và bản demo trên trình duyệt. Nó cũng bao gồm [benchmark hiệu chuẩn phân phối](https://github.com/InternLM/Intern-Decision/blob/main/docs/CALIBRATION_BENCHMARK.md) 96 trường hợp, các tham chiếu chính xác, trình tạo tất định, trình chấm điểm ngoại tuyến, cùng với bảy bộ kiểm tra độ chính xác và các thiết lập nhiệt độ cụ thể cho từng checkpoint. Dữ liệu huấn luyện, hồ sơ hiệu chuẩn/xác thực riêng tư, hình ảnh, quy trình chuẩn bị và trọng số mô hình không được bao gồm. Lược đồ runtime, tokenization và collation hỗ trợ các hồ sơ của riêng bạn. Các ví dụ demo là minh họa giao diện tổng hợp.

### 🎬 Các bản trình diễn

Nhấp vào bất kỳ bản xem trước nào để xem video đầy đủ.

| 🍄 Mario | 🖱️ Di chuyển chuột |
| --- | --- |
| 🛡️ Doom · Phòng thủ | 💚 Doom · Thu thập máu |
| 🌐 Sử dụng trình duyệt |  |

### Phương pháp

Mục tiêu là mô hình ngôn ngữ có mặt nạ tự hồi quy (autoregressive masked language modeling). Đầu vào của trợ lý chứa một khung JSON hoàn chỉnh với một token <decision> cho mỗi trường. Các ký hiệu đáp án đúng (ground-truth) chỉ xuất hiện trong nhãn, không bao giờ xuất hiện trong đầu vào. Quá trình huấn luyện sử dụng căn chỉnh token kế tiếp nhân quả thông thường: logit ngay trước một đánh dấu sẽ dự đoán đáp án của trường đó. Tất cả các trường chia sẻ chung một lượt truyền xuôi nhân quả (causal forward pass).

Cross-entropy huấn luyện sử dụng toàn bộ từ vựng. Suy luận giới hạn các logit ở các ký hiệu đáp án đơn token hợp lệ, áp dụng softmax và ánh xạ chúng trở lại các nhãn gốc. Thứ tự câu hỏi và tùy chọn phải được giữ nguyên.

### Kết quả

Intern-Decision-4B đạt độ chính xác trung bình 90,02% trên bảy bộ kiểm tra (Jev: 88,74%), độ trễ yêu cầu cục bộ trung bình 44,16 ms trên RTX 4090, và 0,550 Brier / 0,089 ECE trên benchmark hiệu chuẩn 96 trường hợp (Jev: 0,595 / 0,130). Các giao thức và phạm vi khác nhau: xem độ chính xác, độ trễ và hiệu chuẩn.

### Độ chính xác của Benchmark

Các cột độ chính xác là phần trăm; Trung bình là giá trị trung bình không trọng số của bảy bộ kiểm tra được hiển thị. Bảy bộ kiểm tra chứa 10.751 hàng và 12.351 quyết định; mẫu số cho mỗi bộ được liệt kê trong phần Đánh giá. Brier và ECE là các chỉ số Jevbench-Hard trên 111 mục. Bảng này sử dụng độ tin cậy max(P) và 10 thùng (bin) có độ rộng bằng nhau cho ECE, hiển thị dưới dạng phân số; Brier là tổng đa lớp thô. Các xác suất của Intern-Decision sử dụng nhiệt độ đã khớp bên dưới, với các dự đoán argmax không thay đổi. Các mô hình cơ sở (baselines) sử dụng xác suất được báo cáo/mặc định của chúng; không có nhiệt độ bổ sung nào được khớp ở đây.

| Mô hình | Dễ | Gốc | Khó | Quyết định có định dạng | ToolACE | AG News | WildJailBreak | Trung bình | Brier ↓ |
| --- | --- | --- | --- | --- | --- | --- | --- | --- | --- |
| Jev | 100.00 | 98.61 | 72.07 | 73.35 | 91.29 | 89.57 | 96.29 | 88.74 | 0.358420 |
| Laya | 95.83 | 72.22 | 28.83 | 35.95 | 63.87 | 92.84 | 14.84 | 57.77 | 0.804244 |
| SemIf | 100.00 | 98.61 | 61.26 | 62.80 | 85.16 | 89.22 | 92.53 | 84.23 | 0.498012 |
| Kev | 100.00 | 93.06 | 45.05 | 65.60 | 87.42 | 89.82 | 75.97 | 79.56 | 0.738253 |
| JevK5 | 100.00 | 97.22 | 73.87 | 64.50 | 80.97 | 89.13 | 90.45 | 85.16 | 0.366162 |
| Intern-Decision-0.8B | 97.92 | 80.56 | 52.25 | 77.35 | 94.52 | 88.61 | 64.48 | 79.38 | 0.529519 |
| Intern-Decision-2B | 100.00 | 84.72 | 63.96 | 79.35 | 96.45 | 89.96 | 78.33 | 84.68 | 0.437256 |
| Intern-Decision-4B | 100.00 | 98.61 | 73.87 | 80.55 | 96.45 | 90.82 | 89.86 | 90.02 | 0.346762 |

Xem [hướng dẫn tái lập](https://github.com/InternLM/Intern-Decision/blob/main/docs/EVALUATION.md).

### Độ trễ suy luận trên RTX 4090

Các phép đo cục bộ sử dụng một NVIDIA RTX 4090, BF16, SDPA, suy luận Hugging Face gốc, Transformers 5.14.1 và flash-linear-attention 0.4.2. Mỗi yêu cầu chứa 289 token đầu vào và ba trường (lựa chọn, có/không và điểm số), được trả lời trong một lượt truyền xuôi với nhiệt độ cụ thể cho checkpoint được áp dụng.

| Mô hình | Trung bình | Trung vị / P50 | P95 |
| --- | --- | --- | --- |
| Jev | 109,70 ms | 106,30 ms | 146,70 ms |
| Intern-Decision-0.8B | 33,98 ms | 33,44 ms | 37,50 ms |
| Intern-Decision-2B | 33,28 ms | 33,15 ms | 33,55 ms |
| Intern-Decision-4B | 44,16 ms | 44,03 ms | 44,60 ms |

### Benchmark hiệu chuẩn phân phối đã biết

[Bộ tiêu chuẩn đánh giá 96 trường hợp](https://github.com/InternLM/Intern-Decision/blob/main/benchmarks/known-distribution-pilot-v1/README.md) đi kèm là một chương trình thí điểm hiệu chuẩn quy mô nhỏ với sáu danh mục, 24 nhóm và 48 thiết lập theo cặp. Các câu hỏi yêu cầu kết quả ngẫu nhiên; các phân phối tham chiếu chính xác được lưu trữ tách biệt với dữ liệu đầu vào của mô hình. Đây chỉ là đánh giá: không điều chỉnh nhiệt độ (temperature) hoặc huấn luyện trên các tham chiếu của nó.

### Kết quả đánh giá

Cả ba thiết lập đều có 96/96 dự đoán hợp lệ, với 16 trường hợp mỗi danh mục. Intern-Decision-4B được đánh giá với checkpoint cuối cùng và backend XTuner cố định. Nhiệt độ T=1.992418 được điều chỉnh trên một tập hiệu chuẩn riêng biệt; bộ tiêu chuẩn này không được sử dụng để điều chỉnh hoặc lựa chọn. Hiệu chuẩn bảo toàn mọi nhãn argmax được dự đoán. Kết quả Jev sử dụng jev-1.13.0.

Mỗi ô là Brier đa lớp kỳ vọng / ECE kỳ vọng; chỉ số thấp hơn là tốt hơn. Brier bao gồm tính ngẫu nhiên của kết quả không thể loại bỏ. ECE sử dụng 10 thùng (bin) có độ rộng bằng nhau và độ tin cậy trả về hợp lệ, dự phòng bằng max(P), khác với bảng đánh giá cứng chỉ dùng max(P) ở trên. Đây là các điểm số so với phân phối tham chiếu chính xác, không phải độ chính xác của nhãn được lấy mẫu.

| Danh mục | Intern-Decision-4B, chưa hiệu chuẩn | Intern-Decision-4B, đã hiệu chuẩn | Jev |
| --- | --- | --- | --- |
| Tính ngẫu nhiên trực tiếp và hỗ trợ | 0.483 / 0.181 | 0.421 / 0.129 | 0.490 / 0.216 |
| Sự kiện hỗn hợp và tổ hợp | 0.677 / 0.254 | 0.577 / 0.150 | 0.682 / 0.274 |
| Lịch sử, điều kiện hóa và trạng thái ẩn | 0.711 / 0.219 | 0.613 / 0.108 | 0.657 / 0.113 |
| Bằng chứng hàng ngày và thiên kiến quan sát | 0.701 / 0.328 | 0.575 / 0.210 | 0.603 / 0.114 |
| Tiết lộ có chọn lọc và các câu đố xác suất | 0.540 / 0.119 | 0.510 / 0.049 | 0.483 / 0.138 |
| Quy trình tuần tự và tổ hợp | 0.656 / 0.180 | 0.605 / 0.058 | 0.657 / 0.116 |
| Tổng thể (gộp) | 0.628 / 0.213 | 0.550 / 0.089 | 0.595 / 0.130 |

Hiệu chuẩn giúp giảm Brier tổng thể từ 0.628 xuống 0.550 và ECE kỳ vọng từ 0.213 xuống 0.089, thấp hơn mức 0.595 / 0.130 của Jev trong chương trình thí điểm này. Brier tổng thể tính trung bình trên 96 trường hợp; ECE tổng thể được tính toán lại trên tất cả các trường hợp và không phải là trung bình cộng của ECE theo danh mục. Các biến thể tùy chọn theo cặp làm cho đây trở thành một nghiên cứu chẩn đoán nhỏ, không phải 96 thử nghiệm độc lập.

### Chạy đánh giá

Chấm điểm các dự đoán từ mô hình/API đã lưu của bạn bằng Python 3.10+ (chỉ sử dụng thư viện tiêu chuẩn):

```
python -m src.eval.score_known_distribution \
  --dataset benchmarks/known-distribution-pilot-v1 \
  --predictions /path/to/predictions.jsonl \
  --output outputs/calibration-benchmark
```

Thư mục đầu ra mới chứa summary.md (Brier/ECE theo danh mục và tổng thể), metrics.json (tất cả các chỉ số và thùng), và scored.jsonl (điểm số theo từng trường hợp). ECE tổng thể gộp tất cả các trường hợp; nó không phải là trung bình của ECE theo danh mục. Xem [hướng dẫn chấm điểm](https://github.com/InternLM/Intern-Decision/blob/main/docs/CALIBRATION_BENCHMARK.md) để biết định dạng phản hồi, ví dụ suy luận, công thức, xác thực và các hạn chế.

### Cài đặt

Sử dụng Linux, Python 3.12 và CUDA cho các backend đã huấn luyện. Chạy các lệnh từ thư mục gốc của kho lưu trữ này. Giữ HF và XTuner trong các môi trường ảo riêng biệt: các phiên bản Transformers được kiểm thử của chúng khác nhau. Checkpoint là các thư mục HF cục bộ bao gồm trọng số, bộ xử lý, tokenizer, chat template và token <decision>.

### Suy luận Hugging Face gốc

```
python3.12 -m venv .venv-hf
source .venv-hf/bin/activate
python -m pip install -r requirements-inference.txt -r requirements-eval.txt
```

Backend này tải trực tiếp Qwen3_5ForConditionalGeneration và không yêu cầu import XTuner hoặc bản vá tương thích. Không đưa runtime/xtuner vào PYTHONPATH của nó. Một wheel PyTorch CUDA tương thích phải có sẵn cho hệ thống của bạn.

### Huấn luyện và suy luận XTuner

Việc thực thi mô hình sử dụng XTuner với các bản điều chỉnh runtime được cung cấp. Bản sửa đổi nguồn upstream đã được ghim; không có nguồn hoặc tập dữ liệu của bên thứ ba nào được tích hợp vào thư mục xuất bản này.

```
python3.12 -m venv .venv-xtuner
source .venv-xtuner/bin/activate
python -m pip install torch==2.6.0 torchvision==0.21.0 \
  --index-url https://download.pytorch.org/whl/cu126
python -m pip install -r requirements-xtuner.txt -r requirements-eval.txt
mkdir -p third_party
git clone https://github.com/InternLM/xtuner.git third_party/xtuner
git -C third_party/xtuner checkout fb51baebdf91b03bd39255c4427edac9aca82865
python -m pip install --no-deps -e third_party/xtuner
# Install a flash-attn 2.8.3 wheel/build matching your Torch/CUDA toolchain.
python -m pip install flash-attn==2.8.3 --no-build-isolation
export XTUNER_PATH="$PWD/third_party/xtuner"
```

Việc ghi đè phụ thuộc rõ ràng giúp bảo toàn Transformers 4.57.0 cho đường dẫn XTuner này. runtime/xtuner/sitecustomize.py cung cấp các hook tương thích Torch 2.6 đã được kiểm thử; các trình khởi chạy chỉ kích hoạt nó cho XTuner. Các công cụ phát triển CUDA có thể cần thiết cho các tiện ích mở rộng tùy chọn. Môi trường HF vẫn độc lập. Các kernel khác nhau và làm tròn BF16 có thể tạo ra sự khác biệt về xác suất giữa các backend; không khẳng định sự tương đương bitwise giữa các backend.

_Bài gốc còn tiếp._ Xem tiếp tại: <https://github.com/InternLM/Intern-Decision>
