# inclusionAI ra mắt mô hình đa phương thức Ling-3.0-flash-VL-fp4

- Nguồn: Ant Group inclusionAI: HuggingFace mô hình mới
- Thời gian phát hành: 2026-09-08 17:22 (giờ Việt Nam)
- Điểm AI: 18/100
- Link AIHOT.vn: https://aihot.vn/items/83250db9cf1b373c
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmtu70igi11t6rofpfuamns22
- Link gốc: https://huggingface.co/inclusionAI/Ling-3.0-flash-VL-fp4

## Tóm tắt AI

inclusionAI vừa phát hành phiên bản fp4 của dòng mô hình thị giác ngôn ngữ Ling-3.0-flash trên HuggingFace. Do lưu lượng truy cập quá tải, người dùng cần đăng nhập tài khoản và sử dụng API token để truy cập mô hình.

## Thân bài

![inclusionAI/Ling-3.0-flash-VL-fp4 · Hugging Face](https://cdn-thumbnails.huggingface.co/social-thumbnails/models/inclusionAI/Ling-3.0-flash-VL-fp4.png)

![](https://mdn.alipayobjects.com/huamei_qa8qxu/afts/img/A*4QxcQrBlTiAAAAAAQXAAAAgAemJ7AQ/original)

🤗 Hugging Face | 🤖 ModelScope

### Giới thiệu

Chúng tôi xin giới thiệu Ling-3.0-flash-VL, mô hình đa phương thức (multimodal) thế hệ mới của chúng tôi. Được xây dựng dựa trên Ling-3.0-flash, mô hình này đưa thông tin hình ảnh vào toàn bộ quá trình hiểu, suy luận, hành động và xác thực—vượt xa khả năng nhận diện hình ảnh và video thông thường để giải quyết các tác vụ thực tế thông qua thị giác. Với tổng cộng 124B tham số, chỉ 5,5B tham số được kích hoạt trên mỗi token, hỗ trợ đầu vào là hình ảnh và video, cùng cửa sổ ngữ cảnh lên tới 1M token, Ling-3.0-flash-VL mang lại khả năng suy luận đa phương thức mạnh mẽ và năng lực tác tử (agentic) với hiệu suất vượt trội.

### Tổng quan về mô hình

Ling-3.0-flash-VL kế thừa các khả năng về ngôn ngữ, suy luận và ngữ cảnh dài của Ling-3.0-flash, đồng thời mở rộng chúng với khả năng hiểu hình ảnh và video gốc (native). Mô hình có tổng cộng 124B tham số, với chỉ 5,5B tham số được kích hoạt trên mỗi token và hỗ trợ cửa sổ ngữ cảnh lên tới 1M token.

Kiến trúc của Ling-3.0-flash-VL được thiết kế để tích hợp thông tin thị giác vào các quy trình suy luận và tác tử trong thế giới thực.

Nhìn chung, các thiết kế này biến thị giác trở thành một phần không thể thiếu thay vì chỉ là đầu vào đơn thuần, tích hợp nó vào toàn bộ quá trình hiểu, suy luận, lập kế hoạch, hành động và xác thực.

![ling-3.0-flash-vl-0906](https://cdn-uploads.huggingface.co/production/uploads/6666ca359f5a0b3229238a1a/WhsE3cM7QMelBCjdeyex2.png)

### Đánh giá

Ling-3.0-flash-VL đạt 42 điểm trên Artificial Analysis Intelligence Index v4.1.1, tăng 4 điểm so với mức 38 điểm của Ling-3.0-flash. Kết quả cho thấy việc mở rộng mô hình với các khả năng thị giác giúp cải thiện hơn nữa hiệu suất trí tuệ tổng thể.

![ling-3.0-flash-vl-aa](https://cdn-uploads.huggingface.co/production/uploads/6666ca359f5a0b3229238a1a/5gqrYjboQ8j7sTWjd1A_q.png)

Trên các tiêu chuẩn đánh giá đa phương thức (multimodal benchmarks), Ling-3.0-flash-VL thể hiện ba khía cạnh năng lực riêng biệt:

![ling-3.0-flash-vl-benchmark](https://cdn-uploads.huggingface.co/production/uploads/6666ca359f5a0b3229238a1a/w-V0gtCa3qy0un6vuz-sj.png)

### SGLang

Ma trận khởi chạy cụ thể theo phần cứng và công thức (BF16/FP8 × Độ trễ thấp / Thông lượng cao), cùng với trình tạo lệnh trực tiếp và các cấu hình đã được xác thực, có sẵn trong SGLang cookbook:

Cookbook: https://docs.sglang.io/cookbook/autoregressive/InclusionAI/Ling-3.0-flash-VL

### Chạy suy luận (Inference)

Công thức khuyến nghị với ngữ cảnh 256K (YaRN), trên 2 GPU loại 141GB (H20-3e / H200) hoặc các node Blackwell 2-GPU (B300 / GB300):

Trên các card 80GB (H100 / H800), hãy mở rộng quy mô lên --tp 2. Các trình phân tích suy luận và gọi công cụ (tool-call) sẽ tự động phân giải thành ling3 từ chat template; bạn cũng có thể thiết lập chúng một cách rõ ràng với --reasoning-parser ling3 --tool-call-parser ling3.

Client

Tính năng Thinking (Suy nghĩ) được bật theo mặc định bởi chat template; bạn có thể tắt tính năng này cho từng yêu cầu với "chat_template_kwargs": {"enable_thinking": false}. Lấy mẫu khuyến nghị: temperature=1.0, top_p=0.95, top_k=20 (theo generation_config.json).

Đầu vào video sử dụng {"type": "video_url", "video_url": {"url": "..."}} trong cùng định dạng tin nhắn. Để biết các lệnh tái lập MMMU-Pro / bench_serving và các công thức cho từng loại phần cứng, hãy xem trang cookbook được liên kết ở trên.

### Chạy suy luận (Inference)

Server

Client

Tính năng Thinking (Suy nghĩ) được bật theo mặc định bởi chat template; bạn có thể tắt tính năng này cho từng yêu cầu với "chat_template_kwargs": {"enable_thinking": false}. Lấy mẫu khuyến nghị: temperature=1.0, top_p=0.95, top_k=20 (theo generation_config.json).

Đầu vào video sử dụng {"type": "video_url", "video_url": {"url": "..."}} trong cùng định dạng tin nhắn. Để biết các lệnh tái lập MMMU-Pro / bench_serving và các công thức cho từng loại phần cứng, hãy xem trang cookbook được liên kết ở trên.

_Bài gốc còn tiếp._ Xem tiếp tại: <https://huggingface.co/inclusionAI/Ling-3.0-flash-VL-fp4>
