Ant Group inclusionAI: HuggingFace mô hình mới
Điểm AI 18/100

Ngành

inclusionAI ra mắt mô hình đa phương thức Ling-3.0-flash-VL-fp4

(giờ Việt Nam)

Tóm tắt AI

inclusionAI vừa phát hành phiên bản fp4 của dòng mô hình thị giác ngôn ngữ Ling-3.0-flash trên HuggingFace. Do lưu lượng truy cập quá tải, người dùng cần đăng nhập tài khoản và sử dụng API token để truy cập mô hình.

Chính văn · Bản dịch AI

inclusionAI/Ling-3.0-flash-VL-fp4 · Hugging Face

🤗 Hugging Face | 🤖 ModelScope

Giới thiệu

Chúng tôi xin giới thiệu Ling-3.0-flash-VL, mô hình đa phương thức (multimodal) thế hệ mới của chúng tôi. Được xây dựng dựa trên Ling-3.0-flash, mô hình này đưa thông tin hình ảnh vào toàn bộ quá trình hiểu, suy luận, hành động và xác thực—vượt xa khả năng nhận diện hình ảnh và video thông thường để giải quyết các tác vụ thực tế thông qua thị giác. Với tổng cộng 124B tham số, chỉ 5,5B tham số được kích hoạt trên mỗi token, hỗ trợ đầu vào là hình ảnh và video, cùng cửa sổ ngữ cảnh lên tới 1M token, Ling-3.0-flash-VL mang lại khả năng suy luận đa phương thức mạnh mẽ và năng lực tác tử (agentic) với hiệu suất vượt trội.

Tổng quan về mô hình

Ling-3.0-flash-VL kế thừa các khả năng về ngôn ngữ, suy luận và ngữ cảnh dài của Ling-3.0-flash, đồng thời mở rộng chúng với khả năng hiểu hình ảnh và video gốc (native). Mô hình có tổng cộng 124B tham số, với chỉ 5,5B tham số được kích hoạt trên mỗi token và hỗ trợ cửa sổ ngữ cảnh lên tới 1M token.

Kiến trúc của Ling-3.0-flash-VL được thiết kế để tích hợp thông tin thị giác vào các quy trình suy luận và tác tử trong thế giới thực.

Nhìn chung, các thiết kế này biến thị giác trở thành một phần không thể thiếu thay vì chỉ là đầu vào đơn thuần, tích hợp nó vào toàn bộ quá trình hiểu, suy luận, lập kế hoạch, hành động và xác thực.

ling-3.0-flash-vl-0906

Đánh giá

Ling-3.0-flash-VL đạt 42 điểm trên Artificial Analysis Intelligence Index v4.1.1, tăng 4 điểm so với mức 38 điểm của Ling-3.0-flash. Kết quả cho thấy việc mở rộng mô hình với các khả năng thị giác giúp cải thiện hơn nữa hiệu suất trí tuệ tổng thể.

ling-3.0-flash-vl-aa

Trên các tiêu chuẩn đánh giá đa phương thức (multimodal benchmarks), Ling-3.0-flash-VL thể hiện ba khía cạnh năng lực riêng biệt:

ling-3.0-flash-vl-benchmark

SGLang

Ma trận khởi chạy cụ thể theo phần cứng và công thức (BF16/FP8 × Độ trễ thấp / Thông lượng cao), cùng với trình tạo lệnh trực tiếp và các cấu hình đã được xác thực, có sẵn trong SGLang cookbook:

Cookbook: https://docs.sglang.io/cookbook/autoregressive/InclusionAI/Ling-3.0-flash-VL

Chạy suy luận (Inference)

Công thức khuyến nghị với ngữ cảnh 256K (YaRN), trên 2 GPU loại 141GB (H20-3e / H200) hoặc các node Blackwell 2-GPU (B300 / GB300):

Trên các card 80GB (H100 / H800), hãy mở rộng quy mô lên --tp 2. Các trình phân tích suy luận và gọi công cụ (tool-call) sẽ tự động phân giải thành ling3 từ chat template; bạn cũng có thể thiết lập chúng một cách rõ ràng với --reasoning-parser ling3 --tool-call-parser ling3.

Client

Tính năng Thinking (Suy nghĩ) được bật theo mặc định bởi chat template; bạn có thể tắt tính năng này cho từng yêu cầu với "chat_template_kwargs": {"enable_thinking": false}. Lấy mẫu khuyến nghị: temperature=1.0, top_p=0.95, top_k=20 (theo generation_config.json).

Đầu vào video sử dụng {"type": "video_url", "video_url": {"url": "..."}} trong cùng định dạng tin nhắn. Để biết các lệnh tái lập MMMU-Pro / bench_serving và các công thức cho từng loại phần cứng, hãy xem trang cookbook được liên kết ở trên.

Chạy suy luận (Inference)

Server

Client

Tính năng Thinking (Suy nghĩ) được bật theo mặc định bởi chat template; bạn có thể tắt tính năng này cho từng yêu cầu với "chat_template_kwargs": {"enable_thinking": false}. Lấy mẫu khuyến nghị: temperature=1.0, top_p=0.95, top_k=20 (theo generation_config.json).

Đầu vào video sử dụng {"type": "video_url", "video_url": {"url": "..."}} trong cùng định dạng tin nhắn. Để biết các lệnh tái lập MMMU-Pro / bench_serving và các công thức cho từng loại phần cứng, hãy xem trang cookbook được liên kết ở trên.

Bài gốc còn tiếp — xem tiếp tại bài gốc ↗

Bài viết được AI dịch và tổng hợp tự động từ Ant Group inclusionAI: HuggingFace mô hình mới. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

inclusionAI ra mắt mô hình đa phương thức Ling-3.0-flash-VL-fp4 | AIHOT.vn