Hướng dẫn
DeepSeek V4 nào hỗ trợ nhập liệu hình ảnh? Hướng dẫn chi tiết từ OpenRouter
(giờ Việt Nam)
Tóm tắt AI
OpenRouter tổng hợp khả năng hỗ trợ hình ảnh của dòng DeepSeek V4, trong đó phiên bản V4.1 Flash đã hỗ trợ đọc ảnh trực tiếp với chi phí tối ưu từ ngày 10/9/2026.
Chính văn · Bản dịch AI

DeepSeek V4 không phải là một mô hình đơn lẻ. Trong danh mục của chúng tôi, đây là một dòng mô hình bao gồm V4.1 Flash, V4 Pro 0813, V4 Flash 0731, V4 Flash Vision Exp, hai checkpoint 0423 cũ hơn và một alias "latest" (mới nhất) cho bản Flash. Tên gọi cho biết cấp độ và phiên bản phát hành, nhưng không cho biết mô hình nào có thể xử lý hình ảnh.
Hướng dẫn này sẽ đi qua từng mô hình trong dòng sản phẩm, sử dụng chính xác các slug từ danh mục của chúng tôi và chỉ ra hai cách để sử dụng V4 với hình ảnh. Cách thứ nhất là gửi hình ảnh đến một mô hình V4 có khả năng đọc hình ảnh. Cách thứ hai là chạy một mô hình thị giác (vision model) riêng biệt trước khi gửi dữ liệu đến một mô hình V4 chỉ hỗ trợ văn bản.
Câu trả lời ngắn gọn, theo từng mô hình
Có hai mô hình V4 chấp nhận hình ảnh. DeepSeek V4.1 Flash đọc hình ảnh một cách tự nhiên (natively) và là mô hình nên dùng cho các tác vụ hình ảnh mới. DeepSeek V4 Flash Vision Exp cũng đọc được hình ảnh, nhưng được DeepSeek gắn nhãn là thử nghiệm (experimental).
Tất cả các slug V4 khác trong danh mục của chúng tôi đều chỉ hỗ trợ nhập văn bản và xuất văn bản. Điều này bao gồm V4 Pro 0813, V4 Flash 0731, hai checkpoint 0423 và alias ~deepseek/deepseek-v4-flash-latest. Một yêu cầu gửi kèm image_url đến các mô hình này sẽ thất bại vì chúng không liệt kê hình ảnh trong các phương thức đầu vào (input modalities) được hỗ trợ.
Các mô hình V4 hiện có và khả năng hỗ trợ của chúng
Bảng dưới đây liệt kê từng mô hình V4 trong danh mục của chúng tôi cùng với cột phương thức (modality) để trả lời câu hỏi này. Giá được niêm yết theo mức giá danh mục trên mỗi triệu token vào ngày 11 tháng 9 năm 2026, được làm tròn đến ba chữ số thập phân nếu mức giá niêm yết có nhiều chữ số hơn.
Tất cả sáu mô hình đều chỉ trả về văn bản. Mỗi trang mô hình đều liệt kê giá hiện tại, độ dài ngữ cảnh và các phương thức đầu vào; các giá trị này sẽ thay đổi khi nhà cung cấp và checkpoint thay đổi. Hãy đọc kỹ trang thông tin trước khi đưa một slug vào môi trường sản xuất (production).
Alias ~deepseek/deepseek-v4-flash-latest sẽ chuyển hướng đến mô hình mới nhất trong dòng V4 Flash. Tại thời điểm viết bài, nó trỏ đến bản Flash 0731 và chỉ liệt kê văn bản là phương thức đầu vào duy nhất. Đừng sử dụng alias này cho các yêu cầu hình ảnh. Hãy ghim trực tiếp deepseek/deepseek-v4.1-flash hoặc deepseek/deepseek-v4-flash-vision-exp.
V4.1 Flash đọc hình ảnh một cách tự nhiên
DeepSeek V4.1 Flash là mô hình đầu tiên được xây dựng trên kiến trúc Causal Encoder-Decoder của DeepSeek. Nó kích hoạt 8B tham số ở đầu vào và 16B ở đầu ra từ một backbone 552B tham số. Khả năng hiểu hình ảnh là một phần của kiến trúc, với các embedding hình ảnh và văn bản được huấn luyện đồng thời ngay từ đầu quá trình tiền huấn luyện. Mô hình có cửa sổ ngữ cảnh 1.048.576 token và đầu ra tối đa 384.000 token trên endpoint của DeepSeek, đồng thời hỗ trợ gọi công cụ (tool calling), response_format và đầu ra có cấu trúc.
Việc gọi mô hình với hình ảnh cũng giống như yêu cầu chat thông thường mà bạn vẫn thực hiện, chỉ cần thêm phần hình ảnh vào nội dung tin nhắn. TypeScript SDK lồng phần thân yêu cầu (request body) dưới chatRequest và sử dụng tên trường theo kiểu camelCase, vì vậy phần hình ảnh là imageUrl trong SDK và image_url trên đường truyền.
Trường url chấp nhận một URL hình ảnh công khai hoặc một URL dữ liệu base64. Hãy gửi phần văn bản trước phần hình ảnh. Hướng dẫn về đầu vào hình ảnh sẽ bao gồm định dạng base64, các loại hình ảnh được hỗ trợ và cách gửi nhiều hình ảnh trong một yêu cầu.
V4 Flash Vision Exp là tùy chọn thử nghiệm
DeepSeek V4 Flash Vision Exp là phiên bản thử nghiệm có hỗ trợ thị giác của V4 Flash 0731. Nó bổ sung khả năng hiểu hình ảnh trong khi vẫn duy trì hiệu suất tương đương với mô hình cơ sở trong các tác vụ văn bản. Nó được phát hành vào ngày 21 tháng 8 năm 2026 và cho đến khi V4.1 Flash ra mắt vào ngày 10 tháng 9 năm 2026, đây là mô hình V4 duy nhất chấp nhận hình ảnh.
Nó nhận yêu cầu tương tự như ví dụ trên với trường model được thay đổi thành deepseek/deepseek-v4-flash-vision-exp. Nó có cửa sổ ngữ cảnh 1.048.576 token và hỗ trợ gọi công cụ, response_format và đầu ra có cấu trúc.
DeepSeek gắn nhãn mô hình này là thử nghiệm. Hãy sử dụng V4.1 Flash cho các tác vụ hình ảnh mới trừ khi bạn có lý do cụ thể để kiểm thử mô hình thử nghiệm, và hãy ghim chính xác slug nếu bạn chọn dùng nó.
Đặt một mô hình thị giác trước một mô hình V4 chỉ hỗ trợ văn bản
V4 Pro 0813, V4 Flash 0731 và các checkpoint 0423 không chấp nhận hình ảnh. Nếu bạn muốn một trong số chúng suy luận về một hình ảnh, hãy chạy một mô hình thị giác trước và truyền đầu ra văn bản của nó vào mô hình V4. Mô hình V4 sẽ không bao giờ nhìn thấy các pixel mà chỉ đọc phần mô tả.
Hai mô hình chấp nhận đầu vào hình ảnh và video là Qwen3.8 27B tại qwen/qwen3.8-27b và Kimi K3 tại moonshotai/kimi-k3. Bộ sưu tập các mô hình thị giác của chúng tôi liệt kê mọi mô hình trong danh mục chấp nhận đầu vào hình ảnh.
Hãy thay thế qwen/qwen3.8-27b bằng moonshotai/kimi-k3 để sử dụng Kimi K3 cho hình ảnh, hoặc thay thế deepseek/deepseek-v4-pro-0813 bằng deepseek/deepseek-v4-flash-0731 ở lượt xử lý văn bản.
Hai lệnh gọi sẽ tốn kém hơn một. Vào ngày 11 tháng 9 năm 2026, Qwen3.8 27B có giá 0,42 USD cho mỗi triệu token đầu vào và 3,00 USD cho mỗi triệu token đầu ra, còn Kimi K3 là 2,10 USD và 10,53 USD. Bạn sẽ phải trả thêm phí cho mô hình V4. Hãy sử dụng mô hình này khi bạn cần một mô hình V4 chỉ hỗ trợ văn bản hoặc đầu vào video, thay vì coi đây là cách mặc định để đọc hình ảnh với V4.
Lựa chọn lộ trình sử dụng
Hãy chọn lộ trình phù hợp với mô hình bạn cần và đầu vào bạn có.
Nếu hình ảnh được gửi đến mà không có cảnh báo trước, hãy kiểm tra nội dung tin nhắn trong mã nguồn của bạn và chọn mô hình trước khi gửi yêu cầu. Tính năng định tuyến nhà cung cấp (provider routing) chỉ chọn giữa các nhà cung cấp của mô hình bạn đã đặt tên. Nó không tự động chuyển sang một mô hình khác, vì vậy nó không thể biến một yêu cầu hình ảnh gửi đến mô hình chỉ hỗ trợ văn bản thành một yêu cầu gửi đến mô hình thị giác.
Cách tự kiểm tra các phương thức của mô hình
Trang mô hình và API mô hình là nguồn thông tin chính xác nhất về những gì một slug chấp nhận. Mỗi trang mô hình đều liệt kê các phương thức đầu vào và đầu ra của nó. API mô hình trả về dữ liệu tương tự như architecture.input_modalities trên mọi mô hình.
Trang mô hình được lọc theo đầu vào hình ảnh sẽ hiển thị mọi mô hình trong danh mục của chúng tôi chấp nhận hình ảnh. Nếu một checkpoint V4 sau này bổ sung đầu vào hình ảnh, trang mô hình và phản hồi API sẽ hiển thị điều đó, và chúng tôi sẽ cập nhật trang này.
DeepSeek V4 Flash có khả năng thị giác không?
Tùy thuộc vào checkpoint. deepseek/deepseek-v4.1-flash và deepseek/deepseek-v4-flash-vision-exp chấp nhận cả văn bản và hình ảnh. deepseek/deepseek-v4-flash-0731 và deepseek/deepseek-v4-flash chỉ hỗ trợ văn bản, và alias ~deepseek/deepseek-v4-flash-latest trỏ đến bản Flash 0731 tại thời điểm viết bài.
DeepSeek V4 Pro có khả năng thị giác không?
Không. deepseek/deepseek-v4-pro-0813 và bản deepseek/deepseek-v4-pro cũ hơn chỉ liệt kê văn bản là phương thức đầu vào duy nhất. Để sử dụng Pro với hình ảnh, hãy chạy một mô hình thị giác trước và truyền phần mô tả văn bản của nó vào Pro.
Tôi nên sử dụng mô hình DeepSeek V4 nào cho hình ảnh?
Hãy sử dụng deepseek/deepseek-v4.1-flash. Nó đọc hình ảnh một cách tự nhiên, không bị đánh dấu là thử nghiệm và có giá 0,15 USD cho mỗi triệu token đầu vào và 0,60 USD cho mỗi triệu token đầu ra vào ngày 11 tháng 9 năm 2026. deepseek/deepseek-v4-flash-vision-exp là lựa chọn thay thế thử nghiệm.
Chi phí cho đầu vào hình ảnh của DeepSeek V4 là bao nhiêu?
Đầu vào hình ảnh được tính phí thông qua giá token của mô hình. Vào ngày 11 tháng 9 năm 2026, V4.1 Flash có giá 0,15 USD đầu vào và 0,60 USD đầu ra trên mỗi triệu token, còn V4 Flash Vision Exp là 0,22 USD đầu vào và 0,66 USD đầu ra. Hãy kiểm tra trang mô hình trước khi lập ngân sách vì giá niêm yết có thể thay đổi.
DeepSeek V4 có xử lý được video không?
Không có mô hình V4 nào trong danh mục của chúng tôi liệt kê video là phương thức đầu vào. Đối với video, hãy sử dụng một mô hình hỗ trợ tính năng này, chẳng hạn như qwen/qwen3.8-27b hoặc moonshotai/kimi-k3, sau đó truyền đầu ra văn bản của nó vào một mô hình V4.
Bài gốc còn tiếp — xem tiếp tại bài gốc ↗
Bài viết được AI dịch và tổng hợp tự động từ OpenRouter: Announcements. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.