# Ant Group ra mắt Realtime-Venus: Mô hình AI tương tác âm thanh - hình ảnh thời gian thực

- Nguồn: Ant Group inclusionAI: HuggingFace mô hình mới
- Thời gian phát hành: 2026-09-16 15:02 (giờ Việt Nam)
- Điểm AI: 60/100
- Link AIHOT.vn: https://aihot.vn/items/5519ca355c2fba5d
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmu72qy2c0o5qrowk0rgihc9e
- Link gốc: https://huggingface.co/inclusionAI/Realtime-Venus

## Tóm tắt AI

Ant Group vừa phát hành Realtime-Venus trên Hugging Face, mô hình 9B đa phương thức hỗ trợ tương tác toàn song công, được xây dựng trên nền tảng kiến trúc Omni-Flow và Qwen3-8B.

## Thân bài

![inclusionAI/Realtime-Venus · Hugging Face](https://cdn-thumbnails.huggingface.co/social-thumbnails/models/inclusionAI/Realtime-Venus.png)

Hệ thống tương tác song công (full-duplex) với cơ chế ủy quyền bất đồng bộ

Tiếng Anh |

![Example proactive, delegated, and full-duplex interactions with Realtime-Venus](https://arxiv.org/html/2609.13814v1/case.png)

Realtime-Venus hỗ trợ tương tác nghe nhìn chủ động, ủy quyền bất đồng bộ và đối thoại song công có nhận biết ngắt lời.

### 1. 🧭 Tổng quan

Kho lưu trữ này chứa hai điểm kiểm tra (checkpoint) của hệ thống Realtime-Venus:

Cả hai thư mục đều chứa trọng số mô hình và mã nguồn Hugging Face Transformers tùy chỉnh. Realtime-Venus-Harness bất đồng bộ và các công cụ tích hợp bên ngoài nằm trong kho lưu trữ GitHub.

### 4. 📊 Đánh giá

Tất cả các giá trị đều được báo cáo trong báo cáo kỹ thuật của Realtime-Venus.

Hình 1. Kết quả hiểu video và âm thanh từ bài báo.

Hình 2. Kết quả tương tác song công từ bài báo.

### 5. 🗂️ Cấu trúc kho lưu trữ

Các ví dụ dưới đây ghi phương tiện được tạo vào thư mục output/. Hãy sử dụng tên tệp mới hoặc thư mục đầu ra mới khi lặp lại thí nghiệm.

### 6. 🛠️ Cài đặt

Yêu cầu Python 3.10, CUDA và FFmpeg. Tải xuống kho lưu trữ (hai checkpoint nằm trong các thư mục con của nó) và cài đặt các phụ thuộc Python:

Tất cả các đường dẫn ví dụ dưới đây đều tương đối so với thư mục gốc của kho lưu trữ này. from_pretrained không xử lý các thư mục con của một repo Hub, vì vậy các ví dụ trỏ đến các đường dẫn cục bộ Realtime-Venus-Omni/ và Realtime-Venus-Audio/ sau khi tải xuống.

### 7. 🎙️ Cách sử dụng Realtime-Venus-Omni

Các phiên bản độc lập có thể chạy được của những ví dụ này nằm trong Omni cookbook trên GitHub.

### 7.1 🧱 Khởi tạo mô hình

Các ví dụ dưới đây chia sẻ cách khởi tạo mô hình sau; hãy chạy mỗi ví dụ trong một tiến trình Python mới. Chat và Duplex sẽ tự động tải giọng nói tham chiếu mặc định.

### 7.2 🔊 Chế độ Duplex Omni

model = model.as_duplex chuyển mô hình sang chế độ phát trực tuyến song công: prepare khởi tạo phiên, sau đó mỗi giây đầu vào được xử lý bởi một cặp streaming_prefill + streaming_generate, và as_simplex chuyển trở lại chế độ ngoại tuyến. Hãy đặt MAX_NUM_FRAMES trước khi import minicpmo.utils, nếu không các video dài hơn 64 giây sẽ bị cắt bớt theo giới hạn khung hình mặc định.

Lưu ý về phông chữ phụ đề: Các ví dụ Duplex ghi đè văn bản phản hồi vào video đầu ra thông qua FFmpeg/libass, vốn phân giải phông chữ thông qua fontconfig. Việc hiển thị các phản hồi không phải tiếng Latin (ví dụ: tiếng Trung) yêu cầu hệ thống phải có phông chữ hỗ trợ CJK, nếu không các ký tự đó sẽ hiển thị dưới dạng ô trống. Trên bất kỳ bản phân phối Linux nào, hãy cài đặt một phông chữ mà không cần quyền root và làm mới bộ nhớ đệm phông chữ:

Các lệnh tương đương của trình quản lý gói: apt install -y fonts-noto-cjk (Debian/Ubuntu) hoặc yum install -y cjkuni-ukai-fonts cjkuni-uming-fonts (RHEL/Alibaba Cloud Linux). Không cần thay đổi mã nguồn.

### 7.2.1 Duplex Chat

Phát trực tuyến video demo theo từng giây và chèn các câu hỏi văn bản vào các giây được chỉ định bởi question_times (đi kèm với câu hỏi). Mô hình lắng nghe liên tục và sẽ nói khi đưa ra câu trả lời.

### 7.2.2 Speech-In Duplex Chat

Tương tự như trên, ngoại trừ việc câu hỏi được nói và đã được trộn vào rãnh âm thanh của video (tại khoảng giây thứ 3, yêu cầu cảnh báo khi nước sôi), vì vậy không có văn bản nào được chèn vào — mô hình phải tự nghe thấy câu hỏi đó.

### 7.2.3 Memory Duplex Chat

model.use_memory(memory_minutes=40) kích hoạt Memory cho video dài trước khi vào chế độ song công.

### 7.3 💬 Chế độ Half-Duplex Omni

model.chat(...) trả lời từng lượt một trên toàn bộ video. model.init_tts cho phép xuất âm thanh.

### 7.3.1 Offline Chat

Các khung hình được lấy mẫu, âm thanh mỗi giây và câu hỏi sẽ đi vào một lệnh gọi chat duy nhất. Giới hạn 128 khung hình (MAX_NUM_FRAMES) hạn chế tải hình ảnh, trong khi max_inp_length=32768 thiết lập ngân sách token đầu vào. Âm thanh đầy đủ vẫn được giữ lại, vì vậy các video rất dài có thể vượt quá ngân sách đó ngay cả khi đã lấy mẫu khung hình.

### 7.3.2 Memory Offline Chat

model.use_memory kích hoạt Memory trước khi gọi chat; quá trình truy xuất sẽ chọn tối đa 96 khung hình lịch sử cộng với 4 khung hình gần nhất, mỗi khung hình đi kèm với ±1 giây âm thanh.

_Bài gốc còn tiếp._ Xem tiếp tại: <https://huggingface.co/inclusionAI/Realtime-Venus>
