Simon Willison Blog
Điểm AI 67/100

Mô hình

Google ra mắt Gemini 3.8 Live: Trải nghiệm hội thoại giọng nói thời gian thực

(giờ Việt Nam)

Tóm tắt AI

Google vừa giới thiệu bộ đôi mô hình Gemini 3.8 Live và Extended Thinking, mang đến khả năng tương tác giọng nói trực tiếp tương tự GPT-Live của OpenAI.

Chính văn · Bản dịch AI

Tool: Gemini Live audio

Google hôm nay đã ra mắt Gemini 3.8 Live và 3.8 Live Extended Thinking - hai mô hình chuyển đổi giọng nói sang giọng nói (speech-to-speech) mới có cấu trúc tương tự như dòng GPT-Live của OpenAI.

Tôi đã hướng GPT-6 Astra Extra High vào tài liệu hướng dẫn và yêu cầu nó xây dựng giao diện web này để trải nghiệm các mô hình mới. Bạn có thể chọn mô hình và cài đặt giọng nói trước, nhập system prompt tùy chọn, sau đó bắt đầu cuộc trò chuyện bằng giọng nói ngay trên trình duyệt, bao gồm cả khả năng ngắt lời mô hình khi nó đang nói.

Bản triển khai này không sử dụng bất kỳ thư viện nào. Nó kết nối tới endpoint WebSocket wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent?key=... và sử dụng Web Audio API AudioContext cho cả việc thu âm và phát lại.

Đây là hướng dẫn Gemini Live để bắt đầu làm quen với API WebSockets đó.

Bài viết được AI dịch và tổng hợp tự động từ Simon Willison Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Xem toàn bộ
Google ra mắt mô hình giọng nói thời gian thực Gemini 3.8 Live và 3.5 Transcribe
Google ra mắt Gemini 3.8 Live: Trải nghiệm hội thoại giọng nói thời gian thực | AIHOT.vn