Alibaba giới thiệu bộ 5 mô hình Qwen-Audio-3.1 chuyên về nhận diện (ASR) và tổng hợp giọng nói (TTS) với khả năng xử lý đa ngôn ngữ, cảm xúc và âm thanh môi trường vượt trội, đồng thời cắt giảm mạnh chi phí API lên đến 95%.
⚡ Meet Qwen-Audio-3.1! ASR, TTS & Realtime are fully upgraded, joined by two new models: TTS-Next fo…
DịchQwen giới thiệu Qwen-Audio-3.1 với 5 mô hình mới, bổ sung TTS-Next và ASR-Next cùng khả năng tương tác thời gian thực thông minh. Đặc biệt, chi phí sử dụng được cắt giảm mạnh tới 95%, hỗ trợ nhận diện cảm xúc và phản hồi tự nhiên hơn.
Vì sao đáng đọc: Nhà phát hành công bố chi tiết năng lực của năm mô hình âm thanh cùng ba mức giảm giá, giúp độc giả đối chiếu với nhu cầu thực tế để đánh giá chi phí thay thế.
Alibaba vừa giới thiệu 5 mô hình thuộc dòng Qwen-Audio-3.1 bao gồm ASR, ASR-Next, TTS, TTS-Next và Realtime, hỗ trợ toàn diện từ nhận diện, tổng hợp giọng nói đến tương tác thời gian thực.
Alibaba chính thức công bố trang sản phẩm và báo cáo kỹ thuật cho Qwen-Audio-3.1-Realtime, hỗ trợ tương tác âm thanh thời gian thực với các bản demo trực quan.
Introducing StepAudio 3, our new family of 5 audio models for real-time voice, speech recognition, s…
DịchStepFun vừa trình làng bộ 5 mô hình StepAudio 3, dẫn đầu bảng xếp hạng Artificial Analysis về khả năng hội thoại và suy luận giọng nói, đồng thời đạt tỷ lệ lỗi nhận diện (ASR) cực thấp chỉ 1,7%.
GOOGLE 🔥: Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking are rolling out on APIs, Google AI …
DịchGoogle vừa trình làng Gemini 3.8 Live cùng phiên bản Extended Thinking, hỗ trợ xử lý âm thanh chuyên sâu và hiện đã có mặt trên API, Google AI Studio và ứng dụng Gemini Live.
Introducing our most advanced Gemini Audio models yet 🗣 Gemini 3.8 Live and 3.8 Live Extended Thin…
DịchGoogle vừa giới thiệu Gemini 3.8 Live và 3.8 Live Extended Thinking, những mô hình âm thanh tiên tiến nhất của hãng với khả năng xử lý tư duy mở rộng.
StepAudio 3 Gen là mô hình tạo âm thanh đa năng sử dụng kiến trúc tự hồi quy rời rạc thay vì khuếch tán, hỗ trợ toàn diện từ chuyển văn bản thành giọng nói, thiết kế âm thanh đến tạo nhạc trong một khung duy nhất.
AuK là mô hình nền tảng đa năng cho phép tạo và chỉnh sửa giọng nói thông qua ngôn ngữ tự nhiên, được huấn luyện trên quy mô dữ liệu khổng lồ. Phiên bản AuK-Flash tối ưu hóa tốc độ suy luận nhanh gấp 4.5 lần, mở ra tiềm năng ứng dụng lớn cho các nhà phát triển.
NAPE là khung học tự giám sát tối giản sử dụng Transformer nhân quả để dự đoán các đoạn âm thanh tiếp theo mà không cần bộ giải mã phức tạp. Phương pháp này đạt hiệu suất vượt trội trên nhiều tác vụ âm thanh và giọng nói, đồng thời có khả năng mở rộng quy mô ấn tượng.
PRISM là khung làm việc mới giúp các mô hình âm thanh-văn bản xử lý nhiễu nặng mà không cần huấn luyện lại, bằng cách loại bỏ biến dạng trong không gian tiềm ẩn dựa trên các điểm neo hình học.