NVIDIA vừa phát hành Nemotron 3 Diarization trên Hugging Face, mô hình mã nguồn mở 100M tham số có khả năng theo dõi thời gian thực tới 8 người nói và xử lý chồng lấn âm thanh, cho phép sử dụng thương mại.
been using astra to transcribe music, then to review the spectrogram to do error correction and then…
DịchNgười dùng chia sẻ cách kết hợp Astra để chuyển soạn nhạc với việc kiểm tra phổ âm (spectrogram) nhằm sửa lỗi cao độ và điều chỉnh các đoạn nhạc phức tạp, giúp đạt kết quả chính xác cho mục đích học tập.
VoiceArena launched Diarization Bench to compare 12 diarization systems on the same real-world audio…
DịchVoiceArena giới thiệu bộ tiêu chuẩn Diarization Bench với 139 đoạn hội thoại thực tế để so sánh 12 hệ thống tách lời nói. Kết quả cho thấy NVIDIA Nemotron 3 dẫn đầu với tỷ lệ lỗi DER 14.72%, đồng thời làm rõ sự ảnh hưởng của tham số collar và độ khó khi xử lý giọng nói chồng lấn.
Baseten ra mắt dịch vụ lưu trữ cho mô hình NVIDIA Nemotron 3 Diarization, hỗ trợ ba chế độ xử lý từ batch đến thời gian thực với chi phí tối ưu chỉ 1 cent mỗi giờ âm thanh.
NVIDIA phát hành mã nguồn mở mô hình Nemotron 3 Diarization với 100 triệu tham số, hỗ trợ tách tối đa 8 người nói và dẫn đầu bảng xếp hạng VoiceArena Diarization-Bench với tỷ lệ lỗi DER chỉ 14.72%.
OmniVChat giới thiệu phương thức tương tác trực tiếp giữa người dùng và mô hình AI thông qua âm thanh và video mà không cần chuyển đổi văn bản, giúp giảm độ trễ và giữ trọn vẹn các tín hiệu cảm nhận.
StepAudio 3 giới thiệu cơ chế 'Think-While-Speaking' cho phép AI suy luận chuyên sâu song song với việc phản hồi bằng giọng nói, tạo ra trải nghiệm hội thoại tự nhiên, mượt mà và có độ trễ cực thấp.
Vì sao đáng đọc: Đây là một nghiên cứu quan trọng giải quyết bài toán hóc búa về độ trễ trong AI hội thoại, mang tính ứng dụng cao cho các trợ lý ảo thế hệ mới.
11/09
Thứ Sáu · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
X-AuT sử dụng kỹ thuật cắt tỉa dần dần và chưng cất đa quy mô để nén bộ mã hóa âm thanh của LLM, giúp giảm số lớp Transformer mà vẫn cải thiện độ chính xác trên các bài kiểm tra tiếng Anh và tiếng Trung.
DịchGemini Flash 3.8 gây bất ngờ với khả năng phân tích và "nghe" hiểu các biểu đồ phổ âm thanh (spectrogram) một cách chính xác, mở ra tiềm năng ứng dụng mới trong xử lý tín hiệu.
TFO là giải pháp plug-and-play cho phép tích hợp khả năng hiểu âm thanh vào các mô hình VLM đóng băng mà không cần thay đổi kiến trúc hay huấn luyện lại, giúp bảo toàn nguyên vẹn năng lực suy luận thị giác ban đầu.
Vì sao đáng đọc: Giải pháp đột phá giúp tiết kiệm chi phí tính toán đáng kể khi tích hợp đa phương thức, giải quyết trực tiếp vấn đề 'quên lãng' năng lực cũ của các mô hình VLM hiện nay.
Nghiên cứu phân tích cơ chế 'tam giác chú ý' trong các mô hình khuếch tán, chỉ ra cách thông tin ngữ nghĩa bị rò rỉ giữa âm thanh và hình ảnh, dẫn đến các kết quả sai lệch so với yêu cầu người dùng.
Meta giới thiệu Muse Voice Transcribe, mô hình xử lý âm thanh thời gian thực có khả năng nhận diện, chuyển đổi văn bản và tách biệt giọng nói của hơn 20 người cùng lúc với độ trễ cực thấp.
Meta Superintelligence Labs giới thiệu Muse Voice Transcribe, mô hình tự hồi quy đầu tiên xử lý đồng thời nhận diện giọng nói, phân tách hơn 20 người nói và phát hiện điểm cuối mà không cần hậu xử lý.
StemDeck là công cụ tách nhạc mạnh mẽ cho phép tách file âm thanh hoặc link YouTube thành 6 kênh riêng biệt (vocal, trống, bass, guitar, piano...) hoàn toàn miễn phí, bảo mật và không cần kết nối internet.
Nghiên cứu giới thiệu khung làm việc Super Star, cho phép người ảo tạo cử chỉ đồng bộ với lời nói theo thời gian thực mà không cần dữ liệu tương lai, giải quyết bài toán độ trễ trong tương tác thực tế.
UniSwap là khung làm việc đầu tiên cho phép thay đổi đồng thời diện mạo và giọng nói trong video nói thông qua mô hình Transformer khuếch tán, giúp giữ nguyên nội dung và chuyển động gốc của video.