NVIDIA vừa phát hành mô hình tách lời nói (speaker diarization) mã nguồn mở với 100 triệu tham số mang tên Nemotron 3 Diarization trên Hugging Face
Tổng quan sự kiện
Tóm tắt sự kiện · Thông tin xác thực
NVIDIA ra mắt mô hình tách lời người nói mã nguồn mở Nemotron 3 Diarization với 100 triệu tham số, hỗ trợ theo dõi tối đa 8 người nói (bao gồm cả các đoạn chồng lấn). Một checkpoint duy nhất hỗ trợ cả ghi âm ngoại tuyến (offline) và phát trực tuyến (streaming) thời gian thực. Mô hình được phát hành theo giấy phép OpenMDW License 1.1, cho phép sử dụng thương mại và chạy thông qua NVIDIA NeMo trên Linux cùng các dòng GPU Ampere, Ada Lovelace, Hopper và Blackwell. Mô hình tiếp nhận định dạng wav/flac/opus/mp3 đơn kênh 16 kHz, xử lý qua đặc trưng Mel, bộ mã hóa RoPE Transformer 31 lớp và lớp lấy mẫu Conv1D để xuất ra xác suất hoạt động của từng người nói [T,8]. Hệ thống sử dụng giải pháp Sortformer sắp xếp theo thời gian đến, hỗ trợ streaming qua hàng đợi AOSC và FIFO với nhãn ẩn danh. Cung cấp 4 cấu hình độ trễ (offline 30.4 giây, thấp 1.04 giây, cực thấp 0.64 giây, siêu thấp 0.32 giây), trong đó 0.32 giây là mức khuyến nghị thấp nhất (độ trễ không bao gồm thời gian tính toán, mạng và ASR). Mô hình được huấn luyện trên khoảng 10 nghìn giờ hội thoại thực tế và 82,611 giờ dữ liệu mô phỏng đa người nói, bao gồm âm thanh đa người nói thực tế được cấp phép từ David AI (giúp giảm chỉ số DER tổng hợp từ 11.19% xuống 10.42%). Dữ liệu mô phỏng bao phủ 21 ngôn ngữ. Yêu cầu cài đặt Python 3.12 trở lên, mã ví dụ sử dụng SortformerEncLabelModel.from_pretrained("nvidia/Nemotron-3-Diarization"), đầu ra gồm start, end, speaker_id, có thể kết hợp với Parakeet TDT 0.6B v3 để trích xuất văn bản. Demo thời gian thực trên Space cung cấp các tính năng hội thoại tổng hợp, micro thời gian thực, micro đa ngôn ngữ và tải lên âm thanh. Môi trường sản xuất hỗ trợ Baseten và DigitalOcean, phía thiết bị đầu cuối hỗ trợ Argmax Pro SDK 3, hiện chưa có trên Hugging Face Inference Providers. Hạn chế của mô hình: hơn 8 người nói có thể dẫn đến bỏ sót hoặc sai lệch, nhiễu mạnh, tiếng vang và thu âm trường xa sẽ làm tăng tỷ lệ lỗi.
Theo bài gốc của sự kiện từ MarkTechPost.
Diễn biến mới nhất
NVIDIA phát hành mô hình tách lời người nói (speaker diarization) mã nguồn mở với 100 triệu tham số mang tên Nemotron 3 Diarization trên Hugging Face.
Chính chủ · 2 bài
Nghe trực tiếp từ bên liên quan
- Baseten kỹ thuật Blog (Web)NVIDIA ra mắt mô hình tách lời người nói trực tuyến Nemotron 3 Diarization, hỗ trợ 4 cấu hình độ trễ từ 0.32 đến 30.4 giây trên cùng một checkpoint
- Hugging Face: BlogNVIDIA phát hành mô hình mã nguồn mở 100 triệu tham số Nemotron 3 Diarization, hỗ trợ 8 người nói, dẫn đầu bảng xếp hạng VoiceArena Diarization-Bench với 14.72% DER
Dòng thời gian đưa tin
Đang hiện 4 bài · tất cả · mới trước
T5 · 24/09
NVIDIA vừa phát hành mô hình tách lời nói (speaker diarization) mã nguồn mở với 100 triệu tham số mang tên Nemotron 3 Diarization trên Hugging Face
MarkTechPostNVIDIA ra mắt mô hình tách lời người nói mã nguồn mở Nemotron 3 Diarization với 100 triệu tham số, hỗ trợ theo dõi tối đa 8 người nói (bao gồm cả các đoạn chồng lấn). Một checkpoint duy nhất hỗ trợ cả ghi âm ngoại tuyến (offline) và phát trực tuyến (streaming) thời gian thực. Mô hình được phát hành theo giấy phép OpenMDW License 1.1, cho phép sử dụng thương mại và chạy thông qua NVIDIA NeMo trên Linux cùng các dòng GPU Ampere, Ada Lovelace, Hopper và Blackwell. Mô hình tiếp nhận định dạng wav/flac/opus/mp3 đơn kênh 16 kHz, xử lý qua đặc trưng Mel, bộ mã hóa RoPE Transformer 31 lớp và lớp lấy mẫu Conv1D để xuất ra xác suất hoạt động của từng người nói [T,8]. Hệ thống sử dụng giải pháp Sortformer sắp xếp theo thời gian đến, hỗ trợ streaming qua hàng đợi AOSC và FIFO với nhãn ẩn danh. Cung cấp 4 cấu hình độ trễ (offline 30.4 giây, thấp 1.04 giây, cực thấp 0.64 giây, siêu thấp 0.32 giây), trong đó 0.32 giây là mức khuyến nghị thấp nhất (độ trễ không bao gồm thời gian tính toán, mạng và ASR). Mô hình được huấn luyện trên khoảng 10 nghìn giờ hội thoại thực tế và 82,611 giờ dữ liệu mô phỏng đa người nói, bao gồm âm thanh đa người nói thực tế được cấp phép từ David AI (giúp giảm chỉ số DER tổng hợp từ 11.19% xuống 10.42%). Dữ liệu mô phỏng bao phủ 21 ngôn ngữ. Yêu cầu cài đặt Python 3.12 trở lên, mã ví dụ sử dụng SortformerEncLabelModel.from_pretrained("nvidia/Nemotron-3-Diarization"), đầu ra gồm start, end, speaker_id, có thể kết hợp với Parakeet TDT 0.6B v3 để trích xuất văn bản. Demo thời gian thực trên Space cung cấp các tính năng hội thoại tổng hợp, micro thời gian thực, micro đa ngôn ngữ và tải lên âm thanh. Môi trường sản xuất hỗ trợ Baseten và DigitalOcean, phía thiết bị đầu cuối hỗ trợ Argmax Pro SDK 3, hiện chưa có trên Hugging Face Inference Providers. Hạn chế của mô hình: hơn 8 người nói có thể dẫn đến bỏ sót hoặc sai lệch, nhiễu mạnh, tiếng vang và thu âm trường xa sẽ làm tăng tỷ lệ lỗi.
NVIDIA Nemotron 3 đạt chỉ số DER 4.29% ở ngưỡng dung sai (collar) 250 mili giây; cùng kết quả đầu ra đó ở ngưỡng 0 mili giây là 14.72%
X: Rohan Paul (@rohanpaul_ai)NVIDIA Nemotron 3 đạt chỉ số DER 4.29% ở ngưỡng dung sai (collar) 250 mili giây; nếu đánh giá cùng kết quả đầu ra đó ở ngưỡng 0 mili giây, con số này trở thành 14.72%.
T4 · 23/09
NVIDIA ra mắt mô hình tách lời người nói trực tuyến Nemotron 3 Diarization, hỗ trợ 4 cấu hình độ trễ từ 0.32 đến 30.4 giây trên cùng một checkpoint
Baseten kỹ thuật Blog (Web)Chính chủNVIDIA phát hành mô hình Nemotron 3 Diarization: kiến trúc transformer với khoảng 100 triệu tham số, xây dựng trên nền tảng NVIDIA Streaming Sortformer, chuyển đổi âm thanh 16kHz thành các khung 10ms và xuất ra ma trận xác suất hoạt động của người nói. Nhờ bộ đệm người nói theo thứ tự đến và hàng đợi khung FIFO, mô hình có thể xử lý âm thanh không giới hạn độ dài mà không cần nhúng (embedding) hay phân cụm (clustering). Một checkpoint duy nhất có thể phục vụ các yêu cầu với 4 mức độ trễ thuật toán từ 0.32 đến 30.4 giây. Các kết quả kiểm chuẩn cho thấy trên AISHELL-4 với cấu hình độ trễ thấp, chỉ số DER đạt 9.8%, cải thiện đáng kể so với mức 27.2% của thế hệ tiền nhiệm Streaming Sortformer v2.1, đồng thời vượt trội hơn Meta Muse Voice Transcribe trên hầu hết các tập dữ liệu, chỉ đứng sau pyannote community-1 trên tập AMI.
NVIDIA phát hành mô hình mã nguồn mở 100 triệu tham số Nemotron 3 Diarization, hỗ trợ 8 người nói, dẫn đầu bảng xếp hạng VoiceArena Diarization-Bench với 14.72% DER
Hugging Face: BlogChính chủNVIDIA ra mắt mô hình tách lời người nói mã nguồn mở Nemotron 3 Diarization (100 triệu tham số), hỗ trợ tối đa 8 người nói, xử lý giọng nói chồng lấn và độ trễ streaming linh hoạt, sử dụng giấy phép OpenMDW 1.1 và có thể gọi qua NeMo trên Hugging Face (nvidia/Nemotron-3-Diarization). Quá trình huấn luyện sử dụng dữ liệu giọng nói công khai và được cấp phép (bao gồm dữ liệu từ David AI, giúp giảm DER tổng hợp 0.77 điểm phần trăm xuống còn 10.42%). Trong bảng xếp hạng khởi đầu VoiceArena Diarization-Bench (12 hệ thống, 17 cấu hình, 139 đoạn hội thoại tiếng Anh khoảng 22 giờ, không có dung sai biên), mô hình đứng thứ nhất với 14.72% DER, giảm khoảng 24% tương đối so với vị trí thứ hai là 19.3%. So với mô hình cơ sở 4 người nói trước đó là diar_streaming_sortformer_4spk-v2.1, mô hình đạt mức giảm DER trung bình khoảng 41% trên 8 bộ kiểm chuẩn công khai (ở độ trễ 1.04 giây), với RTFx đạt 15113× ở cấu hình 30.4 giây. Bài viết lưu ý rằng các kết quả ban đầu này có thể thay đổi theo đánh giá VoiceArena V1.