# Microsoft Research ra mắt VibeVoice: Công nghệ nhận diện giọng nói theo thời gian thực tích hợp định danh người nói

- Nguồn: HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
- Thời gian phát hành: 2026-09-02 07:00 (giờ Việt Nam)
- Điểm AI: 51/100
- Link AIHOT.vn: https://aihot.vn/items/4158783954baa590
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmtl5ao8a0ic8roalw9ma3wap
- Link gốc: https://arxiv.org/abs/2609.02812

## Tóm tắt AI

VibeVoice là mô hình ASR đầu cuối dựa trên LLM, cho phép xác định người nói ngay khi âm thanh được truyền đến mà không cần bước phân tách giọng nói (diarization) riêng biệt.

## Thân bài

Tác giả: Yujie Tu, Zhiliang Peng, Jianwei Yu, Li Dong, Songchen Xu, Yaoyao Chang, Wenhui Wang, Zilong Wang, Zehua Wang, Yan Xia, Jiajun Zhang, Xie Chen, Furu Wei

Xem PDF HTML (thử nghiệm)

DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

### Lịch sử gửi bài

Từ: Yujie Tu [xem email] [v1] Thứ Tư, ngày 2 tháng 9 năm 2026 16:52:55 UTC (4.788 KB)
