25/09

Thứ Sáu · 2 tin
Elvis Saravia@omarsar0
Mô hìnhĐiểm AI 39/100

Humyn Labs ra mắt BRIDGE ASR 2.0: Chuẩn đánh giá nhận diện giọng nói đa ngôn ngữ

Recommended benchmark. I expect voice to become one of the main ways people interact with robots a…

DịchBRIDGE ASR 2.0 đánh giá 23 mô hình nhận diện giọng nói qua các cuộc hội thoại thực tế, hỗ trợ 18 ngôn ngữ Ấn Độ cùng tiếng Tây Ban Nha, Bồ Đào Nha và Việt Nam, tập trung vào khả năng xử lý từ ngữ pha trộn (code-switch).

Apple Machine Learning Research
Nghiên cứuĐiểm AI 38/100

Apple công bố giải pháp ASR liên kết bán giám sát: Tối ưu hóa nhãn giả và ổn định cập nhật máy chủ

Apple giới thiệu phương pháp mới giúp giảm sai số trong học máy liên kết ASR bán giám sát, cải thiện hiệu suất nhận diện giọng nói đáng kể bằng cách ổn định nhãn giả và cập nhật máy chủ liên tục.

24/09

Thứ Năm · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 36/100

Six Layers Less: Kỹ thuật cắt tỉa Encoder cho Whisper giúp tối ưu hiệu năng mà không cần nhãn

Nghiên cứu giới thiệu phương pháp loại bỏ 6 lớp ít quan trọng nhất trong bộ mã hóa Whisper, giúp giảm 18,5% kích thước mô hình mà không cần thay đổi cấu trúc suy luận. Hiệu suất được khôi phục ấn tượng thông qua kỹ thuật chưng cất từ dữ liệu âm thanh không nhãn.

23/09

Thứ Tư · 4 tin
Qwen@Alibaba_Qwen
Mô hìnhĐiểm AI 67/100

Tinh chọnQwen ra mắt hệ sinh thái Qwen-Audio-3.1: Nâng cấp toàn diện ASR, TTS và Realtime

⚡ Meet Qwen-Audio-3.1! ASR, TTS & Realtime are fully upgraded, joined by two new models: TTS-Next fo…

DịchQwen giới thiệu Qwen-Audio-3.1 với 5 mô hình mới, bổ sung TTS-Next và ASR-Next cùng khả năng tương tác thời gian thực thông minh. Đặc biệt, chi phí sử dụng được cắt giảm mạnh tới 95%, hỗ trợ nhận diện cảm xúc và phản hồi tự nhiên hơn.


Vì sao đáng đọc: Nhà phát hành công bố chi tiết năng lực của năm mô hình âm thanh cùng ba mức giảm giá, giúp độc giả đối chiếu với nhu cầu thực tế để đánh giá chi phí thay thế.
Pandaily
Mô hìnhĐiểm AI 85/100

Cùng sự kiệnAlibaba nâng cấp bộ công cụ Qwen Audio: Giảm độ trễ LiveTranslate và ra mắt Qwen-Audio-3.1

Tại sự kiện Apsara 2026, Alibaba giới thiệu Qwen3.8-LiveTranslate với độ trễ giảm xuống còn 2.3 giây, đồng thời công bố dòng Qwen-Audio-3.1 hỗ trợ ASR, TTS và âm thanh điện ảnh thời gian thực.

Cùng sự kiện, bài đại diện «Alibaba ra mắt Qwen-Audio-3.1 với 5 mô hình mới, giảm giá dịch vụ AI âm thanh tới 95%»
IT Home
Mô hìnhĐiểm AI 68/100

Cùng sự kiệnAlibaba ra mắt dòng mô hình âm thanh Qwen-Audio-3.1 và giảm giá toàn bộ sản phẩm

Alibaba vừa giới thiệu 5 mô hình thuộc dòng Qwen-Audio-3.1 bao gồm ASR, ASR-Next, TTS, TTS-Next và Realtime, hỗ trợ toàn diện từ nhận diện, tổng hợp giọng nói đến tương tác thời gian thực.

Cùng sự kiện, bài đại diện «Alibaba ra mắt Qwen-Audio-3.1 với 5 mô hình mới, giảm giá dịch vụ AI âm thanh tới 95%»
Artificial Analysis@ArtificialAnlys
Sản phẩmĐiểm AI 52/100

StepAudio 3 ASR của StepFun dẫn đầu bảng xếp hạng chuyển đổi giọng nói của Artificial Analysis

StepFun has released StepAudio 3 ASR, ranking #1 on the AA-WER Index for non-streaming Speech to Tex…

DịchStepFun vừa ra mắt StepAudio 3 ASR, đạt tỷ lệ lỗi từ (WER) chỉ 1,7% trên bảng xếp hạng của Artificial Analysis, vượt xa thành tích 4,7% của phiên bản tiền nhiệm.

17/09

Thứ Năm · 1 tin
Rohan Paul@rohanpaul_ai
Mô hìnhĐiểm AI 55/100

NetEase Youdao ra mắt mô hình nhận diện giọng nói Confucius4-R2T2: Không bao giờ sửa lại văn bản đã xuất

Voice agents should consume speech incrementally but only act on committed text, because a fast tran…

DịchNetEase Youdao giới thiệu mô hình nhận diện giọng nói thời gian thực Confucius4-R2T2, sử dụng kỹ thuật Longest Stable Prefix để đảm bảo văn bản đã xuất ra sẽ không bị thay đổi. Mô hình dựa trên Qwen3-ASR, cho phép tùy chỉnh thuật ngữ chuyên ngành linh hoạt mà không cần huấn luyện lại.

15/09

Thứ Ba · 1 tin

04/09

Thứ Sáu · 1 tin
Rohan Paul@rohanpaul_ai
Mô hìnhĐiểm AI 34/100

Hojo-ASR-Multi-V1: Mô hình nhận diện giọng nói đa ngôn ngữ đạt WER 3.54%, dẫn đầu bảng xếp hạng mã nguồn mở

My criteria for buying tech have changed a lot over the years. The biggest limitation of the smartp…

DịchHojo-ASR-Multi-V1 vừa gia nhập Open ASR Leaderboard với vị trí thứ 7 toàn cầu và đứng đầu trong nhóm mô hình mã nguồn mở, đạt tỷ lệ lỗi từ (WER) trung bình ấn tượng 3.54% trên 5 ngôn ngữ.

03/09

Thứ Năm · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 51/100

Microsoft Research ra mắt VibeVoice: Công nghệ nhận diện giọng nói theo thời gian thực tích hợp định danh người nói

VibeVoice là mô hình ASR đầu cuối dựa trên LLM, cho phép xác định người nói ngay khi âm thanh được truyền đến mà không cần bước phân tách giọng nói (diarization) riêng biệt.

02/09

Thứ Tư · 2 tin
AI at Meta@AIatMeta
Mô hìnhĐiểm AI 61/100

Meta ra mắt Muse Voice Transcribe: Mô hình nhận diện âm thanh thời gian thực đột phá

Introducing Muse Voice Transcribe, the first real-time audio perception model from Meta Superintelli…

DịchMeta giới thiệu Muse Voice Transcribe, mô hình nhận diện giọng nói thời gian thực hỗ trợ đa ngôn ngữ, phân tách người nói và chuyển đổi ngôn ngữ linh hoạt. Công nghệ này hiện dẫn đầu các bảng xếp hạng về khả năng chuyển đổi giọng nói thành văn bản.

Thêm 7 nguồn khác đưa tinIT HomeX: Rohan Paul (@rohanpaul_ai)MarkTechPostX: Alexandr Wang (Scale AI nhà sáng lập/Meta Giám đốc AI) (@alexandr_wang)X: Artificial Analysis (@ArtificialAnlys)X: Testing Catalog (@testingcatalog)X: Mark Zuckerberg (@finkd)

29/08

Thứ Bảy · 2 tin
Rohan Paul@rohanpaul_ai
Sản phẩmĐiểm AI 38/100

Hugging Face và Voice Arena ra mắt bộ tiêu chuẩn đánh giá ASR tiếng Ấn Độ

Speech recognition for the world's languages needs benchmarks models cannot easily overfit. @huggin…

DịchHugging Face hợp tác cùng Voice Arena bổ sung bộ dữ liệu Monsoon (tiếng Hindi và tiếng Anh Ấn Độ) vào bảng xếp hạng Open ASR, giúp đánh giá chính xác khả năng nhận diện giọng nói và hạn chế tình trạng mô hình học vẹt.

Hugging Face: Blog
Sản phẩmĐiểm AI 66/100

Tinh chọnBảng xếp hạng Open ASR bổ sung ngôn ngữ Nam bán cầu đầu tiên: Tiếng Hindi và tiếng Anh Ấn Độ

Voice Arena và Hugging Face vừa tích hợp bộ dữ liệu Monsoon cho tiếng Hindi và tiếng Anh Ấn Độ vào bảng xếp hạng Open ASR, đánh dấu cột mốc ngôn ngữ phi châu Âu đầu tiên được đưa vào hệ thống đánh giá này.


Vì sao đáng đọc: Tin tức quan trọng về tính đa dạng ngôn ngữ trong AI, giúp cải thiện độ chính xác cho các khu vực ít được đại diện, phù hợp với xu hướng phát triển AI toàn cầu.

28/08

Thứ Sáu · 1 tin
Google AI: DEV tác giả
Hướng dẫnĐiểm AI 74/100

Tinh chọnHướng dẫn toàn tập về Gemini 3.5 Transcribe: Giải pháp chuyển đổi giọng nói thành văn bản tối ưu

Google ra mắt Gemini 3.5 Transcribe, mô hình chuyên biệt cho chuyển đổi giọng nói với độ chính xác cao, hỗ trợ hơn 85 ngôn ngữ, tách lời người nói và tùy chỉnh từ vựng chuyên ngành.

Diễn biến sự kiện · 6 bài →Thêm 4 nguồn khác đưa tinMarkTechPostHacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)The Decoder: AI NewsIT Home

Vì sao đáng đọc: Đây là công cụ cực kỳ hữu ích cho người làm nội dung và lập trình viên, giải quyết trực tiếp các vấn đề về độ chính xác và chi phí trong xử lý âm thanh.

25/08

Thứ Ba · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 66/100

Nghiên cứu: Các kỹ thuật RAG nâng cao vô tình làm trầm trọng thêm lỗi từ nhận dạng giọng nói (ASR)

Nghiên cứu chỉ ra rằng việc sử dụng đồ thị thực thể và tái viết truy vấn trong RAG đa chặng làm khuếch đại sai sót từ ASR, khiến độ chính xác giảm mạnh hơn so với tìm kiếm thuần túy khi dữ liệu đầu vào bị nhiễu.

21/08

Thứ Sáu · 2 tin
Hugging Face: Blog
Nghiên cứuĐiểm AI 69/100

Tinh chọnHugging Face vạch trần hiện tượng 'gian lận' điểm số trong các mô hình nhận dạng giọng nói (ASR)

Nghiên cứu mới từ Hugging Face chỉ ra nhiều mô hình ASR đạt điểm cao nhờ học thuộc lòng dữ liệu kiểm thử thay vì cải thiện khả năng nhận dạng thực tế, dẫn đến kết quả đánh giá bị thổi phồng.


Vì sao đáng đọc: Bài viết cung cấp góc nhìn chuyên sâu về lỗ hổng trong đánh giá AI, giúp cộng đồng nhận diện thực trạng 'học vẹt' của các mô hình hiện nay.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 50/100

Vạch trần lỗ hổng: Các mô hình ASR hàng đầu đang 'học vẹt' để đạt điểm chuẩn cao

Nghiên cứu mới chỉ ra rằng các mô hình ASR hàng đầu có xu hướng 'học vẹt' văn bản tham chiếu thay vì thực sự hiểu âm thanh, dẫn đến điểm số ảo dù dữ liệu đầu vào bị nhiễu hoặc thiếu hụt.

17/08

Thứ Hai · 1 tin
Tổng 20 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (33 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “ASR” | AIHOT.vn