Bộ dữ liệu mã nguồn mở trên HuggingFace bao gồm 2.194 kịch bản hội thoại giữa bác sĩ và bệnh nhân do Claude Opus 5.5 tạo ra, với trung bình 33 lượt hội thoại mỗi ca, bao quát từ triệu chứng, chẩn đoán đến phác đồ điều trị.
Check out this week's updates and releases: - Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS, t…
DịchGoogle vừa giới thiệu bộ đôi mô hình Gemini 3.8 Flash TTS và Flash-Lite TTS chuyên về âm thanh, đồng thời ra mắt Gemini 3.8 Live tích hợp Avatar ảo cho trải nghiệm hội thoại trực quan.
Tại sự kiện Made On YouTube, YouTube Music đã giới thiệu Ask Music giúp tương tác hội thoại tự nhiên và Your Podcast Lineup giúp cá nhân hóa trải nghiệm nghe podcast thông qua AI.
SteerDuplex là mô hình hội thoại song công (full-duplex) đột phá, cho phép người dùng điều chỉnh linh hoạt tông giọng, phong cách và tốc độ nói thông qua các hướng dẫn trực tiếp, giúp tương tác tự nhiên và thông minh hơn.
Vì sao đáng đọc: Nghiên cứu giải quyết vấn đề quan trọng về khả năng tùy biến trong hội thoại thời gian thực, kết hợp kỹ thuật RL tiên tiến, rất có giá trị cho tương lai của trợ lý ảo.
Gricea là nền tảng khoa học mở giúp chuẩn hóa, chia sẻ và tái lập các nghiên cứu về AI hội thoại, giải quyết vấn đề thiếu hụt thông tin trong các báo cáo khoa học hiện nay.
It's time for our end-of-week recap 👇 - Gemini 3.8 Live and 3.8 Live Extended Thinking, our most a…
DịchGoogle vừa giới thiệu Gemini 3.8 Live và bản Extended Thinking, nâng tầm khả năng tương tác giọng nói. Đồng thời, công cụ Dreambeans chính thức ra mắt, biến CC thành trợ lý thông minh hỗ trợ quản lý lịch trình gia đình.
Ant Group và Đại học Thanh Hoa vừa công bố Realtime-Venus, hệ thống hỗ trợ đối thoại song công (full-duplex) và xử lý tác vụ bất đồng bộ, bao gồm các mô hình 9B chuyên biệt cho âm thanh và video.
Thêm 1 nguồn khác đưa tinAnt Group inclusionAI: HuggingFace mô hình mới
Vì sao đáng đọc: Dự án mã nguồn mở từ Ant Group có tính ứng dụng cao trong phát triển AI hội thoại thời gian thực, thu hút sự quan tâm lớn từ cộng đồng kỹ thuật.
StepAudio 3 giới thiệu cơ chế 'Think-While-Speaking' cho phép AI suy luận chuyên sâu song song với việc phản hồi bằng giọng nói, tạo ra trải nghiệm hội thoại tự nhiên, mượt mà và có độ trễ cực thấp.
Vì sao đáng đọc: Đây là một nghiên cứu quan trọng giải quyết bài toán hóc búa về độ trễ trong AI hội thoại, mang tính ứng dụng cao cho các trợ lý ảo thế hệ mới.
Google vừa giới thiệu Gemini 3.8 Live và phiên bản Extended Thinking, hỗ trợ 97 ngôn ngữ. Trong đó, bản tiêu chuẩn tối ưu chi phí, còn bản Extended tập trung vào các tác vụ suy luận đa bước phức tạp.
Introducing StepAudio 3, our new family of 5 audio models for real-time voice, speech recognition, s…
DịchStepFun vừa trình làng bộ 5 mô hình StepAudio 3, dẫn đầu bảng xếp hạng Artificial Analysis về khả năng hội thoại và suy luận giọng nói, đồng thời đạt tỷ lệ lỗi nhận diện (ASR) cực thấp chỉ 1,7%.
Nghiên cứu giới thiệu phương pháp Self-Listening, cho phép mô hình AI phản hồi chính xác hơn khi bị ngắt lời bằng cách tự lắng nghe lại những gì mình đã phát ra, thay vì chỉ dựa trên dữ liệu văn bản thuần túy.
Nghiên cứu đề xuất phương pháp tạo dữ liệu hội thoại tổng hợp từ đánh giá sản phẩm và tương tác người dùng để huấn luyện hệ thống gợi ý mà không cần dữ liệu hội thoại thực tế, giúp tối ưu hóa hiệu suất trong các lĩnh vực mới.