24/09

Thứ Năm · 5 tin
Artificial Intelligence News (Web)
Sản phẩmĐiểm AI 59/100

Cùng sự kiệnGoogle ra mắt bộ đôi mô hình chuyển văn bản thành giọng nói Gemini 3.8 Flash TTS và Flash-Lite TTS

Google vừa giới thiệu Gemini 3.8 Flash TTS và Gemini 3.8 Flash-Lite TTS, tối ưu hóa cho các tác vụ lồng tiếng sáng tạo và xử lý tự động hóa với tốc độ cao.

Cùng sự kiện, tinh chọn hiển thị «Google DeepMind ra mắt Gemini 3.8 Flash TTS và Flash-Lite TTS: Đột phá công nghệ chuyển văn bản thành giọng nói»
@typesafeai@typesafeai
Sản phẩmĐiểm AI 34/100

ElevenLabs ra mắt tính năng phân tích cảm xúc thời gian thực trong cuộc gọi

This can't just be transcript analysis, reveal your secrets! Brb playing with the live version @Ele…

DịchElevenLabs vừa giới thiệu công cụ phân tích cảm xúc trực tiếp, cho phép theo dõi và hiển thị sắc thái biểu cảm của người nói ngay khi họ đang trò chuyện thông qua các biểu đồ thời gian thực.

MarkTechPost
Mô hìnhĐiểm AI 57/100

Cùng sự kiệnGoogle ra mắt Gemini 3.8 Flash TTS và Flash-Lite TTS, hỗ trợ thiết kế giọng nói qua prompt

Google vừa giới thiệu hai mô hình chuyển văn bản thành giọng nói (TTS) mới là Gemini 3.8 Flash TTS và Flash-Lite TTS, hiện đã có sẵn trên Gemini API và Google AI Studio.

Cùng sự kiện, tinh chọn hiển thị «Google DeepMind ra mắt Gemini 3.8 Flash TTS và Flash-Lite TTS: Đột phá công nghệ chuyển văn bản thành giọng nói»
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Mô hìnhĐiểm AI 69/100

Cùng sự kiệnGoogle ra mắt Gemini 3.8 Flash TTS và Flash-Lite TTS: Bước tiến mới trong công nghệ chuyển văn bản thành giọng nói

Google giới thiệu hai mô hình Gemini 3.8 Flash TTS và Flash-Lite TTS, chuyển đổi khả năng tạo giọng nói từ các thiết lập tĩnh sang môi trường studio tùy chỉnh linh hoạt.

Cùng sự kiện, tinh chọn hiển thị «Google DeepMind ra mắt Gemini 3.8 Flash TTS và Flash-Lite TTS: Đột phá công nghệ chuyển văn bản thành giọng nói»
The Decoder: AI News
Sản phẩmĐiểm AI 70/100

Cùng sự kiệnGoogle ra mắt Gemini 3.8 Flash TTS và Flash-Lite TTS: Thiết kế giọng nói AI từ mô tả văn bản

Google giới thiệu bộ đôi mô hình Flash TTS hỗ trợ hơn 100 ngôn ngữ, cho phép tạo giọng nói tùy chỉnh qua mô tả văn bản hoặc sao chép giọng nói từ mẫu 30 giây, tích hợp sẵn watermark SynthID để bảo mật.

Cùng sự kiện, tinh chọn hiển thị «Google DeepMind ra mắt Gemini 3.8 Flash TTS và Flash-Lite TTS: Đột phá công nghệ chuyển văn bản thành giọng nói»

23/09

Thứ Tư · 7 tin
IT Home
Mô hìnhĐiểm AI 64/100

Cùng sự kiệnGoogle ra mắt Gemini 3.8 Flash và Flash-Lite TTS: Đột phá khả năng kiểm soát giọng nói

Google vừa giới thiệu bộ đôi mô hình Gemini 3.8 Flash TTS và Flash-Lite TTS, cho phép kiểm soát chi tiết từng dòng thoại với hỗ trợ hơn 100 ngôn ngữ và 2000 tùy chọn giọng nói có sẵn.

Cùng sự kiện, tinh chọn hiển thị «Google DeepMind ra mắt Gemini 3.8 Flash TTS và Flash-Lite TTS: Đột phá công nghệ chuyển văn bản thành giọng nói»
Logan Kilpatrick@OfficialLoganK
Mô hìnhĐiểm AI 62/100

Cùng sự kiệnGoogle ra mắt Gemini 3.8 Flash và mô hình chuyển văn bản thành giọng nói Flash-Lite TTS

Introducing Gemini 3.8 Flash and Flash-Lite TTS, our new SOTA text to speech model with: - a new vo…

DịchGoogle giới thiệu Gemini 3.8 Flash cùng Flash-Lite TTS, mô hình chuyển văn bản thành giọng nói SOTA hỗ trợ hơn 100 ngôn ngữ, 2000+ giọng đọc và dẫn đầu bảng xếp hạng Hume AI.

Cùng sự kiện, tinh chọn hiển thị «Google DeepMind ra mắt Gemini 3.8 Flash TTS và Flash-Lite TTS: Đột phá công nghệ chuyển văn bản thành giọng nói»
Google DeepMind: Blog
Mô hìnhĐiểm AI 73/100

Tinh chọnGoogle DeepMind ra mắt Gemini 3.8 Flash TTS và Flash-Lite TTS: Đột phá công nghệ chuyển văn bản thành giọng nói

Google DeepMind giới thiệu hai mô hình Gemini 3.8 Flash TTS và Flash-Lite TTS, hỗ trợ tạo giọng nói từ mô tả tự nhiên, sao chép mẫu âm thanh 30 giây và xử lý đa ngôn ngữ với khả năng điều khiển biểu cảm chuyên sâu.

Diễn biến sự kiện · 16 bài →Thêm 12 nguồn khác đưa tinX: Google AI (@GoogleAI)Artificial Intelligence News (Web)X: Testing Catalog (@testingcatalog)MarkTechPostHacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)The Decoder: AI NewsX: Artificial Analysis (@ArtificialAnlys)Simon Willison BlogX: Logan Kilpatrick (@OfficialLoganK)X: Ammaar Reshi (@ammaar)IT HomeX: Google DeepMind (@GoogleDeepMind)

Vì sao đáng đọc: Google đã giới thiệu chi tiết về khả năng, thứ hạng đánh giá và cổng truy cập của hai mô hình TTS. Các nhà phát triển có thể dựa vào đây để đánh giá và lựa chọn mô hình cho quy trình tạo giọng nói của mình.
Artificial Analysis@ArtificialAnlys
Mô hìnhĐiểm AI 53/100

Cùng sự kiệnGoogle ra mắt Gemini 3.8 Flash TTS và Gemini 3.8 Flash-Lite TTS

Google has released Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS. Gemini 3.8 Flash TTS debuts …

DịchGoogle vừa giới thiệu hai mô hình chuyển đổi văn bản thành giọng nói (TTS) mới là Gemini 3.8 Flash TTS và Gemini 3.8 Flash-Lite TTS, hỗ trợ cả giọng đọc mặc định lẫn tính năng sao chép giọng nói cá nhân.

Cùng sự kiện, tinh chọn hiển thị «Google DeepMind ra mắt Gemini 3.8 Flash TTS và Flash-Lite TTS: Đột phá công nghệ chuyển văn bản thành giọng nói»
Google AI@GoogleAI
Sản phẩmĐiểm AI 61/100

Cùng sự kiệnGoogle ra mắt Gemini 3.8 Flash TTS và Gemini 3.8 Flash-Lite TTS: Bước tiến mới trong công nghệ giọng nói

We're launching Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS ⚡️ Our most expressive audio mod…

DịchGoogle giới thiệu hai mô hình Gemini 3.8 Flash TTS và Gemini 3.8 Flash-Lite TTS, hỗ trợ hơn 100 ngôn ngữ với khả năng tùy chỉnh giọng nói linh hoạt, cho phép tạo ra hàng giờ âm thanh chất lượng cao, mượt mà và nhất quán.

Cùng sự kiện, tinh chọn hiển thị «Google DeepMind ra mắt Gemini 3.8 Flash TTS và Flash-Lite TTS: Đột phá công nghệ chuyển văn bản thành giọng nói»
Google DeepMind@GoogleDeepMind
Sản phẩmĐiểm AI 57/100

Cùng sự kiệnGoogle DeepMind ra mắt bộ đôi mô hình chuyển văn bản thành giọng nói Gemini 3.8 Flash TTS và Flash-Lite TTS

Create and deploy custom audio with our new text-to-speech models: 🔵 Gemini 3.8 Flash TTS: Design …

DịchGoogle DeepMind vừa giới thiệu Gemini 3.8 Flash TTS cho phép tùy chỉnh giọng nói độc bản và Gemini 3.8 Flash-Lite TTS tập trung vào hiệu suất cao, tối ưu cho các ứng dụng quy mô lớn.

Cùng sự kiện, tinh chọn hiển thị «Google DeepMind ra mắt Gemini 3.8 Flash TTS và Flash-Lite TTS: Đột phá công nghệ chuyển văn bản thành giọng nói»

21/09

Thứ Hai · 3 tin
Rohan Paul@rohanpaul_ai
Quan điểmĐiểm AI 33/100

Nhà sáng lập Cartesia giải mã lý do đặt cược vào mô hình không gian trạng thái cho AI giọng nói

One of the stranger assumptions in AI is that the same model architecture should work equally well f…

DịchTheo Cartesia, thách thức lớn nhất của AI giọng nói không nằm ở âm thanh mà là khả năng duy trì trạng thái hội thoại liên tục. Đó là lý do họ ưu tiên mô hình không gian trạng thái (SSM) thay vì các kiến trúc truyền thống để xử lý chuỗi dữ liệu dài.

Tripo (X chính thức)@tripoai
Hướng dẫnĐiểm AI 26/100

Trải nghiệm quy trình làm game AI: Tripo P2.0 kết hợp Jev tạo thế giới 3D sống động

Jev x Tripo x Astra in action. This showcases a smooth workflow using Tripo P2.0 to generate 3D ass…

DịchBản demo kết hợp giữa Jev, Tripo và Astra cho thấy khả năng tạo tài nguyên 3D, mô hình VRM và điều khiển logic game thông qua giọng nói một cách mượt mà, mở ra tiềm năng mới cho việc phát triển game tự động hóa.

20/09

Chủ Nhật · 1 tin
Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 47/100

NVIDIA giới thiệu kiến trúc mới giúp mô hình giọng nói song công thực hiện gọi công cụ

NVIDIA research papers are on fire recently! Here is another interesting paper where they give full…

DịchNVIDIA phát triển kiến trúc mới cho phép mô hình giọng nói song công chuyển tiếp luồng dữ liệu đến LLM để thực thi công cụ, sau đó phản hồi kết quả qua cơ chế prefill-and-repeat và TTS.

18/09

Thứ Sáu · 2 tin
Elon Musk@elonmusk
Sản phẩmĐiểm AI 44/100

Cùng sự kiệnGrok AI chính thức cập nhật tính năng trò chuyện bằng giọng nói

Grok @Bot now has a voice

DịchChatbot Grok của xAI vừa được bổ sung khả năng tương tác bằng giọng nói, cho phép người dùng trò chuyện trực tiếp với AI thay vì chỉ nhập văn bản.

Cùng sự kiện, tinh chọn hiển thị «xAI ra mắt mô hình chuyển đổi giọng nói Grok Voice Transcribe 2.0 với độ chính xác vượt trội»

17/09

Thứ Năm · 3 tin
SpaceXAI@SpaceXAI
Sản phẩmĐiểm AI 48/100

Grok Voice chính thức có mặt trên nền tảng fal: Đột phá tốc độ phản hồi giọng nói AI

Use Grok Voice in fal to build intelligent, low-latency agents that resolve real customer issues

DịchGrok Voice từ xAI đã cập bến nền tảng fal, mang đến khả năng phản hồi giọng nói siêu tốc dưới 0.7 giây, hỗ trợ đa ngôn ngữ và tính năng sao chép giọng nói chỉ với 2 phút dữ liệu âm thanh.

16/09

Thứ Tư · 7 tin
Google AI: DEV tác giả
Mô hìnhĐiểm AI 69/100

Cùng sự kiệnGoogle ra mắt Gemini 3.8 Live và 3.5 Transcribe: Đột phá mô hình giọng nói thời gian thực

Google giới thiệu bộ đôi mô hình Gemini 3.8 Live và 3.5 Transcribe với khả năng xử lý giọng nói đa ngôn ngữ, hỗ trợ tư duy mở rộng và tích hợp thị giác, trong đó bản Extended Thinking hiện dẫn đầu bảng xếp hạng Artificial Analysis.

Cùng sự kiện, tinh chọn hiển thị «Google DeepMind ra mắt Gemini 3.8 Live và bản Extended Thinking: Đột phá mới cho trợ lý giọng nói»
Simon Willison Blog
Mô hìnhĐiểm AI 67/100

Cùng sự kiệnGoogle ra mắt Gemini 3.8 Live: Trải nghiệm hội thoại giọng nói thời gian thực

Google vừa giới thiệu bộ đôi mô hình Gemini 3.8 Live và Extended Thinking, mang đến khả năng tương tác giọng nói trực tiếp tương tự GPT-Live của OpenAI.

Cùng sự kiện, tinh chọn hiển thị «Google DeepMind ra mắt Gemini 3.8 Live và bản Extended Thinking: Đột phá mới cho trợ lý giọng nói»
Artificial Analysis@ArtificialAnlys
Hướng dẫnĐiểm AI 66/100

Cùng sự kiệnĐánh giá Gemini 3.8 Live: Phiên bản Extended Thinking thống trị bảng xếp hạng giọng nói

Google has released Gemini 3.8 Live, its new Speech to Speech model, with the Extended Thinking (Hig…

DịchArtificial Analysis công bố Gemini 3.8 Live (bản Extended Thinking) đã vươn lên dẫn đầu bảng xếp hạng Speech to Speech Index với 82.6 điểm và đạt hiệu suất 68.6% trên Tau Voice.

Cùng sự kiện, tinh chọn hiển thị «Google DeepMind ra mắt Gemini 3.8 Live và bản Extended Thinking: Đột phá mới cho trợ lý giọng nói»
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Mô hìnhĐiểm AI 74/100

Cùng sự kiệnGoogle ra mắt Gemini 3.8 Live và bản Extended Thinking: Bước tiến mới cho trợ lý giọng nói

Google vừa giới thiệu hai mô hình Gemini 3.8 Live tập trung vào khả năng hội thoại thời gian thực và tư duy chuyên sâu, tối ưu hóa cho các tác vụ phức tạp và tương tác giọng nói thông minh.

Cùng sự kiện, tinh chọn hiển thị «Google DeepMind ra mắt Gemini 3.8 Live và bản Extended Thinking: Đột phá mới cho trợ lý giọng nói»
Rohan Paul@rohanpaul_ai
Mô hìnhĐiểm AI 73/100

Cùng sự kiệnGoogle ra mắt Gemini 3.8 Live: Đỉnh cao mới trong công nghệ hội thoại giọng nói

Google released Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking And now it takes the #1 overa…

DịchGoogle vừa trình làng Gemini 3.8 Live và bản Extended Thinking, chính thức soán ngôi đầu bảng xếp hạng Artificial Analysis về khả năng tương tác giọng nói, vượt qua GPT-Live-1 Astra với hiệu suất ấn tượng 82,6%.

Cùng sự kiện, tinh chọn hiển thị «Google DeepMind ra mắt Gemini 3.8 Live và bản Extended Thinking: Đột phá mới cho trợ lý giọng nói»
The Decoder: AI News
Mô hìnhĐiểm AI 70/100

Cùng sự kiệnGoogle ra mắt Gemini 3.8 Live: Đối thủ cạnh tranh trực tiếp với GPT-Live-1 của OpenAI

Google DeepMind vừa giới thiệu hai mô hình giọng nói mới là Gemini 3.8 Live và 3.8 Live Extended Thinking, mang đến giải pháp thay thế hiệu quả với chi phí tối ưu hơn so với GPT-Live-1.

Cùng sự kiện, tinh chọn hiển thị «Google DeepMind ra mắt Gemini 3.8 Live và bản Extended Thinking: Đột phá mới cho trợ lý giọng nói»
Logan Kilpatrick@OfficialLoganK
Mô hìnhĐiểm AI 63/100

Cùng sự kiệnGoogle ra mắt Gemini 3.8 Live và 3.8 Live Extended Thinking: Đột phá mới về mô hình giọng nói thời gian thực

Say hello (literally) to Gemini 3.8 Live and 3.8 Live Extended Thinking, our new SOTA live audio mod…

DịchGoogle vừa giới thiệu bộ đôi mô hình giọng nói thời gian thực Gemini 3.8 Live, hỗ trợ 97 ngôn ngữ với khả năng chuyển đổi mượt mà và hiệu suất dẫn đầu thị trường theo đánh giá của Artificial Analysis.

Cùng sự kiện, tinh chọn hiển thị «Google DeepMind ra mắt Gemini 3.8 Live và bản Extended Thinking: Đột phá mới cho trợ lý giọng nói»

15/09

Thứ Ba · 1 tin
Rohan Paul@rohanpaul_ai
NgànhĐiểm AI 44/100

VoiceArena ra mắt Jarvis Bench v0.5: Chuẩn mực mới đánh giá tác nhân AI giọng nói

I really like how @voicearena_ai designed this evaluation. Instead of asking whether one voice mode…

DịchJarvis Bench v0.5 đánh giá tác nhân AI qua độ hoàn thành nhiệm vụ và sự tự nhiên bằng phương pháp đối chứng với con người. Kết quả cho thấy AI đã tiệm cận con người về khả năng hoàn thành tác vụ, nhưng vẫn còn khoảng cách lớn về sự tự nhiên trong giao tiếp.

14/09

Thứ Hai · 1 tin

11/09

Thứ Sáu · 2 tin
The Decoder: AI News
Mô hìnhĐiểm AI 73/100

Cùng sự kiệnOpenAI ra mắt API GPT-Live-1: Đột phá hội thoại song công, phản hồi tức thì

OpenAI chính thức cung cấp API GPT-Live-1 với khả năng nghe-nói đồng thời, giảm độ trễ xuống 0,8 giây và cải thiện đáng kể độ chính xác khi gọi công cụ với mức giá 0,05 USD/phút.

Cùng sự kiện, tinh chọn hiển thị «OpenAI ra mắt mô hình giọng nói song công GPT-Live-1 qua API»
OpenAI: Tin chính thức (RSS - lọc nội dung doanh nghiệp/khách hàng)
Sản phẩmĐiểm AI 70/100

Tinh chọnOpenAI ra mắt mô hình giọng nói song công GPT-Live-1 qua API

OpenAI vừa giới thiệu GPT-Live-1, mô hình giọng nói cho phép tương tác hai chiều thời gian thực, hỗ trợ tích hợp các mô hình mạnh mẽ như GPT-6 Astra với mức giá 0,05 USD mỗi phút.

Diễn biến sự kiện · 12 bài →Thêm 11 nguồn khác đưa tinX: Hongming (@hongming731)X: Testing Catalog (@testingcatalog)X: Sherwin Wu (@sherwinwu)IT HomeX: Greg Brockman (@gdb)X: Thomas Wolf (Hugging Face đồng sáng lập/CSO) (@Thom_Wolf)The Decoder: AI NewsX: Tibo (@thsottiaux)X: OpenAI Developers (@OpenAIDevs)X: Rohan Paul (@rohanpaul_ai)X: Kim (@kimmonismus)

Vì sao đáng đọc: Đây là bước tiến lớn trong tương tác giọng nói thời gian thực, mở ra khả năng ứng dụng thực tế cao cho các nhà phát triển và doanh nghiệp.

10/09

Thứ Năm · 4 tin
ModelBest OpenBMB@OpenBMB
NgànhĐiểm AI 43/100

VoxCPM kết hợp VoiceMem: Bước tiến mới cho trí tuệ nhân tạo giọng nói có trí nhớ

🎙️ VoxCPM is more than a voice generator. Developer @XieZhifei14110 integrated VoxCPM with VoiceMe…

DịchNhà phát triển XieZhifei14110 đã tích hợp mô hình VoxCPM với hệ thống VoiceMem, giúp các trợ lý giọng nói thời gian thực vừa có khả năng phát âm tự nhiên, vừa sở hữu bộ nhớ lưu trữ linh hoạt.

Tencent Hunyuan@TencentHunyuan
Mô hìnhĐiểm AI 58/100

Tencent Hunyuan ra mắt AuK: Mô hình AI nguồn mở đột phá trong tạo và chỉnh sửa giọng nói

🚀 AuK is officially here. Nano banana🍌 for audio An open-source foundation model for unified spee…

DịchTencent Hunyuan giới thiệu AuK, mô hình nền tảng hỗ trợ tạo và chỉnh sửa giọng nói đa năng từ văn bản và âm thanh mẫu, cùng phiên bản AuK-Flash tối ưu hóa với tốc độ suy luận chỉ trong 4 bước.

Testing Catalog@testingcatalog
Sản phẩmĐiểm AI 68/100

Cùng sự kiệnChatGPT cập nhật chế độ giọng nói, hỗ trợ các mô hình GPT-5.6 Sol và GPT-6 Astra

OPENAI 🔥: Voice Mode on ChatGPT now supports GPT 5.6 Sol and GPT 6 Astra. > Support for GPT 6 …

DịchOpenAI nâng cấp chế độ giọng nói trên ChatGPT, cho phép người dùng tùy chọn mô hình và cấp độ suy luận. Trong đó, GPT-6 Astra cao cấp hiện chỉ dành riêng cho người dùng gói ChatGPT Pro.

Cùng sự kiện, bài đại diện «ChatGPT Voice cập nhật mô hình GPT-6 Astra và GPT-5.6 Sol»

03/09

Thứ Năm · 1 tin

02/09

Thứ Tư · 2 tin

31/08

Thứ Hai · 1 tin
Đã tải 40 tin

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (56 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “AI giọng nói” | AIHOT.vn