Nvidia vừa phát hành mô hình Nemotron 3 Diarization với 100 triệu tham số, cho phép nhận diện và phân tách giọng nói của tối đa 8 người cùng lúc trong thời gian thực, hỗ trợ cả ghi âm và luồng âm thanh trực tiếp.
Take the wheel and drive across open terrain. #PixVerseWorldModel Change the world without stopping….
DịchPixVerse R2 là mô hình thế giới thời gian thực mới, cho phép người dùng điều khiển, chỉnh sửa môi trường và tương tác với các nhân vật có khả năng ghi nhớ thông qua câu lệnh.
Đội ngũ Qwen của Alibaba vừa giới thiệu mô hình Qwen3.8-LiveTranslate với kiến trúc Interleave mới, giúp giảm độ trễ phiên dịch xuống còn 2,3 giây và hỗ trợ lên đến 60 ngôn ngữ.
Alibaba giới thiệu Qwen3.8-LiveTranslate, mô hình thông dịch thời gian thực sử dụng kiến trúc Hybrid MoE Thinker-Talker, giúp giảm độ trễ trung bình xuống còn 2,3 giây.
Realtime-Venus là hệ thống tương tác đa phương thức sử dụng mô hình 9B, cho phép duy trì hội thoại liên tục trong khi thực hiện các tác vụ phức tạp ở chế độ nền nhờ cơ chế ủy quyền bất đồng bộ.
Thêm 1 nguồn khác đưa tinAnt Group inclusionAI: GitHub kho mã mới
Vì sao đáng đọc: Bước tiến quan trọng trong việc tối ưu hóa trải nghiệm hội thoại thời gian thực, giải quyết được bài toán xử lý đa nhiệm mà không làm gián đoạn tương tác của người dùng.
We're bringing StepAudio 3 to San Francisco this Wednesday. Live demos, an open AMA with the StepAud…
DịchStepFun mang StepAudio 3 đến San Francisco vào ngày 16/9 với các buổi demo trực tiếp, tọa đàm cùng chuyên gia về tương lai của AI thời gian thực và các giải pháp thực tế trong sản xuất.
Restaurant reservations don't always follow a script. GPT-Live-1 listens while it speaks, so caller…
DịchOpenAI giới thiệu GPT-Live-1 với khả năng lắng nghe và phản hồi tức thì, cho phép người dùng ngắt lời hoặc thay đổi yêu cầu linh hoạt. Yelp đã ứng dụng công nghệ này để tối ưu hóa trải nghiệm đặt bàn tại nhà hàng.
OpenAI chính thức đưa GPT-Live-1 vào API, cho phép xây dựng các trợ lý giọng nói có độ trễ thấp, hỗ trợ đàm thoại hai chiều, xử lý ngắt lời và tích hợp gọi công cụ linh hoạt.
GPT-Live-1 is now available in the API. Bring ChatGPT's natural back-and-forth to your app, with vo…
DịchOpenAI vừa ra mắt API cho GPT-Live-1, cho phép các nhà phát triển tích hợp trải nghiệm hội thoại tự nhiên như ChatGPT vào ứng dụng, hỗ trợ tính năng vừa nghe vừa nói cùng khả năng tùy biến mô hình linh hoạt.
It's crazy how far small models can be pushed. Robbyant just open-sourced LingBot-World 2.0 Small, …
DịchRobbyant vừa mã nguồn mở LingBot-World 2.0 Small, mô hình thế giới 1.3B có khả năng tạo môi trường tương tác thời gian thực ở độ phân giải 720p/60fps trên GPU tiêu dùng, mở ra hướng đi mới cho việc tối ưu hóa mô hình AI trên phần cứng cá nhân.
Tại sự kiện IBC ở Amsterdam, NVIDIA giới thiệu các giải pháp AI thời gian thực đột phá, hứa hẹn thay đổi cách thức sản xuất và phân phối nội dung trong ngành truyền thông toàn cầu.
DịchFei-Fei Li vừa xác nhận mô hình Atlas của World Labs đã có thể hoạt động trong thời gian thực, đánh dấu bước tiến quan trọng trong khả năng xử lý của AI.
There is a subtle architecture shift happening in voice AI. The voice stack is becoming part of the…
DịchCartesia vừa ra mắt Sonic-3.6 (Text-to-Speech) và Ink-2 (Speech-to-Text) với độ trễ cực thấp lần lượt là 90ms và 100ms, trở thành đơn vị duy nhất dẫn đầu cả hai mảng xử lý âm thanh, tối ưu hóa mạnh mẽ cho các tác nhân AI đàm thoại.
Inworld's Realtime TTS-2 is now generally available and currently ranks #1 in Artificial Analysis' C…
DịchInworld chính thức phát hành Realtime TTS-2, mô hình được đánh giá nhanh nhất phân khúc trên Artificial Analysis. Người dùng có thể tùy chỉnh cảm xúc và ngữ điệu linh hoạt thông qua mô tả văn bản, dựa trên những phản hồi tích cực từ phiên bản thử nghiệm trước đó.
Love this, another huge release from Meta. Lunched Muse Voice Transcribe for real-time voice dicta…
DịchMeta vừa giới thiệu Muse Voice Transcribe, mô hình nhận diện âm thanh thời gian thực với độ chính xác cao (tỷ lệ lỗi từ chỉ 3,1%). Công nghệ này tích hợp khả năng phân tách người nói và phát hiện điểm dừng tự động, mang lại trải nghiệm xử lý luồng âm thanh mượt mà.
Introducing Muse Voice Transcribe, the first real-time audio perception model from Meta Superintelli…
DịchMeta giới thiệu Muse Voice Transcribe, mô hình nhận diện giọng nói thời gian thực hỗ trợ đa ngôn ngữ, phân tách người nói và chuyển đổi ngôn ngữ linh hoạt. Công nghệ này hiện dẫn đầu các bảng xếp hạng về khả năng chuyển đổi giọng nói thành văn bản.
Thêm 7 nguồn khác đưa tinIT HomeX: Rohan Paul (@rohanpaul_ai)MarkTechPostX: Alexandr Wang (Scale AI nhà sáng lập/Meta Giám đốc AI) (@alexandr_wang)X: Artificial Analysis (@ArtificialAnlys)X: Testing Catalog (@testingcatalog)X: Mark Zuckerberg (@finkd)
1/ The fastest reasoning LLM is now live exclusively on OpenRouter. Mercury 2.5 Preview from @_ince…
DịchMercury 2.5 Preview vừa cập bến OpenRouter với khả năng tạo token song song, đạt tốc độ kỷ lục 1.107 token/giây, tối ưu hóa cho các tác vụ yêu cầu độ trễ cực thấp và xử lý JSON chính xác.
EditaLive là khung chỉnh sửa video nhân vật dựa trên lệnh điều khiển, tối ưu hóa mô hình Wan-Animate để đạt độ trễ thấp và giữ vững biểu cảm khuôn mặt trong livestream.
Grok Build is incredible 🔥 I just built this interactive visual that I can control with my hands. …
DịchGrok Build cho phép người dùng tương tác trực tiếp với các hiệu ứng hình ảnh thông qua camera máy tính, biến cử chỉ bàn tay thành công cụ điều khiển sáng tạo đầy ấn tượng.
Nari Labs vừa ra mắt dịch vụ mô hình đa phương thức thời gian thực, đạt tốc độ phản hồi âm thanh đầu tiên (TTFA) chỉ trong 50ms, mang lại trải nghiệm hội thoại tự nhiên cho các trợ lý ảo.
Grok Voice Think Fast 2.0 vừa thiết lập cột mốc mới trên VulcanBench, vượt qua GPT Realtime về cả độ chính xác văn bản lẫn tốc độ phản hồi giọng nói, khẳng định vị thế là mô hình suy luận thời gian thực hàng đầu.
Nhóm nghiên cứu từ USTC và Huawei giới thiệu RiO-DETR, mô hình DETR đầu tiên tối ưu hóa cho phát hiện vật thể xoay với tốc độ thực, đạt 78.4 AP50 chỉ trong 2.7ms, giải quyết triệt để bài toán độ trễ và độ chính xác trong các tác vụ viễn thám.
Vì sao đáng đọc: Đây là bước đột phá quan trọng trong kiến trúc DETR cho bài toán phát hiện vật thể xoay, kết hợp hiệu suất thực tế cao và tính ứng dụng rộng rãi trong công nghiệp.
15/08
Thứ Bảy · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
MOSS-VL là dòng mô hình ngôn ngữ thị giác tiên phong tích hợp khả năng vừa quan sát vừa phản hồi theo thời gian thực. Nhờ cơ chế chú ý chéo, mô hình đạt hiệu suất vượt trội trên các bài kiểm tra luồng dữ liệu, dẫn đầu các giải pháp mã nguồn mở hiện nay.
Vì sao đáng đọc: Đây là bước tiến quan trọng trong việc xử lý video thời gian thực, giải quyết bài toán độ trễ vốn là điểm yếu của các mô hình đa phương thức hiện nay.
Tổng 23 tin, không còn tin nào nữa
40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (36 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả
Chủ đề
Kênh
Đang lọc:Thẻ: AI thời gian thực
Toàn bộ tin AI · Thẻ “AI thời gian thực” | AIHOT.vn