Runway ra mắt GWM Worlds 2, mô hình tạo video và âm thanh độ phân giải cao theo thời gian thực, tích hợp WorldPrompt cho phép kiểm soát chi tiết bối cảnh, nhân vật và góc máy thông qua sự kiện có gắn dấu thời gian.
Take the wheel and drive across open terrain. #PixVerseWorldModel Change the world without stopping….
DịchPixVerse R2 là mô hình thế giới thời gian thực mới, cho phép người dùng điều khiển, chỉnh sửa môi trường và tương tác với các nhân vật có khả năng ghi nhớ thông qua câu lệnh.
Runway giới thiệu mô hình thế giới GWM-1 cho phép tạo video dạng luồng (stream) ngay khi người dùng nhập mô tả, thay vì phải chờ đợi kết quả hoàn chỉnh. Công nghệ này sử dụng cơ chế tự huấn luyện để giảm thiểu sai số trong quá trình tạo hình liên tục.
DịchAlibaba Cloud giới thiệu Qwen3.8-LiveTranslate, mô hình dịch thuật thời gian thực hỗ trợ 60 ngôn ngữ với độ trễ giảm xuống còn 2,3 giây. Công nghệ này tích hợp tính năng tách lời người nói, sao chép giọng nói ổn định và khả năng xử lý ngữ cảnh dài để dịch thuật chính xác hơn.
StepAudio 3 giới thiệu cơ chế 'Think-While-Speaking' cho phép AI suy luận chuyên sâu song song với việc phản hồi bằng giọng nói, tạo ra trải nghiệm hội thoại tự nhiên, mượt mà và có độ trễ cực thấp.
Vì sao đáng đọc: Đây là một nghiên cứu quan trọng giải quyết bài toán hóc búa về độ trễ trong AI hội thoại, mang tính ứng dụng cao cho các trợ lý ảo thế hệ mới.
Vidu S2 của Shengshu Technology mang đến khả năng chỉnh sửa video và tương tác với nhân vật ảo theo thời gian thực cực mượt mà, cho phép thay đổi phong cách, nhân vật hoặc bối cảnh ngay trong khi quay mà vẫn giữ nguyên chuyển động gốc.
Vidu S2 giới thiệu khả năng tạo avatar kỹ thuật số và chỉnh sửa video thời gian thực với độ phân giải 720p, hỗ trợ thay đổi trang phục, bối cảnh và tạo video không gian linh hoạt.
Vì sao đáng đọc: Đây là bước đột phá lớn về tốc độ xử lý video AI, giải quyết được bài toán độ trễ vốn là rào cản lớn nhất hiện nay, có tính ứng dụng thực tế cực cao.
We believe instant generation is where video models are headed. Last week, we released Solaris and G…
DịchRunway khẳng định tạo video tức thời là tương lai của các mô hình video, đồng thời công bố lộ trình nghiên cứu chuyên sâu về cách huấn luyện tác nhân AI trong môi trường thực tế và kỹ thuật số.
Meta giới thiệu Muse Voice Transcribe, mô hình AI tích hợp nhận diện giọng nói, tách lời và phát hiện điểm dừng theo thời gian thực với chi phí 3 USD/1000 phút.
A new kind of video generator model just dropped. Orbis 1.0 from Visko, a real-time, steerable vide…
DịchVisko giới thiệu Orbis 1.0, mô hình tạo video trực tiếp đầu tiên có khả năng duy trì thế giới ảo liên tục, hỗ trợ tương tác vật lý và bộ nhớ dài hạn trong thời gian thực.
MiniMax H3 Max gây ấn tượng với khả năng tạo video AI nhanh hơn tốc độ phát, mở ra kỷ nguyên tương tác thời gian thực và chính thức vận hành kênh livestream AI hoạt động liên tục 24 giờ.
Matrix-Game 3.5 nâng cấp khả năng mô phỏng thế giới ảo tương tác dài hạn bằng cách tích hợp bộ nhớ hình học 3D, giúp duy trì tính nhất quán của cảnh vật và camera mà không làm tăng tham số học máy.
Vì sao đáng đọc: Đây là bước tiến quan trọng trong mô phỏng thế giới ảo thời gian thực, giải quyết bài toán khó về tính nhất quán hình học cho game và robot, rất đáng chú ý cho giới nghiên cứu.
A line in AI video was crossed, in my experiments with just the web interface, H3 Max can now create…
DịchH3 Max đã đạt cột mốc quan trọng khi có thể tạo video AI chất lượng ổn định với tốc độ nhanh hơn cả thời lượng video, mang lại trải nghiệm thời gian thực ngay trên trình duyệt.
LiveAnimate là hệ thống tạo hoạt ảnh người dùng mô hình DiT 14B, cho phép tạo video dài ổn định với độ trễ thấp nhờ cơ chế PR-Sink và tối ưu hóa quy trình lấy mẫu chỉ trong 3 bước.