# Định vị mọi thứ trong video: Giải pháp giải mã song song cho bài toán STVG hiệu quả

- Nguồn: Hugging Face Daily Papers
- Thời gian phát hành: 2026-08-31 07:00 (giờ Việt Nam)
- Điểm AI: 85/100
- Link AIHOT.vn: https://aihot.vn/items/9038cf28c70d7ede
- Link gốc: https://arxiv.org/abs/2608.28192

## Tóm tắt AI

Nghiên cứu giới thiệu Parallel Tube Decoding (PTD), phương pháp giúp định vị đối tượng trong video nhanh chóng bằng cách giải mã song song thay vì tuần tự, loại bỏ độ trễ và lỗi tích lũy so với các mô hình ngôn ngữ đa phương thức hiện nay.

## Thân bài

Xem PDF HTML (thử nghiệm)

DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

### Lịch sử gửi bài

Từ: Hanoona Bangalath Rasheed Ms [xem email] [v1] Thứ Sáu, 28 tháng 8 năm 2026 11:05:30 UTC (2.234 KB)
