18/09

Thứ Sáu · 6 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 36/100

FAMOS: Mô hình dự đoán khớp nối vật thể 3D từ dữ liệu quan sát thưa thớt

FAMOS là mô hình Transformer tiên phong giúp dự đoán phân đoạn bộ phận và tham số khớp nối của vật thể 3D từ các đám mây điểm rời rạc, hỗ trợ linh hoạt ngay cả với dữ liệu đầu vào từ một góc nhìn duy nhất.

Rohan Paul@rohanpaul_ai
Quan điểmĐiểm AI 35/100

Fei-Fei Li tại Stanford: Lịch sử 540 triệu năm của thị giác chính là lịch sử tiến hóa trí tuệ

Stanford deep learning for computer Vision taught by Professor Fei-Fei Li (@drfeifei) "Evolutiona…

DịchTrong khóa học về thị giác máy tính tại Stanford, Fei-Fei Li khẳng định thị giác và xúc giác là những giác quan cổ xưa nhất, đóng vai trò then chốt trong việc thúc đẩy sự phát triển của hệ thần kinh và trí tuệ sinh học suốt hàng triệu năm qua.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 36/100

WeVisDoc: Khung phân tích tài liệu hai giai đoạn đạt 95.38 điểm trên OmniDocBench

WeVisDoc là khung phân tích tài liệu end-to-end tối ưu hóa dữ liệu qua hai giai đoạn: mở rộng độ bao phủ ngữ nghĩa và tinh chỉnh cấu trúc thông qua cơ chế dò lỗi thông minh, giúp nâng cao độ chính xác vượt trội.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 43/100

VA-Bench: Bước tiến mới trong đánh giá trí tuệ không gian cho robot thông qua quan sát và hành động

VA-Bench là bộ tiêu chuẩn mới đánh giá khả năng 'quan sát-suy luận-hành động-điều chỉnh' của mô hình đa phương thức (MLLM) trong môi trường robot, nơi mô hình tự học từ video RGB và điều khiển hành động thực tế.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 43/100

Vision-RL2: Tối ưu hóa chiến lược cấp vùng cho mô hình ngôn ngữ đa phương thức (MLLM)

Vision-RL2 sử dụng học tăng cường cấp vùng để tối ưu hóa mạng đề xuất khu vực trong MLLM mà không cần nhãn dữ liệu, giúp cải thiện độ chính xác vượt trội với số lượng token thị giác ít hơn gấp 4 lần.

17/09

Thứ Năm · 7 tin
Pandaily
Mô hìnhĐiểm AI 88/100

Tinh chọnLight Origins ra mắt mã nguồn mở LightNav-0: Bộ não điều hướng đa năng cho robot

LightNav-0 là mô hình điều hướng dựa trên Qwen3-VL-4B, được huấn luyện qua quy trình Real2Sim2Real với hơn 4.000 giờ dữ liệu VLA, đạt hiệu suất dẫn đầu trên 10 bảng xếp hạng điều hướng đơn thị giác.


Vì sao đáng đọc: Bước tiến quan trọng trong điều hướng robot với khả năng zero-shot ấn tượng, mã nguồn mở giúp thúc đẩy nghiên cứu thực tiễn trong cộng đồng AI.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 39/100

PANORAMA: Mô hình VLM đột phá trong việc định vị và mô tả toàn cảnh hình ảnh

PANORAMA là mô hình VLM mới giúp định vị và mô tả chi tiết cả vật thể lẫn bối cảnh ở cấp độ pixel. Nghiên cứu còn giới thiệu bộ dữ liệu PanoCaps và các chỉ số đánh giá mới, thiết lập tiêu chuẩn hiệu năng vượt trội trong các tác vụ thị giác máy tính.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

EventEgoHands++: Tái tạo lưới bàn tay 3D từ camera sự kiện trong góc nhìn thứ nhất

Nghiên cứu giới thiệu phương pháp tái tạo lưới bàn tay 3D bằng camera sự kiện, khắc phục nhược điểm thiếu sáng và nhòe chuyển động của camera truyền thống, đồng thời giải quyết bài toán phân biệt tay trái - phải trong môi trường thực tế.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 75/100

Ánh mắt như bằng chứng của sự đồng thuận: Phân tích so sánh qua MapTask và MUNDEX

Nghiên cứu phân tích cách ánh mắt phản ánh sự hiểu biết chung trong các nhiệm vụ hợp tác. Kết quả cho thấy khi người tham gia đạt được sự đồng thuận, ánh mắt tập trung nhiều hơn vào nhiệm vụ và ít hướng về đối phương hơn.

16/09

Thứ Tư · 4 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

OmniHarness: Tối ưu hóa tạo ảnh đa năng thông qua học chính sách biểu tượng

OmniHarness là khung làm việc mới giúp cải thiện khả năng tạo ảnh đa năng bằng cách chuyển đổi các quy trình thực thi thành chính sách biểu tượng có thể tái sử dụng, giúp hệ thống tự học và thích nghi với các tác vụ mới hiệu quả hơn.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 40/100

ModAR: Mô hình thế giới-hành động tự hồi quy đa phương thức đột phá

ModAR là mô hình thế giới-hành động đầu tiên sử dụng cơ chế khử nhiễu tự hồi quy trên nhiều phương thức tương lai, giúp tối ưu hóa dự đoán hành động với hiệu suất vượt trội và chi phí tính toán thấp hơn 20 lần so với các phương pháp hiện tại.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 37/100

PhysStream: Đột phá tạo video vật lý với khả năng ghi nhớ cảnh và kiểm soát chuyển động chi tiết

PhysStream là mô hình tạo video tự hồi quy sử dụng bộ nhớ cảnh có cấu trúc và tín hiệu vận tốc để kiểm soát chuyển động chính xác, vượt trội hơn các mô hình hiện tại về độ chính xác quỹ đạo và sự ưa thích của người dùng.

OpenRouter: Announcements
Hướng dẫnĐiểm AI 73/100

Tinh chọnDeepSeek V4 nào hỗ trợ nhập liệu hình ảnh? Hướng dẫn chi tiết từ OpenRouter

OpenRouter tổng hợp khả năng hỗ trợ hình ảnh của dòng DeepSeek V4, trong đó phiên bản V4.1 Flash đã hỗ trợ đọc ảnh trực tiếp với chi phí tối ưu từ ngày 10/9/2026.


Vì sao đáng đọc: Thông tin cập nhật kịp thời về khả năng đa phương thức của mô hình DeepSeek, rất hữu ích cho người dùng muốn tối ưu chi phí và công cụ lập trình.

15/09

Thứ Ba · 7 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnECCV 2026: REAL - Bước tiến mới giúp robot tự chủ trong thế giới thực mà không cần 'góc nhìn thượng đế'

Nhóm nghiên cứu từ Thượng Hải giới thiệu REAL, khung làm việc cho robot giúp giải quyết các yêu cầu mơ hồ và môi trường chưa biết, cho phép robot chủ động khám phá và tương tác với người dùng thay vì dựa vào dữ liệu hoàn hảo.


Vì sao đáng đọc: Đề tài (Embodied AI) đang là xu hướng nóng. Bài báo giải quyết vấn đề thực tế về sự thiếu hụt thông tin trong môi trường thực, có tính ứng dụng cao và đã được ECCV 2026 chấp nhận.
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnAlayaVista: Mô hình thế giới video streaming kết hợp toàn cảnh và góc nhìn chi tiết

AlayaVista là mô hình thế giới video mới giúp tách biệt quá trình tiến hóa của bối cảnh toàn cảnh 360 độ với việc tổng hợp hình ảnh góc nhìn chi tiết, cho phép điều khiển camera mượt mà và duy trì độ trung thực cao.


Vì sao đáng đọc: Đột phá trong cách xử lý bối cảnh 360 độ kết hợp với video streaming, giải quyết hiệu quả bài toán đánh đổi giữa tầm nhìn bao quát và độ chi tiết trong mô hình thế giới.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 48/100

PhysBrain 1.5: Bước tiến từ mô hình ngôn ngữ thị giác đến mô hình nền tảng vật lý

PhysBrain 1.5 là mô hình tiên phong hợp nhất khả năng hiểu môi trường vật lý, điều khiển hành động và dự đoán tương lai thông qua cơ chế tự hồi quy, biến các tín hiệu thị giác và vận động thành chuỗi token thống nhất.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 40/100

BVB: Dùng Blender tái tạo video để kiểm chứng khả năng hiểu hình ảnh của AI

BVB (Blender-VideoBench) là bộ tiêu chuẩn mới yêu cầu AI tái tạo video thực thành hoạt cảnh Blender. Kết quả cho thấy dù mô hình có thể mô phỏng hình ảnh tốt, chúng vẫn gặp khó khăn lớn trong việc duy trì tính chính xác của các sự kiện theo thời gian.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Attention-DP3: Tối ưu hóa chính sách khuếch tán 3D thông qua cơ chế chú ý nhận diện vật thể

Attention-DP3 cải thiện khả năng thao tác robot trong môi trường phức tạp bằng cách tích hợp thông tin hình học cấp vật thể vào mô hình khuếch tán 3D, giúp robot định vị mục tiêu chính xác hơn ngay cả khi bị che khuất.

14/09

Thứ Hai · 6 tin

12/09

Thứ Bảy · 2 tin
Latent Space
Mô hìnhĐiểm AI 85/100

Cùng sự kiệnDeepSeek v4.1-Flash: Kiến trúc Encoder-Decoder đột phá đánh dấu sự trở lại đầy ấn tượng

DeepSeek ra mắt kiến trúc 763B tham số mới tích hợp thị giác máy tính, một bước tiến mạnh mẽ khiến giới chuyên gia cho rằng đây xứng đáng là phiên bản v5.

Cùng sự kiện, tinh chọn hiển thị «DeepSeek ra mắt DeepSeek-V4.1-Flash: Cửa sổ 1M token, tối ưu bộ nhớ KV Cache cực đỉnh»
Rohan Paul@rohanpaul_ai
NgànhĐiểm AI 43/100

Google DeepMind: Mô hình thế giới thị giác là chìa khóa dẫn đến AGI

Google DeepMind + Harvard + Stanford and many other top labs paper argues that a path to AGI may be …

DịchNghiên cứu mới từ DeepMind và các đại học danh tiếng khẳng định AGI cần các hệ thống thị giác biết học hỏi từ tương tác thực tế thay vì chỉ xử lý ngôn ngữ, nhằm hiểu sâu sắc về sự thay đổi và dự đoán tương lai.

11/09

Thứ Sáu · 11 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnTừ GitHub Trending đến ECCV Oral: LingBot-Map định nghĩa lại khả năng ghi nhớ không gian của robot

LingBot-Map là mô hình tái tạo 3D thời gian thực đột phá, cho phép robot ghi nhớ môi trường chỉ với một camera RGB thông thường. Dự án mã nguồn mở này đã thu hút cộng đồng lớn và được vinh danh tại hội nghị ECCV 2026.


Vì sao đáng đọc: Dự án kết hợp hoàn hảo giữa tính ứng dụng thực tế (mã nguồn mở phổ biến) và giá trị học thuật cao (ECCV Oral), là chủ đề rất được quan tâm trong giới AI và robotics.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 48/100

FreeFlow: Transformer phân cấp đột phá, thiết lập kỷ lục mới cho bài toán ước tính luồng quang học

Nhóm nghiên cứu từ ĐH Quốc gia Moscow giới thiệu FreeFlow, kiến trúc Transformer tinh gọn không cần các thành phần chuyên dụng như warping hay volume tương quan, đạt hiệu suất dẫn đầu trên các bộ dữ liệu Sintel, KITTI-2015 và Spring.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 47/100

GLIE: Phương pháp nhúng tương tác hậu kỳ tạo sinh tối ưu cho truy xuất tài liệu thị giác

GLIE giải quyết bài toán lưu trữ lớn trong truy xuất tài liệu bằng cách sử dụng k vector tâm chuẩn hóa để lập chỉ mục, sau đó dùng bộ giải mã để tái tạo và tái xếp hạng chính xác, giúp tối ưu hóa hiệu suất mà vẫn đảm bảo độ chính xác.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 38/100

RCWM: Tái tạo thế giới 3D phức tạp từ một ảnh duy nhất bằng mô hình lập trình đệ quy

RCWM sử dụng các chương trình cảnh đệ quy (RSP) và bộ giải xây dựng để tái tạo không gian 3D chi tiết chỉ từ một hình ảnh tham chiếu duy nhất, mở ra hướng đi mới cho mô hình thế giới.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 41/100

World in World: Bước tiến mới trong việc điều khiển và tương tác với mô hình thế giới video

World in World (WiW) là phương pháp đột phá cho phép tương tác và điều khiển video thời gian thực mà không cần huấn luyện lại mô hình, thông qua việc tích hợp trực tiếp dữ liệu hình ảnh vào các mô hình thế giới có sẵn.

Đã tải 40 tin

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (64 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Thị giác máy tính” — Trang 2 | AIHOT.vn