18/08

Thứ Ba · 8 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 54/100

TRACE-Bench: Giải mã và đánh giá khả năng tạo ảnh từ nhiều ảnh tham chiếu

TRACE-Bench phân tách quá trình tạo ảnh từ nhiều tham chiếu thành 4 thao tác cơ bản, giúp chỉ ra rằng các mô hình AI hiện nay vẫn gặp khó khăn lớn trong việc tách biệt và gán thuộc tính chính xác.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 53/100

Đột phá mô hình khuếch tán: Chiến lược 'Latent-to-Pixel' giúp tăng tốc suy luận lên tới 4,75 lần

Nghiên cứu đề xuất chiến lược huấn luyện mới bằng cách tận dụng tiền đề từ không gian tiềm ẩn (latent) trước khi chuyển sang không gian pixel, giúp mô hình đạt hiệu suất vượt trội và tăng tốc độ suy luận đáng kể so với các phương pháp truyền thống.

JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnECCV 2026: OVOW - Biến video đơn lẻ thành thế giới 4D có thể mô phỏng vật lý

OVOW là bước đột phá giúp chuyển đổi video đơn lẻ thành các mô hình 4D dạng Mesh có thể tương tác, hỗ trợ đắc lực cho việc huấn luyện robot trong môi trường mô phỏng thực tế mà không cần dựng hình thủ công.


Vì sao đáng đọc: Nghiên cứu giải quyết bài toán cốt lõi trong huấn luyện robot (Real2Sim) bằng cách tự động hóa việc tạo môi trường mô phỏng từ video, có tính ứng dụng thực tiễn rất cao.

17/08

Thứ Hai · 9 tin
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Hướng dẫnĐiểm AI 59/100

GPT-5.6 Sol: Mô hình thị giác mạnh mẽ nhất từ trước đến nay của OpenAI

Dòng GPT-5.6 mới của OpenAI, đặc biệt là phiên bản Sol, đã thiết lập tiêu chuẩn mới về khả năng thị giác máy tính với hiệu suất vượt trội trong các bài kiểm tra phát hiện vật thể và đếm đối tượng so với thế hệ tiền nhiệm.

Thêm 1 nguồn khác đưa tinIT Home
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

S^2VOPD: Phương pháp chưng cất mô hình thị giác tự giám sát không cần dữ liệu đặc quyền

Nghiên cứu giới thiệu S^2VOPD, phương pháp tạo tín hiệu học tập bằng cách lược bỏ thông tin từ mô hình học sinh thay vì bổ sung dữ liệu cho giáo viên, giúp huấn luyện mô hình thị giác hiệu quả mà không cần nhãn hay mô hình giáo viên mạnh.

JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnECCV 2026: Vinci2 đưa trợ lý AI góc nhìn thứ nhất từ 'hỏi đáp thụ động' sang 'chủ động hỗ trợ'

Vinci2 giải quyết bài toán khó khi nào AI nên chủ động lên tiếng bằng cách kết hợp ra quyết định và tạo nội dung dựa trên dòng video liên tục và bộ nhớ dài hạn, giúp trợ lý AI hiểu ngữ cảnh và thói quen người dùng tốt hơn.


Vì sao đáng đọc: Nghiên cứu đột phá tại ECCV 2026, giải quyết vấn đề thực tế trong tương tác người-AI (trợ lý chủ động), có tính ứng dụng cao cho kính thông minh và thiết bị đeo.
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Hướng dẫnĐiểm AI 41/100

Đánh giá Qwen 3.8 27B: Hiệu năng ấn tượng nhưng mặc định lại 'suy nghĩ quá đà'

Alibaba vừa ra mắt mô hình thị giác Qwen 3.8 27B với hiệu suất vượt trội. Tuy nhiên, chế độ 'suy nghĩ' mặc định khiến tốc độ phản hồi chậm, người dùng cần tùy chỉnh để tối ưu hóa trải nghiệm.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

SPARGen: Hợp nhất nhận thức và suy luận không gian thông qua mô hình tạo sinh đa phương thức

SPARGen là khung làm việc đa phương thức thống nhất, giải quyết các bài toán tái dựng 3D, tương ứng mật độ và suy luận không gian bằng cách chuyển đổi chúng thành các tác vụ tạo sinh có điều kiện, giúp tối ưu hóa khả năng biểu diễn không gian.

15/08

Thứ Bảy · 2 tin

14/08

Thứ Sáu · 9 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 55/100

LiveAnimate: Hệ thống tạo video người chuyển động thời gian thực với độ ổn định cao

LiveAnimate là hệ thống tạo hoạt ảnh người dùng mô hình DiT 14B, cho phép tạo video dài ổn định với độ trễ thấp nhờ cơ chế PR-Sink và tối ưu hóa quy trình lấy mẫu chỉ trong 3 bước.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 40/100

CW-BASS v2: Giải pháp chọn nhãn giả dựa trên độ bão hòa cho mô hình phân đoạn bán giám sát

CW-BASS v2 giải quyết vấn đề bão hòa độ tin cậy khi dùng DINOv2 làm giáo viên trong phân đoạn bán giám sát, giúp cải thiện đáng kể hiệu suất trên các tập dữ liệu như ADE20K.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 49/100

Spatial Memory Agent: Tối ưu hóa suy luận không gian cho mô hình VLM mà không cần huấn luyện lại

Spatial Memory Agent (SMA) là khung tự tiến hóa giúp các mô hình VLM đóng băng cải thiện khả năng suy luận không gian thông qua việc đúc kết kinh nghiệm và đánh giá độ tin cậy, đạt hiệu suất vượt trội trên nhiều tiêu chuẩn đánh giá.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 50/100

DreamX-Phi 1.0: Mô hình thế giới video điều khiển bằng hành động cho robot

DreamX-Phi 1.0 là mô hình thế giới video dự đoán trạng thái tương lai dựa trên hình ảnh, lệnh ngôn ngữ và chuỗi hành động. Mô hình tối ưu hóa khả năng điều khiển robot thông qua mã hóa hình học PRoPE và kỹ thuật duy trì tính nhất quán của vật thể.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 36/100

Nghiên cứu Meta & Oxford: Mô hình đa phương thức chỉ cần 5% dữ liệu tạo ảnh để đạt hiệu suất tối ưu

The Meta/Oxford study finds, a multimodal model may need surprisingly little image-generation data i…

DịchNghiên cứu chỉ ra rằng việc cân bằng tỷ lệ dữ liệu ngôn ngữ và hình ảnh giúp mô hình đa phương thức đạt hiệu suất cao hơn dù giảm 5 lần dữ liệu tạo ảnh. Đồng thời, việc đưa hình ảnh vào quá muộn dễ gây ra tình trạng 'lười thị giác', khiến mô hình quá phụ thuộc vào ngôn ngữ.

Kim@kimmonismus
Sản phẩmĐiểm AI 35/100

Robot hút bụi Matic: Từ bỏ LiDAR, chuyển sang công nghệ thị giác máy tính

This is so cool: Matic put the same vision-first bet Tesla made for self driving into a robot that c…

DịchMatic áp dụng triết lý thị giác của Tesla cho robot hút bụi, sử dụng 5 camera RGB-IR và chip NVIDIA Jetson Orin để nhận diện vật thể thông minh mà không cần LiDAR. Sản phẩm nhận đánh giá tuyệt đối 10/10 từ WIRED nhờ khả năng xử lý 3D thời gian thực.

13/08

Thứ Năm · 6 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 45/100

Hand Visibility Detector: Bước tiến mới trong việc xác định độ hiển thị của khớp tay

Hand Visibility Detector là hệ thống đầu tiên chuyên biệt hóa việc ước tính độ hiển thị của từng khớp tay, giúp tối ưu hóa độ chính xác cho các tác vụ 3D và thực tế ảo (AR/VR). Công cụ này hiện đã được phát hành dưới dạng mã nguồn mở để cộng đồng dễ dàng tích hợp.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnAtlasVLA: Bước tiến mới trong mô hình VLA với khả năng ghi nhớ trạng thái thế giới bền vững

AtlasVLA giải quyết hạn chế của các mô hình VLA truyền thống bằng cách tích hợp bộ nhớ không gian 4D và trạng thái làm việc cá nhân, giúp robot duy trì nhận thức về môi trường và tiến độ công việc ngay cả khi vật thể nằm ngoài tầm nhìn.


Vì sao đáng đọc: Đây là nghiên cứu quan trọng giải quyết điểm yếu cốt lõi của robot AI hiện nay là khả năng ghi nhớ dài hạn, có tiềm năng ứng dụng cao trong tự động hóa thực tế.
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Self-Geometry: Tối ưu hóa tính nhất quán hình học cho các mô hình thị giác máy tính 3D

Self-Geometry là giải pháp plug-and-play giúp các mô hình thị giác nền tảng tự điều chỉnh trong quá trình kiểm thử, bằng cách áp đặt các ràng buộc hình học đa góc nhìn thông qua tương quan pixel mà không cần dữ liệu huấn luyện.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Ảo tưởng về công cụ thị giác: Đánh giá nhân quả khả năng 'tư duy bằng hình ảnh' của LLM

Nghiên cứu chỉ ra rằng các thao tác thị giác như cắt/phóng ảnh trong LLM đa phương thức thường không cải thiện hiệu suất đáng kể mà lại gây tốn kém tài nguyên. Tác giả đề xuất mô hình đồ thị nhân quả để kiểm chứng liệu các công cụ này có thực sự hỗ trợ tư duy hay chỉ là sự ngẫu nhiên.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 39/100

S2R-Removal: Mô hình khuếch tán đầu tiên giúp loại bỏ phản chiếu trong video

S2R là khung làm việc toàn diện đầu tiên kết hợp mô phỏng vật lý, khử phản chiếu video bằng mô hình khuếch tán và bộ tiêu chuẩn đánh giá mới, giúp khôi phục video sắc nét chỉ với một bước khử nhiễu.

12/08

Thứ Tư · 6 tin
Aidan Gomez (Cohere CEO)@aidangomez
Mô hìnhĐiểm AI 58/100

Cohere ra mắt North Micro Vision: Mô hình thị giác máy tính mã nguồn mở cho doanh nghiệp

North Micro Vision is our new quick, smart, and Apache 2 vision model for enterprise document unders…

DịchCohere vừa giới thiệu North Micro Vision, mô hình thị giác máy tính mã nguồn mở theo giấy phép Apache 2, được tối ưu hóa đặc biệt cho khả năng hiểu và xử lý tài liệu doanh nghiệp.

Cohere@cohere
Mô hìnhĐiểm AI 56/100

Cohere ra mắt North Micro Vision: Mô hình thị giác nhỏ gọn, chuyên xử lý tài liệu phức tạp

Today, we're adding another member to our model family. Meet North Micro Vision. Our smallest visio…

DịchCohere vừa giới thiệu North Micro Vision, mô hình ngôn ngữ thị giác nhỏ nhất của hãng, được tối ưu hóa cho việc hiểu tài liệu phức tạp và phát hành mã nguồn mở theo giấy phép Apache 2.0.

Thêm 1 nguồn khác đưa tinX: Aidan Gomez (Cohere CEO, @aidangomez)
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

iFAN: Tối ưu hóa học máy dựa trên suy luận cho mô hình Mask Transformer

iFAN giải quyết sự lệch pha giữa quá trình huấn luyện và suy luận trong các mô hình Mask Transformer bằng cách điều chỉnh thứ hạng xác suất và chưng cất tri thức giữa các lớp, giúp cải thiện độ chính xác của phân đoạn hình ảnh.

Tổng 36 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (37 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “thị giác máy tính” — Trang 6 | AIHOT.vn