27/08

Thứ Năm · 5 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Tác nhân mô-đun giúp xác thực quan hệ không gian chính xác và minh bạch trong ảnh chụp CT

Hệ thống mới giúp khắc phục điểm yếu về suy luận không gian của các mô hình ngôn ngữ thị giác trong y tế bằng cách phân tách quy trình thành các bước phân tích ngôn ngữ, định vị giải phẫu và tính toán hình học xác định.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 56/100

V-Rubrics: Tối ưu hóa độ trung thực thị giác cho mô hình đa phương thức bằng học tăng cường

V-Rubrics cải thiện độ chính xác của mô hình thị giác-ngôn ngữ bằng cách phân tách câu trả lời thành các mệnh đề nguyên tử và chấm điểm dựa trên độ trung thực, tính nhất quán và khả năng tuân thủ chỉ dẫn, giúp mô hình suy luận tốt hơn thông qua phương pháp GRPO.

26/08

Thứ Tư · 4 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 50/100

G2WEngine: Khai phá video game thực tế để huấn luyện mô hình thế giới

G2WEngine là khung làm việc tự động loại bỏ giao diện người dùng (UI) khỏi video game, tạo ra bộ dữ liệu chất lượng cao giúp cải thiện đáng kể hiệu suất của các mô hình thế giới và tác vụ xử lý hình ảnh.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 46/100

DiffusionOPSD: Khung tự chưng cất chiến lược trực tuyến cho mô hình khuếch tán

DiffusionOPSD tối ưu hóa mô hình khuếch tán bằng cách chuyển đổi phần thưởng hình ảnh thành mục tiêu dự đoán trực tiếp, giúp cải thiện đáng kể hiệu suất và giảm tới 63% thời gian huấn luyện so với các phương pháp hiện có.

25/08

Thứ Ba · 2 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

EXPL-FR: Giải mã mô hình nhận diện khuôn mặt thông qua sự kết hợp giữa thị giác và ngôn ngữ

EXPL-FR sử dụng bộ chuyển đổi nhẹ để liên kết mô hình ngôn ngữ thị giác với không gian nhúng của nhận diện khuôn mặt, cho phép giải thích các đặc điểm ngữ nghĩa mà mô hình dựa vào mà không cần huấn luyện lại.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 37/100

ReWorld: Mô hình thế giới tương tác với khả năng ghi nhớ dài hạn

ReWorld tối ưu hóa mô hình thế giới bằng cách tách biệt điều khiển và bộ nhớ, cho phép xử lý video thời gian thực với độ chính xác cao và khả năng ghi nhớ lịch sử dài hạn vượt trội so với các mô hình hiện nay.

24/08

Thứ Hai · 6 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnĐột phá trên Science Robotics: Nhóm nghiên cứu Thanh Hoa mất 22 năm để dạy robot đá bóng

Nhóm nghiên cứu từ Đại học Thanh Hoa đã phát triển khung học tập dựa trên thị giác, giúp robot hình người thực hiện các kỹ năng đá bóng linh hoạt trong môi trường thực tế, đánh dấu cột mốc quan trọng sau 22 năm kiên trì nghiên cứu.


Vì sao đáng đọc: Đây là nghiên cứu đột phá được đăng trên tạp chí Science Robotics danh giá, thể hiện sự kết hợp xuất sắc giữa thị giác máy tính và điều khiển robot trong môi trường thực tế.
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

EviRank: Giải pháp tối ưu hóa tìm kiếm ảnh đa phương thức dựa trên bằng chứng ngữ nghĩa

EviRank chuyển đổi bài toán tìm kiếm ảnh phức tạp thành dạng kiểm chứng ràng buộc, giúp phân tích chính xác các yêu cầu về thực thể và thuộc tính, từ đó cải thiện độ chính xác khi truy vấn ảnh đa phương thức.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

OmniAssistBench: Bộ tiêu chuẩn đánh giá khả năng tương tác thời gian thực của các mô hình Omni-LLM

OmniAssistBench là bộ tiêu chuẩn mới giúp đánh giá khả năng làm trợ lý video thời gian thực của các mô hình Omni-LLM, giải quyết thách thức trong việc đo lường các tương tác động mà các tập dữ liệu tĩnh hiện nay chưa đáp ứng được.

23/08

Chủ Nhật · 1 tin

22/08

Thứ Bảy · 1 tin
The Decoder: AI News
Mô hìnhĐiểm AI 61/100

Cùng sự kiệnDeepSeek ra mắt mô hình thị giác V4-Flash-Vision-Exp, thách thức hiệu năng của Opus 4.8

DeepSeek vừa giới thiệu mô hình đa phương thức V4-Flash-Vision-Exp với khả năng suy luận văn bản mạnh mẽ và hiệu suất tiệm cận Opus 4.8 trong các bài kiểm tra tác tử AI. Mô hình hỗ trợ API linh hoạt, cho phép xử lý tới 600 ảnh mỗi yêu cầu với chi phí tối ưu.

Cùng sự kiện, bài đại diện «DeepSeek ra mắt mô hình đa phương thức thử nghiệm V4-Flash-Vision-Exp»

21/08

Thứ Sáu · 8 tin
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Mô hìnhĐiểm AI 45/100

DeepSeek ra mắt mô hình DeepSeek-v4-flash-vision-exp: Hỗ trợ đa phương thức hình ảnh và văn bản

DeepSeek vừa giới thiệu phiên bản thử nghiệm DeepSeek-v4-flash-vision-exp, cho phép người dùng phân tích hình ảnh, trích xuất văn bản từ ảnh chụp màn hình và đọc hiểu biểu đồ một cách hiệu quả.

IT Home
Mô hìnhĐiểm AI 63/100

Cùng sự kiệnDeepSeek ra mắt mô hình đa phương thức V4-Flash-Vision-Exp trên nền tảng API

DeepSeek vừa trình làng mô hình thị giác máy tính V4-Flash-Vision-Exp với khả năng hiểu hình ảnh vượt trội, tiệm cận hiệu suất của Opus-4.8. Dịch vụ đã sẵn sàng trên API với cơ chế tính phí theo token linh hoạt, hỗ trợ đa dạng phương thức truyền tải hình ảnh.

Cùng sự kiện, bài đại diện «DeepSeek ra mắt mô hình đa phương thức thử nghiệm V4-Flash-Vision-Exp»
WeChat: DeepSeek
Mô hìnhĐiểm AI 73/100

Tinh chọnDeepSeek ra mắt mô hình thị giác đa phương thức V4-Flash-Vision-Exp

DeepSeek vừa trình làng V4-Flash-Vision-Exp, mô hình đa phương thức có khả năng xử lý hình ảnh mạnh mẽ ngang ngửa Opus-4.8. Người dùng có thể truy cập qua API với cơ chế tính phí theo token và tận dụng Files API mới để tối ưu hóa việc tải lên hình ảnh.


Vì sao đáng đọc: Đây là bản cập nhật quan trọng từ DeepSeek, mở rộng khả năng đa phương thức cho dòng V4, thu hút sự quan tâm lớn từ cộng đồng lập trình viên và người dùng AI.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 50/100

4DAnyone: Đột phá tái tạo người 4D từ video đơn khung hình

4DAnyone là khung làm việc mới giúp tái tạo mô hình người 4D từ video đơn lẻ mà không cần hiệu chuẩn, thông qua kỹ thuật 4D Gaussian Splatting. Phương pháp này giải quyết hiệu quả vấn đề nhất quán đa góc nhìn, mang lại chất lượng hình ảnh vượt trội so với các công nghệ hiện có.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 51/100

WithEveryone: Bước tiến mới trong tạo ảnh nhóm với khả năng giữ vững danh tính nhân vật

WithEveryone là khung làm việc đột phá cho phép tạo ảnh nhóm lên tới 10 nhân vật với độ chính xác cao. Công nghệ này giải quyết triệt để vấn đề nhầm lẫn danh tính và lỗi ghép ảnh, giúp duy trì sự nhất quán của từng cá nhân trong cùng một khung hình.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 53/100

SPK: Khung phát hiện dữ liệu ngoài phân phối (OoD) có khả năng giải thích cho bài toán phát hiện vật thể thời gian thực

SPK giải quyết vấn đề ảo giác trong phát hiện vật thể bằng cách khai thác tri thức tiên nghiệm về cấu trúc và ngữ cảnh, tạo ra biểu diễn 5 chiều giúp nhận diện chính xác các dữ liệu ngoài phân phối (OoD).

20/08

Thứ Năm · 2 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 46/100

SoftVTBench: Bộ dữ liệu và chuẩn đánh giá thị giác - xúc giác cho thao tác vật thể biến dạng

SoftVTBench cung cấp 4.000 dữ liệu trình diễn đa phương thức, giúp robot thao tác vật thể mềm chính xác hơn thông qua chỉ số DSR (tỷ lệ thành công nhận thức biến dạng), khắc phục tình trạng các mô hình hiện nay bỏ qua sai số hình học.

19/08

Thứ Tư · 8 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnPixRestore: Bước đột phá trong phục hồi ảnh bằng mô hình Diffusion Transformer không dùng VAE

PixRestore là mô hình Diffusion Transformer hoạt động trực tiếp trên không gian pixel, loại bỏ sự phụ thuộc vào VAE để bảo toàn chi tiết ảnh sắc nét và khắc phục các lỗi sai lệch nội dung thường gặp ở các mô hình T2I.


Vì sao đáng đọc: Giải pháp sáng tạo khi từ bỏ VAE để tối ưu hóa phục hồi ảnh, giải quyết trực tiếp điểm yếu của các mô hình khuếch tán hiện nay. Rất đáng chú ý cho giới nghiên cứu thị giác máy tính.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 50/100

MoE-ViE: Bước tiến mới cho bộ mã hóa thị giác hiệu suất cao

MoE-ViE tối ưu hóa khả năng hiểu hình ảnh và video bằng kiến trúc chuyên gia hỗn hợp (MoE), đạt hiệu suất vượt trội với độ trễ thấp hơn 24% so với các mô hình cùng kích thước, thiết lập chuẩn mực mới cho các mô hình đa phương thức.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 46/100

CoinVE-200K: Bộ dữ liệu quy mô lớn cho chỉnh sửa video bằng câu lệnh phức hợp

CoinVE-200K là bộ dữ liệu chất lượng cao gồm các cặp video 1080p, hỗ trợ thực hiện đồng thời 2-5 thao tác chỉnh sửa như thêm, xóa, sửa đổi và thay đổi phong cách trên cùng một video.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 41/100

TAMP-Nav: Bước tiến mới trong điều hướng robot nhờ mô hình ngôn ngữ thị giác (VLM)

TAMP-Nav tối ưu hóa điều hướng robot bằng cách chuyển đổi tác vụ thành chọn điểm 2D trên ảnh, kết hợp suy luận chọn lọc và bộ nhớ quỹ đạo để đạt hiệu suất kỷ lục trên R2R-CE.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 56/100

Abra: Nghiên cứu đột phá về quy luật mở rộng (Scaling Laws) cho mô hình khuếch tán hình ảnh

Nghiên cứu của Abra chỉ ra rằng mô hình khuếch tán có tính dự báo cao tương tự LLM, nhưng đòi hỏi lượng dữ liệu gấp 10 lần so với công thức Chinchilla để đạt hiệu suất tối ưu.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 50/100

Thiết kế dữ liệu tập trung vào năng lực cho mô hình tạo ảnh đa năng: Từ kho ngữ liệu đến sự tiến hóa cộng hưởng

Nghiên cứu đề xuất hạ tầng dữ liệu mới giúp tối ưu hóa khả năng tạo ảnh thông qua việc kết hợp giám sát chuyên biệt và lập lịch học tập, tạo ra kho dữ liệu khổng lồ để huấn luyện các mô hình khuếch tán đa phương thức từ con số không.

Rohan Paul@rohanpaul_ai
Sản phẩmĐiểm AI 24/100

Robot hút bụi Matic: 20 năm nghiên cứu thị giác máy tính nay đã thành sản phẩm tiêu dùng

What you're watching looks like a shiny new hardware company. the tech behind it are almost two deca…

DịchSử dụng 5 camera và chip NVIDIA, robot Matic có khả năng lập bản đồ 3D toàn nhà trong 20 phút, tự động nhận diện và xử lý vật cản mà không cần ứng dụng. Công nghệ này kế thừa từ nghiên cứu thị giác máy tính đột phá của nhà sáng lập sau 20 năm ấp ủ.

18/08

Thứ Ba · 8 tin
fofr@fofrAI
Hướng dẫnĐiểm AI 28/100

TypeGPU gây ấn tượng với khả năng suy luận mô hình độ sâu đơn mắt thời gian thực

Incredible stuff. Now I need a Navi fairy companion version.

DịchChuyên gia fofr đánh giá cao TypeGPU khi chạy mô hình độ sâu 448x448 trên chip M4 Pro chỉ trong 8ms. Giải pháp này tối ưu hóa hiệu suất bằng cách hợp nhất quy trình suy luận, chiếu sáng và kết xuất vào cùng một bộ mã hóa lệnh mà không cần đồng bộ GPU.

Kim@kimmonismus
NgànhĐiểm AI 46/100

Lộ diện AirPods tích hợp camera: Siri lột xác thành trợ lý AI có khả năng 'nhìn'

Apple's rumored camera-equipped AirPods have appeared in a leaked demo. Siri turns into an AI assist…

DịchThông tin rò rỉ từ macOS Tahoe cho thấy Apple đang phát triển AirPods tích hợp camera, cho phép Siri nhận diện môi trường xung quanh và hỗ trợ người dùng xử lý công việc thông qua Visual Intelligence.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 54/100

GRNEdit: Đột phá chỉnh sửa video đa năng với mô hình nhị phân siêu nhẹ

GRNEdit giới thiệu khung làm việc hai giai đoạn tối ưu, mô hình hóa chỉnh sửa video dưới dạng quyết định nhị phân. Với chỉ 3% tham số điều kiện, mô hình 2B đã vượt qua nhiều đối thủ 14B, thiết lập chuẩn mực mới về hiệu suất và tính ứng dụng.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 44/100

Giao diện chuyển động 2D 'cắm và chạy': Giúp mô hình ngôn ngữ chuyển động 3D hoạt động mà không cần tinh chỉnh

Nghiên cứu giới thiệu giao diện 2D cho phép các mô hình ngôn ngữ chuyển động (MoLMs) 3D xử lý dữ liệu 2D mà không cần huấn luyện lại, đạt hiệu suất vượt trội trong các tác vụ ước tính tư thế từ video thực tế.

Đã tải 40 tin

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (63 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “thị giác máy tính” — Trang 5 | AIHOT.vn