11/09

Thứ Sáu · 11 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnECCV 2024 công bố giải thưởng lớn: Nghiên cứu 3D đột phá giành giải Best Paper, Fei-Fei Li nhận giải Cống hiến

Hội nghị ECCV vừa vinh danh nghiên cứu 'Heat Kernel Textures' về biểu diễn bề mặt 3D là bài báo xuất sắc nhất, đồng thời trao giải 'Thời gian kiểm chứng' cho giáo sư Fei-Fei Li vì những đóng góp nền tảng cho thị giác máy tính.


Vì sao đáng đọc: Đây là tin tức quan trọng từ một trong ba hội nghị CV hàng đầu thế giới, cập nhật xu hướng nghiên cứu 3D mới nhất và vinh danh nhân vật tầm cỡ trong ngành AI.

10/09

Thứ Năm · 10 tin
Elvis Saravia@omarsar0
Mô hìnhĐiểm AI 65/100

DeepSeek ra mắt DeepSeek-V4.1-Flash: Mô hình nhỏ gọn, hiệu năng vượt trội với trọng số mở

Another goated release by DeepSeek. Open weight, btw. Outperforms Opus 5 on key benchmarks, btw. L…

DịchDeepSeek vừa trình làng DeepSeek-V4.1-Flash, mô hình nhỏ nhất trong kiến trúc mới với khả năng hiểu thị giác nguyên bản, tối ưu tốc độ suy luận và chi phí, đồng thời vượt qua Opus 5 trên nhiều tiêu chuẩn quan trọng.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

OracleZoom: Đột phá siêu phân giải hình ảnh đệ quy với cơ chế tự chưng cất và ràng buộc tham chiếu

OracleZoom giải quyết thách thức thiếu dữ liệu gốc ở các cấp độ phóng đại cực lớn bằng cách sử dụng cơ chế tự chưng cất và ràng buộc tham chiếu, giúp mô hình duy trì độ chính xác khi thực hiện siêu phân giải đệ quy.

Kim@kimmonismus
Mô hìnhĐiểm AI 78/100

Cùng sự kiệnDeepSeek ra mắt V4.1-Flash: Kiến trúc mới hỗ trợ thị giác và giảm giá sâu

Whats really exciting about DeepSeek 4.1 Flash its insane efficiency and pricing. It matches or be…

DịchDeepSeek trình làng V4.1-Flash với kiến trúc Causal Encoder-Decoder đột phá, tích hợp khả năng hiểu thị giác nguyên bản cùng hiệu suất tối ưu nhờ mô hình 552B MoE.

Cùng sự kiện, tinh chọn hiển thị «DeepSeek ra mắt DeepSeek-V4.1-Flash: Cửa sổ 1M token, tối ưu bộ nhớ KV Cache cực đỉnh»
Kim@kimmonismus
Mô hìnhĐiểm AI 79/100

Cùng sự kiệnDeepSeek ra mắt V4.1-Flash: Kiến trúc Causal Encoder-Decoder mới với khả năng hiểu thị giác

DeepSeek just released V4.1-Flash with a new architecture, six weeks after its July V4-Flash update….

DịchDeepSeek giới thiệu V4.1-Flash, mô hình MoE 552B tham số tối ưu hóa hiệu suất với kiến trúc mới, giúp giảm đáng kể yêu cầu bộ nhớ KV cache và chi phí API trong khi vẫn hỗ trợ xử lý hình ảnh trực tiếp.

Cùng sự kiện, tinh chọn hiển thị «DeepSeek ra mắt DeepSeek-V4.1-Flash: Cửa sổ 1M token, tối ưu bộ nhớ KV Cache cực đỉnh»
Thomas Wolf (Hugging Face đồng sáng lập/CSO)@Thom_Wolf
Mô hìnhĐiểm AI 73/100

Cùng sự kiệnDeepSeek-V4.1-Flash ra mắt: Bước tiến mới về tốc độ và khả năng thị giác

don't get distracted by all the hedging words in its name ("flash", minor version): seems like DeepS…

DịchDeepSeek vừa trình làng V4.1-Flash, mẫu model nhỏ gọn nhất trong kiến trúc mới với khả năng hiểu thị giác nguyên bản, tối ưu hóa cho tốc độ suy luận vượt trội và hiệu suất cao.

Cùng sự kiện, tinh chọn hiển thị «DeepSeek ra mắt DeepSeek-V4.1-Flash: Cửa sổ 1M token, tối ưu bộ nhớ KV Cache cực đỉnh»
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)@deepseek_ai
Mô hìnhĐiểm AI 57/100

Cùng sự kiệnDeepSeek ra mắt V4.1-Flash: Mô hình nhỏ gọn với khả năng hiểu thị giác nguyên bản

DeepSeek vừa trình làng V4.1-Flash, thành viên nhỏ nhất trong kiến trúc mới, tập trung tối ưu tốc độ và hiệu suất xử lý, đồng thời tích hợp khả năng hiểu thị giác trực tiếp.

Cùng sự kiện, tinh chọn hiển thị «DeepSeek ra mắt DeepSeek-V4.1-Flash: Cửa sổ 1M token, tối ưu bộ nhớ KV Cache cực đỉnh»
Aravind Srinivas (Perplexity CEO)@AravSrinivas
Mô hìnhĐiểm AI 61/100

Cùng sự kiệnDeepSeek ra mắt DeepSeek-V4.1-Flash: Mô hình nhỏ gọn tích hợp khả năng thị giác máy tính

DeepSeek vừa giới thiệu DeepSeek-V4.1-Flash, mô hình nhỏ nhất trong kiến trúc mới với tốc độ suy luận vượt trội và khả năng hiểu hình ảnh trực tiếp, đạt kết quả ấn tượng trên nhiều bài kiểm tra kỹ thuật.

Cùng sự kiện, tinh chọn hiển thị «DeepSeek ra mắt DeepSeek-V4.1-Flash: Cửa sổ 1M token, tối ưu bộ nhớ KV Cache cực đỉnh»
DeepSeek@deepseek_ai
Mô hìnhĐiểm AI 56/100

Cùng sự kiệnDeepSeek ra mắt DeepSeek-V4.1-Flash: Model nhỏ gọn nhất với khả năng hiểu thị giác nguyên bản

🚀 Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient. 🔹 Introducing the smallest mo…

DịchDeepSeek vừa giới thiệu DeepSeek-V4.1-Flash, thành viên mới nhất trong dòng kiến trúc tối ưu hóa với kích thước nhỏ gọn, tích hợp sẵn khả năng xử lý và hiểu hình ảnh trực tiếp.

Cùng sự kiện, tinh chọn hiển thị «DeepSeek ra mắt DeepSeek-V4.1-Flash: Cửa sổ 1M token, tối ưu bộ nhớ KV Cache cực đỉnh»
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

VDiff-Bench: Bộ tiêu chuẩn đánh giá khả năng nhận diện thay đổi chi tiết giữa hai hình ảnh

VDiff-Bench là bộ tiêu chuẩn mới gồm 1.756 câu hỏi trắc nghiệm, giúp kiểm tra khả năng phát hiện các thay đổi tinh vi giữa hai hình ảnh của các mô hình ngôn ngữ đa phương thức (MLLM) vốn thường gặp khó khăn trong tác vụ này.

AK@_akhaliq
NgànhĐiểm AI 34/100

Marigold V2: Bước tiến mới trong ước tính độ sâu đơn ảnh bằng Diffusion Transformer

Marigold V2 Revisiting Diffusion Transformers for Monocular Depth Estimation paper: https://huggin...

DịchMarigold V2 tối ưu hóa kiến trúc Diffusion Transformer để nâng cao độ chính xác và hiệu quả trong việc ước tính độ sâu từ ảnh đơn, mở ra tiềm năng mới cho thị giác máy tính.

09/09

Thứ Tư · 11 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 43/100

SynthGait-19K: Bộ dữ liệu video tổng hợp phục vụ phân tích dáng đi

SynthGait-19K là bộ dữ liệu gồm hơn 19.000 video mô phỏng dáng đi từ 437 đối tượng, đi kèm chú thích chuyển động SMPL và 6 thông số dáng đi quan trọng, hỗ trợ đắc lực cho nghiên cứu thị giác máy tính.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 45/100

Marigold V2: Đột phá ước tính độ sâu từ ảnh đơn bằng kiến trúc Diffusion Transformer

Marigold V2 ứng dụng kiến trúc Diffusion Transformer để tối ưu hóa việc ước tính độ sâu, cho phép suy luận một bước với độ chính xác vượt trội trên các chi tiết phức tạp như lông thú hay tán lá, đồng thời giảm đáng kể chi phí vận hành.

Ant Ling@AntLingAGI
NgànhĐiểm AI 46/100

Mô hình Ling 3.0 Flash của Ant Group được nâng cấp khả năng thị giác

Thanks to our day0 partner @atomic_chat_hq to bring the visual intelligence to more users and creato…

DịchAntLingAGI vừa bổ sung khả năng phân tích hình ảnh cho Ling 3.0 Flash. Đối tác Atomic Chat đã phát hành phiên bản GGUF cho phép chạy mô hình cục bộ trên các thiết bị đầu cuối.

Ant Ling@AntLingAGI
Mô hìnhĐiểm AI 55/100

Cùng sự kiệnAnt Group ra mắt mô hình thị giác máy tính mã nguồn mở Ling-3.0-flash-VL trên ModelScope

Come and play with the new models on @ModelScope2022! 😺

DịchAnt Group vừa phát hành mô hình thị giác Ling-3.0-flash-VL theo giấy phép MIT trên nền tảng ModelScope, hỗ trợ sẵn hai định dạng trọng số BF16 và FP8.

Cùng sự kiện, bài đại diện «Ant Group ra mắt mô hình đa phương thức Ling-3.0-flash-VL với khả năng phản hồi thị giác»
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 36/100

CoVeR: Phương pháp cắt tỉa token dựa trên độ phủ cho suy luận 3D đa góc nhìn trên VLM

CoVeR là bộ chọn token thị giác không cần huấn luyện, giúp tối ưu hóa suy luận 3D đa góc nhìn bằng cách loại bỏ token dư thừa. Chỉ với 8% lượng token, mô hình vẫn duy trì 93,5% hiệu suất, vượt qua các phương pháp hiện có tới 3,9 điểm phần trăm.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 46/100

TANGO: Khung điều hướng toàn thân cho robot hình người trong môi trường phức tạp

TANGO là khung điều hướng thị giác-ngôn ngữ đầu tiên cho phép robot hình người di chuyển trong không gian 3D hỗn loạn bằng lệnh thoại. Mô hình đạt hiệu suất SOTA trong mô phỏng và có thể triển khai trực tiếp lên robot Unitree G1 mà không cần dữ liệu thực tế.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 36/100

Mask Forcing: Tối ưu hóa chất lượng video AI bằng kỹ thuật che nhiễu kép

Phương pháp Mask Forcing giúp khắc phục tình trạng video bị bão hòa hoặc mờ nhòe trong các mô hình khuếch tán tự hồi quy bằng cách chèn các lớp mặt nạ ngẫu nhiên. Kỹ thuật này cải thiện đáng kể chất lượng hình ảnh mà không cần dữ liệu thực tế hay bước hậu huấn luyện phức tạp.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Tạo ảnh bằng AI: Từ mô hình tạo sinh đến hệ thống điều khiển tự hành

Nghiên cứu phân tích sự chuyển dịch của công nghệ tạo ảnh từ các mô hình đơn lẻ sang hệ thống tự hành có khả năng lập kế hoạch, sử dụng công cụ và tự sửa lỗi. Bài viết đề xuất khung phân loại mới dựa trên mức độ kiểm soát của AI trong quy trình tạo hình ảnh.

08/09

Thứ Ba · 2 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

ENEAS: Phương pháp phân đoạn hình ảnh thích ứng dựa trên nhúng văn bản

ENEAS là mô hình hợp nhất cho phép theo dõi đối tượng và phân đoạn ngữ nghĩa thông qua câu lệnh văn bản, giúp khắc phục các lỗi phổ biến như ảo giác thời gian và phân mảnh không gian trong các mô hình nền tảng hiện nay.

07/09

Thứ Hai · 4 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

ShallowStream: Tối ưu hóa xử lý video trực tuyến bằng cách phân tầng độ sâu mô hình

ShallowStream là khung làm việc mới giúp giảm chi phí tính toán khi xử lý video trực tuyến bằng cách kết hợp xử lý nông (shallow) cho các khung hình đầu vào và chỉ đi sâu (deep) khi cần thiết, giúp tối ưu hóa bộ nhớ KV cache.

06/09

Chủ Nhật · 1 tin
IT Home
Mô hìnhĐiểm AI 50/100

Cùng sự kiệnAlibaba ra mắt Qwen-Drive-1.0-4B: Mô hình ngôn ngữ thị giác chuyên dụng cho xe tự lái

Alibaba vừa mã nguồn mở Qwen-Drive-1.0-4B, mô hình ngôn ngữ thị giác nền tảng đầu tiên được tối ưu hóa riêng cho lĩnh vực xe tự lái, phát triển dựa trên kiến trúc Qwen3.5-4B.

Cùng sự kiện, bài đại diện «Alibaba ra mắt Qwen-Drive: Mô hình mã nguồn mở đột phá cho xe tự lái»

05/09

Thứ Bảy · 5 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 88/100

Tinh chọnVLA-Corrector: Giải pháp 40M tham số giúp robot 'tỉnh táo' hơn khi thực hiện hành động

Nhóm nghiên cứu từ ĐH Chiết Giang và Alibaba DAMO Academy đã phát triển VLA-Corrector, một mô hình nhẹ giúp robot phát hiện và sửa lỗi kịp thời trong các khoảng mù hành động, thay vì mù quáng thực hiện chuỗi lệnh cũ.


Vì sao đáng đọc: Giải quyết vấn đề thực tế trong robot học (VLA) bằng cách tối ưu hóa hiệu suất mà không cần tốn kém tài nguyên tính toán, có tính ứng dụng cao và kỹ thuật đột phá.
JiQiZhiXin
Nghiên cứuĐiểm AI 85/100

UrbanGround: Khi AI 'mất phương hướng' trong mô hình 3D thực tế của Hồng Kông

Nhóm nghiên cứu từ SJTU, NUS và các đối tác đã tạo ra UrbanGround, một môi trường 3D mô phỏng Hồng Kông để kiểm tra khả năng điều hướng của AI. Kết quả cho thấy các mô hình lớn hiện nay dù nhận diện hình ảnh tốt nhưng lại cực kỳ yếu trong việc duy trì lộ trình dài hạn.

JiQiZhiXin
Nghiên cứuĐiểm AI 88/100

Tinh chọnECCV 2026: ART - Đột phá giới hạn trong công nghệ chuyển đổi trang điểm kỹ thuật số

Nghiên cứu từ vivo và các đại học hàng đầu giới thiệu ART, phương pháp mới giúp chuyển đổi chính xác các kiểu trang điểm phức tạp như kim tuyến hay họa tiết nghệ thuật mà vẫn giữ nguyên cấu trúc khuôn mặt và danh tính người dùng.


Vì sao đáng đọc: Bài viết giới thiệu giải pháp kỹ thuật đột phá cho một bài toán khó trong thị giác máy tính, có tính ứng dụng cao trong ngành làm đẹp và chỉnh sửa ảnh, nội dung chuyên sâu và có giá trị tham khảo tốt.
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 92/100

Tinh chọnRoboTok: Công cụ khai thác dữ liệu từ Internet để huấn luyện robot thao tác khéo léo

RoboTok là hệ thống đột phá giúp trích xuất các video thao tác của con người từ Internet để huấn luyện robot, giải quyết bài toán thiếu hụt dữ liệu thực tế thông qua không gian chuyển động 3D linh hoạt.


Vì sao đáng đọc: Giải quyết trực tiếp nút thắt lớn nhất trong robot học là dữ liệu. Phương pháp tìm kiếm dựa trên chuyển động 3D rất sáng tạo và có tính ứng dụng thực tiễn cao.

04/09

Thứ Sáu · 6 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 40/100

Scal3R: Phương pháp truy vấn tư thế tương đối đa khung hình giúp ổn định tái tạo 3D video dài

Scal3R tối ưu hóa tái tạo 3D trực tuyến bằng cách sử dụng các token học được để tinh chỉnh mô hình nền, kết hợp tối ưu hóa đồ thị tư thế giúp giảm thiểu sai số tích lũy trong các video dài.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 39/100

FlashRender: Khung dựng hình video thế hệ mới với khả năng điều khiển camera siêu tốc

FlashRender là khung dựng hình video đột phá giúp tái tạo video theo quỹ đạo camera mục tiêu chỉ trong vài giây, giảm 25 lần chi phí lấy mẫu mà vẫn đảm bảo chất lượng hình ảnh và tính nhất quán hình học vượt trội.

Đã tải 40 tin

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (39 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Thị giác máy tính” — Trang 3 | AIHOT.vn