26/09

Thứ Bảy · 4 tin
InternLM
Mô hìnhĐiểm AI 20/100

Phòng thí nghiệm AI Thượng Hải ra mắt mô hình quyết định đa phương thức Intern-Decision

Dự án InternLM vừa công bố Intern-Decision, một mô hình AI tập trung vào khả năng ra quyết định đa phương thức tốc độ cao. Hiện tại, các thông số kỹ thuật chi tiết và lộ trình phát hành vẫn chưa được công bố cụ thể.

IT Home
Nghiên cứuĐiểm AI 48/100

Cùng sự kiệnAI học cách 'bắt lỗi': GPT-6 Astra đạt 80% độ chính xác khi kiểm tra lắp ráp nội thất

Benchmark FAB từ Epoch AI cho thấy OpenAI GPT-6 Astra dẫn đầu với 80% độ chính xác trong việc phát hiện lỗi lắp ráp nội thất, vượt qua Claude Fable 5.1 (70%) và Claude Opus 5 (61%).

Cùng sự kiện, bài đại diện «GPT-6 Astra của OpenAI đạt độ chính xác 80% trong việc phát hiện lỗi lắp ráp nội thất IKEA»
MarkTechPost
Hướng dẫnĐiểm AI 57/100

Hướng dẫn xây dựng quy trình tăng cường dữ liệu đa phương thức và kiểm thử độ bền vững với AugLy

Hướng dẫn chi tiết cách sử dụng AugLy để tăng cường dữ liệu cho hình ảnh, văn bản và âm thanh, đồng thời giải quyết các vấn đề tương thích để xây dựng bộ dữ liệu tổng hợp chuẩn xác cho mô hình PyTorch.

Suno@suno
Sản phẩmĐiểm AI 22/100

Cùng sự kiệnSuno v6: Biến chuyển động cơ thể thành âm nhạc đầy cảm hứng

For @braylonbrowner movement doesn't simply follow music, it's where the music begins. Watch him us…

DịchSuno v6 cho phép người dùng chuyển hóa các động tác vũ đạo thành những bản nhạc độc bản, mở ra cách tiếp cận sáng tạo mới nơi chuyển động chính là khởi nguồn của âm thanh.

Cùng sự kiện, bài đại diện «Suno v6: Biến vũ đạo thành âm nhạc đầy cảm hứng»

25/09

Thứ Sáu · 2 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 39/100

AV-GRPO: Khung học tăng cường khuếch tán tách biệt đa phương thức cho tạo video-âm thanh đồng bộ

AV-GRPO là khung học tăng cường khuếch tán trực tuyến giúp tách biệt các ưu tiên đa phương thức thành bài toán đơn lẻ, tối ưu hóa sự đồng bộ giữa âm thanh và hình ảnh. Kết quả thực nghiệm trên JavisBench và VABench cho thấy hiệu suất vượt trội so với LTX-2.3 trong việc căn chỉnh ngữ nghĩa và chất lượng tạo nội dung.

24/09

Thứ Năm · 3 tin
Google DeepMind: Blog
Mô hìnhĐiểm AI 49/100

Google ra mắt Gemini 3.8 Live với tính năng Live Avatar: Đưa AI hội thoại lên tầm cao mới

Google DeepMind giới thiệu Gemini 3.8 Live tích hợp Live Avatar, kết hợp truyền phát video độ trễ thấp với khả năng đối thoại thời gian thực, mang đến trải nghiệm AI có hình ảnh động sống động cho người dùng doanh nghiệp.

Thêm 1 nguồn khác đưa tinThe Verge: AI
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 41/100

Epoch AI ra mắt FAB: Benchmark lắp ráp nội thất cho thấy bước tiến vượt bậc của AI

So many different kind of AI benchmarks are being released. This one is cool, "Furniture Assembly B…

DịchEpoch AI giới thiệu Furniture Assembly Benchmark (FAB), thử thách khả năng suy luận không gian của AI thông qua việc phát hiện lỗi lắp ráp nội thất. Điểm số cao nhất đã tăng vọt từ 28% lên 80% chỉ trong 10 tháng, cho thấy sự cải thiện đáng kể trong lĩnh vực vốn là điểm yếu của AI.

Ethan Mollick@emollick
Mô hìnhĐiểm AI 47/100

Cùng sự kiệnĐiểm chuẩn FAB của Epoch AI: Khả năng lắp ráp nội thất của AI tăng vọt

This is both fun and a useful measure of how much better multimodal AI has gotten In a short time.

DịchBenchmark FAB mới từ Epoch AI kiểm tra khả năng phát hiện lỗi lắp ráp nội thất của AI thông qua hình ảnh. Chỉ trong 10 tháng, điểm số cao nhất đã tăng ấn tượng từ 28% lên 80%, cho thấy bước tiến lớn của AI đa phương thức.

Cùng sự kiện, bài đại diện «Epoch AI ra mắt FAB: Bộ tiêu chuẩn đánh giá khả năng lắp ráp nội thất của AI»

22/09

Thứ Ba · 6 tin
Pandaily
Mô hìnhĐiểm AI 85/100

Phòng thí nghiệm AI Thượng Hải ra mắt mô hình đa phương thức Intern-S2-397B với bộ giải mã bộ nhớ

Phòng thí nghiệm AI Thượng Hải vừa công bố Intern-S2-397B, mô hình đa phương thức chuyên sâu về khoa học với bộ giải mã bộ nhớ linh hoạt và tối ưu hóa cho chip Ascend, hiện đã có sẵn trên Hugging Face và ModelScope.

Thêm 1 nguồn khác đưa tinInternLM
TechNode
Mô hìnhĐiểm AI 85/100

Xiaomi mã nguồn mở dòng mô hình MiMo-V2.6 sau khi tối ưu hóa học tăng cường

Xiaomi vừa công bố mã nguồn mở bộ mô hình MiMo-V2.6, bao gồm các phiên bản Pro và Flash với khả năng đa phương thức mạnh mẽ, vượt qua nhiều đối thủ trong các bài kiểm tra hiệu năng nhờ ứng dụng học tăng cường quy mô lớn.

Thêm 4 nguồn khác đưa tinThe Decoder: AI NewsXiaomi MiMo: Phát hành và blog chính thứcWeChat: Carl AI WattsWeChat: Khazix
IT Home
Mô hìnhĐiểm AI 72/100

Cùng sự kiệnXiaomi ra mắt và mã nguồn mở dòng MiMo-V2.6: Đạt trình độ nghiên cứu tương đương tiến sĩ

Xiaomi vừa công bố dòng mô hình MiMo-V2.6 (Pro và Flash) với khả năng đa phương thức toàn diện, đánh dấu bước tiến quan trọng trong việc ứng dụng cơ chế tự cải tiến đệ quy (RSI) vào nghiên cứu khoa học.

Cùng sự kiện, bài đại diện «Xiaomi MiMo-V2.6-Pro: Bước tiến mới trong tối ưu hóa nghiên cứu vật liệu»
Xiaomi MiMo: Phát hành và blog chính thức
Mô hìnhĐiểm AI 36/100

Cùng sự kiệnXiaomi ra mắt dòng mô hình AI MiMo-V2.6 với khả năng đa phương thức toàn diện

Xiaomi vừa giới thiệu dòng mô hình MiMo-V2.6 tập trung vào trí tuệ nhân tạo tiên tiến và khả năng đa phương thức. Tuy nhiên, các thông số kỹ thuật chi tiết về quy mô, hiệu suất và hình thức triển khai vẫn chưa được công bố.

Cùng sự kiện, bài đại diện «Xiaomi mã nguồn mở dòng mô hình MiMo-V2.6 sau khi tối ưu hóa học tăng cường»
IT Home
Mô hìnhĐiểm AI 79/100

Cùng sự kiệnXiaomi ra mắt và mở mã nguồn dòng MiMo-V2.6: Hai phiên bản Pro và Flash với giá API không đổi

Xiaomi chính thức phát hành dòng mô hình đa phương thức MiMo-V2.6 gồm bản Pro và Flash. Trong đó, bản Pro đạt 46 điểm trên bảng xếp hạng AA Intelligence Index v4.3.2.

Cùng sự kiện, bài đại diện «Xiaomi MiMo-V2.6-Pro: Bước tiến mới trong tối ưu hóa nghiên cứu vật liệu»
Google AI for Developers@googleaidevs
Sản phẩmĐiểm AI 32/100

Gemini 3.8: Trợ lý lập trình thông minh có khả năng 'nhìn' và sửa lỗi trực tiếp trên màn hình

Ever get stuck on a bug and wish the exact problem could be pointed out to you on screen? Watch how…

DịchKhám phá cách Gemini 3.8 Live Extended Thinking đóng vai trò gia sư lập trình, tự động quan sát màn hình và sử dụng function calling để giải thích logic code p5.js giúp bạn gỡ lỗi hiệu quả.

21/09

Thứ Hai · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

OmniVChat: Bước tiến mới trong đối thoại đa phương thức trực tiếp qua âm thanh và hình ảnh

OmniVChat giới thiệu phương thức tương tác trực tiếp giữa người dùng và mô hình AI thông qua âm thanh và video mà không cần chuyển đổi văn bản, giúp giảm độ trễ và giữ trọn vẹn các tín hiệu cảm nhận.

20/09

Chủ Nhật · 1 tin
JiQiZhiXin
NgànhĐiểm AI 92/100

Tinh chọnOpenAI đang tự mình định nghĩa lại tương lai của ngành robot

GPT-6 Astra đang gây sốt khi chứng minh khả năng điều khiển robot thực hiện các tác vụ phức tạp chỉ qua quan sát, từ vẽ tranh đến mô phỏng vật lý, cho thấy OpenAI có thể trở thành 'ông trùm' trong lĩnh vực robot.


Vì sao đáng đọc: Tin tức mang tính đột phá về sự kết hợp giữa AI đa phương thức và robot học, có bằng chứng thực tế từ cộng đồng, thu hút sự quan tâm lớn từ giới công nghệ.

19/09

Thứ Bảy · 2 tin
The Decoder: AI News
Mô hìnhĐiểm AI 68/100

Cùng sự kiệnQwen3.8-Omni-Flash ra mắt: Đối thủ đáng gờm của Gemini Flash với giá rẻ hơn

Qwen giới thiệu Qwen3.8-Omni-Flash, mô hình đa phương thức chuyên dụng cho AI agent với khả năng xử lý âm thanh, video và công cụ, cùng cửa sổ ngữ cảnh lên tới 1 triệu token.

Cùng sự kiện, bài đại diện «Thông Nghĩa Thiên Vấn ra mắt Qwen3.8-Omni-Flash: Mô hình toàn năng tập trung vào tác tử AI»
Testing Catalog@testingcatalog
Mô hìnhĐiểm AI 36/100

Cùng sự kiệnĐiểm tin AI: Grok ra mắt tính năng chuyển giọng nói 2.0 và Alibaba trình làng Qwen3.8-Omni-Flash

DAILY AI BRIEF 🗞 - Sept 19 XAI 🔥: - Grok Voice Transcribe 2.0 is live in the Grok Voice API. $0.1…

DịchxAI giới thiệu Grok Voice Transcribe 2.0 với chi phí tối ưu, trong khi Alibaba ra mắt Qwen3.8-Omni-Flash, mô hình đa phương thức toàn diện với cửa sổ ngữ cảnh 1 triệu token và chi phí xử lý video giảm tới 89%.

Cùng sự kiện, bài đại diện «Meta ra mắt Muse Connectors và tích hợp thanh toán qua Stripe»

18/09

Thứ Sáu · 1 tin
karminski@karminski3
Mô hìnhĐiểm AI 71/100

Cùng sự kiệnQwen ra mắt Qwen3.8-Omni-Flash: Hiệu suất vượt trội, chi phí giảm sâu

Qwen3.8-Omni-Flash cải thiện 25% hiệu suất, giảm tỷ lệ lỗi nhận diện giọng nói trong hội họp từ 88% xuống 3% và hỗ trợ xử lý âm thanh/video liên tục 1 giờ. Đặc biệt, giá thành giảm mạnh và ra mắt phiên bản Realtime với độ trễ cực thấp.

Cùng sự kiện, bài đại diện «Thông Nghĩa Thiên Vấn ra mắt Qwen3.8-Omni-Flash: Mô hình toàn năng tập trung vào tác tử AI»

17/09

Thứ Năm · 1 tin

16/09

Thứ Tư · 2 tin
QbitAI
Mô hìnhĐiểm AI 88/100

Tinh chọnZDTaichu 5.0-9B: Mô hình AI đa phương thức nội địa Trung Quốc dẫn đầu thế giới về trí tuệ không gian

ZDTaichu 5.0-9B vừa ra mắt đã gây ấn tượng mạnh khi giành vị trí dẫn đầu trong 8/9 bài kiểm tra năng lực không gian, chính thức gia nhập nhóm các mô hình đa phương thức hàng đầu thế giới.


Vì sao đáng đọc: Đây là bước tiến quan trọng của AI nội địa Trung Quốc trong lĩnh vực trí tuệ không gian (embodied AI), với hiệu suất vượt trội so với các mô hình cùng quy mô.

15/09

Thứ Ba · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 46/100

Omni-Streaming Thinking: Giải pháp ngăn chặn AI đa phương thức đưa ra kết luận vội vàng

Omni-Streaming Thinking (OST) giúp mô hình AI phân tách dữ liệu thành bằng chứng và dự đoán, cho phép kiểm chứng thông tin theo thời gian thực để tránh sai sót khi xử lý dữ liệu đa phương thức.

12/09

Thứ Bảy · 1 tin

11/09

Thứ Sáu · 1 tin
Sierra: Blog
NgànhĐiểm AI 25/100

Sierra ra mắt AI đa phương thức thế hệ mới: Giao diện biến hình theo hội thoại

Sierra vừa giới thiệu AI đa phương thức tích hợp linh hoạt giọng nói, văn bản và hình ảnh. Giao diện của ứng dụng sẽ tự động thay đổi cấu trúc theo nội dung hội thoại, giúp tối ưu hóa trải nghiệm người dùng trong từng tình huống cụ thể.

10/09

Thứ Năm · 2 tin
DeepSeek@deepseek_ai
Mô hìnhĐiểm AI 56/100

Cùng sự kiệnDeepSeek ra mắt DeepSeek-V4.1-Flash: Model nhỏ gọn nhất với khả năng hiểu thị giác nguyên bản

🚀 Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient. 🔹 Introducing the smallest mo…

DịchDeepSeek vừa giới thiệu DeepSeek-V4.1-Flash, thành viên mới nhất trong dòng kiến trúc tối ưu hóa với kích thước nhỏ gọn, tích hợp sẵn khả năng xử lý và hiểu hình ảnh trực tiếp.

Cùng sự kiện, tinh chọn hiển thị «DeepSeek ra mắt DeepSeek-V4.1-Flash: Cửa sổ 1M token, tối ưu bộ nhớ KV Cache cực đỉnh»

09/09

Thứ Tư · 3 tin
TechNode
Mô hìnhĐiểm AI 85/100

Cùng sự kiệnDeepSeek ra mắt bản thử nghiệm giới hạn cho mô hình đa phương thức V4.1 Flash

DeepSeek vừa giới thiệu phiên bản beta của V4.1 Flash, mô hình sử dụng kiến trúc mới với khả năng xử lý đa phương thức vượt trội, tốc độ nhanh và chi phí tối ưu hơn. Người dùng hiện có thể trải nghiệm mô hình này thông qua API của hãng.

Cùng sự kiện, bài đại diện «DeepSeek V4.1 Flash chính thức mở thử nghiệm: Cấu trúc mới, tốc độ vượt trội»
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 57/100

Gander: Công bố và mã nguồn mở mô hình AI tương tác toàn diện, hỗ trợ song công

Gander là mô hình AI end-to-end tích hợp khả năng nhận diện đa phương thức, tương tác thời gian thực và tư duy logic. Với kiến trúc Cerebellum-Brain, mô hình cho phép phản hồi giọng nói, video và văn bản với độ trễ thấp, hỗ trợ tính năng ngắt lời tự nhiên.

08/09

Thứ Ba · 2 tin
Gabriel@gabriel1
NgànhĐiểm AI 20/100

Google Astra toàn diện nhưng vẫn thiếu chiều sâu cảm xúc so với Fable AI

astra is at everything except it still lacks fables ability to evoke the right emotions in people w…

DịchDù Astra sở hữu khả năng đa nhiệm ấn tượng, Fable AI lại vượt trội hơn trong việc thấu hiểu và khơi gợi cảm xúc sâu sắc từ người dùng, tạo ra những trải nghiệm mang tính kết nối cao.

07/09

Thứ Hai · 2 tin

05/09

Thứ Bảy · 1 tin

03/09

Thứ Năm · 1 tin
AI Notes@AYi_AInotes
Mô hìnhĐiểm AI 65/100

World Labs ra mắt Atlas: Mô hình thế giới đa phương thức đột phá được Fei-Fei Li bảo chứng

Why is Spatial Intelligence considered the lifeline for Embodied AI? Because the biggest Achilles' h…

DịchWorld Labs giới thiệu Atlas, mô hình thế giới đa phương thức đầu tiên cho phép điều khiển camera chính xác, tái tạo 3D từ ảnh đơn và mô phỏng không gian nhất quán, mở ra tiềm năng ứng dụng lớn từ kỹ xảo điện ảnh đến robot học.

02/09

Thứ Tư · 3 tin
JiQiZhiXin
Mô hìnhĐiểm AI 95/100

Fei-Fei Li ra mắt Atlas: Kỷ nguyên mới của mô hình thế giới đa phương thức

World Labs của Fei-Fei Li vừa giới thiệu Atlas, mô hình thế giới đa phương thức đầu tiên có khả năng xử lý văn bản, hình ảnh, video và 3D với độ chân thực cao, cho phép kiểm soát camera ở cấp độ pixel và tái tạo không gian 3D từ dữ liệu 2D.

Thêm 4 nguồn khác đưa tinX: AI Notes (@AYi_AInotes)X: Xiaobei (@frxiaobei)IT HomeHacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 40/100

EM^2Mem: Khung bộ nhớ đa phương thức lấy sự kiện làm trung tâm giúp tối ưu hóa hỏi đáp video dài

EM^2Mem là khung bộ nhớ mới giúp liên kết các bằng chứng đa phương thức vào các mốc sự kiện, từ đó cải thiện độ chính xác khi truy vấn video dài và giảm đáng kể chi phí tính toán.

Google DeepMind: Blog
Sản phẩmĐiểm AI 71/100

Tinh chọnGoogle DeepMind ra mắt tính năng hiểu video thông minh cho Gemini

Google DeepMind cập nhật khả năng xử lý video thông minh cho dòng Gemini Flash, giúp mô hình tự động quét các phân đoạn quan trọng. Công nghệ này giúp giảm 88% lượng token, tiết kiệm 66% chi phí và tăng 7% độ chính xác so với phương pháp xử lý khung hình cố định truyền thống.

Diễn biến sự kiện · 2 bài →Thêm 4 nguồn khác đưa tinX: Google AI for Developers (@googleaidevs)X: Logan Kilpatrick (@OfficialLoganK)X: Google DeepMind (@GoogleDeepMind)The Decoder: AI News

Vì sao đáng đọc: Đây là bước tiến quan trọng trong tối ưu hóa chi phí và hiệu suất cho AI đa phương thức, có tác động trực tiếp đến người dùng doanh nghiệp và lập trình viên.
Đã tải 40 tin

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (86 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “AI đa phương thức” | AIHOT.vn