26/08

Thứ Tư · 12 tin

25/08

Thứ Ba · 3 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 51/100

EchoWM: Mô hình thế giới đa phương thức cho trải nghiệm nhập vai tương tác

EchoWM là mô hình thế giới đột phá cho phép tạo đồng thời video 720p, âm thanh môi trường và giọng nói dựa trên điều hướng liên tục, hỗ trợ tương tác góc nhìn thứ nhất và thứ ba với độ chân thực cao.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 42/100

Chỉ huấn luyện lớp chiếu: Mở rộng đa phương thức cho LLM mà không làm mất khả năng vốn có

You can teach a language model a new modality without ever touching the backbone's weights. Train …

DịchNghiên cứu mới đề xuất phương pháp chỉ huấn luyện lớp kết nối giữa encoder và mô hình ngôn ngữ, giúp bổ sung đa phương thức mà không cần tinh chỉnh toàn bộ tham số, vừa tăng tốc độ huấn luyện vừa bảo toàn hiệu suất gốc của mô hình.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnTLive-Omni: Mô hình đa phương thức chuyên biệt cho livestream thương mại điện tử

TLive-Omni là mô hình AI đột phá giúp phân tích livestream bán hàng bằng cách hợp nhất dữ liệu từ video, âm thanh, hình ảnh và văn bản. Với cơ chế Per-vGrid và kỹ thuật tinh chỉnh Faithful-RFT, mô hình giúp AI hiểu ngữ cảnh và phản hồi chính xác các thông tin sản phẩm trong thời gian thực.


Vì sao đáng đọc: Đây là nghiên cứu thực tiễn cao, giải quyết bài toán khó trong livestream thương mại điện tử bằng cách kết hợp đa phương thức và tối ưu hóa độ chính xác của phản hồi.

24/08

Thứ Hai · 4 tin
Alibaba Cloud@alibaba_cloud
Mô hìnhĐiểm AI 42/100

Mô hình Wan 3.0 chính thức cập bến SeaArt, hỗ trợ nhập liệu đa phương thức

Wan 3.0 is now live on @SeaArt_Ai! 🚀 More inputs. More control. More creative possibilities. Creat…

DịchWan 3.0 đã có mặt trên nền tảng SeaArt, mang đến khả năng kiểm soát sáng tạo mạnh mẽ hơn với tính năng hỗ trợ nhập liệu đa phương thức. Người dùng hiện có thể trải nghiệm mô hình này trực tiếp hoặc thông qua API từ Alibaba Cloud và Qwen Cloud.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

EviRank: Giải pháp tối ưu hóa tìm kiếm ảnh đa phương thức dựa trên bằng chứng ngữ nghĩa

EviRank chuyển đổi bài toán tìm kiếm ảnh phức tạp thành dạng kiểm chứng ràng buộc, giúp phân tích chính xác các yêu cầu về thực thể và thuộc tính, từ đó cải thiện độ chính xác khi truy vấn ảnh đa phương thức.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

OmniAssistBench: Bộ tiêu chuẩn đánh giá khả năng tương tác thời gian thực của các mô hình Omni-LLM

OmniAssistBench là bộ tiêu chuẩn mới giúp đánh giá khả năng làm trợ lý video thời gian thực của các mô hình Omni-LLM, giải quyết thách thức trong việc đo lường các tương tác động mà các tập dữ liệu tĩnh hiện nay chưa đáp ứng được.

23/08

Chủ Nhật · 2 tin
karminski@karminski3
Hướng dẫnĐiểm AI 39/100

Cùng sự kiệnThử nghiệm thực tế khả năng đa phương thức của DeepSeek-V4-Flash-Vision và OX-Alpha

So sánh khả năng phân tích chiến thuật CS2 của DeepSeek-V4-Flash-Vision và OX-Alpha thông qua phương pháp trích xuất khung hình video, đánh giá độ chính xác trong việc nhận diện tình huống và đưa ra lời khuyên cải thiện.

Cùng sự kiện, bài đại diện «DeepSeek-V4-Flash-Vision-Exp ra mắt: Hiệu năng đa phương thức tiệm cận Opus-4.8»
Elvis Saravia@omarsar0
Sản phẩmĐiểm AI 41/100

Mô hình Inkling của Thinking Machines đã có mặt trên DAIR.AI: Trải nghiệm miễn phí ngay

Just made this @thinkymachines Inkling model available in our harness playground. Try it for free w…

DịchDAIR.AI vừa tích hợp mô hình MoE đa phương thức Inkling vào nền tảng playground. Người dùng có thể trải nghiệm miễn phí khả năng xử lý văn bản, hình ảnh, âm thanh với cửa sổ ngữ cảnh 1 triệu token cùng các tác nhân AI như Pi hoặc Hermes.

22/08

Thứ Bảy · 2 tin
Hongming@hongming731
Hướng dẫnĐiểm AI 35/100

Cùng sự kiệnĐiểm tin AI: DeepSeek ra mắt mô hình đa phương thức V4-Flash-Vision

DeepSeek vừa phát hành mô hình V4-Flash-Vision-Exp với khả năng xử lý hình ảnh vượt trội, cùng lúc Anthropic công bố quy trình phát triển phần mềm (SDLC) thế hệ mới dành cho AI.

Cùng sự kiện, bài đại diện «DeepSeek ra mắt mô hình đa phương thức thử nghiệm V4-Flash-Vision-Exp»
OpenRouter@OpenRouter
Sản phẩmĐiểm AI 56/100

Bộ mô hình Inkling ra mắt trên OpenRouter: Miễn phí cho các tác nhân AI

Inkling and Inkling Small are now served directly by @thinkymachines on OpenRouter, free to use insi…

DịchOpenRouter vừa tích hợp bộ mô hình Inkling và Inkling Small, hỗ trợ đa phương thức (văn bản, hình ảnh, âm thanh) với cửa sổ ngữ cảnh 1M. Người dùng có thể truy cập miễn phí khi kết nối qua các khung tác nhân AI như Claude Code hay Hermes Agent.

21/08

Thứ Sáu · 18 tin
Elvis Saravia@omarsar0
Mô hìnhĐiểm AI 49/100

DeepSeek-V4-Flash-Vision-Exp ra mắt: Hiệu năng đa phương thức tiệm cận Opus-4.8

Brace yourselves. We just entered a new era of frontier multimodal models. DeepSeek-V4-Flash-Vision…

DịchDeepSeek vừa trình làng mô hình V4-Flash-Vision-Exp với khả năng xử lý văn bản, hình ảnh và video vượt trội, hỗ trợ ngữ cảnh 1 triệu token và đạt hiệu suất tiệm cận Opus-4.8 trong các tác vụ thông minh.

Thêm 1 nguồn khác đưa tinX: karminski (@karminski3)
OpenRouter@OpenRouter
Mô hìnhĐiểm AI 50/100

Cùng sự kiệnDeepSeek V4 Flash Vision chính thức có mặt trên OpenRouter

DeepSeek V4 Flash Vision Exp is live on OpenRouter! @deepseek_ai's new model supports Image input a…

DịchDeepSeek vừa ra mắt phiên bản V4 Flash Vision hỗ trợ xử lý hình ảnh trên OpenRouter. Mô hình này duy trì mức giá cũ nhưng đạt hiệu suất vượt trội so với Opus-4.8 trong các bài kiểm tra năng lực AI chuyên sâu.

Cùng sự kiện, bài đại diện «DeepSeek ra mắt mô hình đa phương thức thử nghiệm V4-Flash-Vision-Exp»
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Mô hìnhĐiểm AI 45/100

DeepSeek ra mắt mô hình DeepSeek-v4-flash-vision-exp: Hỗ trợ đa phương thức hình ảnh và văn bản

DeepSeek vừa giới thiệu phiên bản thử nghiệm DeepSeek-v4-flash-vision-exp, cho phép người dùng phân tích hình ảnh, trích xuất văn bản từ ảnh chụp màn hình và đọc hiểu biểu đồ một cách hiệu quả.

AI Notes@AYi_AInotes
Mô hìnhĐiểm AI 62/100

Cùng sự kiệnDeepSeek ra mắt mô hình đa phương thức mới: Xử lý 100 ảnh với chi phí chưa đầy 20 cent

DeepSeek vừa giới thiệu mô hình thử nghiệm deepseek-v4-flash-vision-exp với khả năng xử lý đa phương thức vượt trội, đạt hiệu suất tiệm cận Opus-4.8 trong khi tối ưu hóa chi phí cực thấp.

Cùng sự kiện, bài đại diện «DeepSeek ra mắt mô hình đa phương thức thử nghiệm V4-Flash-Vision-Exp»
Kim@kimmonismus
Mô hìnhĐiểm AI 45/100

Cùng sự kiệnDeepSeek ra mắt mô hình đa phương thức thực nghiệm V4-Flash-Vision-Exp

wtf is happening today: DeepSeek has launched DeepSeek-V4-Flash-Vision-Exp, an experimental multimod…

DịchDeepSeek vừa giới thiệu mô hình thực nghiệm V4-Flash-Vision-Exp, được tối ưu hóa cho các tác nhân AI cần khả năng xử lý thị giác và hiện đã có sẵn trên nền tảng API của hãng.

Cùng sự kiện, bài đại diện «DeepSeek ra mắt mô hình đa phương thức thử nghiệm V4-Flash-Vision-Exp»
DeepSeek@deepseek_ai
Mô hìnhĐiểm AI 64/100

DeepSeek ra mắt mô hình đa phương thức thử nghiệm V4-Flash-Vision-Exp

DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! 🚀 🔹 This experimental mult…

DịchDeepSeek vừa giới thiệu mô hình đa phương thức thử nghiệm V4-Flash-Vision-Exp, sở hữu khả năng xử lý văn bản tương đương bản V4-Flash cùng các tính năng mạnh mẽ về tác tử, suy luận và kiến thức thế giới.

Diễn biến sự kiện · 5 bài →Thêm 14 nguồn khác đưa tinX: Hongming (@hongming731)The Decoder: AI NewsX: karminski (@karminski3)X: OpenRouter (@OpenRouter)X: opencode (@opencode)JiqizhixinX: AI Notes (@AYi_AInotes)X: Kim (@kimmonismus)X: Elvis Saravia (@omarsar0, DAIR.AI)Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)X: Xiaobei (@frxiaobei)IT HomeX: Tianyi Cui (@tianyi)DeepSeek: Nhật ký cập nhật API
Tianyi Cui@tianyi
Mô hìnhĐiểm AI 49/100

Cùng sự kiệnDeepSeek ra mắt mô hình đa phương thức DeepSeek-V4-Flash-Vision-Exp

DeepSeek vừa cập nhật mô hình đa phương thức mới lên nền tảng API, sở hữu khả năng xử lý văn bản tương đương V4-Flash và hiệu suất tác vụ đa phương thức tiệm cận Opus-4.8. Người dùng có thể trải nghiệm ngay thông qua DeepSeek Harness 0.1.1.

Cùng sự kiện, bài đại diện «DeepSeek ra mắt mô hình đa phương thức thử nghiệm V4-Flash-Vision-Exp»
WeChat: DeepSeek
Mô hìnhĐiểm AI 73/100

Tinh chọnDeepSeek ra mắt mô hình thị giác đa phương thức V4-Flash-Vision-Exp

DeepSeek vừa trình làng V4-Flash-Vision-Exp, mô hình đa phương thức có khả năng xử lý hình ảnh mạnh mẽ ngang ngửa Opus-4.8. Người dùng có thể truy cập qua API với cơ chế tính phí theo token và tận dụng Files API mới để tối ưu hóa việc tải lên hình ảnh.


Vì sao đáng đọc: Đây là bản cập nhật quan trọng từ DeepSeek, mở rộng khả năng đa phương thức cho dòng V4, thu hút sự quan tâm lớn từ cộng đồng lập trình viên và người dùng AI.
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

VA-Judger: Mô hình phần thưởng dựa trên phản hồi người dùng cho thế hệ video-âm thanh đồng bộ

VA-Judger giải quyết vấn đề thiếu tính nhất quán trong tạo video-âm thanh bằng cách sử dụng tập dữ liệu VAPref-10K, giúp mô hình hiểu rõ hơn về sự đồng bộ ngữ nghĩa và cảm nhận của con người thay vì chỉ tối ưu các chỉ số rời rạc.

opencode@opencode
Mô hìnhĐiểm AI 29/100

Mô hình ẩn danh Ox Alpha mở cửa miễn phí trong một tuần

Ox Alpha (stealth model) is free for the next week - 1M Context - Multi-modal - Zero Data Retention…

DịchOx Alpha cung cấp quyền truy cập miễn phí trong tuần này với cửa sổ ngữ cảnh 1 triệu token, khả năng đa phương thức và cam kết không lưu trữ dữ liệu người dùng.

Thêm 1 nguồn khác đưa tinX: AI Notes (@AYi_AInotes)
Alexandr Wang (Scale AI nhà sáng lập/Meta Giám đốc AI)@alexandr_wang
Hướng dẫnĐiểm AI 36/100

Meta Muse Spark 1.2 thống trị bảng xếp hạng chuyển đổi video sang website

Meta Muse Spark 1.2 vừa đạt vị trí dẫn đầu về khả năng chuyển đổi video sang website với điểm Elo ấn tượng, đồng thời thiết lập tiêu chuẩn mới về hiệu suất chi phí trong các tác vụ lập trình đa phương thức.

Alexandr Wang (Scale AI nhà sáng lập/Meta Giám đốc AI)@alexandr_wang
Mô hìnhĐiểm AI 28/100

Giải mã sức mạnh của Muse Spark 1.2: Mô hình đa phương thức thế hệ mới

1/ muse spark 1.2 is a very strong multimodal model-it can do visual coding, robotics planning, and …

DịchMuse Spark 1.2 là mô hình đa phương thức mạnh mẽ, tích hợp khả năng mã hóa thị giác, lập kế hoạch cho robot và hiểu sâu về âm thanh, video thông qua các công cụ tác nhân thông minh.

AI at Meta@AIatMeta
Mô hìnhĐiểm AI 53/100

Meta ra mắt Muse Spark 1.2: Bước tiến mới trong khả năng đa phương thức và điều khiển robot

Muse Spark 1.2 supports a broad range of multimodal tasks, from turning visuals into working code to…

DịchMeta vừa giới thiệu Muse Spark 1.2 với khả năng xử lý đa phương thức vượt trội, từ chuyển đổi hình ảnh sang mã nguồn đến điều khiển robot thực hiện các tác vụ phức tạp trong môi trường thực tế.

Rohan Paul@rohanpaul_ai
Mô hìnhĐiểm AI 47/100

SenseNova ra mắt U1.5 Lite: Mô hình đa phương thức 8B mạnh mẽ, hỗ trợ chỉnh sửa ảnh chuyên sâu

SenseNova's full U1.5-Lite release is basically a transition from "how many things can one model do? …

DịchSenseNova giới thiệu U1.5 Lite, mô hình đa phương thức 8B tối ưu hóa khả năng hiểu, tạo và chỉnh sửa hình ảnh trong một kiến trúc duy nhất mà không cần chuyển đổi chuyên gia. Mô hình đạt hiệu suất vượt trội trong việc tuân thủ chỉ dẫn và xử lý văn bản phức tạp, tiệm cận các mô hình thương mại lớn.

SenseTime@SenseTime_AI
Mô hìnhĐiểm AI 63/100

SenseTime ra mắt SenseNova U1.5 Lite: Mô hình đa phương thức 8B mạnh mẽ

SenseNova U1.5 Lite - Sharper. More Controllable. More C…

DịchSenseTime giới thiệu SenseNova U1.5 Lite, mô hình đa phương thức 8B hỗ trợ hiểu, tạo và chỉnh sửa hình ảnh 4K với khả năng xử lý văn bản và bố cục phức tạp vượt trội so với các đối thủ cùng phân khúc.

Thêm 2 nguồn khác đưa tinIT HomeX: Rohan Paul (@rohanpaul_ai)

20/08

Thứ Năm · 5 tin
Elvis Saravia@omarsar0
Mô hìnhĐiểm AI 53/100

Ra mắt dots3-note: Mô hình AI đột phá với khả năng tự đánh giá trong các tác vụ dài hơi

dots3-note Preview is an open-weight model built for tasks that run for hours-sometimes days. → 280…

Dịchdots3-note là mô hình đa phương thức (văn bản, hình ảnh, âm thanh) với cửa sổ ngữ cảnh 512K, nổi bật nhờ khả năng tự theo dõi và đánh giá tiến độ trong các tác vụ kéo dài hàng ngày.

JiQiZhiXin
Sản phẩmĐiểm AI 85/100

DeepSeek Harness cập nhật phiên bản RC.8: Nâng cấp mạnh mẽ khả năng đa phương thức và điều phối Agent

DeepSeek Harness vừa tung bản cập nhật RC.8, bổ sung hỗ trợ đầu vào đa phương thức, tích hợp Claude Code và Codex như các sub-agent, biến khung làm việc này thành lớp điều phối Agent thống nhất và linh hoạt hơn.

Thêm 2 nguồn khác đưa tinPandailyIT Home
Pandaily
Sản phẩmĐiểm AI 85/100

Cùng sự kiệnDeepSeek Harness tung bản cập nhật lớn: Nâng cấp đa phương thức và khả năng phối hợp tác vụ

Bản cập nhật v0.1.0-rc.8 mang đến 14 cải tiến quan trọng, bao gồm hỗ trợ đầu vào đa phương thức, khả năng phối hợp giữa các tác nhân (subagent) và tối ưu hóa công cụ, giúp AI xử lý hình ảnh và phân tích dữ liệu hiệu quả hơn.

Cùng sự kiện, bài đại diện «DeepSeek Harness cập nhật phiên bản RC.8: Nâng cấp mạnh mẽ khả năng đa phương thức và điều phối Agent»
WeChat: MiniMax
Sản phẩmĐiểm AI 61/100

Tinh chọnMiniMax Design ra mắt: Bước tiến từ xử lý pixel đến thấu hiểu ý đồ và ngữ nghĩa

MiniMax Design là nền tảng tích hợp mô hình đa phương thức H3, giúp tự động hóa quy trình sản xuất nội dung từ khâu xử lý tư liệu đến dựng phim hoàn chỉnh thông qua các tác nhân AI thông minh.


Vì sao đáng đọc: Sản phẩm thực tế có tính ứng dụng cao trong ngành sáng tạo nội dung, thể hiện bước tiến quan trọng trong việc kết hợp mô hình đa phương thức với quy trình làm việc chuyên nghiệp.

19/08

Thứ Tư · 2 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

CardioState-JEPA: Mô hình nền tảng học biểu diễn tim mạch đa phương thức với khả năng xử lý độ trễ

CardioState-JEPA là mô hình nền tảng đầu tiên hợp nhất dữ liệu ECG, PPG và PCG vào một không gian biểu diễn chung, sử dụng cơ chế căn chỉnh độ trễ để khai thác bản chất sinh lý học thay vì chỉ dựa vào hình dạng sóng tín hiệu.

WeChat: ModelBest (MiniCPM)
Hướng dẫnĐiểm AI 52/100

Kỹ sư AI tạo ra YRobot: Robot đồng hành toàn năng nhờ mô hình MiniCPM-o 4.5

Kỹ sư Yan Xin đã phát triển YRobot, robot để bàn có khả năng nghe, nhìn và trò chuyện thời gian thực nhờ mô hình MiniCPM-o 4.5 chạy cục bộ. Dự án mã nguồn mở này gây ấn tượng với hiệu suất vượt trội và khả năng xử lý đa phương thức mượt mà.

Đã tải 40 tin

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (47 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Đa phương thức” — Trang 4 | AIHOT.vn