Nghiên cứu & Luận văn
CHỦ ĐỀ · TRANG 3

Nghiên cứu & Luận văn

Các bài báo AI đáng chú ý: Kiến trúc mới, phương pháp huấn luyện và đo lường năng lực mô hình.

2.415 bài thu thập349 tinh chọncập nhật đến 28/09 00:35

  1. Hugging Face Daily PapersT3 · 22/09 · 13:15

    OmniEdu: Bộ mô hình nền tảng mã nguồn mở dành cho giáo dục và giảng dạy

    OmniEdu là dòng mô hình nền tảng chuyên biệt cho giáo dục K-12, được huấn luyện để giải quyết vấn đề, chẩn đoán khó khăn của học sinh và cung cấp hỗ trợ sư phạm bài bản thông qua bộ dữ liệu tinh chỉnh đa dạng.

  2. Hugging Face Daily PapersT3 · 22/09 · 11:00

    Grounded Action Model: Đưa nhận thức không gian 3D vào nền tảng điều khiển robot

    Grounded Action Model (GAM) là mô hình robot mới giúp máy móc hiểu rõ vị trí và hình học 3D của vật thể thay vì chỉ học ngầm định từ dữ liệu, giúp việc điều khiển chính xác và hiệu quả hơn thông qua các lệnh ngôn ngữ hoặc hình ảnh.

  3. Hugging Face Daily PapersT3 · 22/09 · 10:15

    HuRo: Chuyển đổi video hành động của người thành dữ liệu huấn luyện robot quy mô lớn

    HuRo là phương pháp mới giúp chuyển đổi video hành động của con người thành dữ liệu điều khiển robot, tạo ra tập dữ liệu khổng lồ với 630.000 tập mẫu để huấn luyện các mô hình VLA hiệu quả hơn.

  4. Hugging Face Daily PapersT3 · 22/09 · 10:00

    Tại sao mô hình tạo video lại 'phi vật lý'? Giải mã lỗi từ cơ chế Attention

    Nghiên cứu chỉ ra rằng các mô hình tạo video hiện nay thường vi phạm quy luật vật lý do lỗi trong cơ chế Attention và sự suy giảm không gian từ RoPE, dẫn đến việc định hình chuyển động sai lệch ngay từ giai đoạn khử nhiễu đầu tiên.

  5. Hugging Face Daily PapersT3 · 22/09 · 08:00

    SteerDuplex: Mô hình hội thoại giọng nói song công có khả năng tùy biến linh hoạt

    SteerDuplex là mô hình hội thoại song công (full-duplex) đột phá, cho phép người dùng điều chỉnh linh hoạt tông giọng, phong cách và tốc độ nói thông qua các hướng dẫn trực tiếp, giúp tương tác tự nhiên và thông minh hơn.

  6. JiQiZhiXinT3 · 22/09 · 01:45

    ACM Multimedia 2026: ForgeryVCR - Bước tiến mới trong xác thực hình ảnh bằng suy luận thị giác

    Các nhà nghiên cứu từ Tencent và Đại học Thâm Quyến giới thiệu ForgeryVCR, một khung tác tử AI giúp chuyển đổi việc xác thực hình ảnh từ mô tả văn bản sang suy luận dựa trên bằng chứng thị giác trực tiếp, giúp phát hiện ảnh giả mạo chính xác hơn.

  7. JiQiZhiXinT3 · 22/09 · 01:45

    ICLR 2027 bùng nổ với hơn 60.000 bài nộp: Kỷ lục vượt xa tổng 14 năm cộng lại

    Số lượng bài nộp tại ICLR 2027 đạt con số kỷ lục 60.000, vượt tổng số bài của 14 năm trước cộng lại, đặt ra thách thức khổng lồ cho quy trình phản biện và đánh giá khoa học.

  8. JiQiZhiXinT2 · 21/09 · 23:45

    Đột phá AI: Giảm 50% chi phí huấn luyện với mô hình 'Dự đoán khái niệm' từ Shanghai AI Lab

    Nhóm nghiên cứu từ Shanghai AI Lab và ĐH Giao thông Thượng Hải giới thiệu mô hình NCP-ArchPreview, thay thế dự đoán từ ngữ (NTP) bằng dự đoán khái niệm (NCP), giúp tăng tốc độ hội tụ gấp 1,95 lần và cải thiện hiệu suất suy luận đáng kể.

  9. JiQiZhiXinT2 · 21/09 · 19:45

    Đột phá: Mô hình 7B từ UIUC và startup Thanh Hoa đánh bại GPT-5.6 nhờ tự chưng cất trên thị trường dự báo

    Các nhà nghiên cứu giới thiệu Social World Model, cho phép AI liên tục cập nhật kiến thức từ dữ liệu thị trường thời gian thực, giúp mô hình 7B vượt qua các siêu AI như GPT-5.6 và Claude Opus 5 trong việc dự đoán biến động xã hội.

  10. Hugging Face Daily PapersT2 · 21/09 · 10:00

    CodeMidas: Tự động hóa tạo môi trường học tăng cường cho AI lập trình từ mã nguồn

    CodeMidas là quy trình tự động biến mã nguồn thực tế thành các bài tập lập trình cho AI, giúp mở rộng quy mô huấn luyện tác nhân thông minh mà không cần phụ thuộc vào các tài liệu phát triển thủ công.

  11. Hugging Face Daily PapersT2 · 21/09 · 09:15

    Code2Skill: Tự động hóa chuyển đổi mã nguồn thành kỹ năng thực thi cho AI Agent

    Code2Skill là quy trình tự động giúp AI học kỹ năng từ hàng triệu kho lưu trữ GitHub, biến mã nguồn thành các thao tác có thể thực thi và kiểm chứng, giúp AI mở rộng khả năng vượt xa kinh nghiệm sẵn có.

  12. Hugging Face Daily PapersT2 · 21/09 · 09:15

    MintAct: Tác nhân thị giác hợp nhất cho mọi môi trường kỹ thuật số

    MintAct là dòng mô hình ngôn ngữ-thị giác đa quy mô, có khả năng điều hướng và sử dụng công cụ trên cả di động, máy tính và web với hiệu suất tương đương các chuyên gia riêng biệt.

  13. Hugging Face Daily PapersT2 · 21/09 · 09:15

    Khi AI đánh giá AI: Nguy cơ 'sụp đổ tư duy khoa học' và giải pháp khắc phục

    Nghiên cứu chỉ ra rằng việc dùng AI để đánh giá bài báo khoa học tạo ra vòng lặp phản hồi, làm giảm tính đa dạng và gây ra hiện tượng 'sụp đổ tư duy'. Nhóm tác giả đề xuất TrustReviewer như một giải pháp để duy trì chất lượng đánh giá khách quan.

  14. JiQiZhiXinT2 · 21/09 · 05:45

    EMNLP 2026: ToolLoop - Đột phá trong tổng hợp dữ liệu sử dụng công cụ cho LLM thông qua cơ chế tự phản hồi

    ToolLoop tối ưu hóa việc tạo dữ liệu huấn luyện cho LLM bằng cách chia nhỏ quy trình thành ba giai đoạn: lấy mẫu hàm, tạo câu hỏi ngược và tạo lệnh gọi công cụ, kết hợp cơ chế tự phản hồi để đảm bảo độ chính xác cao hơn so với phương pháp lọc truyền thống.

  15. Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)T2 · 21/09 · 01:20

    Điều tra độc lập: Cookie __obi của ChatGPT theo dõi hành vi duyệt web ngoài nền tảng

    Nghiên cứu chỉ ra OpenAI sử dụng cookie __obi để liên kết dữ liệu duyệt web và mua sắm của người dùng trên các trang web bên thứ ba với tài khoản ChatGPT thông qua mã theo dõi quảng cáo.

  16. JiQiZhiXinCN · 20/09 · 21:45

    Đột phá tại ECCV: HSImul3R - Khung tái tạo tương tác người-cảnh vật chuẩn vật lý cho robot

    HSImul3R là khung tái tạo 3D đầu tiên giúp chuyển đổi video hành động của con người thành dữ liệu mô phỏng vật lý chính xác, giải quyết triệt để vấn đề xuyên thấu mô hình và mất ổn định trong tương tác robot.

  17. JiQiZhiXinCN · 20/09 · 20:45

    CausalWM: Khi 'Chuỗi tư duy nhân quả' giúp mô hình thế giới đạt đỉnh cao mới

    Aether AI ra mắt CausalWM, mô hình thế giới 16B tham số sử dụng 'Chuỗi tư duy nhân quả' để hiểu cơ chế vận động vật lý thay vì chỉ dự đoán hình ảnh, xuất sắc dẫn đầu bảng xếp hạng TriWorldBench.

  18. JiQiZhiXinCN · 20/09 · 17:45

    VBVR-Pro: Hệ thống huấn luyện và đánh giá toàn diện khả năng suy luận thị giác cho mô hình AI

    VBVR-Pro cung cấp bộ 300 tác vụ suy luận thị giác cùng cơ chế chấm điểm tự động, giúp tối ưu hóa khả năng tư duy không gian và logic cho các mô hình đa phương thức thông qua học tăng cường.

  19. PandailyCN · 20/09 · 10:15

    DeepSeek-V4.1-Flash ra mắt: Mô hình MoE 552B, cửa sổ ngữ cảnh 1 triệu token và nén KV siêu cấp

    DeepSeek-V4.1-Flash là mô hình MoE Encoder-Decoder 552 tỷ tham số, hỗ trợ cửa sổ ngữ cảnh 1 triệu token cùng công nghệ nén KV cực mạnh, hiện đã có mặt trên API dưới tên deepseek-flash.

  20. WeChat: StepFun (Step)CN · 20/09 · 09:20

    Step 5 Preview: Bước tiến mới từ StepFun với mô hình mã nguồn mở 600B tham số

    StepFun vừa ra mắt mô hình flagship Step 5 Preview sử dụng kiến trúc MoE, hỗ trợ cửa sổ ngữ cảnh 1 triệu token và khả năng xử lý đa phương thức. Với hiệu suất vượt trội và chi phí vận hành chỉ bằng 1/8 so với Claude 3 Opus, đây là đối thủ đáng gờm trong nhóm mô hình mã nguồn mở.

Nghiên cứu & Luận văn — Chủ Đề AI · Trang 3 | AIHOT.vn