Dữ liệu & Huấn luyện
Phía huấn luyện mô hình: Xây dựng bộ dữ liệu, dữ liệu tổng hợp, tiền huấn luyện và hậu huấn luyện, chi phí tính toán cho huấn luyện.
671 bài thu thập69 tinh chọncập nhật đến 27/09 20:57
- JiQiZhiXinT4 · 16/09 · 15:15
Nghiên cứu từ Thanh Hoa: Chỉ cần một bài toán để huấn luyện mô hình ngôn ngữ lớn?
Nhóm nghiên cứu từ ĐH Thanh Hoa phát hiện On-Policy Distillation (OPD) có thể đạt 70% hiệu suất dù chỉ huấn luyện trên một mẫu dữ liệu duy nhất, cho thấy thuật toán hiện tại vẫn chưa khai thác hết tiềm năng của dữ liệu.
- QbitAIT3 · 15/09 · 15:15
Nghiên cứu mới từ Meta: Chưng cất mô hình Byte giúp phá vỡ giới hạn hiệu năng
Meta vừa công bố phương pháp chưng cất mô hình mới giúp các mô hình Byte vượt qua giới hạn hiệu suất truyền thống, mở ra hướng đi đột phá cho việc tối ưu hóa AI.
- JiQiZhiXinT2 · 14/09 · 19:15
Trao quyền tự chủ cho doanh nghiệp: PyTRIO định nghĩa lại kỷ nguyên huấn luyện mô hình AI qua API
Khi các doanh nghiệp AI dần chuyển sang tự huấn luyện mô hình chuyên biệt để đảm bảo tính tự chủ, nền tảng PyTRIO xuất hiện như một giải pháp đột phá giúp đơn giản hóa quy trình huấn luyện phức tạp thông qua mô hình TaaS (Training-as-a-Service).
- WeChat: Xiaohongshu Tech (dots.llm)T2 · 14/09 · 17:00
Tiểu Hồng Thư mã nguồn mở Iris: Mô hình Search Agent vượt trội ở phân khúc 35B và 397B
Đội ngũ AllSpark của Tiểu Hồng Thư vừa công bố mã nguồn mở cho Iris, mô hình Search Agent chuyên dụng. Hiện tại, trọng số và mã đánh giá đã được phát hành, các dữ liệu huấn luyện sẽ sớm được cập nhật.
- Hugging Face Daily PapersT2 · 14/09 · 14:00
Feyospace-v1: Đột phá trong huấn luyện mô hình AI chuyên biệt về an ninh mạng
Feyospace-v1 giới thiệu khung dữ liệu tập trung giúp tối ưu hóa việc huấn luyện các tác nhân AI an ninh mạng thông qua năm hệ thống chuyên biệt, giải quyết các rào cản về chi phí và môi trường thực thi để tạo ra hơn 164.000 quỹ đạo dữ liệu chất lượng cao.
- JiQiZhiXinT7 · 12/09 · 19:00
Từ định vị đến 'vấp ngã rồi đứng dậy': Robot có đang lặp lại con đường Scaling của mô hình ngôn ngữ lớn?
Startup BrightSource đang áp dụng quy trình ba bước của LLM—tiền huấn luyện, căn chỉnh và triển khai—vào lĩnh vực robot thực tế, nhằm giải quyết bài toán khó về khả năng thích nghi trong môi trường vật lý thay vì chỉ dừng lại ở các bài kiểm tra mô phỏng.
- Hugging Face Daily PapersT7 · 12/09 · 01:00
Xây dựng cầu nối đa ngôn ngữ: Tối ưu hóa dữ liệu để nâng cao khả năng suy luận của AI
Nghiên cứu giới thiệu phương pháp trộn dữ liệu giúp mô hình AI suy luận trực tiếp bằng ngôn ngữ của người dùng thay vì dịch sang tiếng Anh, đạt tỷ lệ chính xác trên 93% ở 60 ngôn ngữ.
- JiQiZhiXinT6 · 11/09 · 21:00
PhyFilter: Đột phá từ Bắc Hàng và NTU giúp robot 'suy luận' linh hoạt mà không cần dữ liệu khổng lồ
Nhóm nghiên cứu từ ĐH Hàng không Vũ trụ Bắc Kinh và NTU giới thiệu PhyFilter, một module vật lý giúp robot thích nghi với môi trường mới chỉ bằng dữ liệu huấn luyện hạn chế, mở ra hướng đi thay thế cho việc 'cày' dữ liệu quy mô lớn.
- The Decoder: AI NewsT6 · 11/09 · 20:58
Báo cáo Anthropic: Claude bị lạm dụng phát triển vũ khí và bị các phòng thí nghiệm Trung Quốc khai thác dữ liệu
Báo cáo mới từ Anthropic tiết lộ Claude bị lợi dụng để viết mã độc, phát triển phần mềm tên lửa tầm xa và drone tự hành, đồng thời bị các phòng thí nghiệm Trung Quốc khai thác quy mô lớn để huấn luyện mô hình.
- Hugging Face Daily PapersT6 · 11/09 · 18:30
Negative Self-Distillation: Cải thiện khả năng suy luận của AI bằng cách tránh các lỗi sai
Thay vì bắt chước đáp án mẫu, phương pháp Negative Self-Distillation (NSD) giúp mô hình ngôn ngữ tự tối ưu hóa bằng cách nhận diện và tránh xa các suy luận sai lầm, từ đó thúc đẩy tư duy phản biện và tự sửa lỗi.
- Together AI Blog nghiên cứu và sản phẩmT6 · 11/09 · 07:00
Together AI nâng cấp dịch vụ tinh chỉnh: Hỗ trợ mô hình mới và công cụ theo dõi thời gian thực
Together AI bổ sung hỗ trợ cho các dòng mô hình mới như GLM-5.3, Kimi K2.7 và Qwen 3.5, đồng thời tích hợp tính năng theo dõi thử nghiệm trực tiếp và kiểm soát dữ liệu chuyên sâu.
- TechCrunch: AIT6 · 11/09 · 03:58
Anthropic cáo buộc Alibaba, Moonshot AI và DeepSeek 'đánh cắp' tri thức từ Claude
Anthropic vừa công bố báo cáo cáo buộc các công ty AI hàng đầu Trung Quốc thực hiện gần 200 triệu lượt truy vấn nhằm 'chưng cất' (distill) dữ liệu từ mô hình Claude.
- Hugging Face Daily PapersT5 · 10/09 · 12:45
DF26: Khi ranh giới giữa video thật và giả do AI tạo ra đã hoàn toàn bị xóa nhòa
DF26 là bộ dữ liệu chuẩn mới gồm hơn 2.700 video, cho thấy cả con người lẫn các công cụ phát hiện deepfake hiện đại đều gần như bất lực trước các video do AI tạo ra. Nghiên cứu này gióng lên hồi chuông cảnh báo về sự cần thiết của các tiêu chuẩn kiểm chứng mới trong kỷ nguyên AI tạo sinh.
- Hugging Face Daily PapersT5 · 10/09 · 05:45
Graph Machine: Đột phá kiến trúc mới giúp tối ưu hóa tiền huấn luyện mô hình ngôn ngữ
Graph Machine (GM) là kiến trúc mới sử dụng các 'cạnh' (edges) linh hoạt để truy xuất dữ liệu, giúp duy trì độ phức tạp O(n) mà vẫn đảm bảo tính thưa thớt hiệu quả. Phương pháp này cho phép thay thế phần lớn các lớp Transformer truyền thống với hiệu suất vượt trội và chi phí tính toán thấp.
- JiQiZhiXinT4 · 09/09 · 18:45
NeoHorse-1: Bước tiến mới của TokenRhythm trong việc hiện thực hóa khả năng tự cải tiến (RSI) cho AI Agent
NeoHorse-1 giới thiệu phương pháp huấn luyện mô hình mới, cho phép AI Agent học hỏi từ kinh nghiệm thực tế thay vì chỉ dừng lại ở nhật ký, đánh dấu bước thử nghiệm quan trọng hướng tới mục tiêu tự cải tiến đệ quy (RSI).
- Rohan PaulT4 · 09/09 · 15:40
Chính phủ Mỹ cáo buộc 6 công ty AI Trung Quốc, bao gồm DeepSeek, 'đánh cắp' mô hình Mỹ quy mô lớn
NSA, CISA và FBI cáo buộc DeepSeek cùng 5 công ty AI Trung Quốc khác đã thực hiện hành vi chưng cất (distillation) trái phép các mô hình AI tiên tiến của Mỹ ở quy mô công nghiệp kể từ cuối năm 2024.
- Hugging Face Daily PapersT4 · 09/09 · 15:30
RelightFormer: Transformer tạo ảnh thế hệ mới cho kỹ thuật chiếu sáng vật thể đa góc nhìn
RelightFormer là mô hình Transformer đột phá giúp tái chiếu sáng vật thể từ một hoặc nhiều góc nhìn mà không cần ước tính các thuộc tính vật lý phức tạp. Bằng cách tận dụng dữ liệu từ bộ dataset LOD khổng lồ, mô hình đạt độ chính xác cao trong việc mô phỏng tương tác ánh sáng 3D.
- Dwarkesh Patel: Podcast & BlogT4 · 09/09 · 00:00
Nghiên cứu của Dwarkesh Patel: Chất lượng dữ liệu là chìa khóa thúc đẩy hiệu suất mô hình AI
Phân tích thực nghiệm cho thấy cải tiến dữ liệu giúp tăng hiệu suất tính toán gấp 12 lần, vượt xa mức 3,7 lần từ cải tiến kiến trúc mô hình, khẳng định dữ liệu đóng vai trò quan trọng gấp 3,24 lần so với thiết kế mô hình.
- Berkeley RDI: Blog (an toàn và đánh giá AI)T3 · 08/09 · 21:01
Berkeley RDI ra mắt CUA-Lite: Nền tảng mã nguồn mở chuẩn hóa cho tác nhân AI điều khiển máy tính
CUA-Lite cung cấp môi trường sandbox, bộ dữ liệu thống nhất và khung đánh giá chuẩn hóa cho các tác nhân AI hoạt động trên máy tính, hỗ trợ hơn 14 dòng mô hình khác nhau.
- JiQiZhiXinT3 · 08/09 · 04:45
LLaDA-Image: Đột phá mô hình tạo ảnh từ văn bản không cần tiền huấn luyện cặp ảnh-chữ
LLaDA-Image là mô hình Diffusion Transformer 6B mới, ưu tiên học cấu trúc hình ảnh trước khi thực hiện căn chỉnh ngôn ngữ, giúp đạt hiệu suất dẫn đầu trên bảng xếp hạng Qwen-Image-Bench.