Hugging Face đã cập nhật thư viện Transformers, cho phép người dùng tải trực tiếp các mô hình GGUF từ Hub thông qua hàm from_pretrained và tận dụng tối ưu hóa từ nhân Metal của ggml.
Vì sao đáng đọc: Đây là cập nhật quan trọng giúp đơn giản hóa quy trình triển khai mô hình AI cục bộ, kết hợp sức mạnh của hệ sinh thái Hugging Face với hiệu suất tối ưu của llama.cpp.
20/09
Chủ Nhật · 1 tin
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Trang web này minh họa cách trích xuất trọng số mô hình AI bằng cách gửi dữ liệu base64 qua các yêu cầu GET đơn giản, sau đó chạy trực tiếp trên llama-server. Phương pháp này được thiết kế để vượt qua các hạn chế trong môi trường mạng bị kiểm soát.
On-device, on Android, nothing leaving the phone. MiniCPM5-2B via llama.cpp GGUF in @RunAnywhereAI r…
DịchOpenBMB xác nhận mô hình MiniCPM5-2B đã có thể chạy suy luận hoàn toàn cục bộ trên thiết bị Android thông qua llama.cpp, đảm bảo dữ liệu người dùng không bị rò rỉ ra ngoài.
🐺 A tiny model powering an autonomous AI trading floor. Developer @ashdebugs built Wall Street of …
DịchNhà phát triển đã sử dụng mô hình MiniCPM5-1B để tạo ra một sàn giao dịch với 4 AI Agent có tính cách khác biệt, tự đưa ra quyết định và cạnh tranh trong môi trường mô phỏng mà không cần dùng đến API đám mây.
llama.cpp cho phép chạy các mô hình AI mạnh mẽ ngay trên thiết bị cá nhân mà không cần API hay kết nối internet, đảm bảo quyền riêng tư tuyệt đối. Công cụ này tối ưu hóa hiệu suất trên nhiều loại phần cứng, hỗ trợ các model mới nhất như Qwen 3.6 và Gemma 4.