Kỹ thuật triển khai
Vận hành mô hình trong thực tế: Tối ưu hóa suy luận, vRAM và chi phí, hạ tầng Serving (vLLM, Ollama).
2.718 bài thu thập170 tinh chọncập nhật đến 28/09 03:21
- OpenRouter: AnnouncementsT2 · 14/09 · 07:00
Hướng dẫn OpenRouter: Tự động đánh giá đầu ra của AI Agent bằng phương pháp LLM-as-a-judge
OpenRouter chia sẻ cách sử dụng mô hình AI làm giám khảo để chấm điểm tự động cho các phản hồi của AI Agent, giúp kiểm soát chất lượng các câu trả lời mở mà phương pháp kiểm thử truyền thống không làm được.
- JiQiZhiXinCN · 13/09 · 23:00
Tối ưu hóa MiniMax H3 trên vLLM-Omni: Đột phá tốc độ tạo video thời gian thực
Bài viết phân tích cách vLLM-Omni và FastVideo FastH3 giải quyết các nút thắt hệ thống trong MiniMax H3, giúp rút ngắn thời gian tạo video 10 giây xuống dưới 9 giây thông qua tối ưu hóa toàn diện từ DiT đến đóng gói MP4.
- JiQiZhiXinCN · 13/09 · 17:00
Khi nào AI sẽ ngừng 'suy nghĩ quá mức'?
Bài viết phân tích vấn đề LLM tiêu tốn tài nguyên do suy nghĩ quá mức, đồng thời đề xuất các giải pháp tối ưu hóa chi phí và hiệu suất suy luận thông qua cơ chế tự điều chỉnh.
- JiQiZhiXinCN · 13/09 · 17:00
Chi phí suy luận giảm 96%, hiệu năng vượt trội: Khi mô hình nhỏ biết tự 'cầu cứu' AI lớn
Pyromind giới thiệu PyroDash, giải pháp cho phép các mô hình nhỏ tự quyết định thời điểm cần gọi mô hình lớn hỗ trợ. Cách tiếp cận này giúp cắt giảm chi phí vận hành tới 96% mà vẫn duy trì, thậm chí cải thiện độ chính xác so với việc chỉ dùng mô hình lớn.
- MarkTechPostCN · 13/09 · 13:09
Kỹ thuật tối ưu ngữ cảnh cho AI Agent: Giải pháp chống tràn bộ nhớ và mất mục tiêu
Bài viết phân tích 4 cơ chế then chốt giúp AI Agent xử lý các tác vụ dài hạn hiệu quả, bao gồm quản lý ngân sách ngữ cảnh, nén dữ liệu, duy trì trạng thái công việc và bộ nhớ xuyên phiên.
- JiQiZhiXinT7 · 12/09 · 21:00
DeepSeek V4.1 Flash: 'Phép màu' công nghệ khiến bản Pro phải dè chừng
DeepSeek V4.1 Flash gây sốt khi vượt mặt bản Pro về hiệu suất dù có tham số nhỏ hơn, nhờ những đột phá trong tối ưu hóa KV cache và chi phí vận hành cực thấp.
- OpenAI: Tin chính thức (RSS - lọc nội dung doanh nghiệp/khách hàng)T7 · 12/09 · 00:02
OpenAI hé lộ cách nền tảng Habitat vận hành hệ thống lưu trữ cho hơn 1 tỷ người dùng ChatGPT (Phần 1)
OpenAI chia sẻ về quá trình phát triển Habitat, nền tảng lưu trữ xử lý 70 triệu yêu cầu mỗi giây, quản lý hơn 500PB dữ liệu phục vụ 1 tỷ người dùng hàng tuần trên toàn cầu.
- JiQiZhiXinT6 · 11/09 · 21:00
openJiuwen ra mắt khung RSI: AI tự tối ưu hóa, nâng tầm hiệu suất cho tác vụ văn phòng
Khung RSI của openJiuwen cho phép các tác nhân AI tự học hỏi và cải tiến quy trình làm việc thông qua phản hồi thực tế, giúp tối ưu hóa cả phương pháp lẫn kết quả đầu ra với chi phí tính toán tối ưu.
- QbitAIT6 · 11/09 · 08:30
Đỉnh cao mã nguồn mở: RunningHub giúp MiniMax H3 tăng tốc gấp 12 lần, chạy mượt ngay trên máy cá nhân
RunningHub tối ưu hóa hiệu suất vượt trội, cho phép tạo video 15 giây chỉ trong 50 giây trên MiniMax H3, giúp việc triển khai cục bộ trở nên cực kỳ nhanh chóng.
- OpenAI: Tin chính thức (RSS - lọc nội dung doanh nghiệp/khách hàng)T6 · 11/09 · 03:16
OpenAI ra mắt bản Public Beta của Agents API
OpenAI chính thức phát hành bản thử nghiệm công khai cho Agents API, cho phép các nhà phát triển truy cập hạ tầng mạnh mẽ của Codex thông qua một lệnh gọi API duy nhất trên nền tảng đám mây.
- OpenAI: Tin chính thức (RSS - lọc nội dung doanh nghiệp/khách hàng)T6 · 11/09 · 00:16
OpenAI ra mắt mô hình giọng nói song công GPT-Live-1 qua API
OpenAI vừa giới thiệu GPT-Live-1, mô hình giọng nói cho phép tương tác hai chiều thời gian thực, hỗ trợ tích hợp các mô hình mạnh mẽ như GPT-6 Astra với mức giá 0,05 USD mỗi phút.
- LlamaIndex: Sản phẩm, kỹ thuật và đánh giáT5 · 10/09 · 23:00
LlamaIndex giới thiệu OCR thông minh: Giải pháp cân bằng chi phí và độ chính xác cho tài liệu
LlamaIndex đề xuất quy trình OCR hai bước: dùng công cụ miễn phí để quét sơ bộ, sau đó chỉ dùng mô hình thị giác (VLM) cho các trang quan trọng nhằm tối ưu chi phí và hiệu suất.
- Hugging Face: BlogT5 · 10/09 · 18:59
Hugging Face ra mắt Workflow1111: Tái hiện sức mạnh của AUTOMATIC1111 bằng Gradio
Hugging Face giới thiệu Workflow1111, sử dụng 73 node Gradio để tái lập hầu hết các tính năng chủ chốt của AUTOMATIC1111, từ tạo ảnh, inpaint, ControlNet đến hỗ trợ video, mang lại trải nghiệm linh hoạt và trực quan hơn.
- DeepSeek: Nhật ký cập nhật APIT5 · 10/09 · 12:58
DeepSeek ra mắt V4.1-Flash: Mô hình đa phương thức nhỏ gọn với giá API siêu rẻ
DeepSeek vừa trình làng V4.1-Flash, phiên bản nhỏ nhất trong dòng kiến trúc mới với khả năng hiểu hình ảnh vượt trội và hiệu suất ấn tượng trên các bài kiểm tra chuyên sâu, đi kèm chính sách giảm giá API.
- Hugging Face: BlogT5 · 10/09 · 07:00
Hugging Face tối ưu huấn luyện GRPO: Dùng LoRA và Storage Bucket tăng tốc 3.9 lần, loại bỏ NCCL
Hugging Face ra mắt AsyncGRPOTrainer giúp tách biệt quá trình huấn luyện LoRA và suy luận vLLM trên các máy chủ khác nhau mà không cần NCCL, giúp tăng tốc độ huấn luyện lên 3.9 lần.
- Hugging Face Daily PapersT5 · 10/09 · 05:45
Graph Machine: Đột phá kiến trúc mới giúp tối ưu hóa tiền huấn luyện mô hình ngôn ngữ
Graph Machine (GM) là kiến trúc mới sử dụng các 'cạnh' (edges) linh hoạt để truy xuất dữ liệu, giúp duy trì độ phức tạp O(n) mà vẫn đảm bảo tính thưa thớt hiệu quả. Phương pháp này cho phép thay thế phần lớn các lớp Transformer truyền thống với hiệu suất vượt trội và chi phí tính toán thấp.
- Cognition Mô hình / Devin Blog (Web)T4 · 09/09 · 23:00
Cognition ra mắt mô hình lập trình SWE-2: Hiệu năng tiệm cận đỉnh cao với chi phí tối ưu
Cognition giới thiệu SWE-2, mô hình lập trình dựa trên Kimi K33, đạt 50% điểm số trên FrontierCode 1.1. Dù hiệu năng gần bằng Fable 5.1, SWE-2 giúp tiết kiệm tới 64% chi phí vận hành.
- OpenRouter: AnnouncementsT4 · 09/09 · 21:27
OpenRouter ra mắt định tuyến tại Mỹ, đảm bảo lưu trữ dữ liệu theo khu vực
OpenRouter vừa giới thiệu tính năng định tuyến khu vực Mỹ (US In-Region Routing), cho phép dữ liệu được giải mã và xử lý nội bộ tại Mỹ, tương tự như giải pháp đã triển khai cho EU trước đó nhằm tuân thủ quy định về lưu trữ dữ liệu.
- Hugging Face Daily PapersT4 · 09/09 · 12:15
BeaconKV: Tối ưu bộ nhớ KV Cache cho mô hình suy luận lớn thông qua truy vấn Beacon
BeaconKV giải quyết nút thắt bộ nhớ khi suy luận dài bằng cách xác định các 'Thought Revisiting Tokens' quan trọng, giúp nén KV cache hiệu quả mà không làm giảm khả năng truy xuất ngữ cảnh xa.
- WeChat: KhazixT4 · 09/09 · 07:20
Bí quyết tối ưu Token khi chọn cấp độ suy luận trên GPT-6 Astra
Bài viết giải mã ý nghĩa các cấp độ 'Reasoning Effort' trên GPT-6 Astra, giúp bạn hiểu cách điều chỉnh ngân sách tư duy của AI để tiết kiệm chi phí mà vẫn đạt hiệu quả cao nhất.