Kỹ thuật triển khai
Vận hành mô hình trong thực tế: Tối ưu hóa suy luận, vRAM và chi phí, hạ tầng Serving (vLLM, Ollama).
2.718 bài thu thập170 tinh chọncập nhật đến 28/09 02:09
- OpenRouter: AnnouncementsT4 · 09/09 · 07:00
Hướng dẫn sử dụng API OpenRouter để chỉnh sửa ảnh với Nano Banana 2
OpenRouter chia sẻ hướng dẫn chi tiết cách dùng API để chỉnh sửa ảnh bằng mô hình Nano Banana 2, kèm ví dụ code Python/TypeScript và mẹo tối ưu hóa kết quả.
- Together AI Blog nghiên cứu và sản phẩmT4 · 09/09 · 07:00
Together AI giải mã 'MIGHT': Bộ khung chuẩn để xây dựng ứng dụng AI từ mã nguồn mở
Together AI giới thiệu khung MIGHT—một bộ công cụ toàn diện bao gồm Model, Inference, Gateways, Harness và Tools, giúp các nhà phát triển chuyển đổi từ mô hình đóng sang hệ sinh thái mã nguồn mở một cách hiệu quả.
- Claude: Blog (Web)T4 · 09/09 · 00:59
Anthropic chia sẻ bí quyết tối ưu chi phí và hiệu suất khi sử dụng Claude API
Anthropic hướng dẫn ba chiến lược giúp doanh nghiệp tiết kiệm chi phí khi dùng Claude: tận dụng bộ nhớ đệm prompt, loại bỏ các lỗi thiết kế prompt cũ và điều chỉnh độ phức tạp của tác vụ phù hợp với từng mô hình.
- Hugging Face Daily PapersT3 · 08/09 · 14:45
Tăng tốc LLM không mất dữ liệu bằng mô hình khuếch tán rời rạc
Nghiên cứu giới thiệu phương pháp kết hợp mô hình khuếch tán vào LLM để tạo nhiều token song song, giúp tăng tốc độ suy luận mà không làm giảm độ chính xác so với cách dự đoán tuần tự truyền thống.
- vLLM Blog chính thứcT3 · 08/09 · 07:00
vLLM kết hợp AgentX: Tối ưu hóa toàn diện cho các tác vụ suy luận AI Agent thực tế
Đội ngũ vLLM công bố tối ưu hóa hiệu suất cho các tác vụ AI Agent, đạt tốc độ ấn tượng 83K tokens/giây trên mỗi GPU với mô hình DeepSeek V4 Pro dựa trên chuẩn AgentX.
- The Decoder: AI NewsT3 · 08/09 · 01:27
Anthropic chi 517 tỷ USD thâu tóm hạ tầng tính toán, quyết tâm tự xây trung tâm dữ liệu
Anthropic vừa ký kết các hợp đồng hạ tầng trị giá 517 tỷ USD, đảm bảo nguồn cung 14,8 GW điện năng để phục vụ tham vọng tự xây dựng trung tâm dữ liệu riêng.
- TechNodeT2 · 07/09 · 12:30
DeepSeek dự kiến xây dựng siêu cụm 160.000 chip AI Huawei tại Nội Mông
DeepSeek đang lên kế hoạch triển khai cụm 160.000 chip Ascend 950DT của Huawei tại một trung tâm dữ liệu ở Nội Mông, đánh dấu một trong những dự án hạ tầng AI lớn nhất sử dụng công nghệ nội địa Trung Quốc.
- Tomer Tunguz Blog (phân tích VC)T2 · 07/09 · 07:00
Tomer Tunguz: Ba làn sóng tiêu thụ token AI từ Chatbot đến Hệ thống đa tác nhân
VC Tomer Tunguz dự báo sự bùng nổ tiêu thụ token AI qua ba giai đoạn: từ chatbot cá nhân (1 triệu token/ngày) đến các tác nhân thông minh (100-200 triệu) và hệ thống điều phối đa tác nhân (hàng tỷ token).
- PandailyCN · 06/09 · 21:15
DeepSeek xây dựng siêu cụm suy luận với 160.000 chip Huawei Ascend 950DT tại Nội Mông
DeepSeek đang triển khai một trong những cụm suy luận AI lớn nhất thế giới tại Nội Mông, sử dụng 160.000 chip Huawei Ascend 950DT với quy mô gigawatt, tùy thuộc vào tiến độ cung ứng phần cứng.
- JiQiZhiXinT7 · 05/09 · 18:15
GPT-6 Astra chính thức mở rộng quy mô: Reset hạn mức và hỗ trợ API cho người dùng chuyên nghiệp
OpenAI vừa chính thức mở rộng quyền truy cập GPT-6 Astra cho người dùng Pro, Enterprise và Business, đồng thời reset toàn bộ hạn mức sử dụng. Mô hình này hiện đã hỗ trợ API và tích hợp trên OpenRouter, cho phép thực hiện các tác vụ phức tạp như dựng mô hình 3D từ ảnh chụp.
- xAI: News (Web)T7 · 05/09 · 02:02
xAI ứng dụng Grok tối ưu chi phí mua sắm, tiết kiệm hơn 100.000 USD cho doanh nghiệp
xAI đã phát triển Haggle Bot dựa trên Grok để phân tích dữ liệu hợp đồng và chi tiêu, giúp doanh nghiệp cắt giảm hơn 100.000 USD bằng cách loại bỏ các tài khoản SaaS không sử dụng và các SKU dư thừa.
- Tomer Tunguz Blog (phân tích VC)T7 · 05/09 · 00:55
Tom Tunguz: Làn sóng nợ 4 nghìn tỷ USD đổ vào các trung tâm dữ liệu AI
Chuyên gia Tom Tunguz dự báo nhu cầu hạ tầng AI sẽ đẩy chi phí xây dựng trung tâm dữ liệu toàn cầu lên 5 nghìn tỷ USD, trong đó 4 nghìn tỷ USD cần huy động qua nợ vay, gây áp lực lớn lên thị trường tài chính.
- GitHub BlogT6 · 04/09 · 23:29
GitHub ra mắt Project HydraFusion: Tối ưu chi phí và hiệu suất cho Copilot nhờ điều phối đa mô hình
GitHub giới thiệu Project HydraFusion, giải pháp điều phối đa mô hình thông minh giúp cân bằng giữa chất lượng, chi phí và độ trễ bằng cách tự động chọn quy trình thực thi tối ưu cho từng tác vụ lập trình.
- Hugging Face Daily PapersT6 · 04/09 · 09:00
LatentPress: Đột phá nén ngữ cảnh trực tiếp vào không gian tiềm ẩn của AI
LatentPress giới thiệu phương pháp nén tài liệu và lịch sử hội thoại thành các token bộ nhớ liên tục, cho phép mô hình AI đọc trực tiếp mà không cần giải mã văn bản, giúp tăng hiệu suất xử lý dữ liệu dài gấp 4-16 lần.
- Latent SpaceT6 · 04/09 · 04:15
GPT-6 Astra: Kỹ sư AI tự động với chi phí chưa đầy 6 USD mỗi giờ
Khám phá những bài học thực tế từ việc sử dụng hơn 20 tỷ token của GPT-6 Astra để tối ưu hóa quy trình làm việc và tự động hóa kỹ thuật.
- OpenAI: Tin chính thức (RSS - lọc nội dung doanh nghiệp/khách hàng)T6 · 04/09 · 03:51
OpenAI công bố chương trình Daybreak, rót 1 tỷ USD hỗ trợ an ninh mạng cho hạ tầng thiết yếu
OpenAI ra mắt sáng kiến Daybreak với gói hỗ trợ 1 tỷ USD bao gồm công nghệ, đào tạo và tài trợ cho các đơn vị hạ tầng trọng yếu như điện lưới, cấp nước và chính quyền địa phương nhằm tăng cường khả năng phòng thủ mạng.
- Google AI: DEV tác giảT5 · 03/09 · 23:49
Google Cloud hướng dẫn chạy AI Agent 24/7 trên Cloud Run với chi phí chỉ 5,7 USD/tháng
Shir Meir Lador chia sẻ cách thiết lập AI Agent hoạt động liên tục trên Google Cloud Run, tối ưu chi phí vận hành chỉ với 5,7 USD mỗi tháng cho cấu hình cơ bản.
- JiQiZhiXinT5 · 03/09 · 21:15
Apple đột phá với IVT: Tư duy thị giác nội tại giúp tăng tốc suy luận video gấp 5 lần
Apple giới thiệu khung huấn luyện IVT, cho phép mô hình học cách dự đoán tương lai thông qua biểu diễn ẩn thay vì phải tạo ảnh trực tiếp, giúp tăng tốc độ suy luận video gấp 5 lần mà vẫn giữ được độ chính xác.
- JiQiZhiXinT5 · 03/09 · 19:15
RSI còn bao xa? Đội ngũ Trung Quốc đưa ra lời giải kỹ thuật đẳng cấp cho khả năng tự tiến hóa của AI
Thay vì chờ đợi mô hình tự huấn luyện, dự án EvoMap xây dựng hệ thống cho phép các Agent tích lũy và chia sẻ kinh nghiệm thực tế, giúp AI thực sự học hỏi từ sai lầm thay vì 'đọc xong rồi quên'.
- IT HomeT5 · 03/09 · 15:30
Đột phá công nghệ: Transistor Gallium Nitride mới chịu áp 4000V, mở đường cho xe điện và trung tâm dữ liệu
Các nhà nghiên cứu tại EPFL đã phát triển transistor GaN chịu được điện áp gần 4000V, gấp 5 lần thiết bị thương mại hiện nay, giúp tối ưu hiệu suất năng lượng cho xe điện và hệ thống AI.