Kỹ thuật triển khai
CHỦ ĐỀ · TRANG 2

Kỹ thuật triển khai

Vận hành mô hình trong thực tế: Tối ưu hóa suy luận, vRAM và chi phí, hạ tầng Serving (vLLM, Ollama).

2.718 bài thu thập172 tinh chọncập nhật đến 28/09 00:44

  1. PandailyT4 · 23/09 · 09:01

    Trung Quốc xây dựng trung tâm dữ liệu trên quỹ đạo: AI không gian, vệ tinh đám mây và kết nối laser 100Gbps

    Trung Quốc đang tích cực triển khai các mảnh ghép cho trung tâm dữ liệu trên quỹ đạo thông qua việc thử nghiệm AI tích hợp, phần mềm vệ tinh đám mây và liên kết laser tốc độ 100Gbps.

  2. Epoch AI: Nghiên cứu, dữ liệu và đánh giáT4 · 23/09 · 04:40

    Báo cáo Epoch AI: Chi phí để đạt cùng mức hiệu năng AI giảm 47% mỗi quý

    Nghiên cứu từ Epoch AI cho thấy chi phí để đạt được cùng một mức hiệu năng AI giảm trung bình 47% mỗi quý. Tốc độ này cho thấy sự tiến bộ vượt bậc trong hiệu quả tính toán kể từ khi các mô hình ngôn ngữ lớn thương mại ra đời vào cuối năm 2021.

  3. TiboT4 · 23/09 · 04:37

    OpenAI ra mắt bộ đôi GPT-6 Sol và Luna: Hiệu năng cao, giá API giảm 50%

    OpenAI vừa bổ sung GPT-6 Sol và Luna vào dòng GPT-6, tối ưu hóa từ công nghệ Astra để tăng tốc độ và giảm 50% chi phí API so với mức giá khuyến mãi của GPT-5.6.

  4. OpenAI: Tin chính thức (RSS - lọc nội dung doanh nghiệp/khách hàng)T4 · 23/09 · 03:28

    OpenAI nâng cấp hệ thống Prompt Caching và công cụ chẩn đoán cho GPT-6

    OpenAI tối ưu hóa hệ thống bộ nhớ đệm cho GPT-6, giúp giảm tới 90% chi phí token cho các nội dung lặp lại trong vòng 30 phút, đồng thời bổ sung công cụ chẩn đoán mới.

  5. Artificial Analysis bài đầy đủ (Web)T4 · 23/09 · 02:41

    Artificial Analysis đánh giá GPT-6 Sol và Luna: Chi phí giảm một nửa, hiệu năng biến động

    Artificial Analysis công bố kết quả đánh giá GPT-6 Sol và Luna của OpenAI. Với mức giá giảm 50% so với GPT-5.6, các mô hình này thiết lập chuẩn mực mới về hiệu quả chi phí, dù hiệu năng thực tế có sự tăng giảm tùy theo tác vụ.

  6. OpenAI: Tin chính thức (RSS - lọc nội dung doanh nghiệp/khách hàng)T4 · 23/09 · 02:13

    OpenAI ra mắt bộ đôi GPT-6 Sol và Luna, giảm 50% giá API so với bản tiền nhiệm

    OpenAI vừa giới thiệu GPT-6 Sol và Luna, tối ưu hóa từ kiến trúc Astra để tăng tốc độ và giảm 50% chi phí API so với GPT-5.6, giúp tiếp cận công nghệ mạnh mẽ với mức giá cạnh tranh hơn.

  7. Sherwin WuT4 · 23/09 · 01:47

    OpenAI ra mắt GPT-6 Sol và Luna: Giá API giảm 50%, mở ra kỷ nguyên tính phí theo tỷ token

    OpenAI vừa công bố bộ đôi GPT-6 Sol và Luna với chi phí API rẻ hơn 50% so với thế hệ trước. Đáng chú ý, mức giá mới chỉ còn 0,10 USD cho mỗi triệu token đầu vào, báo hiệu xu hướng tính phí theo tỷ token trong tương lai gần.

  8. OpenRouter: AnnouncementsT4 · 23/09 · 00:21

    So sánh Jev 1.13 và Claude Opus 5: Hiệu năng phân loại dữ liệu ngân hàng trên OpenRouter

    Thử nghiệm trên 3.080 mẫu hội thoại ngân hàng cho thấy Jev 1.13 có độ chính xác 81%, thấp hơn Claude Opus 5 (84,4%) nhưng tốc độ phản hồi nhanh gấp 13 lần và chi phí rẻ hơn đáng kể.

  9. LlamaIndex: Sản phẩm, kỹ thuật và đánh giáT3 · 22/09 · 21:38

    LiteParse cập nhật tháng 9: Tăng tốc PDFium 25%, bổ sung định vị thị giác và API định tuyến

    LlamaIndex ra mắt LiteParse 2.14.6 với tối ưu hóa bộ nhớ, giúp giảm thời gian trích xuất văn bản xuống còn 2,76ms/trang, đồng thời bổ sung tính năng định vị thị giác và API is-complex.

  10. Hugging Face Daily PapersT3 · 22/09 · 21:30

    TAPe+ML: Kiến trúc thị giác máy tính siêu gọn nhẹ cho đa tác vụ

    TAPe+ML v3 là hệ thống thị giác máy tính đột phá với chưa đầy 100.000 tham số, sử dụng lý thuyết nhận thức chủ động để xử lý hiệu quả các tác vụ phân loại, phát hiện vật thể và phân đoạn ảnh với độ chính xác ấn tượng.

  11. OpenRouter: AnnouncementsT3 · 22/09 · 19:51

    OpenRouter ra mắt Batch API: Giảm 50% chi phí cho các tác vụ xử lý hàng loạt

    OpenRouter vừa giới thiệu Batch API cho phép xử lý yêu cầu không đồng bộ trong vòng 24 giờ với mức giá ưu đãi chỉ bằng một nửa so với thông thường, hỗ trợ hơn 70 mô hình AI khác nhau.

  12. Hugging Face: BlogT3 · 22/09 · 18:05

    Thư viện Transformers giờ đây hỗ trợ chạy trực tiếp mô hình GGUF với hiệu suất tiệm cận llama.cpp

    Hugging Face đã cập nhật thư viện Transformers, cho phép người dùng tải trực tiếp các mô hình GGUF từ Hub thông qua hàm from_pretrained và tận dụng tối ưu hóa từ nhân Metal của ggml.

  13. JiQiZhiXinT3 · 22/09 · 17:45

    Khi sở hữu 10.000 hay 100.000 GPU: Làm thế nào để mở rộng quy mô huấn luyện RL?

    Bài viết phân tích chiến lược tối ưu hóa Batch Size trong huấn luyện Reinforcement Learning (RL) quy mô lớn, giúp cân bằng giữa hiệu suất tính toán và thời gian huấn luyện để tiết kiệm chi phí vận hành hàng triệu USD.

  14. Artificial AnalysisT3 · 22/09 · 08:51

    Đánh giá Step 5 Preview: Hiệu năng ngang ngửa đối thủ nhưng chi phí rẻ gấp 2.8 lần

    Mô hình Step 5 Preview của StepFun đạt 44 điểm trên bảng xếp hạng Artificial Analysis, ngang hàng với Kimi K3. Điểm nhấn là chi phí vận hành chỉ khoảng 0.72 USD mỗi tác vụ, tối ưu hơn gần 3 lần so với các mô hình cùng phân khúc.

  15. Tomer Tunguz Blog (phân tích VC)T3 · 22/09 · 00:03

    Tomer Tunguz: AI chuyên biệt thay thế lệnh 'if-then', giảm chi phí vận hành tới 200 lần

    Tomer Tunguz chỉ ra rằng các bộ ra quyết định chuyên biệt như Jev và SemIf đang thay thế các lệnh logic 'if-then' truyền thống, giúp tăng độ chính xác lên gấp đôi và giảm chi phí vận hành từ 76 đến 209 lần so với các mô hình AI tạo sinh thông thường.

  16. JiQiZhiXinT2 · 21/09 · 23:45

    Đột phá AI: Giảm 50% chi phí huấn luyện với mô hình 'Dự đoán khái niệm' từ Shanghai AI Lab

    Nhóm nghiên cứu từ Shanghai AI Lab và ĐH Giao thông Thượng Hải giới thiệu mô hình NCP-ArchPreview, thay thế dự đoán từ ngữ (NTP) bằng dự đoán khái niệm (NCP), giúp tăng tốc độ hội tụ gấp 1,95 lần và cải thiện hiệu suất suy luận đáng kể.

  17. OpenRouter: AnnouncementsT2 · 21/09 · 07:00

    Mô hình ra quyết định Jev của TypeSafe chính thức có mặt trên OpenRouter

    Mô hình Jev (phiên bản 1.13) từ TypeSafe hiện đã khả dụng thông qua OpenRouter Decisions API, cho phép các nhà phát triển tích hợp khả năng ra quyết định chuyên sâu vào ứng dụng.

  18. Fireworks AI (Web)CN · 20/09 · 23:00

    Fireworks AI ra mắt FireRouter: Tương lai của AI không nằm ở một mô hình duy nhất

    Fireworks AI giới thiệu FireRouter, giải pháp tối ưu hóa hiệu suất bằng cách điều hướng tác vụ thông minh qua 18 mô hình khác nhau, dựa trên phân tích từ 113 bài kiểm tra DeepSWE v1.1.

  19. JiQiZhiXinT7 · 19/09 · 23:30

    KV Cache không cần 'chọn lọc kỹ'? Phương pháp xóa ngẫu nhiên đạt hiệu suất tương đương, tăng tốc độ suy luận tới 43%

    Nghiên cứu mới từ Salesforce và UIUC cho thấy việc xóa ngẫu nhiên các token trong KV Cache mang lại hiệu quả tương đương các thuật toán phức tạp, đồng thời giúp tăng đáng kể tốc độ suy luận nhờ giảm tải tính toán.

  20. VietnamPlus Công nghệT7 · 19/09 · 12:45

    Nvidia dự báo doanh số chip tăng gấp đôi nhờ cơn sốt đầu tư AI toàn cầu

    CEO Jensen Huang khẳng định nhu cầu AI từ chính phủ và doanh nghiệp đang bùng nổ, thúc đẩy Nvidia chuyển dịch từ cung cấp GPU đơn thuần sang tối ưu hóa toàn diện hệ thống AI.

Kỹ thuật triển khai — Chủ Đề AI · Trang 2 | AIHOT.vn