Kỹ thuật triển khai
CHỦ ĐỀ · TRANG 8

Kỹ thuật triển khai

Vận hành mô hình trong thực tế: Tối ưu hóa suy luận, vRAM và chi phí, hạ tầng Serving (vLLM, Ollama).

2.718 bài thu thập170 tinh chọncập nhật đến 28/09 02:09

  1. Ant LingT7 · 22/08 · 12:00

    AntLing ra mắt Weight Cache Daemon cho SGLang: Tăng tốc khởi động mô hình gấp 780 lần

    AntLing vừa giới thiệu Weight Cache Daemon cho SGLang, giúp rút ngắn thời gian tải trọng số xuống còn 0,63 giây và giảm tổng thời gian khởi động engine từ 8,8 phút xuống chỉ còn 0,53 phút.

  2. Hugging Face Daily PapersT7 · 22/08 · 06:15

    FlowEvo: Bước tiến mới giúp AI tự tiến hóa thông qua quy trình và kỹ năng tự học

    FlowEvo là khung làm việc không cần huấn luyện, cho phép AI tự động chuyển đổi các quy trình thành công thành kỹ năng có thể tái sử dụng, giúp hệ thống liên tục phát triển và tối ưu hóa hiệu suất qua từng tác vụ.

  3. Hugging Face Daily PapersT7 · 22/08 · 01:00

    Bài toán khó của Embedder: Dùng LLM thay thế mô hình nhúng truyền thống có đáng không?

    Nghiên cứu so sánh toàn diện cho thấy dù LLM có hiệu suất ngang ngửa mô hình nhúng chuyên dụng, nhưng chi phí vận hành lại đắt gấp 1.400 lần và tốc độ xử lý chậm hơn đáng kể.

  4. LMSYS: Blog (nhóm Chatbot Arena)T7 · 22/08 · 00:56

    Ling-3.0-flash: Tối ưu hóa độ trễ giải mã lên 54% trên 4 GPU Blackwell

    Đội ngũ Ant Group và RadixArk đã tối ưu hóa mô hình Ling-3.0-flash, giúp tăng tốc độ giải mã đơn yêu cầu từ 288 lên 606 tok/s và giảm độ trễ TPOT xuống còn 1.53 ms nhờ kiến trúc MoE cải tiến.

  5. WeChat: DeepSeekT6 · 21/08 · 16:12

    DeepSeek ra mắt mô hình thị giác đa phương thức V4-Flash-Vision-Exp

    DeepSeek vừa trình làng V4-Flash-Vision-Exp, mô hình đa phương thức có khả năng xử lý hình ảnh mạnh mẽ ngang ngửa Opus-4.8. Người dùng có thể truy cập qua API với cơ chế tính phí theo token và tận dụng Files API mới để tối ưu hóa việc tải lên hình ảnh.

  6. Bộ KH&CNT6 · 21/08 · 07:00

    NVIDIA đề xuất 4 trụ cột hợp tác chiến lược thúc đẩy AI tại Việt Nam

    NVIDIA đề xuất hỗ trợ Việt Nam phát triển mô hình ngôn ngữ lớn (LLM) nội địa, nâng cấp hạ tầng GPU, đào tạo nhân lực và đưa hệ sinh thái AI Việt Nam vươn tầm quốc tế.

  7. Hugging Face: BlogT6 · 21/08 · 00:06

    Hugging Face ra mắt dòng mô hình DSpark: Tăng tốc suy luận lên đến 3,18 lần

    Hugging Face giới thiệu các mô hình dự đoán DSpark cho dòng LFM2.5, giúp tăng tốc độ xử lý trên GPU lên 3,18 lần và thiết bị đầu cuối lên 2,87 lần mà không làm giảm chất lượng đầu ra. Công nghệ này đã hỗ trợ mã nguồn mở cho llama.cpp và SGLang.

  8. LMSYS: Blog (nhóm Chatbot Arena)T5 · 20/08 · 00:56

    Tối ưu hóa DeepSeek-V4-Pro trên GPU H20: Đột phá hiệu năng tiệm cận chip B300

    Nhóm LMSYS đã tối ưu hóa mô hình MoE 1.6 nghìn tỷ tham số DeepSeek-V4-Pro trên GPU H20, đạt tốc độ 271 tokens/s, thu hẹp đáng kể khoảng cách hiệu năng so với chip B300.

  9. Hugging Face: BlogT4 · 19/08 · 21:05

    Liquid AI ra mắt dòng LFM 2.5 với kỹ thuật QAD: Khôi phục 97% độ chính xác sau khi lượng tử hóa

    Liquid AI giới thiệu các checkpoint Q4_0 cho dòng mô hình LFM 2.5, sử dụng kỹ thuật chưng cất nhận thức lượng tử (QAD) để duy trì tốc độ cao trong khi khôi phục tới 97% độ chính xác so với chuẩn BF16.

  10. Hugging Face Daily PapersT4 · 19/08 · 15:00

    Giải mã kỹ năng của AI Agent: Tại sao chúng hiệu quả và khi nào thì thất bại?

    Nghiên cứu phân tích sâu về cách các gói kỹ năng (skills) hỗ trợ LLM Agent, đồng thời chỉ ra những giới hạn và nguyên nhân thất bại thông qua thực nghiệm định lượng và phân tích quỹ đạo hành động.

  11. JiQiZhiXinT4 · 19/08 · 14:00

    WAM-Diff2: Đột phá tốc độ giải mã gấp 15 lần cho mô hình VLA trong xe tự lái

    Các nhà nghiên cứu từ Đại học Phúc Đán và Yinwang giới thiệu WAM-Diff2, khung mô hình VLA giúp chuyển đổi từ kiến trúc tự hồi quy sang khuếch tán, tăng tốc độ giải mã lên 15,1 lần mà vẫn giữ nguyên hiệu suất đa nhiệm.

  12. Hugging Face: BlogT4 · 19/08 · 02:05

    Bộ nhớ cho AI Agent: Không phải cứ nhiều là tốt, cần hiệu chỉnh theo năng lực mô hình

    Nghiên cứu từ IBM cho thấy việc tối ưu bộ nhớ AI Agent cần tùy biến theo năng lực mô hình: mô hình mạnh nên dùng toàn bộ hướng dẫn, trong khi mô hình yếu đạt hiệu quả cao nhất với phương pháp truy xuất chọn lọc.

  13. IT HomeT3 · 18/08 · 22:00

    Các ông lớn công nghệ ồ ạt xây nhà máy điện khí cho trung tâm dữ liệu, đe dọa mục tiêu khí hậu Mỹ

    Để đáp ứng cơn khát điện của AI, các tập đoàn như Amazon và Microsoft đang tự xây dựng hàng loạt nhà máy điện khí, có nguy cơ làm tăng 20% lượng khí thải carbon của ngành điện Mỹ và phá vỡ các cam kết bền vững trước đó.

  14. Hugging Face Daily PapersT3 · 18/08 · 15:30

    Large Discovery Model: Bước tiến mới trong tối ưu hóa khám phá khoa học bằng AI

    LDM kết hợp mô hình tạo sinh với mô hình thay thế Bayesian để dự đoán hiệu suất và định lượng độ bất định, giúp tối ưu hóa các không gian giả thuyết phức tạp như phân tử hay protein một cách chính xác hơn.

  15. Hugging Face Daily PapersT3 · 18/08 · 13:15

    DumpsterCluster: Tận dụng GPU cũ giá rẻ để chạy mô hình LLaMA-70B

    Nghiên cứu này chứng minh khả năng xây dựng cụm máy chủ 128 GPU từ linh kiện cũ để chạy suy luận LLM với chi phí thấp hơn đáng kể so với phần cứng hiện đại, đồng thời phân tích tính bền vững và hiệu quả kinh tế của giải pháp này.

  16. PandailyT3 · 18/08 · 09:15

    DeepSeek ra mắt mã nguồn mở Harness: Đặt cược vào nền tảng Agent thay vì sản phẩm đơn lẻ

    DeepSeek vừa phát hành mã nguồn mở Harness (dsh), một hệ thống dựa trên microkernel Cordis nơi mọi thành phần đều là plugin. Đây là bước đi chiến lược nhằm biến Harness thành nền tảng hạ tầng tiêu chuẩn cho kỷ nguyên AI Agent.

  17. Latent SpaceT3 · 18/08 · 06:30

    Stripe thâu tóm OpenRouter với giá 7 tỷ USD

    Không cần GPU hay các tác nhân AI phức tạp, Stripe tập trung vào việc sở hữu hạ tầng và mạng lưới phân phối cực kỳ mạnh mẽ thông qua thương vụ này.

  18. NVIDIA BlogT2 · 17/08 · 20:22

    NVIDIA hợp tác cùng SB Energy đảm bảo nguồn điện tại Ohio, OpenAI xác nhận là khách hàng thuê

    NVIDIA bắt tay với SB Energy để giành quyền ưu tiên sử dụng điện tại khu công nghệ PORTS-Pike (Ohio) nhằm vận hành hạ tầng tính toán, với OpenAI là đối tác thuê hạ tầng chính.

  19. Jensen HuangT2 · 17/08 · 20:06

    Jensen Huang bắt tay SB Energy xây dựng siêu nhà máy AI cho OpenAI

    NVIDIA hợp tác với SB Energy xây dựng hạ tầng AI tại Ohio với công suất ban đầu 4,25 GW, phục vụ OpenAI. Dự án dự kiến mở rộng lên 16 GW vào năm 2030, tạo ra cơ hội kinh tế trị giá hàng trăm tỷ USD.

  20. OpenRouter: AnnouncementsT2 · 17/08 · 19:22

    OpenRouter ra mắt bảng điều khiển Activity và Analytics API: Quản lý chi phí AI theo thời gian thực

    OpenRouter vừa giới thiệu bảng điều khiển Activity và API phân tích mới, cho phép người dùng theo dõi chi phí, lượng token và hiệu suất sử dụng AI chi tiết theo từng mô hình hoặc tác nhân (agent).

Kỹ thuật triển khai — Chủ Đề AI · Trang 8 | AIHOT.vn