26/09

Thứ Bảy · 1 tin

24/09

Thứ Năm · 1 tin

23/09

Thứ Tư · 1 tin
NVIDIA Technical Blog: Agentic AI / Generative AI
Nghiên cứuĐiểm AI 53/100

NVIDIA ra mắt SWE-Serve: Vạch trần khoảng cách giữa kiểm thử cục bộ và thực tế triển khai AI

NVIDIA hợp tác cùng đội ngũ SGLang giới thiệu chuẩn đo lường SWE-Serve, sử dụng 53 tác vụ kỹ thuật thực tế từ 83 pull request của SGLang để đánh giá hiệu năng của các AI agent trong môi trường triển khai thực tế.

21/09

Thứ Hai · 2 tin
Qwen@Alibaba_Qwen
Sản phẩmĐiểm AI 64/100

SGLang-Diffusion hỗ trợ Qwen-Image 2.1: Tạo ảnh, chỉnh sửa đa hình và xuất file RGBA trong suốt

Thanks @sgl_project for the day-0 support! 🙌 SGLang-Diffusion now serves Qwen-Image-2.1: text-to-im…

DịchSGLang-Diffusion vừa cập nhật hỗ trợ Qwen-Image 2.1, cho phép thực hiện tạo ảnh từ văn bản, chỉnh sửa nhiều ảnh và xuất file RGBA trong suốt chỉ với một checkpoint duy nhất.

09/09

Thứ Tư · 1 tin
Ant Ling@AntLingAGI
Mô hìnhĐiểm AI 54/100

Cùng sự kiệnAnt Group ra mắt mô hình đa phương thức Ling-3.0-flash-VL với cửa sổ ngữ cảnh 1 triệu token

Thanks @sgl_project community! The Ling series finally have eyes and we appreciate our day0 partners…

DịchAnt Group vừa trình làng Ling-3.0-flash-VL, mô hình MoE hỗ trợ hiểu hình ảnh và video chuyên sâu với cửa sổ ngữ cảnh lên tới 1 triệu token, đồng thời được SGLang hỗ trợ ngay từ ngày đầu ra mắt.

Cùng sự kiện, bài đại diện «Ant Group ra mắt mô hình đa phương thức Ling-3.0-flash-VL với khả năng phản hồi thị giác»

08/09

Thứ Ba · 1 tin
ModelBest OpenBMB@OpenBMB
Mô hìnhĐiểm AI 55/100

OpenBMB ra mắt MiniCPM5-2B, hỗ trợ triển khai tức thì qua SGLang

Big thanks to @sgl_project for the day-0 support! MiniCPM5-2B is ready to deploy with SGLang today.

DịchOpenBMB vừa giới thiệu MiniCPM5-2B với khả năng triển khai ngay lập tức qua SGLang. Trên card RTX 5090, mô hình đạt tốc độ giải mã ấn tượng hơn 250 tok/s, tối ưu hóa hiệu suất cho các tác vụ lập trình.

31/08

Thứ Hai · 1 tin

29/08

Thứ Bảy · 1 tin

28/08

Thứ Sáu · 1 tin
LMSYS: Blog (nhóm Chatbot Arena)
Nghiên cứuĐiểm AI 65/100

Tinh chọnMiniMax-H3 trên 8x H200: Tăng tốc không mất dữ liệu lên tới 1,95 lần

Nhóm SGLang Diffusion thử nghiệm MiniMax-H3 trên 8 GPU NVIDIA H200, đạt tốc độ nhanh gấp 1,95 lần so với Diffusers mà không làm giảm chất lượng hình ảnh.


Vì sao đáng đọc: Đây là bước tiến kỹ thuật quan trọng trong tối ưu hóa suy luận video, cung cấp số liệu thực tế cho các nhà phát triển AI về hiệu năng phần cứng cao cấp.

26/08

Thứ Tư · 3 tin
Qwen@Alibaba_Qwen
Mô hìnhĐiểm AI 57/100

Cùng sự kiệnQwen3.8-Flash-Next ra mắt: Mô hình 125B tối ưu hiệu suất với công nghệ N-gram

Big thanks to @sgl_project for the day-0 support! 🙌 Qwen3.8-Flash-Next is ready to deploy with SGLa…

DịchAlibaba trình làng Qwen3.8-Flash-Next, mô hình 125B sử dụng 51B N-gram embedding giúp tăng dung lượng mà không tốn thêm chi phí tính toán. SGLang đã hỗ trợ triển khai ngay lập tức cho kiến trúc này.

Cùng sự kiện, bài đại diện «Qwen3.8-Flash-Next chính thức được hỗ trợ trên SGLang ngay từ ngày ra mắt»
LMSYS: Blog (nhóm Chatbot Arena)
Mô hìnhĐiểm AI 70/100

Cùng sự kiệnQwen ra mắt mã nguồn mở Qwen3.8-Flash-Next, hỗ trợ Day-0 từ SGLang

Đội ngũ Qwen vừa phát hành mô hình đa phương thức MoE Qwen3.8-Flash-Next, phiên bản xem trước của kiến trúc Qwen4 với 125B tham số và cơ chế định tuyến chuyên gia tối ưu hóa hiệu suất.

Cùng sự kiện, bài đại diện «Qwen3.8-Flash-Next chính thức được hỗ trợ trên SGLang ngay từ ngày ra mắt»
Qwen@Alibaba_Qwen
Mô hìnhĐiểm AI 47/100

Qwen3.8-Flash-Next chính thức được hỗ trợ trên SGLang ngay từ ngày ra mắt

Big thanks to @sgl_project for the day-0 support! 🙌 Qwen3.8-Flash-Next is ready to deploy with SGLa…

DịchMô hình Qwen3.8-Flash-Next đã nhận được sự hỗ trợ từ SGLang ngay trong ngày đầu phát hành, giúp người dùng triển khai mô hình này một cách nhanh chóng và hiệu quả.

Diễn biến sự kiện · 9 bài →Thêm 11 nguồn khác đưa tinSimon Willison BlogX: Alibaba Cloud (@alibaba_cloud)X: OpenRouter (@OpenRouter)X: SemiAnalysis (@SemiAnalysis_)X: Elvis Saravia (@omarsar0, DAIR.AI)MarkTechPostThe Decoder: AI NewsPandailyLMSYS: Blog (nhóm Chatbot Arena)X: Kim (@kimmonismus)X: opencode (@opencode)

22/08

Thứ Bảy · 3 tin
Ant Ling@AntLingAGI
Sản phẩmĐiểm AI 53/100

Tinh chọnAntLing ra mắt Weight Cache Daemon cho SGLang: Tăng tốc khởi động mô hình gấp 780 lần

Today, we're introducing the Weight Cache Daemon for SGLang. 🚀 On Ling-2.6-1T FP8, it reduced weigh…

DịchAntLing vừa giới thiệu Weight Cache Daemon cho SGLang, giúp rút ngắn thời gian tải trọng số xuống còn 0,63 giây và giảm tổng thời gian khởi động engine từ 8,8 phút xuống chỉ còn 0,53 phút.

Diễn biến sự kiện · 2 bài →Thêm 1 nguồn khác đưa tinLMSYS: Blog (nhóm Chatbot Arena)

Vì sao đáng đọc: Giải pháp kỹ thuật thực tế giúp tối ưu hóa hiệu suất triển khai LLM, mang lại giá trị cao cho cộng đồng kỹ sư AI và các nhà phát triển hạ tầng.
LMSYS: Blog (nhóm Chatbot Arena)
Sản phẩmĐiểm AI 67/100

Cùng sự kiệnSGLang ra mắt Weight Cache Daemon: Khởi động lại engine AI chỉ trong chưa đầy 1 giây

SGLang giới thiệu Weight Cache Daemon sử dụng CUDA IPC để giảm thời gian tải trọng số từ 495 giây xuống còn 0,63 giây. Công nghệ này giúp tăng tốc khởi động hệ thống lên 785 lần, hỗ trợ chia sẻ đa thực thể và phục hồi engine tức thì.

Cùng sự kiện, tinh chọn hiển thị «AntLing ra mắt Weight Cache Daemon cho SGLang: Tăng tốc khởi động mô hình gấp 780 lần»

21/08

Thứ Sáu · 1 tin
Qwen@Alibaba_Qwen
Hướng dẫnĐiểm AI 28/100

Qwen2.5-27B cập nhật công thức tối ưu mới trên SGLang

Fresh recipes just dropped! ⚡ NVFP4 + DFlash2 for Qwen3.8-27B now in the SGLang cookbook. Thanks for…

DịchQwen2.5-27B vừa bổ sung hỗ trợ NVFP4 và DFlash2 vào cookbook của SGLang, giúp tăng tốc độ suy luận hiệu quả hơn. Đây là bản cập nhật đáng chú ý cho cộng đồng phát triển ứng dụng LLM.

18/08

Thứ Ba · 1 tin

12/08

Thứ Tư · 1 tin
Tổng 19 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (30 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “SGLang” | AIHOT.vn