Đội ngũ SGLang giới thiệu cách sử dụng API /v1/score để tối ưu hóa các mô hình ra quyết định, cho phép chỉ định trực tiếp token nhãn thay vì dựa vào logprobs của phản hồi.
Baidu Intelligent Cloud và cộng đồng SGLang đã tổ chức buổi Meetup về hạ tầng suy luận cho kỷ nguyên Agent, tập trung vào tối ưu hóa KV Cache, quản lý bộ nhớ và các giải pháp triển khai thực tế cho mô hình AI.
NVIDIA hợp tác cùng đội ngũ SGLang giới thiệu chuẩn đo lường SWE-Serve, sử dụng 53 tác vụ kỹ thuật thực tế từ 83 pull request của SGLang để đánh giá hiệu năng của các AI agent trong môi trường triển khai thực tế.
Chuyên gia kiến trúc AI chia sẻ cách sử dụng SGLang để thực hiện suy luận cục bộ, giúp tăng tốc tác vụ phân loại lên gấp 180 lần so với phương pháp tự hồi quy truyền thống mà không tốn phí API.
Thanks @sgl_project for the day-0 support! 🙌 SGLang-Diffusion now serves Qwen-Image-2.1: text-to-im…
DịchSGLang-Diffusion vừa cập nhật hỗ trợ Qwen-Image 2.1, cho phép thực hiện tạo ảnh từ văn bản, chỉnh sửa nhiều ảnh và xuất file RGBA trong suốt chỉ với một checkpoint duy nhất.
Thanks @sgl_project community! The Ling series finally have eyes and we appreciate our day0 partners…
DịchAnt Group vừa trình làng Ling-3.0-flash-VL, mô hình MoE hỗ trợ hiểu hình ảnh và video chuyên sâu với cửa sổ ngữ cảnh lên tới 1 triệu token, đồng thời được SGLang hỗ trợ ngay từ ngày đầu ra mắt.
Big thanks to @sgl_project for the day-0 support! MiniCPM5-2B is ready to deploy with SGLang today.
DịchOpenBMB vừa giới thiệu MiniCPM5-2B với khả năng triển khai ngay lập tức qua SGLang. Trên card RTX 5090, mô hình đạt tốc độ giải mã ấn tượng hơn 250 tok/s, tối ưu hóa hiệu suất cho các tác vụ lập trình.
Baseten đã cắt giảm thành công 42,3% độ trễ cho Qwen-Image và 15,2% cho FLUX.2 bằng cách kết hợp SGLang với kiến trúc B300, đồng thời tự động hóa quy trình tối ưu hóa trong môi trường sản xuất.
Infer-forge là hệ thống kỹ thuật nội bộ giúp chuẩn hóa quy trình triển khai mô hình AI thông qua các cấu trúc Harness, Loop và Graph, đảm bảo tính nhất quán và khả năng kiểm chứng cho các hệ thống suy luận phức tạp.
Nhóm SGLang Diffusion thử nghiệm MiniMax-H3 trên 8 GPU NVIDIA H200, đạt tốc độ nhanh gấp 1,95 lần so với Diffusers mà không làm giảm chất lượng hình ảnh.
Vì sao đáng đọc: Đây là bước tiến kỹ thuật quan trọng trong tối ưu hóa suy luận video, cung cấp số liệu thực tế cho các nhà phát triển AI về hiệu năng phần cứng cao cấp.
Big thanks to @sgl_project for the day-0 support! 🙌 Qwen3.8-Flash-Next is ready to deploy with SGLa…
DịchAlibaba trình làng Qwen3.8-Flash-Next, mô hình 125B sử dụng 51B N-gram embedding giúp tăng dung lượng mà không tốn thêm chi phí tính toán. SGLang đã hỗ trợ triển khai ngay lập tức cho kiến trúc này.
Đội ngũ Qwen vừa phát hành mô hình đa phương thức MoE Qwen3.8-Flash-Next, phiên bản xem trước của kiến trúc Qwen4 với 125B tham số và cơ chế định tuyến chuyên gia tối ưu hóa hiệu suất.
Big thanks to @sgl_project for the day-0 support! 🙌 Qwen3.8-Flash-Next is ready to deploy with SGLa…
DịchMô hình Qwen3.8-Flash-Next đã nhận được sự hỗ trợ từ SGLang ngay trong ngày đầu phát hành, giúp người dùng triển khai mô hình này một cách nhanh chóng và hiệu quả.
Today, we're introducing the Weight Cache Daemon for SGLang. 🚀 On Ling-2.6-1T FP8, it reduced weigh…
DịchAntLing vừa giới thiệu Weight Cache Daemon cho SGLang, giúp rút ngắn thời gian tải trọng số xuống còn 0,63 giây và giảm tổng thời gian khởi động engine từ 8,8 phút xuống chỉ còn 0,53 phút.
Vì sao đáng đọc: Giải pháp kỹ thuật thực tế giúp tối ưu hóa hiệu suất triển khai LLM, mang lại giá trị cao cho cộng đồng kỹ sư AI và các nhà phát triển hạ tầng.
SGLang giới thiệu Weight Cache Daemon sử dụng CUDA IPC để giảm thời gian tải trọng số từ 495 giây xuống còn 0,63 giây. Công nghệ này giúp tăng tốc khởi động hệ thống lên 785 lần, hỗ trợ chia sẻ đa thực thể và phục hồi engine tức thì.
Fresh recipes just dropped! ⚡ NVFP4 + DFlash2 for Qwen3.8-27B now in the SGLang cookbook. Thanks for…
DịchQwen2.5-27B vừa bổ sung hỗ trợ NVFP4 và DFlash2 vào cookbook của SGLang, giúp tăng tốc độ suy luận hiệu quả hơn. Đây là bản cập nhật đáng chú ý cho cộng đồng phát triển ứng dụng LLM.
SGLang vừa tái cấu trúc hỗ trợ CUDA Graph, biến Breakable CUDA Graph (BCG) thành mặc định cho giai đoạn prefill. Giải pháp này giúp giảm 75% lượng code so với torch.compile và tăng tốc độ xây dựng lên tới 5,2 lần.
SGLang và Miles đã cập nhật hỗ trợ Day-0 cho Qwen3.8-2.4T-A95B, mô hình mã nguồn mở lớn nhất của Qwen với 2,4 nghìn tỷ tham số và kiến trúc Mixture-of-Attention.