Mô hình
GLM-5.3 ra mắt: Đứng đầu bảng xếp hạng mã nguồn mở về khả năng lập trình và bảo mật
(giờ Việt Nam)
Tóm tắt AI
Zhipu AI vừa trình làng GLM-5.3 với hiệu suất lập trình tăng 50%, dẫn đầu các mô hình mã nguồn mở trên Terminal Bench 3.0. Ngoài ra, mô hình còn thể hiện năng lực vượt trội trong kiểm thử bảo mật và phân tích mã nguồn.
Chính văn · Bản dịch AI
Hôm nay, chúng tôi chính thức phát hành GLM-5.3. So với GLM-5.2, mô hình nền tảng (base model) không thay đổi, nhưng thông qua quá trình hậu huấn luyện (post-training) tối ưu hóa quy mô (Scaling), giới hạn thông minh của mô hình đã được nâng cao đáng kể: môi trường tác vụ dài hạn tăng gấp hàng chục lần, các loại hình môi trường phong phú, đa dạng hơn và thời gian hậu huấn luyện siêu dài. Chúng tôi nhận thấy việc hậu huấn luyện mô hình đầy đủ đã tạo ra những năng lực vượt ngoài mong đợi. So với thế hệ trước, các năng lực mới của GLM-5.3 bao gồm:
Kể từ hôm nay, công cụ lập trình chính thức ZCode và công cụ hiệu suất AutoClaw của Zhipu sẽ được ra mắt, đồng thời mở quyền truy cập GLM Coding Plan cho toàn bộ người dùng và mở đăng ký. Các nền tảng lập trình như TraeWork/TraeCode/ (Coze), WorkBuddy/CodeBuddy, Qoder/QwenWork, CatPaw, JoyCode, OpenCode... cũng bắt đầu mở quyền trải nghiệm sớm. API sẽ sớm được ra mắt, trọng số mô hình đầy đủ sẽ được mã nguồn mở trong vòng hai tuần tới. Trước đó, cần hoàn tất các bước gia cố bảo mật cần thiết để hạn chế tối đa khả năng tấn công tiềm ẩn, đồng thời bảo lưu giá trị phòng thủ của mô hình.
Lập trình mạnh mẽ
Trong nhiều bài kiểm tra chuẩn (benchmark) phổ biến, GLM-5.3 hiện là mô hình mã nguồn mở có thứ hạng cao nhất, năng lực lập trình và tác nhân (agent) tiệm cận với Claude Fable 5, đồng thời trải nghiệm lập trình vượt trội hơn các mô hình nội địa khác.
Trên Terminal-Bench 3.0 – bài kiểm tra đánh giá khả năng hoàn thành các tác vụ phức tạp của mô hình trong môi trường thiết bị đầu cuối thực tế, điểm số của GLM-5.3 đã tăng từ 4,6 lên 28,3; trên DeepSWE v1.1 – tập trung vào kỹ thuật phần mềm dài hạn và khả năng sửa đổi mã nguồn liên tục, điểm số tăng từ 46,2 lên 66,9; trên Agents' Last Exam – bài kiểm tra bao phủ nhiều kịch bản chuyên nghiệp thực tế, nhấn mạnh vào sự hợp tác liên công cụ và tác vụ dài hạn, điểm số tăng từ 23,8 lên 28,5. Trong GDPval-AA v2 – bài kiểm tra bao phủ 44 ngành nghề, đánh giá công việc tri thức thực tế có giá trị cao, mô hình đạt 1769 điểm, cho thấy năng lực thực thi tác vụ chuyên nghiệp nảy sinh từ khả năng lập trình.
Nhìn chung, GLM-5.3 đã đạt được những tiến bộ rất đáng kể trong kỹ thuật phần mềm phức tạp, thao tác thiết bị đầu cuối và các tác vụ Agent trong thế giới thực rộng lớn hơn.
Z.ai Code Bench – công cụ tự phát triển của chúng tôi – đánh giá trải nghiệm tổng thể của mô hình trong các kịch bản lập trình thực tế. Mô hình sẽ được đặt trong môi trường phát triển cục bộ phức tạp và thực hiện các tác vụ từ đầu đến cuối (end-to-end) ở các cấp độ tư duy khác nhau, sát với trải nghiệm thực tế của lập trình viên khi sử dụng Coding Agent.
Kết quả kiểm tra cho thấy GLM-5.3 đạt được sự cân bằng tốt hơn giữa hiệu quả và tỷ lệ sử dụng Token. Ở cấp độ High, GLM-5.3 đạt độ chính xác 31,4%, vượt qua mức 29,5% của Claude Opus 4.8 ở cấp độ cao nhất. Mỗi tác vụ của GLM-5.3 xuất ra trung bình khoảng 50.000 tokens, trong khi Opus 4.8 cần khoảng 120.000 tokens, điều này có nghĩa là GLM-5.3 có thể hoàn thành tác vụ với lộ trình thực thi ngắn hơn.
Trong quá trình huấn luyện GLM-5.3, chúng tôi không chỉ để mô hình giải các bài tập lập trình mà còn mở rộng môi trường huấn luyện đến quy trình hoàn chỉnh, gần với công việc của chuyên gia thực thụ. Một số tác vụ có khối lượng công việc tương đương với một kỹ sư làm việc liên tục trong nhiều ngày. Lấy ví dụ về tác vụ tối ưu hóa học máy, mô hình sử dụng cùng hệ thống tính toán, hệ thống lưu trữ, tài liệu nội bộ, kho mã nguồn và kết quả thực nghiệm như các kỹ sư thuật toán, từ đó đạt được tốc độ tăng trưởng có thể định lượng từ đầu đến cuối.
Được huấn luyện trong môi trường như vậy, mô hình không chỉ học cách thực thi chỉ dẫn một chiều, mà còn bắt đầu từ việc phát hiện vấn đề, thúc đẩy phân tích, thực hiện xác minh và cuối cùng là hoàn thành công việc một cách độc lập.
Năng lực an ninh mạng nảy sinh
Trong quá trình mở rộng không ngừng của môi trường tác vụ, chúng tôi quan sát thấy hiệu suất của mô hình trong lĩnh vực an ninh mạng vượt ngoài mong đợi. Sự xuất hiện của năng lực bảo mật không phải là ngẫu nhiên, vì bản chất của công việc bảo mật chính là năng lực lập trình với các ràng buộc nghiêm ngặt. Chúng tôi bắt đầu đầu tư nghiên cứu theo hướng này từ tháng 9 năm 2025. Trong quá trình phát triển GLM-5.2 và GLM-5.3, chúng tôi đã cùng nhiều phòng thí nghiệm bảo mật hàng đầu trong nước thúc đẩy thêm nhiều môi trường tác vụ dài hạn, xây dựng các khung đánh giá và thực thi (harness) chuyên nghiệp hơn.
Xét theo chuỗi tác vụ, năng lực an ninh mạng bao gồm đánh giá mã nguồn, xác minh lỗ hổng, khai thác lỗ hổng và vòng lặp tấn công - phòng thủ trong môi trường thực tế. Chúng tôi đã chọn ba bài kiểm tra chuẩn bao phủ các giai đoạn khác nhau của phân tích, xác minh và khai thác lỗ hổng để đánh giá toàn diện năng lực an ninh mạng của GLM-5.3. Hiện tại, ưu thế của GLM-5.3 chủ yếu tập trung ở giai đoạn đầu.
Trong bài kiểm tra CyberGym, mô hình bắt đầu từ mã nguồn white-box, thông qua việc kích hoạt lỗi chương trình để nhận diện và xác minh lỗ hổng. GLM-5.3 đạt 84,5%, cao hơn mức 77,2% của GLM-5.2, và nhỉnh hơn một chút so với 83,8% của Mythos 5 và 83,6% của GPT-5.6 Sol.
Trong ExploitBench – bài kiểm tra đòi hỏi khả năng suy luận sâu hơn, mô hình cần hiểu rõ nguyên nhân gốc rễ của các lỗ hổng thực tế và hoàn thành việc khai thác tương ứng. GLM-5.3 đạt 54,4%, gấp hơn hai lần so với GLM-5.2 (24,4%), nhưng vẫn thấp hơn mức 78,0% của Mythos 5 và 76,5% của GPT-5.6 Sol.
ExploitGym đánh giá xem mô hình có thể hoàn thành bao nhiêu tác vụ khai thác lỗ hổng trong thời gian giới hạn. Sau khi chuẩn hóa ngân sách theo thông lượng, trong vòng hai giờ, GLM-5.3 hoàn thành 105 tác vụ và trong sáu giờ hoàn thành 130 tác vụ, một sự cải thiện lớn so với 29 và 39 tác vụ của GLM-5.2. Mythos 5 vẫn dẫn đầu với lần lượt 181 và 247 tác vụ trong hai khoảng thời gian này.
Ba bài kiểm tra chuẩn cho thấy cùng một xu hướng: càng gần với giai đoạn đầu của chuỗi khai thác lỗ hổng, sự cải thiện của GLM-5.3 so với GLM-5.2 càng rõ rệt; càng đi sâu vào khai thác hoàn chỉnh, khoảng cách giữa mô hình và các mô hình tiên phong đóng như Mythos 5 càng lớn. Nói cách khác, hướng tiến bộ nhanh nhất của GLM-5.3 chính là hướng mà hiện tại vẫn cần phải nỗ lực đuổi theo.
1. Kết quả đánh giá bảo mật
Kể từ khi GLM-5.2 ra mắt, chúng tôi đã phối hợp với Đại học Thanh Hoa, Đại học Nam Khai, cùng nhiều đội ngũ bảo mật như Yunqi Wuyin, NSFOCUS, CyberKunlun, DARKNAVY, Huashun Xinan, QiAnXin, DBAPPSecurity, Yuanxu Xinghe, Tencent Xuanwu, CloudDing Lab... để tiến hành các đợt kiểm thử Red Team và đánh giá bảo mật chuyên sâu. Tổng cộng đã phát hiện 2.436 lỗ hổng (sau khi sàng lọc sơ bộ và loại bỏ trùng lặp), trong đó 1.097 lỗ hổng ở mức độ trung bình đến cao. Nhiều lỗ hổng đã tồn tại nhiều năm, thậm chí hàng chục năm mà chưa từng được phát hiện, sớm nhất có thể truy xuất từ khoảng 45 năm trước.
Các lỗ hổng tiêu biểu bao phủ 269 dự án bao gồm nhân hệ thống (kernel), hệ điều hành, công cụ trình duyệt, các thành phần cơ bản mã nguồn mở, ứng dụng internet và giao thức internet. Mối đe dọa từ một số lỗ hổng thậm chí có thể khiến Android, Windows, macOS và một phần mềm liên lạc quốc dân bị sụp đổ trên diện rộng.
Những phát hiện này đã phát triển thành một công việc phát hiện và công bố lỗ hổng liên tục. Các lỗ hổng liên quan đã được gửi dần tới các cơ sở dữ liệu lỗ hổng quốc gia như CNNVD/CNVD. Để tăng tính minh bạch trong quá trình công bố, chúng tôi đã thiết lập Sổ cái công bố bảo mật Z.ai tại https://cvd.z.ai/, ghi lại tiến trình từ khi phát hiện, xác nhận đến khi khắc phục lỗ hổng. Sổ cái sẽ được cập nhật liên tục. Để đảm bảo công bố bảo mật có trách nhiệm, chúng tôi chỉ công khai các lỗ hổng đã được công bố và nhà sản xuất đã khắc phục. Đối với những lỗ hổng đang trong giai đoạn phối hợp công bố, chúng tôi sẽ hiển thị mã băm (hash) của lỗ hổng để đối chiếu sau này.
Tham khảo báo giá công khai từ các thị trường giao dịch lỗ hổng và tiền thưởng toàn cầu như Zerodium, Crowdfense, Apple Security Bounty, Pwn2Own, giá trị kinh tế mà các lỗ hổng này tạo ra lên tới 30 triệu nhân dân tệ.
2. Câu chuyện về Hugging Face – Năng lực an ninh mạng phải cởi mở hơn
Bài học từ sự cố công bố chính thức của Hugging Face: Nếu năng lực tấn công mạnh mẽ đang lan rộng, thì năng lực phòng thủ không thể chỉ nằm trong tay một vài công ty mô hình đóng. Mô hình đóng biến năng lực bảo mật tiên phong thành đặc quyền của một số ít tổ chức. Anthropic cung cấp mô hình Mythos và dịch vụ bảo mật cho khoảng 150 tổ chức lớn, trong khi các doanh nghiệp và dự án mã nguồn mở rộng lớn hơn khó có thể nhận được sự hỗ trợ bảo mật ở cùng trình độ, thậm chí khi gặp tấn công và cần giúp đỡ nhất, họ lại bị các mô hình đóng từ chối.
Không mã nguồn mở mới là điều kém an toàn nhất trong thời đại này. Cùng với việc phát hành và mã nguồn mở GLM-5.3, chúng tôi sẽ đồng thời khởi động kế hoạch "Lá chắn mã nguồn mở" (Open Shield):
2. Cung cấp miễn phí hạn mức mô hình và lối vào phòng thủ thuận tiện hơn cho cộng đồng mã nguồn mở; những người duy trì dự án mã nguồn mở có thể đăng ký để phục vụ cho các tác vụ kiểm toán bảo mật và phòng thủ.
3. Cung cấp tính năng kiểm toán mã nguồn trong ZCode, đưa kiểm tra bảo mật vào quy trình phát triển hàng ngày.
Khi ngọn giáo sắc bén nhất bị khóa trong tay một số ít người, thì chiếc khiên tốt nhất phải thuộc về tất cả mọi người. Chúng tôi sẽ tiếp tục tối ưu hóa năng lực bảo mật của GLM và kiên trì mã nguồn mở, cùng các nhà phát triển và nhà nghiên cứu bảo mật toàn cầu xây dựng một hệ thống phòng thủ không ngừng phát triển, biến các mô hình tiên phong từ đặc quyền của một số ít tổ chức thành hàng hóa công cộng về bảo mật phục vụ cộng đồng mã nguồn mở.
3. Một tình tiết nhỏ: Truy tìm Neo
Tháng 7 năm 2026, một máy chủ tệp tạm thời đặt tại Brazil lọt vào phạm vi giám sát của Ferret. Ferret là công cụ phân tích theo dõi của FOFA – đối tác đầu tiên của GLM-5.3. GLM-5.3 nhanh chóng phát hiện đây không phải là một máy chủ thông thường, trong thư mục xuất hiện hàng loạt thông tin về cơ sở hạ tầng tấn công.
Sau khi phân tích tiếp, một AI Agent có tên "Neo" lộ diện, với mục tiêu tấn công các công ty kế toán, dịch vụ thuế và đơn vị ghi sổ kế toán tại quốc gia A.
Neo đã giành được quyền hệ thống rất cao. Chưa đầy hai tháng, nó quản lý 4 máy chủ, 7 tên miền, 60.000 hộp thư và hơn 100 tập lệnh, gửi đi 18.567 email lừa đảo. Đối mặt với hàng nghìn thư mục mở, hàng vạn tệp nhật ký và các manh mối tấn công bị phân mảnh cao độ, nếu chỉ dựa vào con người thì gần như không thể tìm ra mối liên hệ giữa chúng.
GLM-5.3 nhanh chóng trích xuất các manh mối then chốt, liên kết các cuộc tấn công và hỗ trợ các nhà nghiên cứu bảo mật khôi phục toàn bộ chuỗi tấn công: cách kẻ tấn công thu thập mục tiêu trong ngành kế toán tại quốc gia A, xây dựng hệ thống email, cho đến việc giả mạo khách hàng doanh nghiệp và các tổ chức ngành, chuẩn bị các tệp độc hại tiếp theo, cuối cùng hỗ trợ hiệu quả cho Ferret trong việc bắt giữ cuộc tấn công này.
Điều này tạo nên sự tương đồng với sự cố bảo mật Hugging Face trước đó. Trong sự cố Hugging Face, mô hình tiên phong bị thoát kiểm soát để thực hiện tấn công, GLM-5.2 được triển khai cục bộ để hỗ trợ thu thập chứng cứ; trong sự cố lần này, Agent làm việc cho bên tấn công, và GLM-5.3 lại giúp bên phòng thủ khôi phục chuỗi tấn công từ các bằng chứng.
Cũng là mô hình, đứng về phía nào phụ thuộc vào người nắm giữ nó và mục đích của họ.
4. Sự an toàn tốt nhất là khi sự cố cuối cùng không xảy ra
Rủi ro tiềm ẩn không hề xa vời. Từ một tin nhắn, một email, cho đến các giao thức nền tảng của Internet, robot, ranh giới an toàn của thế giới kỹ thuật số đã kết nối với các thiết bị cá nhân, mạng doanh nghiệp, cơ sở hạ tầng Internet và thậm chí là thế giới thực, ảnh hưởng đến mỗi chúng ta. Ý nghĩa của GLM-5.3 với tư cách là "Lá chắn mã nguồn mở" chính là giúp nhiều đội ngũ bảo mật phát hiện rủi ro trước những kẻ tấn công, để rủi ro được hóa giải và khắc phục trước khi gây ảnh hưởng đến người dùng.
Bảo vệ Cursor, giữ vững bàn làm việc của lập trình viên
Cursor là trình soạn thảo mã nguồn AI được hàng triệu lập trình viên trên toàn cầu sử dụng hàng ngày. Trong một lần đánh giá năng lực mô hình, phòng thí nghiệm NASP của Đại học Thanh Hoa đã sử dụng GLM-5.3 để phân tích mã nhị phân, kiến trúc đa ngôn ngữ và ranh giới quyền hạn của Cursor, phát hiện ra rủi ro tiềm ẩn trong kiến trúc hỗn hợp Rust và Electron cùng logic kiểm tra quyền hạn của nó. Kẻ tấn công có thể lợi dụng điều này để thực hiện ghi tệp tùy ý, từ đó đánh cắp thông tin nhạy cảm, thậm chí chiếm quyền điều khiển môi trường phát triển.
Rủi ro này ẩn giấu trong logic chương trình phức tạp, không thể phát hiện bằng cách kiểm tra cô lập từng lỗi mã nguồn. Trong quá trình khai thác, GLM-5.3 tham gia sâu vào toàn bộ quy trình phân tích ngược, hỗ trợ các nhà nghiên cứu bảo mật khôi phục logic chương trình, định vị các đường dẫn bất thường và loại bỏ nhiễu từ hàng loạt đường dẫn ứng viên, cuối cùng hoàn thành xác minh rủi ro trong môi trường kiểm thử được cấp phép. Hiện tại, đội ngũ nghiên cứu bảo mật đã liên hệ với phía Cursor để thúc đẩy việc khắc phục, lỗ hổng đã được báo cáo lên CNVD và CNNVD.
Bài viết được AI dịch và tổng hợp tự động từ Zhipu AI: Nghiên cứu (Dữ liệu nhúng trên web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.