smol.ai AI News
Điểm AI 85/100

Ngành

Ox Alpha lộ diện, DeepSeek nâng cấp mô hình đa phương thức và OpenAI giảm giá API

(giờ Việt Nam)

Tóm tắt AI

Mô hình bí ẩn Ox Alpha gây chú ý với khả năng lập trình vượt trội, trong khi DeepSeek ra mắt phiên bản V4-Flash hỗ trợ đa phương thức. Đồng thời, OpenAI giảm giá mạnh cho GPT-5.6 Sol nhằm cạnh tranh trong bối cảnh các phòng thí nghiệm AI Trung Quốc đang tăng tốc mạnh mẽ.

Chính văn · Bản dịch AI

not much happened today | AINews

một ngày yên ắng.

Tin tức AI từ 20/8/2026 đến 21/8/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm thông tin nào từ Discord. Trang web của AINews cho phép bạn tìm kiếm tất cả các số đã phát hành. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể tùy chọn đăng ký/hủy đăng ký nhận email theo tần suất!

Tóm tắt AI trên Twitter

Các mô hình ẩn danh (Stealth Models), áp lực từ các mô hình tiên phong của Trung Quốc và bước tiến đa phương thức của DeepSeek

OpenAI, Codex và kinh tế học về giá cả/sử dụng

Tác nhân (Agents), khung hỗ trợ (Harnesses) và sự chuyển dịch sang đào tạo lấy môi trường làm trung tâm

Điểm tin nghiên cứu: Định tuyến (Routing), Tái lưu thông (Recirculation) và Robot học

Cơ sở hạ tầng, năng lực tính toán và các mô hình mở

Các tweet hàng đầu (theo mức độ tương tác)

1. Đánh giá tác nhân cục bộ Qwen3.8 27B

Qwen3.8-27b sở hữu mức độ "tác nhân" (agency) cao nhất mà tôi từng thấy ở một mô hình chạy cục bộ (Hoạt động: 1334): Bài đăng khẳng định Qwen3.8-27B chạy cục bộ trên một card RTX 3090 duy nhất với lượng tử hóa Unsloth Q4_K_S, bộ nhớ đệm q8 KV và ngữ cảnh 150k đã thực hiện các quy trình tác nhân tự hành một cách xuất sắc: sử dụng Playwright cùng với cookie SSO/phiên làm việc hiện có để điều hướng hệ thống đại học và truy xuất lịch học, đồng thời xử lý riêng biệt một video mạng xã hội thông qua tải xuống, trích xuất khung hình, chuyển văn bản bằng Whisper và tăng cường hình ảnh. Hình ảnh đi kèm là ảnh chụp màn hình mô hình báo cáo việc sử dụng hồ sơ Playwright của Outlook/OWA, tính năng "duy trì đăng nhập" của Microsoft và cookie tin cậy trình duyệt Duo để truy cập hệ thống trường học. Ý nghĩa kỹ thuật ở đây không chỉ nằm ở chất lượng mô hình thuần túy mà còn ở khả năng sử dụng công cụ của LLM cục bộ kết hợp với việc xử lý thông tin xác thực/phiên làm việc có rủi ro cao. Các bình luận tỏ ra ấn tượng nhưng thận trọng: một người dùng lo ngại về việc cấp cho tác nhân quyền truy cập đủ để thực hiện các hành động phá hoại như rút khỏi trường đại học, trong khi những người khác coi đây là bằng chứng cho thấy các hệ thống tác nhân cục bộ tiên tiến đã xuất hiện nhưng chưa được phân bổ đồng đều.

Qwen3.8-27B bị sụt giảm đáng kể về kiến thức so với bản 3.6 (Hoạt động: 779): Bài đăng báo cáo rằng Qwen3.8-27B / Qwen3-8-27B dường như bị thoái lui so với Qwen3.6-27B / Qwen3-6-27B trong việc truy xuất thông tin thực tế ngoại tuyến mà không cần gọi công cụ: bộ tiêu chuẩn đánh giá kiến thức phổ thông/sinh tồn "hơi mơ hồ" của tác giả cho thấy sự thất bại ở các mức lượng tử hóa và cài đặt lấy mẫu khác nhau, nhất quán với điểm số thấp hơn trên bảng xếp hạng kiến thức Omniscience của Artificial Analysis. Sự suy giảm được báo cáo cụ thể nằm ở kiến thức lưu trữ trong trọng số và khả năng ảo giác/truy xuất sự thật khi suy luận trong môi trường cách ly (airgapped), không phải về lập trình/sử dụng công cụ; người bình luận lưu ý rằng Qwen3.8 mạnh hơn ở khả năng gọi công cụ, quy trình tìm kiếm/truy xuất web, lập trình và hành vi tác nhân. Người dùng nhìn chung coi đây là một sự đánh đổi có chủ đích: các mô hình Qwen 3.x mới hơn có thể được tối ưu hóa cho các tác vụ lập trình/tác nhân thay vì là "Google thu nhỏ" lưu trữ sự thật, với Gemma 4 được gợi ý là lựa chọn tốt hơn cho các câu hỏi đố vui/sự thật ngẫu nhiên. Một người dùng xác nhận sự thoái lui trong các tác vụ hình ảnh/lịch sử/địa lý chuyên biệt như xác định vị trí tem hoặc ảnh cũ khi tắt công cụ web, nhưng coi sự đánh đổi này là chấp nhận được nhờ khả năng sử dụng công cụ được cải thiện.

Qwen 3.8 27b - PI AGENT so với OPENCODE (Hoạt động: 510): Tác giả so sánh PI Agent với Opencode bằng cách sử dụng backend llama-server cục bộ trên RTX 3090 với Qwen3.8-27B-Q4_K_M.gguf, ctx-size=100000, flash-attn=on, n-gpu-layers=99, lập luận kiểu DeepSeek và mô-đun vision mmproj. Họ báo cáo rằng PI Agent tạo ra kết quả tốt hơn, sử dụng ít token hơn, tránh được giới hạn 32k token đầu ra/hiện tượng đóng băng của Opencode và trì hoãn việc nén ngữ cảnh đến khoảng 90k token so với Opencode bắt đầu ở mức ~67k khi tổng ngữ cảnh là 100k; họ cũng khuyến nghị bật tính năng vision để mô hình có thể đánh giá trực quan các kết quả được tạo ra, với việc offload CPU/RAM là chấp nhận được đối với độ trễ đánh giá ảnh chụp màn hình (~3s so với ~0.3s trên GPU). Bài kiểm tra được lấy cảm hứng từ một bài đăng trước đó trên LocalLLaMA về việc tạo hoạt ảnh quả bóng nảy: reddit.com/r/LocalLLaMA/comments/1j7r47l/…. Người bình luận đặt câu hỏi liệu tác vụ HTML/hoạt ảnh một lần có phải là phép so sánh khung hỗ trợ (harness) có ý nghĩa hay không và đề xuất các quy trình đa bước sử dụng nhiều công cụ thay thế. Một người dùng khác báo cáo rằng PI + Qwen3.8-27B cục bộ cho cảm giác cạnh tranh với Claude Code trong việc xây dựng ứng dụng dự đoán cực quang trong khoảng một giờ, mặc dù cả hai mô hình đều đánh giá kết quả ban đầu của Claude tốt hơn một chút trước khi PI lặp lại.

2. Điểm chuẩn và phục vụ DeepSeek V4 Flash

DeepSeek-V4-Flash-Vision-Exp (Hoạt động: 722): Hình ảnh là bảng điểm chuẩn kỹ thuật cho DeepSeek-V4-Flash-Vision-Exp, so sánh nó với DeepSeek V4-Flash-0731 và Opus-4.8 trên các đánh giá tác nhân văn bản và tác nhân đa phương thức. Nó cho thấy những bước tiến rộng rãi so với bản phát hành DeepSeek Flash trước đó, bao gồm 83.9 trên Terminal Bench 2.1, 75.9 trên Toolathlon-Verified và 64.3 trên Chartography, trong khi Opus-4.8 vẫn dẫn đầu nhiều tiêu chuẩn đánh giá nặng về văn bản; Vision-Exp có vẻ cạnh tranh hơn trong các tác vụ đa phương thức như Agents’ Last Exam và ZeroBench. Phản ứng kỹ thuật chính là việc cải thiện DeepSWE khoảng +4 điểm so với bản 0731 được coi là mức tăng bất thường. Các bình luận khác chủ yếu là sự cường điệu hoặc phản ứng theo phe phái thay vì phân tích thực chất.

Cách "nhàm chán" để chạy Deepseek V4 Flash-0731 130-150 tks - 16x5060ti 16GB qua 2 switch PLX88096 (Hoạt động: 621): Hình ảnh là bảng điều khiển giám sát GPU terminal xác nhận giàn suy luận 16× RTX 5060 Ti 16GB bất thường của bài đăng: tất cả GPU đều hiển thị, gần như đầy ở mức khoảng 15.2–15.7 GiB / 15.9 GiB VRAM và được gán cho các tiến trình worker vLLM cho DeepSeek V4 Flash-0731. Thiết lập sử dụng hai đảo switch PCIe Broadcom/PLX PEX88096 với NVIDIA 610.43.02-p2p đã vá, Resizable BAR/BAR1 đặt ở mức 16 GiB mỗi GPU và song song hóa đường ống all-reduce/DSpark tùy chỉnh; thông lượng được báo cáo là khoảng 100–150 tok/s cho thế hệ người dùng đơn lẻ tùy thuộc vào bố cục TP/PP, với khả năng mở rộng đồng thời lên tới 727 output tok/s tổng hợp cho TP4/PP4 tại 16 người dùng. Hình ảnh cũng cho thấy sự đánh đổi/điểm kỳ lạ của bản dựng: các GPU dường như được kết nối ở PCIe Gen1 x8 và hầu hết ở trạng thái nhàn rỗi tại thời điểm chụp mặc dù VRAM đang được sử dụng cao, ngụ ý rằng ảnh chụp màn hình giống như một bằng chứng về cấu trúc liên kết/lưu trú bộ nhớ hơn là một điểm chuẩn sử dụng trực tiếp. Người bình luận ít tập trung vào bảng điểm chuẩn mà tập trung nhiều hơn vào sự phi lý về mặt vật lý của bản dựng, yêu cầu "một bức ảnh của thiết lập" và gọi đó là một "thiết lập điên rồ". Một phản ứng kỹ thuật hoài nghi/hài hước đáng chú ý là "một chút vibe coding" có khả năng che giấu công việc suy luận phân tán tùy chỉnh đáng kể.

3. Kinh tế học đào tạo mô hình mở

Tôi vừa xây dựng một mini Kimi-K3 từ đầu với giá dưới 250$. Đã đánh bại GPT-2 (124M)! (Hoạt động: 1118): Hình ảnh là bảng tóm tắt đào tạo kỹ thuật cho một mô hình ngôn ngữ MoE kiểu mini Kimi-K3 được đào tạo từ đầu: tổng cộng 1.02B tham số, 145M tham số hoạt động mỗi token, các thành phần giống K3 bao gồm Delta Attention, Gated MLA, Attention Residuals, LatentMoE và bộ mã hóa token 163,840 của K3. Nó báo cáo việc đào tạo trên 5,000,003,584 token trong 38,147 bước trên một H200 với giá 4.54$/giờ, với mức mất mát (loss) giảm từ 12.100 xuống 2.62, 0% chuyên gia chết (dead experts) và chi phí cuối cùng là 252.35$, hơi mâu thuẫn với tuyên bố "dưới 250$" trong tiêu đề; tác giả tuyên bố đạt 33.4% HellaSwag, đánh bại GPT-2 124M ở mức 28%. Các bình luận về hình ảnh chủ yếu mang tính khuyến khích và hướng tới sự tò mò kỹ thuật, hỏi liệu năng lực tính toán được thuê hay chạy cục bộ và đề xuất các thí nghiệm tiếp theo như một biến thể 35B/3B hoạt động lớn hơn hoặc RL tự hành sử dụng K3 làm giáo viên. Không có cuộc tranh luận đáng kể nào về tiêu chuẩn hoặc kiến trúc trong các bình luận được cung cấp.

Sẽ là cú hích lớn cho nguồn mở của Mỹ (Hoạt động: 292): Hình ảnh là ảnh chụp màn hình Techmeme/X báo cáo rằng Nvidia sẽ trả cho Poolside khoảng 6 tỷ USD trong một thỏa thuận cấp phép không độc quyền cho ngăn xếp phát triển mô hình của họ, cộng với khoản đầu tư khoảng 1 tỷ USD ở mức định giá trước tiền (pre-money) khoảng 12 tỷ USD; người bình luận đã liên kết báo cáo cơ bản qua The Information và một bản lưu trữ. Về mặt kỹ thuật, tài sản chính dường như là "Model Factory" của Poolside được sử dụng để xây dựng mô hình lập trình Laguna của họ—được đề cập cụ thể trong các bình luận là Laguna S 2.1, được coi là mạnh mẽ so với quy mô của nó—trong khi 109 nhân viên Poolside tham gia vào Laguna được cho là đã nhận được lời mời làm việc từ Nvidia. Đây không phải là meme; nó có ý nghĩa như một sự thúc đẩy tiềm năng cho hệ sinh thái mô hình mở/Nemotron của Nvidia và sự phát triển mô hình lập trình nguồn mở của Mỹ, nhưng cũng cho thấy Nvidia đang sử dụng các cấu trúc cấp phép kết hợp tuyển dụng để hấp thụ các khả năng cơ sở hạ tầng và mô hình AI chiến lược mà không cần mua lại chính thức. Người bình luận chia làm hai luồng: một số coi đó là "tin tuyệt vời" cho nhiều mô hình mở hơn, trong khi những người khác lo ngại đó thực chất là một vụ mua lại nhân sự (acqui-hire) có thể làm đình trệ lộ trình Laguna độc lập của Poolside và sáp nhập công việc đó vào Nvidia/Nemotron.

Tóm tắt các Subreddit AI ít kỹ thuật hơn

/r/Singularity, /r/Oobabooga, /r/MachineLearning, /r/OpenAI, /r/ClaudeAI, /r/StableDiffusion, /r/ChatGPT, /r/ChatGPTCoding, /r/aivideo, /r/aivideo

1. Tiêu chuẩn đánh giá lập trình tác nhân và các mô hình ẩn danh

Tác nhân lập trình của NVIDIA đạt 100% trên tiêu chuẩn đánh giá suy luận tương tác ARC-AGI-3 (Hoạt động: 1158): Hình ảnh là ảnh chụp màn hình của NVIDIA AI tuyên bố rằng NVIDIA AVO, một tác nhân lập trình/tự hành đa năng, đã đạt 100% trên tiêu chuẩn đánh giá suy luận tương tác ARC-AGI-3, hoàn thành tất cả 183 cấp độ trên 25 môi trường công cộng "mà không cần hướng dẫn, quy tắc rõ ràng hoặc mục tiêu đã nêu." Một lưu ý kỹ thuật quan trọng từ các bình luận là kết quả này dường như chỉ nằm trong tập dữ liệu công cộng, không phải tập tiêu chuẩn đánh giá riêng tư; bài viết của NVIDIA nằm ở đây: bài đăng trên blog developer.nvidia.com. Người bình luận hoài nghi rằng điều này chứng minh khả năng suy luận tổng quát rộng rãi, gợi ý rằng nó có thể phản ánh việc tối đa hóa tiêu chuẩn đánh giá trừ khi được xác thực trên các tác vụ chưa biết/riêng tư hoặc các môi trường tương tác không liên quan như luồng trò chơi ngẫu nhiên hoặc các trò chơi kiểu Pokémon.

Một mô hình ẩn danh có tên Ox-Alpha đã được phát hành, vượt qua Fable trên SWE. (Hoạt động: 1020): Một mô hình ẩn danh tên là Ox-Alpha được báo cáo là vượt qua Fable trên tiêu chuẩn đánh giá SWE, với điểm số do người bình luận báo cáo là 80% cho ox-alpha, 65% cho fable và 52% cho gpt-5.6-sol. Một người bình luận cũng đã chạy một lời nhắc (prompt) kiểu tạo mã/đa phương thức định tính, "Tạo svg của một con rồng đang đạp xe" và chia sẻ so sánh trực quan tại đây. Người bình luận suy đoán mô hình có thể là của Trung Quốc hoặc liên kết với Trung Quốc vì nó được cho là đã từ chối trả lời "Đài Loan có phải là một phần của Trung Quốc không?", làm dấy lên lo ngại về hành vi an toàn/kiểm duyệt chính trị bất chấp hiệu suất tiêu chuẩn đánh giá mạnh mẽ.

2. Kiểm soát tạo video và tăng tốc

Chú ý thưa (Sparse attention) cho H3 minimax, tận hưởng tốc độ nhanh hơn tới 2.5 lần. (Hoạt động: 1204): PlagueKind đã thêm một nút chú ý thưa/SLA cho H3 Minimax vào ComfyUI-PlagueKind-Nodes, tuyên bố tăng tốc tới 2.5× khi nút được đặt cuối cùng trong chuỗi, gắn trực tiếp vào guider và scheduler; tác giả khuyến nghị PyTorch + CU130 mới hơn, lưu ý rằng GPU Blackwell được hưởng lợi nhiều nhất và gợi ý điều chỉnh min_seq cho video độ phân giải thấp/ngắn và tránh chia nhỏ bộ nhớ quá mức. Một người bình luận đã đánh giá RTX 5090 ở 0.5 MP, 25 s, 8 bước với turbo LoRA: 4m13s không có chú ý thưa so với 2m56s với nó (~1.44× tăng tốc). Các quy trình làm việc cập nhật được liên kết trên Civitai và Hugging Face. Kết quả chất lượng dường như phụ thuộc vào mô hình/nội dung: một người dùng báo cáo hiện tượng biến dạng nghiêm trọng và nói rằng anime "nhanh chóng bị hỏng", trong khi những người khác giới thiệu các quy trình làm việc trên Hugging Face của tác giả như một tiêu chuẩn chất lượng/tốc độ tốt.

Tôi đã sử dụng Codex để làm cho Seedance 2.5 đạt đến khung hình Disaster Girl (Hoạt động: 2508): Bài đăng mô tả việc sử dụng ChatGPT/Codex như một công cụ lập kế hoạch cảnh quay ngược cho quá trình tạo hình ảnh thành video 20 giây của Seedance 2.5 nhắm vào khung hình cuối "Disaster Girl" cố định, thay vì là một công cụ viết lại lời nhắc. Quy trình làm việc coi khung hình cuối cùng là một tập hợp ràng buộc cứng—tư thế/ánh nhìn/biểu cảm của chủ thể, chiều cao máy ảnh, trục xem, thứ tự tiền cảnh/hậu cảnh—sau đó giải ngược một đường đi của máy ảnh có động lực vật lý với các chuyển dịch rõ ràng, che khuất, chuyển đổi phơi sáng, tín hiệu thị sai và giai đoạn giảm tốc cuối cùng: "bay nhanh → lướt có kiểm soát → hiệu chỉnh vị trí nhỏ → giảm tốc máy ảnh/chủ thể chung → dừng hoàn toàn." Chi tiết tạo được báo cáo: khung hình mở đầu từ Seedream 5.0 Pro với giá 0.045$; render Seedance 2.5 20 giây ở 1080p-ESR / 60fps qua Atlas Cloud API bên trong OpenMontage với giá 2.68$; liên kết video được lưu trữ trên Reddit không thể truy cập do lỗi 403 Forbidden. Các bình luận hàng đầu tập trung ít hơn vào phương pháp lập kế hoạch và nhiều hơn vào tính hợp lý của cảnh/hiện tượng giả (artifacting): một người bình luận lập luận rằng cảnh quay nội thất trước cửa sổ không nhất quán về mặt vật lý vì hỏa hoạn bên ngoài/tầng dưới nên ngụ ý có khói hoặc lửa bên trong, và một người khác lưu ý về một "sự kết hợp xe cứu hỏa xe kéo" không hợp lý.

3. AI hiện thân (Embodied AI) và Robot học WRC’26

Giới thiệu GEN-1.5, một người học một lần (one-shot learner) (Hoạt động: 1482): Generalist AI đã công bố GEN-1.5, được mô tả là một người học một lần cho AI hiện thân/robot học, với các bản demo trong video YouTube và bài đăng trên blog. Khả năng chính được tuyên bố là người dùng có thể trình diễn một tác vụ một lần và robot có thể nhanh chóng tái tạo và khái quát hóa hành vi đó; video demo được liên kết trên Reddit không thể truy cập do lỗi 403 Forbidden, vì vậy không có chi tiết kỹ thuật độc lập nào từ clip đó. Người bình luận coi kết quả này là một cột mốc quan trọng cho robot học, với một người gọi đó là "tương đương với GPT-2 cho AI hiện thân/robot học." Thảo luận chủ yếu là sự phấn khích/suy đoán thay vì phê bình kỹ thuật hoặc đánh giá tiêu chuẩn.

Robot ngựa địa hình của DaxAI ra mắt tại WRC’26: tự hành 100Km/10h, tải trọng tối đa 300Kg, tốc độ tối đa 40Km/h (Hoạt động: 1737): DaxAI được cho là đã ra mắt một "robot ngựa" bốn chân địa hình tại WRC’26, tuyên bố tự hành 100 km / 10 h, tải trọng tối đa 300 kg và tốc độ tối đa 40 km/h. Video được liên kết trên Reddit không thể truy cập từ URL được cung cấp do lỗi HTTP 403 Forbidden, vì vậy không có xác minh độc lập nào về dáng đi, khả năng xử lý địa hình, kiến trúc pin hoặc kiểm tra tải trọng. Các bình luận hàng đầu không chứa cuộc tranh luận kỹ thuật thực chất nào; chúng chủ yếu là những câu đùa và sự nhiệt tình nhẹ nhàng, bao gồm cả việc so sánh với một "con ngựa không có ngựa" và một người bình luận nói rằng đó sẽ là một chuyến đi tồi tệ nhưng họ vẫn muốn một con.

Cánh tay robot tại WRC’26 định hướng lại các gói hàng nhanh như con người [trực tiếp] (Hoạt động: 1140): Một bản demo trực tiếp trên X được cho là cho thấy các cánh tay robot tại WRC’26 định hướng lại các gói hàng với thông lượng được tuyên bố là "nhanh như con người." Một người bình luận đã quan sát thấy ít nhất một lỗi rõ ràng tại 4:18:27, đặt ra câu hỏi kỹ thuật chính về tỷ lệ lỗi đo được so với tiêu chuẩn con người; video được liên kết trên Reddit không thể truy cập độc lập do lỗi 403 Forbidden. Người bình luận hoài nghi về tuyên bố "nhanh như con người", lập luận rằng một người chưa qua đào tạo có thể nhanh hơn khoảng 2 lần. Cuộc tranh luận chính tập trung vào việc liệu giá trị thực tế của hệ thống phụ thuộc nhiều hơn vào thông lượng hay độ tin cậy/tỷ lệ lỗi trong quá trình vận hành liên tục.

Bài gốc còn tiếp — xem tiếp tại bài gốc ↗

Bài viết được AI dịch và tổng hợp tự động từ smol.ai AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Ox Alpha lộ diện, DeepSeek nâng cấp mô hình đa phương thức và OpenAI giảm giá API | AIHOT.vn