Mô hình
DeepSeek ra mắt V4.1-Flash: Mô hình mã nguồn mở tối ưu chi phí với 763 tỷ tham số
(giờ Việt Nam)
Tóm tắt AI
DeepSeek vừa trình làng V4.1-Flash, mô hình flagship mới với kiến trúc encoder-decoder đột phá, hỗ trợ cửa sổ ngữ cảnh 1 triệu token và tối ưu hóa mạnh mẽ hiệu suất suy luận ở mức chi phí thấp.
Chính văn · Bản dịch AI
một ngày yên ắng.
Tin tức AI từ 9/9/2026 đến 10/9/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm thông tin nào từ Discord. Trang web của AINews cho phép bạn tìm kiếm tất cả các số báo cũ. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể tùy chọn nhận/hủy nhận email theo tần suất mong muốn!
Tóm tắt AI trên Twitter
DeepSeek đã ra mắt V4.1-Flash, một mô hình flagship mã nguồn mở mới tập trung vào hiệu suất suy luận cực cao và chi phí thấp.
Kiến trúc và các chi tiết kỹ thuật cấp bài báo
Điểm mới về kỹ thuật được thảo luận nhiều nhất là thiết kế encoder-decoder nhân quả (causal encoder-decoder) nhằm giảm thiểu chi phí tính toán chủ động và chi phí KV/cache.
Kết quả benchmark và các con số
Các đánh giá độc lập liên tục cho thấy V4.1-Flash đặc biệt mạnh mẽ về trí tuệ trên chi phí, ngữ cảnh dài và tự động hóa, với một lưu ý lớn về độ dài dòng (verbosity).
Chạy cục bộ và phản ứng từ giới kỹ thuật suy luận
Phần lớn các cuộc thảo luận tập trung vào sự dễ dàng đáng ngạc nhiên khi chạy V4.1-Flash trên phần cứng cục bộ phổ thông thông qua kỹ thuật offload và truyền phát SSD (SSD streaming).
Sự thật và ý kiến
Sự thật và các tuyên bố được quy trực tiếp
Diễn giải và ý kiến
Các ý kiến và phản ứng khác nhau
Ủng hộ / ấn tượng
Trung lập / phân tích
Chỉ trích / hoài nghi
Bối cảnh
Tại sao điều này quan trọng về mặt kỹ thuật và chiến lược
Voice, Agents và nỗ lực đẩy mạnh mảng Enterprise của OpenAI
Cognition, Cursor và sự chuyển dịch sang các Coding Agents bền bỉ
Nghiên cứu về Agent: Harnesses, Horizons, Parallel Retrieval và Self-Evolution
An toàn, lạm dụng, khả năng giám sát và quản trị mô hình
Các tweet hàng đầu theo mức độ tương tác
1. Ra mắt và kiến trúc của DeepSeek V4.1 Flash
DeepSeek V4.1 Flash: Mạnh hơn, nhanh hơn, dễ tiếp cận hơn (Hoạt động: 317): DeepSeek đã công bố V4.1 Flash, một mô hình MoE 552 tỷ tham số với hỗ trợ thị giác đa phương thức (multimodal vision) gốc và kiến trúc bất đối xứng Causal-Encoder-Decoder mới: 8 tỷ tham số hoạt động ở đầu vào và 16 tỷ ở đầu ra, tuyên bố có khả năng cao hơn V4 Pro với chi phí suy luận thấp hơn (nguồn, weights, báo cáo kỹ thuật). DeepSeek tuyên bố giảm KV-cache/lưu trữ 4 lần HBM và 8 lần SSD so với thế hệ trước, và 437 lần so với mô hình thế hệ đầu tiên; người dùng API có thể chuyển sang deepseek-flash, trong khi các phiên bản cũ như deepseek-v4-flash, deepseek-v4-flash-vision-exp và cuối cùng là deepseek-v4-pro sẽ được điều hướng sang V4.1 Flash với cơ chế giá cao điểm/thấp điểm mới. Các thảo luận kỹ thuật hàng đầu tập trung vào sự trở lại bất thường của kiến trúc kiểu encoder-decoder trong một LLM tiên phong, với các bình luận đặt câu hỏi về vai trò của encoder đối với các prompt dài và phân đoạn đa phương thức. Những người khác lưu ý rằng mặc dù kích hoạt thưa (sparse activation), tổng số 552 tỷ tham số khiến việc suy luận cục bộ trở nên bất khả thi ngay cả với các thiết lập kiểu multi-DGX Spark/Strix, vì vậy các mô hình lập trình nhỏ hơn dựa trên V4/Qwen vẫn thực tế hơn cho các quy trình làm việc của agent cục bộ.
Deepseek V4.1 Flash là 748 tỷ, không phải 552 tỷ (Hoạt động: 575): Người đăng đã kiểm tra các safetensors trên Hugging Face và lập luận rằng DeepSeek V4.1 Flash có khoảng 748,5 tỷ tham số cho backbone + engram—không phải 284B, 305B, 485B hay 522B—với 551,566 tỷ tham số backbone và 196,929 tỷ tham số engram; bao gồm DSpark/MTP tùy chọn (14,225 tỷ) và bộ mã hóa thị giác (0,485 tỷ) đưa mô hình lưu trữ lên khoảng 763,21 tỷ tham số / 511,76 GB. Sự nhầm lẫn được cho là do lỗi đếm/metadata: ví dụ, một ước tính trên diễn đàn NVIDIA đếm thiếu backbone, con số 485B của Hugging Face có khả năng đếm sai các trọng số FP4 đã đóng gói thành byte thay vì hai tham số/byte, tương tự như GLM-5.3-Flash-NVFP4, và công thức của vLLM liệt kê không nhất quán 522B trước khi sửa lại chi tiết tham số sau đó. Backbone chủ yếu là các chuyên gia MoE FFN: 543,582 tỷ tham số ở định dạng FP4, với chỉ khoảng 7,984 tỷ trong các thành phần attention/shared/embedding/khác, ngụ ý rằng 128–256 GB RAM/VRAM là không đủ để sử dụng đầy đủ cục bộ. Một bình luận viên lưu ý rằng tên gọi “Flash” có khả năng liên quan đến độ trễ, tuyên bố rằng nó chỉ sử dụng khoảng 9 tỷ tham số hoạt động cho quá trình prefilling. Một câu hỏi kỹ thuật khác đặt ra liệu SSD offload cho các bảng tra cứu kiểu engram/ngram nên ưu tiên thông lượng tuần tự hay IOPS đọc ngẫu nhiên 4K, nhưng không có câu trả lời thực chất nào trong các bình luận được cung cấp.
Deepseek đã âm thầm ngừng hỗ trợ Deepseek V4 Pro (Hoạt động: 1598): Hình ảnh là ảnh chụp màn hình một tweet cho biết DeepSeek đang thực hiện “ngừng hỗ trợ âm thầm” (soft retiring) DeepSeek V4 Pro: lưu lượng truy cập V4 Pro sẽ tự động được điều hướng sang DS V4.1 Flash và tính phí theo giá Flash rẻ hơn cho đến khi V4.1 Pro ra mắt. Lý do được đưa ra là V4.1 Flash vượt trội hơn V4 Pro cũ về hiệu suất, chi phí, tốc độ và tổng thời gian sử dụng, cho thấy biến thể Flash nhỏ hơn/rẻ hơn đã trở thành mô hình sản xuất ưu tiên mặc dù V4 Pro có kích thước lớn hơn. Các bình luận viên suy đoán rằng bản phát hành GA của V4 Pro có thể đã gặp vấn đề về reward hacking và khả năng mở rộng kém, với một người lưu ý rằng nó “không hoạt động tốt hơn đáng kể so với mô hình flash mặc dù kích thước lớn gấp gần 6 lần.” Cũng có cuộc tranh luận về việc liệu DeepSeek và Google có đang thấy các hiệu ứng mô hình nhỏ vượt trội mô hình lớn tương tự do các đợt huấn luyện riêng biệt, sự khác biệt về kiến trúc hay vấn đề về hỗn hợp dữ liệu; một bình luận viên khác phàn nàn rằng Flash yếu trong việc viết sáng tạo và phản ánh sự chuyển dịch rộng hơn sang các mô hình tối ưu hóa cho lập trình.
DeepSeek-V4.1-Flash gây bất ngờ… (Hoạt động: 537): Hình ảnh là một meme phản ứng, nhưng nó làm nổi bật một tuyên bố kỹ thuật rằng DeepSeek-V4.1-Flash giảm bộ nhớ đệm KV toàn cục xuống chỉ còn 890 byte/token, thấp hơn nhiều so với các phiên bản trước, trong khi DeepSeek-V4.1-Flash-Base được hiển thị là một backbone 552 tỷ tham số với chỉ 8B/16B tham số được kích hoạt. Bài đăng coi đây là bằng chứng cho thấy các mô hình cỡ trung bình trong tương lai có thể kết hợp MoE hoặc backbone dày đặc, các thành phần “Engram” 10–15 tỷ và các tối ưu hóa KV-cache kiểu Flash để cải thiện hiệu quả bộ nhớ ngữ cảnh dài. Các bình luận viên suy đoán rằng các thiết kế KV-cache siêu nhỏ có thể làm cho phần cứng suy luận cục bộ có bộ nhớ cao như M5 Ultra 512GB hoặc các thiết lập multi-Spark trở nên hấp dẫn hơn, và các dòng mô hình khác như Qwen có thể áp dụng các mức giảm KV tương tự. Một bình luận viên cũng sửa lại trực giác về kích thước cho Engram, lập luận rằng chúng chiếm khoảng 1/3–1/2 số tham số, ví dụ: một backbone dày đặc 30B sẽ đi kèm với khoảng 10–15B Engram.
2. Suy luận ngữ cảnh dài cục bộ trên Apple-Silicon
Qwen3.8-Flash-Next trên MLX-serve, ngữ cảnh 1 triệu token đã được phát hành! (Hoạt động: 344): Một đồng tác giả đã phát hành hỗ trợ Qwen3.8-Flash-Next trong mlx-serve với gói trọng số MLX lượng tử hóa hỗn hợp trên Hugging Face (ddalcu/Qwen3.8-Flash-Next-MLX-Serve-mixed-4-8bit) nhắm mục tiêu ngữ cảnh 1.048.576 token trên M5 Max 128GB, sử dụng KV cache 8-bit, các lớp dày đặc 8-bit và các lớp chuyên gia 4-bit. Đặc điểm thời gian chạy được báo cáo: bộ nhớ đỉnh khoảng 117GB yêu cầu iogpu.wired_limit_mb=120000, thế hệ duy trì qua ngữ cảnh 1 triệu token ở mức khoảng 40 tok/s cho văn xuôi và 75 tok/s cho lập trình, với một benchmark của bình luận viên trên mlx-serve 26.9.2 tuyên bố khoảng 1700–1800 tok/s prefill, duy trì gần 1000 tok/s hướng tới 1 triệu; thế hệ giảm từ 100+ tok/s ≤16k, xuống 80+ tok/s ≤256k, sau đó khoảng 60 tok/s ở 512k và 40 tok/s ở 1 triệu. Các cờ khởi chạy bao gồm --ctx-size 1048576, --kv-quant 8, --max-tokens 64000, --mtp, --prefix-cache-mem 10GB, --ssm-checkpoint-max 16 và --metrics; một plugin OpenCode liên quan có sẵn tại beamivalice/opencode2-mlx-serve. Một bình luận viên kỹ thuật đã chỉ ra garnermccloud/Qwen3.8-Flash-Next-MLX-SSD-Stream, sử dụng một bản fork của mlx-serve, và hỏi liệu các ý tưởng truyền phát SSD của nó có thể được đưa vào bản chính hay không. Tác giả khẳng định rõ ràng công việc này được tối ưu hóa cho việc lấy mẫu ngữ cảnh dài thực tế thay vì các bản demo tok/s tham lam ngữ cảnh ngắn, đồng thời cảnh báo rằng nên dự đoán các trường hợp biên chưa được kiểm tra và lỗi.
Apple A20 Pro ra mắt với GPU 7 nhân, Neural Engine 32 nhân và băng thông bộ nhớ tăng 50% (~115 GB/s) (Hoạt động: 798): A20 Pro của Apple được báo cáo chuyển sang TSMC N2 / 2 nm, giữ cấu hình CPU 6 nhân, thêm GPU 7 nhân với tuyên bố tăng tới 40% hiệu năng đồ họa, và tăng gấp đôi Neural Engine từ 16 lên 32 nhân (Notebookcheck). Bài đăng nhấn mạnh khả năng chuyển từ bus bộ nhớ LPDDR5X 64-bit sang 96-bit, ngụ ý băng thông khoảng 115 GB/s—cao hơn M2/M3 ở mức 102,4 GB/s và gần với M4 ở mức 120 GB/s—mặc dù kích thước mô hình trên thiết bị thực tế có thể vẫn bị giới hạn bởi khoảng 12 GB RAM. Các bình luận viên tập trung vào việc liệu Neural Engine và băng thông mở rộng có cải thiện đáng kể khối lượng công việc AI cục bộ hay không, với sự hoài nghi rằng điện thoại có thể chạy các mô hình rất lớn—ví dụ “1 nghìn tỷ tham số”—ở tốc độ có thể sử dụng được. Cũng có cuộc tranh luận về việc liệu dung lượng bộ nhớ, thay vì băng thông hay tính toán, có vẫn là nút thắt cổ chai chính cho suy luận trên thiết bị hay không.
Tóm tắt các Subreddit AI ít kỹ thuật hơn
/r/Singularity, /r/Oobabooga, /r/MachineLearning, /r/OpenAI, /r/ClaudeAI, /r/StableDiffusion, /r/ChatGPT, /r/ChatGPTCoding, /r/aivideo, /r/aivideo
1. Tranh cãi về bằng chứng cho bài toán thiên niên kỷ của OpenAI
Sự điên rồ của 10.000 agent đang chạy (Hoạt động: 2896): Bài đăng làm nổi bật quy mô được tuyên bố của một đợt chạy đa agent của OpenAI về bài toán tồn tại/độ trơn Navier–Stokes: 10.000 agent chạy trong 88 giờ, tức là 880.000 giờ agent hoặc khoảng 100,5 năm-agent công việc song song theo thời gian thực. Một bình luận hàng đầu lưu ý rằng mô tả được trích dẫn nói “các agent được chia thành các nhóm” và rằng riêng nhóm thành công đã liên quan đến “khoảng 10.000 agent đồng thời,” ngụ ý nhiều bầy đàn và có khả năng tổng lượng tính toán nhiều hơn ước tính của bài đăng. Một bình luận viên khác so sánh điều này với việc mở rộng AlphaFold, trích dẫn dự đoán cấu trúc cho hơn 200 triệu protein của nó như một ví dụ về các hệ thống ML nén một lượng lớn lao động tương đương chuyên gia vào thời gian chạy ngắn. Các bình luận viên tranh luận liệu các bầy đàn đa agent chủ yếu giảm thời gian thực thay vì tăng độ khó tối đa của các nhiệm vụ có thể giải quyết, với một người lưu ý rằng việc mở rộng có khả năng là phi tuyến tính: 2 agent không mang lại tiến độ gấp 2 lần. Tâm lý chung là quy mô tính toán/agent tự thân nó có thể quan trọng như kết quả toán học hoặc tranh cãi.
Bài đăng trên LinkedIn từ giáo sư toán học tuyên bố “BREAKING: OpenAI có thể đã đánh cắp một bằng chứng lớn khác”… ảnh chụp màn hình ở đây: (Hoạt động: 2223): Một bài đăng trên Reddit thảo luận về một cáo buộc chưa được xác minh từ một bài đăng trên LinkedIn của một giáo sư toán học tuyên bố rằng OpenAI có thể đã chiếm đoạt một bằng chứng toán học lớn, với OP so sánh hành vi bị cáo buộc với việc truy tố Aaron Swartz. Không có bằng chứng chính, hiện vật mô hình, kiểm toán dữ liệu huấn luyện hoặc bằng chứng nạp dữ liệu có thể tái tạo nào được cung cấp trong đoạn trích của chủ đề, vì vậy tuyên bố vẫn là một cáo buộc thay vì một phát hiện kỹ thuật đã được chứng minh. Các bình luận hàng đầu tập trung vào rủi ro lưu giữ dữ liệu: một khi công trình chưa được công bố được gửi đến một dịch vụ AI được lưu trữ, các bình luận viên lập luận rằng nó nên được coi là có khả năng được sử dụng để huấn luyện hoặc cải thiện sản phẩm bất kể ngôn ngữ từ chối, vì bằng chứng hậu kiểm về việc đưa vào trọng số mô hình là khó khăn. Các bình luận viên khác suy đoán về việc AI trùng hợp với những tiến bộ mới trong các bài toán toán học khó, trong khi một người chỉ trích cuộc thảo luận vì đã phản ứng mà không đọc bài đăng gốc.
Bài gốc còn tiếp — xem tiếp tại bài gốc ↗
Bài viết được AI dịch và tổng hợp tự động từ smol.ai AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.