# OpenAI ra mắt chip Jalapeño: Thách thức vị thế thống trị của NVIDIA

- Nguồn: smol.ai AI News
- Thời gian phát hành: 2026-08-24 12:44 (giờ Việt Nam)
- Điểm AI: 92/100
- Link AIHOT.vn: https://aihot.vn/items/4f32a1b4d1b56a97
- Link gốc: https://news.smol.ai/issues/26-08-25-not-much

## Tóm tắt AI

OpenAI công bố chip Jalapeño với hiệu suất vượt trội và độ trễ thấp hơn đáng kể so với dòng chip GB200/GB300 của NVIDIA. Đồng thời, nghiên cứu mới cho thấy việc tối ưu hóa hệ thống phần mềm có thể mang lại hiệu quả đột phá cho các tác nhân AI.

## Thân bài

![not much happened today | AINews](https://news.smol.ai/api/og?title=not+much+happened+today&description=**OpenAI**+announced+benchmark+results+for+its+custom+inference+chip+**Jalape%C3%B1o**%2C+showing+**1.5%E2%80%931.9%C3%97**+better+efficiency+and+**1.7%E2%80%933.6%C3%97**+lower+latency+compared+to+NVIDIA+**GB200%2FGB300**.+Deployment+starts+by+year-end+with+**Gen+2**+and+**Gen+3**+in+development.+The+chip+runs+at+**700W**+but+stayed+below+**550W**+in+tests.+Model-assisted+kernel+optimization+using+**GPT-Astra+%2B+Codex**+improved+performance+by+**1.5%E2%80%931.8%C3%97**.+This+signals+a+shift+in+inference+stack+economics%2C+potentially+reducing+NVIDIA%27s+dominance.+Additionally%2C+research+on+agent+harnesses+like+**AutoSaddler**+shows+system-level+improvements+can+surpass+model+changes%2C+with+significant+gains+on+benchmarks+like+**GAIA2**+and+**SWE-Bench+Pro**.+A+new+**Harness+Card**+standard+is+proposed+to+disclose+harness+variance%2C+highlighting+the+importance+of+software+engineering+in+AI+agent+performance.&type=issue&issueNumber=08&date=2026-08-24T05%3A44%3A39.731Z&companies=openai%2Cmicrosoft%2Cnvidia&models=jalapeno%2Cgpt-astra%2Ccodex)

Một ngày yên ắng.

Tin tức AI từ 24/8/2026 đến 25/8/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm thông tin nào từ Discord. Trang web của AINews cho phép bạn tìm kiếm tất cả các số đã phát hành trước đây. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể tùy chọn bật/tắt tần suất nhận email!

### Tóm tắt AI trên Twitter

Chip suy luận Jalapeño của OpenAI và sự thay đổi trong ngăn xếp suy luận (inference stack)

Các khung tác nhân (agent harnesses), hệ thống bộ nhớ và kỹ thuật đánh giá (eval engineering) trở thành ưu tiên hàng đầu

Tác nhân ưu tiên cục bộ (local-first agents), suy luận trên thiết bị (on-device inference) và ngăn xếp điện toán cá nhân mới

Mô hình, truy xuất và hạ tầng tìm kiếm

Robot học, mô hình thế giới vật lý và dữ liệu hiện thân (embodied data)

Các tweet hàng đầu (theo mức độ tương tác)

### 1. Điểm chuẩn (benchmarks) của Qwen3.8 Flash/27B và khả năng chạy cục bộ

Qwen 3.8 Flash: Hỗ trợ ngày đầu tiên từ unsloth (Hoạt động: 956): Hình ảnh là ảnh chụp màn hình tweet từ Daniel Han / UnslothAI giới thiệu "Qwen3.8-Flash-Next", được mô tả là một mô hình MoE đa phương thức (multimodal) mã nguồn mở sắp ra mắt, xây dựng trên kiến trúc Qwen4 mới, kèm theo cảnh báo "hãy chuẩn bị dung lượng đĩa". Ý nghĩa kỹ thuật ở đây là Unsloth đang cố gắng hỗ trợ ngay từ ngày đầu, có khả năng liên quan đến việc tương thích/đưa vào llama.cpp vì các bình luận cho thấy Unsloth không tự duy trì runtime riêng. Người dùng tỏ ra thận trọng nhưng lạc quan, lưu ý rằng "hỗ trợ ngày đầu" chỉ là hy vọng vì kiến trúc này còn mới và có thể gây chậm trễ. Ngoài ra, một số người dùng cũng cảm thấy mệt mỏi vì vừa thiết lập xong quy trình làm việc cho Qwen 27B nay lại phải đối mặt với việc chuyển đổi khác.

Qwen3.8-Flash-Next. Kiến trúc này có thể rất thân thiện với máy cục bộ khi các trọng số được phát hành. 👀 (Hoạt động: 912): Đây không phải là meme; mà là ảnh chụp màn hình thông báo từ ModelScope/X giới thiệu Qwen3.8-Flash-Next như một bản phát hành mã nguồn mở sắp tới và là "kiến trúc thế hệ tiếp theo cung cấp sức mạnh cho Qwen4". Bài đăng trên Reddit ước tính dung lượng suy luận cục bộ khoảng 80–90 GB ở mức lượng tử hóa 4-bit cho thiết kế ~125B-A6B + 51B n-gram, với khoảng 58 GB cho các trọng số chính và 24 GB cho bảng n-gram; tuyên bố kỹ thuật quan trọng là thành phần n-gram được truy cập thưa thớt có thể thực tế để chuyển sang RAM hệ thống, giúp mô hình thân thiện với máy cục bộ hơn so với số lượng tham số thô. Người dùng tập trung vào các câu hỏi triển khai thực tế: tại sao bảng n-gram lớn lại được đưa vào mô hình, và liệu người dùng có cần khoảng 128 GB DRAM cộng với ít nhất 16 GB VRAM hay không. Một người dùng so sánh kỳ vọng với Qwen Coder Next, khen ngợi tốc độ và kiến thức tổng quát của nó bất chấp những chỉ trích từ người khác.

Qwen 3.8 27B đứng vị trí thứ 9 trên bảng xếp hạng code arena. Gemma 4 31B đứng thứ 80. (Hoạt động: 967): Một bài đăng trên Reddit báo cáo rằng Qwen 3.8 27B xếp thứ 9 trên bảng xếp hạng lập trình, trong khi Gemma 4 31B xếp thứ 80, cho thấy khoảng cách lớn về hiệu suất lập trình dù quy mô tham số tương đương. Một người dùng cũng báo cáo về việc thử nghiệm mù (blind-testing) trên chế độ Battle Mode của arena.ai và chọn Qwen 3.8 27B thay vì các mô hình đẳng cấp Claude Opus nhiều lần trong trò chuyện, mặc dù họ lưu ý đây không phải là đánh giá chuyên biệt về lập trình. Người dùng mô tả Gemma 4 31B yếu hơn về lập trình nhưng mạnh ở vai trò trợ lý đa năng: tinh tế, đàm thoại, có tính tác nhân (agentic) và hoạt động tốt với các công cụ như OpenClaw. Ngoài ra còn có sự quan tâm đến biến thể Qwen 3.8 122B lớn hơn và liệu việc mở rộng quy mô có cải thiện thêm hiệu suất trên bảng xếp hạng hay không.

### 2. Các mô hình mở hiệu quả và nghiên cứu MoE

TielCoder 22 GB 4-bit quant ngang ngửa Opus4.6 medium trong các vấn đề lập trình thực tế gần đây, vượt qua KAT-Coder và Nail để trở thành lựa chọn MoE mạnh nhất và nhanh nhất. (Hoạt động: 850): Hình ảnh là biểu đồ điểm chuẩn kỹ thuật cho TielCoder-35B-A3B, một mô hình lập trình thưa/MoE 35B được phân phối dưới dạng 22 GB 4-bit GGUF/MLX quants, tuyên bố giải quyết được 12/25 vấn đề mã nguồn thực tế gần đây—ngang bằng với Opus 4.6 medium và vượt trên KAT-Coder, Nail, Sonnet 5, Qwen3.6-35B-A3B và Ornith 1.5. Bài đăng cho rằng kết quả này là nhờ tinh chỉnh Ornith-1.5, lượng tử hóa động imatrix có trọng số mã và mẫu trò chuyện lập trình tác nhân hiệu quả về token, với các bản phát hành trên Hugging Face cho GGUF, GGUF-MTP, MLX và MLX-MTP. Biểu đồ tốc độ báo cáo TielCoder đạt trung vị 8,6 phút / trung bình 12,3 phút mỗi lần thử, định vị nó là tùy chọn 35B-A3B cục bộ nhanh nhất trong so sánh, mặc dù các mô hình đám mây như Opus/Sonnet có vẻ nhanh hơn về thời gian thử nghiệm thô. Người dùng chủ yếu đặt câu hỏi về phạm vi điểm chuẩn, đặc biệt là tại sao Qwen3.8-27B bị bỏ qua dù bài đăng tuyên bố nó mạnh hơn nhưng chậm hơn, và hỏi liệu TielCoder có phải là một bản tinh chỉnh khác của Qwen 35B hay không. Cũng có một chút thất vọng khi KAT-Coder vẫn đang được đánh giá thì một mô hình lập trình cục bộ cạnh tranh khác đã xuất hiện.

ibm-granite/granite-4.2-30b · Hugging Face (Hoạt động: 451): IBM đã phát hành dòng mô hình suy luận Granite 4.2 trên Hugging Face: granite-4.2-30b, 8b và 3b, tất cả đều theo giấy phép Apache 2.0 với ngữ cảnh 512K và các chế độ suy luận <think>...</think> tích hợp: đầy đủ/mặc định, không suy nghĩ và nỗ lực thấp. Mô hình 30B là một Transformer chỉ giải mã (decoder-only) dày đặc sử dụng GQA (32 đầu chú ý, 8 đầu KV), RoPE với θ=10.000.000, SwiGLU MLP kích thước ẩn 32768, RMSNorm ε=1e-5, nhúng không liên kết và bfloat16; IBM cũng đã xuất bản một blog kỹ thuật, Granite 4.2 LLMs: Cách chúng được xây dựng. Người dùng nhìn chung coi Granite không phải là SOTA (tiên tiến nhất) về điểm chuẩn và "hơi tụt hậu", nhưng hoan nghênh thêm các mô hình mở, đặc biệt là với giấy phép Apache 2.0 cởi mở và những cải tiến ổn định qua từng thế hệ.

Tôi đã tự phát triển LLM lượng tử hóa từ đầu, huấn luyện trên 30B token, triển khai trong 60 MB (Hoạt động: 375): Một nhà phát triển đã phát hành SHADOW-250M, một LLM 250M tham số được xây dựng từ đầu, huấn luyện trên 30B token FineWeb, lượng tử hóa xuống <2 bit cho bản triển khai ~60 MB sử dụng ~80 MB RAM và một runtime CPU tùy chỉnh được cho là đạt ~400 tok/s; mã/trọng số có trên GitHub và Hugging Face. Các chỉ số LM được báo cáo là 3,15 nats/token entropy chéo, 23,3 perplexity và 0,99 bit/byte; nó sử dụng từ vựng token-code cố định 512-bit không chuẩn cho 131k token (8,4 MB, không có bảng nhúng đã học) và tuyên bố WordSim-353 Spearman 0,619 so với 0,029 ngẫu nhiên. Hỗ trợ lịch sử dài được triển khai dưới dạng bộ nhớ đệm lai: 2048 token mới nhất vẫn là fp16 KV, các token cũ hơn được nén xuống 1 bit và lưu trữ trên đĩa ở mức ~320 byte/token, với việc huấn luyện nhắm vào việc truy xuất từ kho lưu trữ lên đến 100M token thay vì suy luận ngữ cảnh đầy đủ. Người dùng thấy các trường hợp sử dụng hợp lý trong các ứng dụng độ trễ thấp/NPC trò chơi hoặc giao diện trợ lý giọng nói, nhưng phản đối kỹ thuật chính là việc tiếp thị nó như một mô hình ngữ cảnh 100M-token là gây hiểu lầm: các nhà phê bình mô tả nó là mô hình ngữ cảnh hoạt động 2k cộng với truy xuất dựa trên đĩa/tìm kiếm-và-đọc lại, không phải là sự chú ý transformer thực sự trên 100M token.

[Bài báo] ToMoE: Chuyển đổi các mô hình ngôn ngữ lớn dày đặc thành Hỗn hợp các chuyên gia (Mixture-of-Experts) thông qua cắt tỉa cấu trúc động (Hoạt động: 318): Bài đăng liên kết đến ToMoE, một bài báo đề xuất phương pháp cắt tỉa cấu trúc động có thể phân biệt được, chuyển đổi các lớp MLP của LLM dày đặc thành dạng Hỗn hợp các chuyên gia trong khi vẫn giữ ngân sách tham số hoạt động cố định, giảm tính toán hoạt động mà không xóa vĩnh viễn các trọng số (arXiv, PDF, GitHub, OpenReview). Các tác giả báo cáo rằng, ngay cả khi không cần tinh chỉnh, ToMoE vẫn vượt trội hơn các phương pháp cắt tỉa cấu trúc trước đây trên Phi-2, LLaMA-2, LLaMA-3 và Qwen-2.5, và OP yêu cầu chuyển đổi các mô hình dày đặc mới hơn như Qwen3-8/27B và Muse-Glimmer-30B. Một lưu ý kỹ thuật hàng đầu cho rằng ToMoE có khả năng sẽ không tạo ra một mô hình cực kỳ thưa thớt như Qwen 27B A3B; người dùng mong đợi thứ gì đó gần với 27B A16B hơn với sự suy giảm chất lượng có thể đo lường được, vẫn tốt hơn các phương pháp "MoEfication" trước đây nhưng kém hơn so với việc huấn luyện một MoE gốc từ đầu.

### 3. Phần cứng máy tính để bàn AI băng thông cao

Apple giới thiệu Mac Studio mới với M5 Max và M5 Ultra - lên đến 512GB bộ nhớ thống nhất (Hoạt động: 2604): Apple đã công bố Mac Studio mới với M5 Max và M5 Ultra, với cấu hình bộ nhớ thống nhất lên đến 512GB và băng thông bộ nhớ M5 Ultra được báo cáo là 1,2TB/s. Người dùng lưu ý giá cho các cấu hình RAM 256GB: 9.499 USD cho mẫu CPU 30 nhân / GPU 64 nhân và 10.799 USD cho mẫu CPU 36 nhân / GPU 80 nhân, với tùy chọn 512GB được cho là sẽ ra mắt vào tháng 10. Người dùng tranh luận về giá trị của nó đối với suy luận AI cục bộ so với việc mua nhiều hệ thống lớp NVIDIA DGX Spark, lập luận rằng bộ nhớ thống nhất lớn và băng thông của Mac Studio có thể giúp suy luận nhanh hơn cho các mô hình rất lớn. Một số người suy đoán điều này có thể gây áp lực lên giá RTX 3090 cũ, mặc dù không có dữ liệu điểm chuẩn nào được cung cấp.

Xiaomi AI Cube được công bố với băng thông bộ nhớ 1,2TB/s (Hoạt động: 2340): Xiaomi đã công bố nguyên mẫu Xiaomi AI Cube được xây dựng xung quanh ngăn xếp ba chip: Xuanjie O3, Xuanjie O100 và Xuanjie D100 (ITHome). Thông số kỹ thuật tiêu đề là băng thông bộ nhớ 1,22 TB/s, nhưng bài đăng lưu ý sự mơ hồ: D100 được cho là hỗ trợ tới 160 GB RAM và ban đầu gắn liền với xe điện Xiaomi, trong khi O100 gắn liền với con số băng thông, làm dấy lên khả năng băng thông được trích dẫn có thể đề cập đến băng thông trên gói/lớp SRAM thay vì DRAM bên ngoài. Người dùng coi thông báo này là áp lực cạnh tranh hữu ích chống lại Nvidia và giá HBM, đặc biệt là với các báo cáo rằng máy chủ AI của Nvidia đang trở nên đắt đỏ hơn. Một lưu ý kỹ thuật cho biết các nền tảng điện toán xe điện hiện đại có thể cung cấp các nhóm bộ nhớ LPDDR5 lớn bất thường—ví dụ: Xiaomi D100 lên đến 160 GB và Xpeng Tuling lên đến 216 GB trên cụm 3 chip—khiến ô tô có khả năng trở thành thiết bị suy luận AI có bộ nhớ cao nhất mà nhiều người dùng sở hữu.

### Tóm tắt các Subreddit AI ít kỹ thuật hơn

/r/Singularity, /r/Oobabooga, /r/MachineLearning, /r/OpenAI, /r/ClaudeAI, /r/StableDiffusion, /r/ChatGPT, /r/ChatGPTCoding, /r/aivideo, /r/aivideo

### 1. Xây dựng sản phẩm thực tế với sự hỗ trợ của Claude

Indeed sa thải vợ tôi đang mang thai, nên tôi đã xây dựng một đối thủ tìm kiếm việc làm với Claude. Nó vừa có ba người đầu tiên được tuyển dụng. (Hoạt động: 1770): Người đăng tuyên bố họ đã xây dựng DreamWorkHQ, một đối thủ của Indeed, phần lớn bằng Claude Code, sau khi Indeed sa thải người vợ đang mang thai của họ; sau ~4 tháng, nó được cho là có hơn 4.300 người dùng đã xác thực, 91 người dùng trả phí và 3 người được tuyển dụng nhờ nền tảng này. Về mặt kỹ thuật, hệ thống thu thập ~15.000 việc làm/ngày trực tiếp từ các trang nghề nghiệp của nhà tuyển dụng, phân loại/làm giàu chúng, nhúng chúng để khớp ngữ nghĩa và dự định ra mắt một tác nhân ứng tuyển "Autopilot" đọc các trang ATS như Workday, Greenhouse và Lever để điền đơn ứng tuyển mà không cần tiện ích mở rộng Chrome. Nhóm báo cáo hơn 1.100 PR đã được hợp nhất trong vài tháng đầu tiên bởi ba người, bao gồm hơn 200 PR từ một người sáng lập không chuyên về kỹ thuật, và lưu ý rằng lưu lượng truy cập đã làm sập công cụ khớp lệnh tạm thời. Các bình luận chủ yếu không mang tính kỹ thuật nhưng tích cực, coi dự án là "Revenge Vibe-Coding" (lập trình trả thù) và bày tỏ sự thất vọng khi tìm việc; một người dùng lưu ý rằng họ đã thấy dự án trên /r/sideproject trước đây và ngạc nhiên vì nó vẫn còn hoạt động.

Tuần thứ 4 thực hiện trò chơi câu cá hoàn toàn bằng AI (Hoạt động: 1231): Cập nhật tuần thứ 4 cho một trò chơi câu cá do AI xây dựng: dự án sử dụng Godot, với hầu hết mã/nội dung được tạo qua Claude/Claude Code, hình ảnh qua ChatGPT, tài sản 3D thông qua Claude Code điều khiển Blender qua MCP cộng với Tripo 3D, và chi phí báo cáo khoảng 300 USD bao gồm Claude Max, tạo hình ảnh, StableAudio và Tripo. Kể từ tuần 3, tác giả đã xây dựng lại bến cảng từ hình ảnh 2D được tạo thành cảnh Blender/Godot 3D phù hợp, tạo trình chỉnh sửa tùy chỉnh trong cảnh để chọn/di chuyển/xoay/tỷ lệ các đối tượng 3D và lưu các biến đổi, thêm tùy chọn đồ họa, một vùng đất mới và màn hình tải hiển thị tiến trình tải thế giới. Các rào cản kỹ thuật hiện tại bao gồm cài đặt đồ họa bị lỗi và các hiện tượng giả (artifacts) của shader nước xung quanh các hòn đảo trong Giờ Vàng/Bình minh/Đêm, nơi việc loại bỏ hiệu ứng sẽ sửa được các hiện tượng giả ở bờ biển nhưng làm giảm vẻ ngoài của vùng nước sâu. Phản hồi chính là giảm bớt các bản sao tường thuật/UI do AI tạo ra một cách rõ ràng như "Cô ấy là của bạn... và cô ấy không phải vậy" và "Con thuyền nhớ lộ trình", với người dùng gợi ý rằng bản sao viết tay sẽ làm cho trò chơi cảm thấy có chủ đích hơn và ít giống "AI slop" (rác AI) hơn.

Tôi đã xây dựng một ứng dụng sổ tay viết tay nơi Claude viết lại và đó là điều thú vị nhất tôi từng làm trong nhiều năm (Hoạt động: 3735): Tác giả đang xây dựng penombra, một ứng dụng sổ tay viết tay bằng bút cảm ứng/máy tính bảng Android cho Daylight DC-1 cho phép người dùng viết ghi chú, chú thích PDF/ebook và để Claude phản hồi trực tiếp trên trang, tạo ghi chú từ các đoạn được đánh dấu, thảo luận tài liệu hoặc kiểm tra người dùng. Ứng dụng hiện đang trong giai đoạn tiền phát hành, dự định chạy trên bất kỳ máy tính bảng Android nào có hỗ trợ bút cảm ứng, với khả năng có bản port cho iPad; đăng ký người thử nghiệm sớm có sẵn qua Google Forms. Các bình luận chủ yếu là phản ứng không kỹ thuật và đùa cợt, không có thảo luận hoặc phê bình thực chất về việc triển khai.

Những gì tôi đã xây dựng với Claude - khoai lang (Hoạt động: 3936): Hình ảnh (JPEG) cho thấy các thùng khoai lang đã thu hoạch, đóng vai trò là kết quả thực tế của quy trình trồng trọt có sự hỗ trợ của AI thay vì một meme. Người đăng cho biết họ đã sử dụng Claude trong suốt mùa vụ để lập kế hoạch cho nhà kính, quản lý thư mục dự án/kết nối/CoWork/Claude Code, xây dựng công cụ khuyến nghị thời tiết/tưới nước/phân bón dựa trên cảm biến, chạy cron job, theo dõi dữ liệu trong bảng tính/ứng dụng và phân tích dữ liệu cây trồng/cánh đồng—mặc dù bắt đầu là một người dùng không chuyên về kỹ thuật. Các bình luận nhìn chung tích cực, coi đây là một cách sử dụng thực tế hấp dẫn của LLM ngoài lập trình; một người dùng đã hỏi cụ thể loại cảm biến nào được sử dụng, nhưng không có chi tiết kỹ thuật nào về cảm biến được cung cấp trong bài đăng.

### 2. Giới hạn truy cập AI và quyền riêng tư doanh nghiệp

Giới hạn 5 giờ đã trở lại cho người dùng Plus. 100 USD và 200 USD có thêm vài tháng. (Hoạt động: 1495): Hình ảnh là ảnh chụp màn hình bài đăng trên X cho biết giới hạn sử dụng 5 giờ đang quay trở lại đối với người dùng ChatGPT Plus trên ChatGPT Work và Codex, với lý do được đưa ra là để làm mượt nhu cầu tính toán và ngăn người dùng thông thường tiêu tốn hạn mức hàng tuần quá nhanh. Theo bài đăng, các gói Pro 100 USD và 200 USD sẽ không bị giới hạn 5 giờ trong vài tháng tới, củng cố sự khác biệt rõ rệt hơn về sản phẩm/quyền truy cập tính toán giữa Plus và các gói giá cao hơn. Liên kết hình ảnh Người dùng phần lớn coi đây là áp lực phân tầng có chủ ý: "Họ muốn mọi người trả 100 một tháng rõ ràng là vậy" và "Tài chính và sản phẩm nói rằng chúng tôi cần thúc đẩy sự khác biệt hơn...". Người đăng ban đầu gợi ý rằng nếu các giới hạn tương tự quay trở lại với Pro, việc thuê thời gian GPU có thể trở thành một giải pháp thay thế hấp dẫn hơn.

Quản trị viên Claude Enterprise, bạn đã bao giờ tìm thấy điều gì gây sốc trong lịch sử trò chuyện của nhân viên chưa? (Hoạt động: 1366): Bài đăng nhấn mạnh rằng quản trị viên Claude Enterprise có thể xuất hoặc kiểm tra toàn bộ lịch sử sử dụng/trò chuyện của người dùng Claude, và chế độ Ẩn danh không ngăn cản khả năng hiển thị của quản trị viên. Một người dùng báo cáo đã phát hiện một nhân viên sử dụng Claude để viết tập lệnh trích xuất PII (thông tin nhận dạng cá nhân) đến một điểm cuối cá nhân để huấn luyện một mô hình cục bộ, dẫn đến sự can thiệp của nhân sự và mất giấy phép Claude. Người dùng bày tỏ lo ngại về việc giám sát AI tại nơi làm việc và kỳ vọng về quyền riêng tư không rõ ràng. Một giai thoại mô tả một chủ sở hữu công ty định tuyến các liên lạc cá nhân và nhân viên rộng rãi thông qua Claude, minh họa cách nhật ký AI doanh nghiệp có thể nắm bắt nội dung không phải mã cực kỳ nhạy cảm.

Tại sao chúng ta cho rằng bất kỳ ai sẽ cho chúng ta quyền truy cập vào siêu trí tuệ? (Hoạt động: 1038): Bài đăng đặt ra một thí nghiệm tư duy về quản trị/kinh tế AI: nếu một công ty có được một hệ thống siêu thông minh thực sự—một "vị thần nô lệ" theo nghĩa khung kiểm soát AI của Max Tegmark (Life 3.0)—thì việc phơi bày khả năng gần biên giới thông qua sản phẩm/API SaaS 200 USD/tháng sẽ có vẻ phi lý về mặt chiến lược nếu hệ thống có thể tăng tốc R&D nội bộ, phát triển mô hình kế nhiệm, phòng thủ mạng/hạ tầng và ra quyết định tổ chức. Câu hỏi kỹ thuật cốt lõi là liệu quyền truy cập công cộng tương đối rộng rãi ngày nay vào các mô hình gần biên giới có phải là trạng thái cân bằng tạm thời do cạnh tranh, quy định và khả năng chưa hoàn thiện gây ra hay không, và liệu cửa sổ đó có thể đóng lại khi khả năng trở nên quyết định hoặc không thể kiểm soát được hay không. Các bình luận hàng đầu chia thành hai quan điểm: một lập luận rằng quyền truy cập sẽ chỉ vẫn do thị trường thúc đẩy khi nhiều phòng thí nghiệm có thể cung cấp các hệ thống tương đương—"chín công ty khác đang bán siêu trí tuệ của riêng họ với giá 205 USD/tháng"—ngụ ý rằng giai đoạn truy cập mở hiện tại có thể là cửa sổ lịch sử liên quan. Những người khác lập luận rằng một ASI thực sự sẽ không thể bị kiểm soát bởi bất kỳ công ty nào; nếu nó có tác nhân, nó sẽ quyết định tương tác với ai, trong khi các hệ thống không có tác nhân nhưng siêu năng lực vẫn có thể bị chặn sau các API như các mô hình biên giới hiện tại.

_Bài gốc còn tiếp._ Xem tiếp tại: <https://news.smol.ai/issues/26-08-25-not-much>
