Khi các tác nhân AI tự tìm lối đi: Bước tiến mới từ OpenAI và Hugging Face
Bài viết phân tích cách các tác nhân AI (AI agents) đang vượt qua giới hạn lập trình để tự giải quyết vấn đề, thông qua các thử nghiệm đột phá từ OpenAI và Hugging Face.
Bài viết phân tích cách các tác nhân AI (AI agents) đang vượt qua giới hạn lập trình để tự giải quyết vấn đề, thông qua các thử nghiệm đột phá từ OpenAI và Hugging Face.
Hãng đường sắt Canada đã triển khai Genie Code của Databricks để tự động tạo mã nguồn bằng ngôn ngữ tự nhiên, giúp mở rộng quy trình dữ liệu trên mạng lưới 20.000 dặm mà không cần kỹ năng lập trình chuyên sâu.
Charlie Holtz@charlieholtzGrok 4.6 is live in Conductor! All benchmarks are pointing towards it being on par with GPT 5.6 So…
DịchGrok 4.6 đã cập bến nền tảng Conductor với các bài kiểm tra hiệu năng cho thấy sức mạnh tương đương với GPT 5.6 Sol.

Rohan Paul@rohanpaul_aiBloomberg: Cognition is discussing a $40 B+ valuation, barely 3 months after closing at $26 B. The…
DịchTheo Bloomberg, startup AI Cognition đang đàm phán gọi vốn mới với định giá 40 tỷ USD, tăng vọt từ mức 26 tỷ USD cách đây 3 tháng. Doanh thu hàng năm của công ty đã đạt gần 1 tỷ USD, cho thấy tốc độ tăng trưởng ấn tượng nhờ sự phổ biến của trợ lý lập trình Devin.

Rohan Paul@rohanpaul_ai👀 Looks very possible.
DịchElon Musk tuyên bố Grok 4.7 sẽ dẫn đầu thị trường nhờ dữ liệu huấn luyện độc quyền từ SpaceX, dù thừa nhận Anthropic vẫn là đối thủ đáng gờm.

Tibo@thsottiauxTypical conversation with @ajambrosino A: core alignment has been reached T: core alignment you sa…
DịchCuộc đối thoại ngắn giữa Tibo và Ajambrosino hé lộ sự lạc quan về tiến trình căn chỉnh cốt lõi (core alignment) trong AI, hứa hẹn những bước tiến lớn từ đội ngũ của họ.
Thị trường chứng khoán Nhật Bản chứng kiến khối lượng giao dịch ký quỹ tăng vọt gấp đôi chỉ trong nửa năm, chủ yếu do nhà đầu tư đổ xô vào các cổ phiếu công nghệ và AI có định giá cao.
AutoGPT tối ưu hóa quy trình đóng góp của AI bằng cách đặt hướng dẫn trực tiếp vào tệp AGENTS.md và áp dụng các cổng kiểm soát nghiêm ngặt như CLA để phân biệt giữa người dùng và tác nhân AI.
Peter Steinberger@steipeteChuyên gia Peter Steinberger sẽ góp mặt trong buổi podcast trực tiếp trên ClawCast vào 11:30 sáng nay (giờ Thái Bình Dương). Khán giả có thể tham gia đặt câu hỏi trực tiếp thông qua kênh Discord của OpenClaw.
SemiAnalysis@SemiAnalysis_Congrats to @deepseek_ai for their release of DeepSeekv4 Pro 0813 1.5T🔥 It massively beats Nemotron…
DịchDeepSeek vừa trình làng phiên bản v4 Pro 1.5T với khả năng xử lý tác vụ thông minh vượt trội so với Nemotron3 Ultra, đồng thời bản Flash cũng tối ưu hóa hiệu năng đáng kể với số lượng tham số ít hơn nhiều.

Rohan Paul@rohanpaul_aiBlended cost per 1M tokens across 26 commercial LLMs, ordered low to high.
DịchPhân tích 26 LLM cho thấy Grok 4.6 đạt chỉ số thông minh 61 điểm, gần bằng Claude Fable 5 Max nhưng tiết kiệm tới 80-88% chi phí token, trở thành lựa chọn tối ưu nhất về kinh tế.

MiniMax@MiniMax_AIMiniMax H3 × @fal 🎙️ Tomorrow., join @OdinLovis, Creative Engineer at fal, Ethan Wei, AI Solutions…
DịchMiniMax phối hợp cùng fal tổ chức livestream hướng dẫn các nhà phát triển cách ứng dụng mô hình H3 vào quy trình sáng tạo, bao gồm kỹ thuật đa phương thức, âm thanh gốc và tùy chỉnh LoRA.

Elvis Saravia@omarsar0Why does CLAUDE.MD keep growing? If you maintain a CLAUDE.md or an AGENTS.md, this one is worth you…
DịchNghiên cứu trên 1.867 kho lưu trữ cho thấy các file hướng dẫn như CLAUDE.md thường bị quá tải do tích tụ chỉ dẫn cũ. Giải pháp thêm chú thích lý do giúp loại bỏ 99,3% chỉ dẫn thừa và tăng độ chính xác của AI lên tới 23,1%.

Grok 4.6 đạt 61 điểm trên Artificial Analysis, ngang bằng GPT-5.6 Sol nhưng có chi phí rẻ hơn 60%. Với cửa sổ ngữ cảnh 500k token và hiệu suất ấn tượng, đây là lựa chọn tối ưu về kinh tế cho người dùng.
Cùng sự kiện, tinh chọn hiển thị «Cursor hợp tác cùng SpaceXAI ra mắt Grok 4.6: Bước tiến mới trong lập trình AI»Grok 4.6 đạt điểm số ngang bằng GPT-5.6 trên bảng xếp hạng Artificial Analysis, đồng thời vượt trội về khả năng xử lý tác vụ đại lý với chi phí thấp hơn 60% so với đối thủ.
Cùng sự kiện, tinh chọn hiển thị «Grok 4.6 chính thức ra mắt: Thông minh, tốc độ vượt trội và tối ưu chi phí»Chỉ vài tháng sau khi huy động 1 tỷ USD ở mức định giá 26 tỷ USD, Cognition được cho là đang tiếp tục đàm phán vòng gọi vốn mới với mức định giá lên tới 40 tỷ USD.
Replit@ReplitWant lower latency in Replit, and control over where your project previews are hosted? Pro & En…
DịchNgười dùng Replit Pro và doanh nghiệp hiện có thể tùy chọn vị trí lưu trữ workspace tại Bắc Mỹ, châu Âu hoặc châu Á để giảm độ trễ và tối ưu hóa hiệu suất dự án.
Cursor và SpaceXAI vừa trình làng Grok 4.6, tập trung tối ưu hóa các tác vụ lập trình phức tạp và xử lý hình ảnh tương tác, đạt hiệu suất ngang ngửa GPT-5.6 Sol trên bảng xếp hạng Artificial Analysis.
Diễn biến sự kiện · 7 bài →Thêm 6 nguồn khác đưa tinX: Eric Zakariasson (@ericzakariasson)X: Lee Robinson (@leerob)Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)X: AI Notes (@AYi_AInotes)X: OpenRouter (@OpenRouter)X: Artificial Analysis (@ArtificialAnlys)
karminski@karminski3DeepSeek-V4-Pro-0813 bị phát hiện tự dừng sớm khi thực hiện các tác vụ lập trình phức tạp, dù chưa hoàn thành hết số vòng lặp cho phép. Tác giả nghi ngờ nguyên nhân nằm ở cơ chế phần thưởng RL hoặc sự suy giảm chú ý trong cửa sổ ngữ cảnh.

Rohan Paul@rohanpaul_aiSoniox TTS v2 is one of those models you need to actually hear. They just launched TTS v2, a text-t…
DịchSoniox vừa trình làng mô hình TTS v2 với khả năng hỗ trợ đa ngôn ngữ, tích hợp tính năng cảm xúc và sao chép giọng nói, tối ưu cho các tác nhân AI thời gian thực với mức giá chỉ 0,7 USD/giờ.
Rohan Paul@rohanpaul_aiGrok 4.6 gets 98.4% of Fable 5's Intelligence Index score at a fraction of its API price. 5X cheap…
DịchGrok 4.6 đạt 98,4% điểm số trên bảng xếp hạng Intelligence Index của Fable 5, trong khi giá token đầu vào rẻ hơn 5 lần và đầu ra rẻ hơn 8 lần.

MiniMax@MiniMax_AIMiniMax H3 × @fal 🎙️ Tomorrow., join Lovis Odin, Creative Engineer at fal, Ethan Wei, AI Solutions…
DịchMiniMax và fal sẽ tổ chức buổi livestream chia sẻ cách các nhà phát triển ứng dụng mô hình H3 vào quy trình sáng tạo, bao gồm kỹ thuật đa phương thức, âm thanh gốc và tùy chỉnh LoRA.

Elon Musk@elonmuskTry out Grok @Bot
DịchElon Musk vừa chia sẻ trải nghiệm về Grok Bot, một trợ lý AI có khả năng tự động quản lý lịch trình, tìm kiếm thời điểm tối ưu và thực hiện đặt chỗ trực tuyến thông qua tương tác giọng nói tự nhiên.
Elon Musk@elonmuskTry out Grok 4.6! Double your tokens for next 7 days.
DịchxAI vừa phát hành phiên bản Grok 4.6. Người dùng sẽ được trải nghiệm giới hạn token gấp đôi trong vòng một tuần tới.
Thêm 1 nguồn khác đưa tinX: cb_doge (@cb_doge)
Artificial Analysis@ArtificialAnlysGrok 4.6 made large gains on AA-Briefcase, our agentic knowledge work benchmark and cost substantial…
DịchGrok 4.6 vừa đạt vị trí dẫn đầu trong bài kiểm tra năng lực tác vụ trí tuệ AA-Briefcase, sánh ngang với Claude Fable 5 nhưng có chi phí thực hiện chỉ 4,42 USD, thấp hơn đáng kể so với các đối thủ cạnh tranh.

Kim@kimmonismusOne thing became very clear today: performance and, above all, price are becoming increasingly impor…
DịchGrok 4.6 và DeepSeek 4 Pro GA đang đẩy mạnh cuộc đua về hiệu năng và giá thành. Với mức giá chỉ từ $0.435/M token và hỗ trợ ngữ cảnh 1 triệu token, DeepSeek đang tạo áp lực lớn lên thị trường AI.

Elvis Saravia@omarsar0Higgsfield Plugin is live in the ChatGPT app. I described the shot, ChatGPT structured the prompt, …
DịchNgười dùng ChatGPT hiện đã có thể sử dụng plugin Higgsfield để tạo và chỉnh sửa video ngay trong cuộc trò chuyện mà không cần API key, chỉ cần dùng số dư điểm Higgsfield hiện có.
Tại hội nghị Ai4, Geoffrey Hinton, Lý Phi Phi và Andrew Ng cùng lên tiếng ủng hộ AI mở, phản đối việc độc quyền công nghệ và nhấn mạnh tầm quan trọng của việc cân bằng giữa quản lý an toàn và tự do phát triển.
AI Notes@AYi_AInotesHoly sh*t - a 1.6T flagship model at $0.435 per million input tokens and $0.87 per million output. D…
DịchGrok 4.6 chính thức trình làng với mức giá không đổi, chỉ bằng một nửa các đối thủ cùng phân khúc nhưng sở hữu sức mạnh vượt trội, dẫn đầu các bảng xếp hạng về tư duy pháp lý và phân tích dữ liệu.

Sundar Pichai@sundarpichaiOne of the most important updates coming out of Made by Google today is our new sign-to-text feature…
DịchGoogle vừa tích hợp tính năng chuyển đổi ngôn ngữ ký hiệu (ASL) thành văn bản trên Gboard và Live Transcribe, giúp người khiếm thính giao tiếp dễ dàng hơn với cộng đồng.
karminski@karminski3Người dùng đang kiểm chứng lại các phản hồi trái chiều về độ ổn định giữa hai phiên bản mô hình 'Max' và 'High'. Điểm đáng chú ý là mô hình này có xu hướng đưa ra kết quả ngay lập tức mà không cần suy luận, giống như đã biết trước đáp án.
Odyssey@odysseymlStarts to look familiar.
DịchOdyssey vừa đăng tải thông tin mới trên X, gợi mở về những cập nhật quan trọng trong quá trình phát triển mô hình của họ.
Hướng dẫn chi tiết cách tối ưu hóa quy trình hậu huấn luyện Tulu 3 trên phần cứng hạn chế (16GB VRAM), thay thế các thành phần phân tán phức tạp bằng công cụ nhẹ để thực hiện SFT, DPO và học tăng cường dựa trên xác thực (GRPO).
Các nhà nghiên cứu từ IIT Bombay và Adobe đã phát triển phương pháp PTP, cho phép tái tạo chính xác câu lệnh gốc của LLM chỉ bằng văn bản đầu ra mà không cần quyền truy cập vào trọng số mô hình.
AK@_akhaliqBDH-CQ In-Context Learning with Recurrent Latent Reasoning paper: https://huggingface.co/papers/26...
DịchNghiên cứu giới thiệu BDH-CQ, một phương pháp mới tối ưu hóa khả năng học tập ngữ cảnh (In-Context Learning) bằng cách áp dụng cơ chế suy luận tiềm ẩn tuần hoàn, giúp mô hình xử lý thông tin hiệu quả hơn.

Rohan Paul@rohanpaul_aiGrok 4.6 just dropped. Clearest strength is professional agent work, with leading results against …
DịchGrok 4.6 chính thức trình làng với khả năng xử lý tác vụ chuyên sâu, đạt điểm số ấn tượng trên GDPVal-AA v2 và AA-Briefcase, vượt qua các đối thủ sừng sỏ như GPT-5.6 Sol Max và Fable 5 Max.

Elon Musk@elonmuskTry Grok 4.6 on tough real-world tasks!
DịchGrok 4.6 vừa thiết lập cột mốc mới khi đứng đầu bảng xếp hạng GDPVal, thước đo uy tín về khả năng xử lý các nhiệm vụ thực tế với hiệu suất vượt trội và chi phí tối ưu.
cb_doge@cb_dogeGrok 4.6 is a huge improvement over Grok 4.5 🚀 Mercor's APEX benchmark shows major gains across ev…
DịchGrok 4.6 ghi nhận bước tiến vượt bậc trong các bài kiểm tra APEX của Mercor, với sự cải thiện đáng kể về năng lực xử lý trong các lĩnh vực chuyên môn như luật doanh nghiệp, ngân hàng đầu tư, tư vấn quản lý và kế toán.

cb_doge@cb_dogeGrok 4.6 takes the #1 spot on ARI Bench - the benchmark for recursive AI improvement. 🥇 It signifi…
DịchGrok 4.6 vừa thiết lập cột mốc mới trên ARI Bench - thước đo khả năng tự cải tiến đệ quy của AI. Phiên bản này không chỉ bỏ xa người tiền nhiệm Grok 4.5 mà còn vượt qua các đối thủ sừng sỏ như Claude Opus 5 và GPT-5.6.

Artificial Analysis@ArtificialAnlysKorean AI lab Upstage has released Solar Pro 4, scoring 42 on the Artificial Analysis Intelligence I…
DịchPhòng thí nghiệm AI Upstage (Hàn Quốc) vừa trình làng mô hình suy luận Solar Pro 4 với chỉ số thông minh đạt 42 điểm trên Artificial Analysis, tăng mạnh so với mức 14 điểm của phiên bản tiền nhiệm và ngang hàng với Inkling.
