OpenRouter ra mắt hướng dẫn giúp lập trình viên sử dụng chung một cấu trúc code để gọi công cụ (tool calling) trên nhiều mô hình như Claude, GPT và các mô hình mã nguồn mở, chỉ cần thay đổi tên mô hình trong yêu cầu.
Congrats to @deepseek_ai for their release of DeepSeekv4 Pro 0813 1.5T🔥 It massively beats Nemotron…
DịchDeepSeek vừa trình làng phiên bản v4 Pro 1.5T với khả năng xử lý tác vụ thông minh vượt trội so với Nemotron3 Ultra, đồng thời bản Flash cũng tối ưu hóa hiệu năng đáng kể với số lượng tham số ít hơn nhiều.
Blended cost per 1M tokens across 26 commercial LLMs, ordered low to high.
DịchPhân tích 26 LLM cho thấy Grok 4.6 đạt chỉ số thông minh 61 điểm, gần bằng Claude Fable 5 Max nhưng tiết kiệm tới 80-88% chi phí token, trở thành lựa chọn tối ưu nhất về kinh tế.
Grok 4.6 made large gains on AA-Briefcase, our agentic knowledge work benchmark and cost substantial…
DịchGrok 4.6 vừa đạt vị trí dẫn đầu trong bài kiểm tra năng lực tác vụ trí tuệ AA-Briefcase, sánh ngang với Claude Fable 5 nhưng có chi phí thực hiện chỉ 4,42 USD, thấp hơn đáng kể so với các đối thủ cạnh tranh.
One thing became very clear today: performance and, above all, price are becoming increasingly impor…
DịchGrok 4.6 và DeepSeek 4 Pro GA đang đẩy mạnh cuộc đua về hiệu năng và giá thành. Với mức giá chỉ từ $0.435/M token và hỗ trợ ngữ cảnh 1 triệu token, DeepSeek đang tạo áp lực lớn lên thị trường AI.
Hướng dẫn chi tiết cách tối ưu hóa quy trình hậu huấn luyện Tulu 3 trên phần cứng hạn chế (16GB VRAM), thay thế các thành phần phân tán phức tạp bằng công cụ nhẹ để thực hiện SFT, DPO và học tăng cường dựa trên xác thực (GRPO).
Các nhà nghiên cứu từ IIT Bombay và Adobe đã phát triển phương pháp PTP, cho phép tái tạo chính xác câu lệnh gốc của LLM chỉ bằng văn bản đầu ra mà không cần quyền truy cập vào trọng số mô hình.
BDH-CQ In-Context Learning with Recurrent Latent Reasoning paper: https://huggingface.co/papers/26...
DịchNghiên cứu giới thiệu BDH-CQ, một phương pháp mới tối ưu hóa khả năng học tập ngữ cảnh (In-Context Learning) bằng cách áp dụng cơ chế suy luận tiềm ẩn tuần hoàn, giúp mô hình xử lý thông tin hiệu quả hơn.
Grok 4.6 takes the #1 spot on ARI Bench - the benchmark for recursive AI improvement. 🥇 It signifi…
DịchGrok 4.6 vừa thiết lập cột mốc mới trên ARI Bench - thước đo khả năng tự cải tiến đệ quy của AI. Phiên bản này không chỉ bỏ xa người tiền nhiệm Grok 4.5 mà còn vượt qua các đối thủ sừng sỏ như Claude Opus 5 và GPT-5.6.
models that are not usable by humans are not useful i don't think it is constructive to say that "o…
DịchDex Horthy cho rằng các mô hình AI hiện nay chỉ có 'năng lực' chứ không có 'trí tuệ' thực sự, đồng thời chỉ trích việc các mô hình ngày càng khó sử dụng và có dấu hiệu suy giảm hiệu suất.
Grok 4.6 is objectively #1 when considering intelligence, speed & cost
DịchGrok 4.6 của xAI đạt điểm số ấn tượng trên bảng xếp hạng Artificial Analysis, vượt trội về hiệu suất tác vụ với chi phí rẻ hơn 60% so với các đối thủ hàng đầu như Claude Opus 5 và GPT-5.6 Sol.
Alibaba vừa phát hành Qwen3.8-2.4T-A95B, mô hình mã nguồn mở khổng lồ với 2,4 nghìn tỷ tham số tổng và 95 tỷ tham số kích hoạt, hiện đã có mặt trên Hugging Face.
JUST IN: Deepseek V4 Pro has just released. A quick glance at latest benchmarks comparing with V4 pr…
DịchDeepSeek vừa trình làng phiên bản V4 Pro. Bài viết cung cấp cái nhìn tổng quan về các kết quả kiểm thử hiệu năng mới nhất so với bản xem trước (preview) trước đó.
Here we go: DeepSeek 4 GA Benchmarks are circulating already. A very solid upgrade, but it's a bit …
DịchDeepSeek 4 vừa lộ kết quả kiểm thử với hiệu năng ổn định, ngang hàng với các mô hình đầu bảng như Kimi k3 và GLM-5.2, đồng thời ra mắt phiên bản Pro song song với Grok 4.6 API.
DeepSeek vừa phát hành phiên bản V4 Pro trên nền tảng API, hỗ trợ cửa sổ ngữ cảnh 1 triệu token cùng bộ công cụ chuyên dụng cho nhà phát triển, với mức giá cao gấp 3 lần so với bản Flash.
Alibaba chính thức mở mã nguồn mô hình Qwen-Max với 2.4 nghìn tỷ tham số, kích hoạt 95 tỷ tham số mỗi token và hỗ trợ cửa sổ ngữ cảnh lên tới 1 triệu token.
Qwen3.8-Max weights just dropped on Hugging Face! 2.4T total parameters, with 95B activated. A goo…
DịchAlibaba vừa phát hành trọng số của Qwen3.8-Max trên Hugging Face. Với quy mô khổng lồ 2.4 nghìn tỷ tham số, đây là bước tiến lớn tiếp theo cho cộng đồng AI mã nguồn mở.
SGLang và Miles đã cập nhật hỗ trợ Day-0 cho Qwen3.8-2.4T-A95B, mô hình mã nguồn mở lớn nhất của Qwen với 2,4 nghìn tỷ tham số và kiến trúc Mixture-of-Attention.
Grok 4.6 is a massive upgrade 🚀 It beats Grok 4.5 High across every benchmark listed and now ranks…
DịchGrok 4.6 mang đến bước tiến lớn khi vượt qua phiên bản tiền nhiệm ở mọi bài kiểm tra, đồng thời đạt điểm số ngang bằng với GPT-5.6 Sol Max trên bảng xếp hạng Artificial Analysis. Người dùng hiện đã có thể trải nghiệm mô hình này thông qua Cursor và Grok Build.
BREAKING: Grok 4.6 takes the #1 spot on the GDPVal-AA benchmark 🏆 • Grok 4.6 - 1, 753 Elo • Fable 5…
DịchGrok 4.6 vừa thiết lập cột mốc mới khi dẫn đầu bảng xếp hạng GDPVal-AA với 1.753 điểm Elo, vượt qua các đối thủ mạnh như Fable 5 Max và GPT-5.6 Sol Max.
DeepSeek v4 Pro GA is rolling out! Grok 4.6 API spotted as well! Really excited! After the most rec…
DịchDeepSeek V4 Pro đã chính thức phát hành cùng với sự xuất hiện của API Grok 4.6. Đây là bước tiến lớn tiếp theo sau phiên bản Flash, hứa hẹn mang đến nhiều cải tiến mạnh mẽ cho cộng đồng AI.
Một nghiên cứu mới chỉ ra lỗ hổng bảo mật nghiêm trọng trên các API mô hình lớn, cho phép kẻ xấu trích xuất toàn bộ chuỗi tư duy (reasoning traces) vốn được các hãng như OpenAI hay Anthropic mã hóa để bảo mật.
Vì sao đáng đọc: Đây là phát hiện bảo mật quan trọng ảnh hưởng trực tiếp đến các mô hình AI hàng đầu, có giá trị chuyên môn cao và đang thu hút sự quan tâm lớn từ cộng đồng công nghệ.
My latest piece is a little verbose, but I think it is really a nice example digging into a sort of …
DịchTác giả Nathan Lambert chia sẻ trải nghiệm thực tế khi viết sách giáo khoa về AI, qua đó chỉ ra rằng các mô hình hiện nay vẫn chưa đủ khả năng để thay thế con người trong việc tổng hợp và trình bày kiến thức chuyên sâu.
Chỉ sau một tuần mở mã nguồn, MiniMax H3 đã tạo cơn sốt với gần 300 biến thể trên Hugging Face. Cộng đồng đã tối ưu hóa trọng số xuống còn 42.5GB để chạy trên GPU phổ thông, đồng thời phát triển engine suy luận riêng cho Mac.
A few years ago, when I started my AI textbook, I would've guessed AI models would've maybe made it …
DịchSau khi tự viết sách giáo khoa AI, Nathan Lambert nhận thấy các mô hình hiện nay vẫn gặp khó khăn trong việc viết và tổ chức tư duy cho các nội dung kỹ thuật dài. Ông lo ngại điều này sẽ cản trở tiềm năng của AI trong việc thúc đẩy nghiên cứu khoa học mở.
Tác giả nhận thấy dù AI đã đạt trình độ siêu việt trong lập trình và toán học, khả năng viết văn bản dài và phi hư cấu vẫn dậm chân tại chỗ, gây cản trở việc tự chủ giải quyết các vấn đề khoa học phức tạp.
Vì sao đáng đọc: Góc nhìn thực tế từ người trong cuộc về giới hạn của LLM hiện tại, giúp độc giả có cái nhìn khách quan hơn về sự phát triển của AI thay vì chỉ chạy theo các con số kỹ thuật.
Nvidia đang phát triển Nemotron 4 với quy mô lên tới 1.000 tỷ tham số, dự kiến ra mắt vào mùa thu này. Để hiện thực hóa tham vọng này, hãng đã nâng mức chi tiêu cho hạ tầng đám mây lên 28 tỷ USD đến năm 2031.
Objectively one of the coolest papers in LLM jailbreak world but most people didn't read the actual …
DịchChuyên gia Deedy Das làm rõ rằng các cuộc tấn công khai thác lỗ hổng API để trích xuất suy luận ẩn không hiệu quả với mô hình Fable, bác bỏ các tuyên bố trước đó về việc giải mã quá trình chưng cất mô hình này.
Dù OpenAI đã giải được nhiều bài toán hóc búa, LLM vẫn mạnh về tìm phản ví dụ hơn là chứng minh lý thuyết. Bài viết phân tích lý do tại sao mô hình ngôn ngữ lại có ưu thế đặc biệt trong việc phát hiện các trường hợp ngoại lệ này.
Nghiên cứu giới thiệu Power Law Graph Attention (PLGA), một cơ chế chú ý mới thay thế tích vô hướng truyền thống bằng toán tử song tuyến tính học được, giúp tối ưu hóa khả năng biểu diễn và suy luận của các mô hình ngôn ngữ lớn.
llama.cpp cho phép chạy các mô hình AI mạnh mẽ ngay trên thiết bị cá nhân mà không cần API hay kết nối internet, đảm bảo quyền riêng tư tuyệt đối. Công cụ này tối ưu hóa hiệu suất trên nhiều loại phần cứng, hỗ trợ các model mới nhất như Qwen 3.6 và Gemma 4.
Nghiên cứu giới thiệu bài kiểm tra 'Taboo' giúp đánh giá độ bền của LLM bằng cách ép mô hình đi chệch khỏi lộ trình tạo văn bản thông thường, từ đó bộc lộ những hạn chế thực tế mà các bài benchmark truyền thống thường bỏ qua.
AI Agent là hệ thống tự vận hành dựa trên LLM để giải quyết tác vụ phức tạp, trong khi Workflow cung cấp quy trình cố định. Hiểu rõ sự kết hợp giữa tính linh hoạt của Agent và tính ổn định của Workflow là chìa khóa để xây dựng hệ thống AI thực tế.
You're paying for the same tokens twice. Every API call reloads the same context: system prompts, do…
DịchTính năng bộ nhớ đệm ngữ cảnh (Context Caching) mới trên Model Studio giúp bạn tránh việc phải trả phí lặp lại cho các dữ liệu đầu vào cố định như system prompt hay tài liệu, từ đó tiết kiệm đáng kể chi phí sử dụng API.
Alibaba Cloud vừa triển khai cụm siêu máy tính Lingjun Zhenwu M890, cho phép doanh nghiệp thuê hạ tầng tính toán hiệu năng cao để vận hành các mô hình AI lên tới 10 nghìn tỷ tham số mà không cần tự xây trung tâm dữ liệu.
Alibaba Cloud chính thức ra mắt siêu node M890, cho phép doanh nghiệp vận hành các mô hình MoE quy mô 10 nghìn tỷ tham số với hiệu suất huấn luyện tăng gấp 3 lần so với thế hệ trước.