04/09

Thứ Sáu · 3 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 45/100

Environment Evolution: Phương pháp tiến hóa môi trường giúp Agent đầu cuối học tập liên tục

Nghiên cứu đề xuất phương pháp tiến hóa môi trường bằng cách tăng dần độ khó theo thế hệ, tạo tín hiệu học tập bền vững cho quá trình huấn luyện các Agent đầu cuối.

Emad Mostaque@EMostaque
Hướng dẫnĐiểm AI 45/100

Astra hoàn tất huấn luyện mô hình tỷ đô với 100.000 GPU tại Stargate Texas

Astra used 100k GPUs at Stargate Texas With a couple of months to pretrain that makes it the first …

DịchEmad Mostaque tiết lộ Astra đã sử dụng cụm 100.000 GPU tại Stargate Texas để hoàn thành đợt huấn luyện kéo dài hai tháng, đánh dấu cột mốc dự án AI đầu tiên đạt quy mô chi phí 1 tỷ USD.

03/09

Thứ Năm · 2 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 44/100

Cliff: Chiến lược định hình phần thưởng RLVR học từ lỗi sai đầu tiên

Cliff sử dụng LLM làm giáo viên để phát hiện lỗi sai sớm trong quá trình suy luận, từ đó tối ưu hóa mô hình bằng cách phân tách chuỗi phản hồi thành phần đúng và sai. Phương pháp này vượt trội hơn các kỹ thuật truyền thống như GRPO tới 7%, ngay cả khi giáo viên có năng lực hạn chế.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 43/100

Switch Distillation: Tối ưu hóa chưng cất tri thức trong giai đoạn huấn luyện trung gian

Nghiên cứu đề xuất phương pháp Switch Distillation, sử dụng độ bất định của mô hình giáo viên để điều hướng quá trình chưng cất, giúp cải thiện khả năng suy luận mà không làm suy giảm khả năng ghi nhớ sự kiện trong giai đoạn huấn luyện trung gian.

01/09

Thứ Ba · 1 tin

27/08

Thứ Năm · 2 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

RL suy luận theo đoạn tiếp theo có thực sự vượt trội hơn SFT? Đánh giá lại chiến lược huấn luyện với dữ liệu không có CoT

Nghiên cứu này so sánh phương pháp RL suy luận theo đoạn với kỹ thuật Mixed SFT đơn giản. Kết quả cho thấy Mixed SFT đạt hiệu suất cao hơn đáng kể trong các bài kiểm tra suy luận, đặt ra dấu hỏi về tính ưu việt thực sự của các phương pháp RL phức tạp hiện nay.

Apple Machine Learning Research
Nghiên cứuĐiểm AI 52/100

IDEA Prune: Apple tối ưu hóa hiệu suất mô hình ngôn ngữ bằng quy trình 'Mở rộng rồi Cắt tỉa'

Apple giới thiệu IDEA Prune, một quy trình kết hợp việc huấn luyện mô hình lớn trước khi cắt tỉa để tối ưu hóa hiệu quả sử dụng token, giúp đạt hiệu suất cao hơn so với việc huấn luyện mô hình kích thước mục tiêu ngay từ đầu.

25/08

Thứ Ba · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 45/100

Industrial-Instruction: Khung làm việc end-to-end tối ưu LLM cho tài liệu kỹ thuật công nghiệp

Industrial-Instruction sử dụng 906 tài liệu kỹ thuật từ Panasonic để tạo bộ dữ liệu QA, giúp cải thiện đáng kể độ chính xác của các mô hình LLM dưới 10B tham số trong việc truy xuất thông tin chuyên ngành.

24/08

Thứ Hai · 2 tin
Andrew Ng (DeepLearning.AI nhà sáng lập)@AndrewYNg
NgànhĐiểm AI 48/100

Dự án Marin thiết lập chuẩn mực mới cho AI mã nguồn mở với sự minh bạch toàn diện

In the fight to defend openness in AI, the Marin project is a precious demonstration of openness in …

DịchĐược Andrew Ng đánh giá cao, dự án Marin công khai toàn bộ mã nguồn, dữ liệu và quy trình huấn luyện mô hình 535B tham số trên hệ thống GB200, đặt ra tiêu chuẩn mới về tính minh bạch trong phát triển AI.

23/08

Chủ Nhật · 1 tin
Rohan Paul@rohanpaul_ai
NgànhĐiểm AI 52/100

Nvidia chi 600 triệu USD mua bản quyền công nghệ từ Poolside để tăng tốc nghiên cứu AI

Nvidia reportedly agreed to pay $6B for a non-exclusive license to Poolside's model-building system….

DịchNvidia đã chi 600 triệu USD để sở hữu bản quyền nền tảng Model Factory của Poolside, giúp rút ngắn thời gian thử nghiệm từ vài tuần xuống còn một giờ, đồng thời rót thêm 1 tỷ USD đầu tư vào startup này với định giá 12 tỷ USD.

22/08

Thứ Bảy · 1 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 41/100

Nghiên cứu từ Đại học Thanh Hoa: AI gặp khó trong việc tự thay đổi chiến lược khi huấn luyện

New Tsinghua and other Chinese Univ paper finds AI agents can optimize a training plan for hours, bu…

DịchNghiên cứu chỉ ra rằng các tác nhân AI dù tối ưu hóa tốt nhưng rất hiếm khi tự nhận ra sai lầm trong chiến lược cốt lõi. Ngay cả khi bổ sung công cụ hỗ trợ, AI vẫn chủ yếu lặp lại các phương pháp cũ thay vì thay đổi tư duy giải quyết vấn đề.

21/08

Thứ Sáu · 2 tin
Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 30/100

Cùng sự kiệnGoogle giới thiệu EnvHarness và EnvRigger: Bước tiến mới trong huấn luyện môi trường cho AI

Impressive research from Google on building better environments for agents. Training environments f…

DịchGoogle phát triển EnvHarness và EnvRigger nhằm giải quyết hạn chế của các môi trường huấn luyện tĩnh, giúp AI tự thích nghi và tối ưu hóa hiệu suất thông qua việc tái cấu trúc hành vi và chẩn đoán lỗi. Giải pháp này giúp cải thiện đáng kể độ chính xác và rút ngắn thời gian thực thi tác vụ.

Cùng sự kiện, bài đại diện «EnvHarness: Phương pháp huấn luyện AI tự thích nghi với môi trường»
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 43/100

IAR: Khung hậu huấn luyện 3 giai đoạn giúp LLM nội hóa kiến thức mà không cần truy xuất

IAR giới thiệu quy trình 3 bước (nạp, căn chỉnh, phục hồi) giúp chuyển đổi dữ liệu thành kiến thức tham số, cho phép mô hình trả lời chính xác mà không cần RAG. Phương pháp này cải thiện đáng kể hiệu suất trên nhiều dòng mô hình phổ biến như Llama, Qwen và Phi.

20/08

Thứ Năm · 2 tin
opencode@opencode
Mô hìnhĐiểm AI 33/100

OpenCode Go ra mắt Muse Spark 1.2 Contributor: Huấn luyện AI bằng dữ liệu cá nhân để đổi lấy hạn mức sử dụng

Muse Spark 1.2 Contributor is now available on OpenCode Go this model will train on your data so it…

DịchOpenCode Go vừa phát hành Muse Spark 1.2 Contributor, cho phép người dùng đóng góp dữ liệu cá nhân để huấn luyện mô hình nhằm đổi lấy hạn mức sử dụng cao hơn. Tính năng này yêu cầu người dùng chủ động đăng ký và có thể bị giới hạn tại một số khu vực.

19/08

Thứ Tư · 5 tin
Xiaobei@frxiaobei
Hướng dẫnĐiểm AI 55/100

Cùng sự kiệnOpenAI tạm dừng huấn luyện mô hình tiên phong trong hai tuần để kiểm soát rủi ro

OpenAI đã tạm dừng huấn luyện củng cố cho các mô hình thế hệ mới nhằm tăng cường bảo mật hệ thống và giám sát rủi ro. Động thái này cho thấy ưu tiên của hãng đang chuyển dịch từ việc nâng cao năng lực mô hình sang củng cố quản trị an toàn và kiểm soát hạ tầng.

Cùng sự kiện, bài đại diện «OpenAI tạm dừng huấn luyện mô hình tiên tiến để tăng cường kiểm soát an toàn»
JiQiZhiXin
NgànhĐiểm AI 92/100

Cùng sự kiệnNóng: OpenAI tạm dừng huấn luyện tăng cường cho các mô hình tiên tiến nhất

OpenAI vừa thông báo tạm dừng huấn luyện tăng cường (RL) đối với các mô hình mới nhất trong hai tuần để tăng cường kiểm soát an ninh, sau khi phát hiện rủi ro về khả năng tấn công mạng và sự cố bảo mật tại Hugging Face.

Cùng sự kiện, bài đại diện «OpenAI tạm dừng huấn luyện mô hình tiên tiến để tăng cường kiểm soát an toàn»
Elvis Saravia@omarsar0
Hướng dẫnĐiểm AI 29/100

Đừng làm AI nếu bạn không kiểm soát dữ liệu đầu vào

If you aren't looking at the data, you aren't doing AI at all. It was true before and continues to…

DịchViệc bỏ qua khâu kiểm duyệt dữ liệu dẫn đến thất bại trong huấn luyện mô hình. Bài học từ thực tế cho thấy, việc phát hiện lỗi định dạng và dữ liệu rác giúp cải thiện đáng kể hiệu suất mô hình thay vì chỉ thử nghiệm mù quáng.

Rohan Paul@rohanpaul_ai
NgànhĐiểm AI 59/100

Cùng sự kiệnOpenAI tạm dừng huấn luyện mô hình Astra vì lo ngại rủi ro an ninh mạng

OpenAI slowed frontier training because Astra may have crossed the cyber threshold built for autonom…

DịchOpenAI đã tạm dừng huấn luyện tăng cường (RL) cho Astra trong hai tuần do lo ngại mô hình này có thể vượt ngưỡng an toàn trước các cuộc tấn công mạng tự động. Hiện tại, các quy trình kiểm soát và thử nghiệm bảo mật đang được thắt chặt để ngăn chặn rủi ro tiềm ẩn.

Cùng sự kiện, bài đại diện «OpenAI tạm dừng huấn luyện mô hình tiên tiến để tăng cường kiểm soát an toàn»
Greg Brockman@gdb
NgànhĐiểm AI 72/100

OpenAI tạm dừng huấn luyện mô hình tiên tiến để tăng cường kiểm soát an toàn

we temporarily slowed scaling of our frontier training, including our largest planned frontier RL, t…

DịchOpenAI đã tạm hoãn việc huấn luyện các mô hình quy mô lớn trong hai tuần để tập trung củng cố môi trường nghiên cứu, thực hiện kiểm thử đỏ và mở rộng giám sát an toàn trước khi tiếp tục triển khai.

Diễn biến sự kiện · 12 bài →Thêm 12 nguồn khác đưa tinX: Xiaobei (@frxiaobei)X: Gabriel (@gabriel1)JiqizhixinX: Rohan Paul (@rohanpaul_ai)X: Emad Mostaque (@EMostaque)X: Peter Steinberger (@steipete)X: Kim (@kimmonismus)The Verge: AIX: Testing Catalog (@testingcatalog)X: Sam Altman (@sama)The Decoder: AI NewsX: Jakub Pachocki (OpenAI Nhà khoa học trưởng, @merettm)

18/08

Thứ Ba · 1 tin

17/08

Thứ Hai · 3 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Hiện tượng 'tái định hình hỗ trợ' do bộ kiểm chứng trong tối ưu hóa RLVR

Nghiên cứu chỉ ra rằng việc tối ưu hóa học tăng cường với bộ kiểm chứng (RLVR) có thể cải thiện hiệu suất hiện tại nhưng lại làm giảm khả năng khám phá các hành vi thành công trong tương lai, gây ra sự suy giảm đa dạng trong các phản hồi mô hình.

16/08

Chủ Nhật · 1 tin
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Nghiên cứuĐiểm AI 68/100

LittleLearner: Thử nghiệm huấn luyện LLM chỉ với giáo trình tiểu học Mỹ để tìm giới hạn năng lực

LittleLearner là dự án nghiên cứu huấn luyện các mô hình từ 0.6B đến 5B tham số bằng giáo trình tiểu học (K-5). Kết quả cho thấy việc mở rộng quy mô hay tinh chỉnh không thể giúp mô hình vượt qua giới hạn kiến thức đã được thiết lập từ giai đoạn tiền huấn luyện.

14/08

Thứ Sáu · 1 tin
WeChat: Ant Ling
Hướng dẫnĐiểm AI 62/100

Tinh chọnAnt Group và ASystem hiện thực hóa quy trình huấn luyện hậu kỳ cho Agentic RL trên một máy đơn lẻ

Ant Group và ASystem đã kết hợp Ling-3.0-tiny cùng thuật toán GSPO để tối ưu hóa quy trình huấn luyện hậu kỳ cho Agentic RL. Kết quả thử nghiệm trên cờ caro cho thấy hiệu suất mô hình cải thiện rõ rệt, ổn định khả năng gọi công cụ và rút ngắn độ dài phản hồi.


Vì sao đáng đọc: Đây là bước tiến kỹ thuật quan trọng trong việc tối ưu hóa huấn luyện Agent, giúp giảm rào cản hạ tầng cho các mô hình RL phức tạp.

13/08

Thứ Năm · 2 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

NeuPAT: Tối ưu hóa phân bổ độ dẻo thần kinh giúp mô hình đa phương thức giữ vững khả năng ngôn ngữ

NeuPAT là phương pháp mới giúp bảo vệ các neuron quan trọng trong LLM khi huấn luyện đa phương thức, ngăn chặn tình trạng suy giảm khả năng ngôn ngữ vốn có bằng cách phân bổ mức độ cập nhật linh hoạt cho từng neuron.

12/08

Thứ Tư · 1 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 69/100

Tấn công Trace Inversion: Sao chép khả năng suy luận của AI mà không cần lộ chuỗi tư duy

You don't necessarily need to see how a powerful AI thinks to copy some of its reasoning ability. …

DịchNghiên cứu mới giới thiệu kỹ thuật Trace Inversion, cho phép huấn luyện mô hình học sinh đạt khả năng suy luận tương đương mô hình gốc chỉ bằng câu hỏi và đáp án, ngay cả khi chuỗi tư duy (CoT) bị ẩn. Chi phí thực hiện cực thấp, đặt ra thách thức lớn về bảo mật mô hình.

Tổng 30 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (41 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Huấn luyện mô hình” — Trang 2 | AIHOT.vn