Nghiên cứu của Abra chỉ ra rằng mô hình khuếch tán có tính dự báo cao tương tự LLM, nhưng đòi hỏi lượng dữ liệu gấp 10 lần so với công thức Chinchilla để đạt hiệu suất tối ưu.
New Meta paper shows, small models may not be bad predictors of scale; they may just be getting unde…
DịchNghiên cứu của Meta chỉ ra rằng các mô hình nhỏ có thể đạt hiệu suất cao nếu được tinh chỉnh siêu tham số kỹ lưỡng. Các mô hình này bắt đầu tuân theo quy luật mở rộng từ quy mô 4 triệu tham số và cực kỳ nhạy cảm với cấu hình huấn luyện.