Nghiên cứu khám phá cách Sparse AutoEncoders (SAE) biểu diễn cấu trúc ngôn ngữ thông qua từ loại. Kết quả cho thấy các danh mục từ loại được hình thành từ các nhóm latent ổn định, không phụ thuộc vào bộ nhớ từ vựng đơn thuần.
Viện Hàn lâm Khoa học Áo phối hợp cùng Mistral và Sail Reply phát triển mô hình ngôn ngữ Apollo, được huấn luyện trên 600 triệu từ cổ ngữ để hỗ trợ phục dựng các bản thảo, giấy cói và bia đá Hy Lạp cổ.
Việc chọn 'a' hay 'an' dựa trên phát âm thay vì chữ cái đầu. Tác giả đã phân tích hơn 32.000 từ và chứng minh rằng chỉ một số ít trường hợp ngoại lệ cần xử lý đặc biệt, đồng thời xây dựng mô hình trực quan hóa để xác định quy tắc này.
Dữ liệu từ Arena.ai cho thấy Claude Fable 5.1 đã cắt giảm các từ đệm và thói quen diễn đạt cũ, chuyển sang phong cách viết gãy gọn hơn với tần suất sử dụng dấu câu được tinh chỉnh đáng kể so với bản tiền nhiệm.
Nghiên cứu mới chỉ ra ChatGPT có thể phân tích các quy luật ngôn ngữ để dự đoán mô hình tính cách con người, mở ra tiềm năng mới trong việc ứng dụng AI vào tâm lý học.