# MobilePA-Bench: Bộ tiêu chuẩn đánh giá tác nhân AI trên thiết bị di động với các tác vụ thực tế phức tạp

- Nguồn: HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
- Thời gian phát hành: 2026-08-24 07:00 (giờ Việt Nam)
- Điểm AI: 52/100
- Link AIHOT.vn: https://aihot.vn/items/71c2b34b2817d11b
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmt89ixa72xy8ro73wqugms3o
- Link gốc: https://arxiv.org/abs/2608.23035

## Tóm tắt AI

MobilePA-Bench là bộ tiêu chuẩn tương tác mới giúp đánh giá khả năng lập kế hoạch và sử dụng công cụ của các tác nhân AI trên di động thông qua 212 công cụ thực tế. Kết quả cho thấy các mô hình ngôn ngữ lớn hiện nay vẫn gặp khó khăn khi xử lý các ràng buộc phức tạp và lỗi vận hành.

## Thân bài

Tác giả: Yi Zhu, Xiongwei Wu, Qiyi Wang, Tingyu Qu, Jiajun Liu, Sihan Cao, Long Chen, Weigao Sun, Feida Zhu, Yiran Zhong, Steven Hoi

Xem PDF HTML (thử nghiệm)

DOI do arXiv cấp thông qua DataCite (đang chờ đăng ký)

### Lịch sử gửi bài

Từ: Xiongwei Wu [xem email] [v1] Thứ Hai, 24 tháng 8 năm 2026 09:38:24 UTC (9.032 KB)
