‹ Quay lạiTinh chọnĐiểm AI 60/100
Epoch AI: Nghiên cứu, dữ liệu và đánh giá
Tinh chọnĐiểm AI 60/100

Nghiên cứu

Đánh giá HealthBench Professional: Epoch AI chỉ ra 50% tác vụ kiểm thử bị lỗi

(giờ Việt Nam)

Tóm tắt AI

Epoch AI đã thực hiện kiểm định độc lập trên bộ tiêu chuẩn HealthBench Professional của OpenAI và phát hiện một nửa trong số 50 tác vụ được lấy mẫu ngẫu nhiên gặp vấn đề nghiêm trọng về chất lượng.

Chính văn · Bản dịch AI

HealthBench Professional – Benchmark Review

HealthBench Professional là một bộ tiêu chuẩn đánh giá được xây dựng dựa trên HealthBench của OpenAI. Mục tiêu của nó là đánh giá xem các LLM có đưa ra câu trả lời hữu ích và chính xác cho các tác vụ thực tế liên quan đến chăm sóc sức khỏe mà các bác sĩ lâm sàng đã đặt ra cho ChatGPT trong quá trình làm việc hay không. Chúng tôi đã lấy mẫu ngẫu nhiên 50 tác vụ, phân tầng theo nguồn dữ liệu, và phát hiện 25 tác vụ (50% mẫu) có lỗi rõ ràng. Trong số đó, ít nhất 14 tác vụ (28% mẫu) là lỗi cấu trúc: các vấn đề của chúng không liên quan đến độ chính xác về y tế. 11 tác vụ còn lại có những vấn đề có thể xác định rõ ràng chỉ với kiến thức chuyên môn tối thiểu. 4 tác vụ (8% mẫu) là không thể trả lời theo cách đặt câu hỏi hoặc đặt vấn đề sai, 17 tác vụ (34% mẫu) chứa kết quả âm tính giả, 8 tác vụ (16% mẫu) chứa kết quả dương tính giả và 6 tác vụ (12% mẫu) không đo lường đúng năng lực được tuyên bố. Một đánh giá toàn diện bởi các chuyên gia y tế sẽ có phạm vi rộng hơn và có khả năng phát hiện thêm nhiều vấn đề khác, nhưng với tỷ lệ lỗi cao trong mẫu ngẫu nhiên của chúng tôi, chúng tôi tin rằng tỷ lệ thực tế là ít nhất 20%, dẫn đến kết luận là "Có khiếm khuyết" (Flawed).

Phương pháp luận

Chúng tôi đã lấy mẫu ngẫu nhiên 50 tác vụ từ tổng số 525 tác vụ, được phân tầng theo ba danh mục, tất cả đều được đại diện theo tỷ lệ: 24 trên 256 (9,4%) cho Good Faith Typical, 18 trên 191 (9,4%) cho Red Teaming Difficult, và 8 trên 78 (10,3%) cho Good Faith Difficult. Sau đó, chúng tôi yêu cầu Claude Fable 5.1 và GPT-6 Astra gắn cờ bất kỳ vấn đề nào sau đây, theo định nghĩa trong bảng tiêu chí của chúng tôi: Đặt vấn đề sai hoặc Không thể giải quyết; Âm tính giả; Dương tính giả; Đo lường sai năng lực.

Cuối cùng, chúng tôi đã rà soát thủ công tất cả các lỗi. Một số ít trường hợp đòi hỏi kiến thức y khoa tối thiểu để xác minh, chẳng hạn như tác vụ a5778c7ecdb4eeccf9d252631e18a274, vốn yêu cầu phải biết các tiêu chuẩn chấm điểm xét nghiệm phổ quát.

Điểm số HealthBench Professional được xây dựng qua ba giai đoạn.

Các lỗi tiêu biểu

Các câu hỏi không thể giải quyết có thể do đặt vấn đề sai, chẳng hạn như yêu cầu diễn giải một xét nghiệm mà không cung cấp các chi tiết như phiên bản xét nghiệm hoặc tiêu chuẩn độ tuổi, hoặc yêu cầu mô hình cung cấp công thức thành phần của một sản phẩm độc quyền.

Âm tính giả bao gồm việc không được tính điểm khi yêu cầu thông tin còn thiếu, bị trừ điểm khi thách thức các quan điểm mơ hồ của một bác sĩ như thể đó là sự thật, và bị trừ điểm đối với nội dung được hỗ trợ bởi thông tin đã được thiết lập trong các lượt trao đổi trước đó của tác vụ.

Dương tính giả có thể bao gồm các tác vụ kiểm tra hình thức thay vì nội dung: chúng tôi đã tìm thấy các trường hợp mà bất kỳ trích dẫn nào cũng được chấp nhận (kể cả những trích dẫn bịa đặt), và việc từ chối viết các tài liệu được yêu cầu lại nhận được điểm số 100%.

Đo lường sai năng lực bao gồm các tác vụ mà bảng tiêu chí chấm điểm các dữ kiện lân cận trong khi bỏ qua câu hỏi thực tế. Ví dụ bao gồm các tác vụ liên quan đến dịch thuật hoặc bị trừ điểm do các xu hướng định dạng.

Một vài lựa chọn về cấu trúc có thể khiến bộ tiêu chuẩn này dễ mắc lỗi liên quan đến nội dung hơn, điều mà chúng tôi chưa đánh giá một cách toàn diện:

Các lỗi

Để ngăn chặn sự nhiễm dữ liệu, các tác giả của bộ tiêu chuẩn yêu cầu không xuất bản các ví dụ từ tập dữ liệu dưới dạng văn bản thuần hoặc hình ảnh trực tuyến. Chúng tôi tôn trọng yêu cầu của họ bằng cách cung cấp các ví dụ về các loại lỗi thực tế trong phần Các lỗi tiêu biểu và các Ghi chú tóm tắt bởi LLM tại đây.

Các loại lỗi: 1) Không thể giải quyết, 2) Âm tính giả, 3) Dương tính giả, 4) Đo lường sai năng lực.

Các tác vụ khác

Dưới đây là danh sách 25 ID tác vụ không bị gắn cờ. Những tác vụ này vẫn có thể tồn tại các lỗi mà một chuyên gia y tế có thể phát hiện, nhưng chúng đã vượt qua quá trình phân tích của chúng tôi.

1. Khả năng rà soát

* Công khai hoặc riêng tư cho người đánh giá.

2. Chấm điểm

Đây là tiêu chuẩn tối thiểu cần thiết để được Xác minh (Verified); việc không đạt bất kỳ mục nào trong số này sẽ dẫn đến kết luận là "Có khiếm khuyết" (Flawed).

Đạt Gắn cờ [dừng → Có khiếm khuyết] Chưa rà soát

Đạt Gắn cờ [dừng → Có khiếm khuyết] Chưa rà soát

Việc gợi mở mô hình (model elicitation) cực kỳ hạn chế và không phải là trọng tâm của bộ tiêu chuẩn:

Đạt Gắn cờ [dừng → Có khiếm khuyết] Chưa rà soát

Đạt Gắn cờ [dừng → Có khiếm khuyết] Chưa rà soát

† Đối với các bộ tiêu chuẩn có >50 tác vụ khả dụng, chúng tôi sẽ lấy mẫu ngẫu nhiên 50 tác vụ (phân tầng theo danh mục, nếu có). Nếu tỷ lệ lỗi quan sát được là 15–25%, chúng tôi sẽ mở rộng mẫu lên 100. Đối với các bộ tiêu chuẩn có ≤50 tác vụ khả dụng, tất cả các tác vụ khả dụng sẽ được đánh giá.

3. Chất lượng đánh giá

Đây là tiêu chuẩn mà chúng tôi mong muốn tất cả các bộ tiêu chuẩn đều đạt được, nhưng việc bỏ qua hoặc không đạt các mục này không nhất thiết dẫn đến việc bị loại.

Hạn chế đầy đủ Hạn chế không hợp lý Không xác định Chưa rà soát

Khung chung được chia sẻ Kết hợp giữa khung dành riêng cho mô hình và khung chung Khung dành riêng cho mô hình Chưa rà soát

Chưa rà soát

Tất cả các tác vụ Tập hợp tác vụ tiêu biểu Triển khai kém (Tập hợp tác vụ không tiêu biểu, tập hợp người tham gia không hợp lý) Chưa thiết lập Chưa rà soát

— sàn, — trần Chưa rà soát

— lượt chạy/mô hình Không xác định Chưa rà soát

Đo lường các năng lực đã nêu Đo lường một phần các năng lực đã nêu Không đo lường các năng lực đã nêu Chưa rà soát

Tuyên bố miễn trừ trách nhiệm

Đây là một đánh giá một phần. Chúng tôi đã ngừng kiểm tra ngay khi phát hiện các lỗi vượt quá ngưỡng công bố của chúng tôi cho một bộ tiêu chuẩn bị khiếm khuyết.

Chúng tôi đã kiểm tra 50 tác vụ, được lấy mẫu ngẫu nhiên, phân tầng theo danh mục. Các tác vụ chưa được kiểm tra có thể chứa thêm các lỗi khác.

Bài gốc còn tiếp — xem tiếp tại bài gốc ↗

Bài viết được AI dịch và tổng hợp tự động từ Epoch AI: Nghiên cứu, dữ liệu và đánh giá. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.

Đánh giá HealthBench Professional: Epoch AI chỉ ra 50% tác vụ kiểm thử bị lỗi | AIHOT.vn