Quay lại Bài viết
10 tháng 5, 2026Cập nhật 10 tháng 7, 2026Góc nhìn5 phút đọc

Vì sao dữ liệu tư vấn khác dữ liệu hỏi-đáp?

Benchmark hỏi-đáp đo câu trả lời trong bối cảnh cố định. Một buổi tư vấn phải giữ trạng thái và nhận ra thông tin còn thiếu. Meddies Consultant tách hai bài toán này; chưa có kết quả ở cấp mô hình.

Meddies Research

Clinical AI research at Meddies

Vì sao dữ liệu tư vấn khác dữ liệu hỏi-đáp?

Hỏi-đáp y khoa không phải một dạng dữ liệu kém. Dạng dữ liệu này chỉ trả lời một câu hỏi khác.

Một mẫu hỏi-đáp cho mô hình câu hỏi, bối cảnh cần thiết và đáp án cần tạo ra. Một buổi hỏi bệnh lại yêu cầu mô hình theo dõi những gì người bệnh đã nói, nhận ra điều còn thiếu và chọn câu hỏi tiếp theo. Nếu dùng điểm hỏi-đáp để đại diện cho cả hai năng lực, chúng ta đang đo một việc rồi kết luận sang việc khác.

Các benchmark hỏi-đáp đang đo gì?

PubMedQA yêu cầu mô hình đọc tóm tắt nghiên cứu y sinh rồi trả lời có, không hoặc chưa rõ. MultiMedQA tập hợp nhiều benchmark hỏi-đáp y khoa, trong đó có câu hỏi trắc nghiệm theo dạng USMLE.

Những bài toán này hữu ích để kiểm tra khả năng dùng kiến thức hoặc đọc bằng chứng trong một ngữ cảnh cố định. Chúng không yêu cầu mô hình duy trì một cuộc trò chuyện nhiều lượt. Kết quả trên benchmark hỏi-đáp vì thế không tự cho biết chất lượng hỏi bệnh.

Meddies Consultant tách hai dạng dữ liệu huấn luyện ra sao?

Meddies Consultant đặt cả hai dạng bài toán trong cùng một bản phát hành. Hai cấu hình hội thoại gồm 109.005 mẫu tiếng Anh và 58.064 mẫu tiếng Việt. Mỗi mẫu có nhiều lượt, kèm bệnh mục tiêu và chân dung bệnh nhân.

RandomQA có 67.372 cặp hỏi-đáp hai lượt. RandomQuestion có 61.162 câu hỏi không kèm đáp án. Hai cấu hình này phù hợp với các thí nghiệm hẹp hơn về tạo câu trả lời, truy xuất hoặc xây tập prompt. Chúng không cần mang theo trạng thái của một buổi hỏi bệnh.

Hội thoại nhiều lượt tạo điều kiện để câu hỏi sau phụ thuộc vào câu trả lời trước. Khả năng đó không có nghĩa mô hình chắc chắn sẽ học được. Cấu trúc dữ liệu mới chỉ cho phép chúng ta kiểm tra hành vi này.

Hai khung phỏng vấn và các nhãn giai đoạn dùng để làm gì?

Thẻ dữ liệu công khai nêu các tiêu chí rà soát liên quan tới OPQRST và FIFE. Một số mẫu hiển thị công khai còn mô tả cách tạo hội thoại bằng bốn chức năng: khởi đầu hoặc mở đầu buổi hỏi bệnh, khai thác thông tin, tạo cấu trúc và kết thúc. Bản phát hành không gắn những nhãn này với một khung phỏng vấn cụ thể.

  • Các giai đoạn hội thoại đánh dấu việc khởi đầu hoặc mở đầu buổi hỏi bệnh, khai thác thông tin, tạo cấu trúc và kết thúc.
  • OPQRST giúp khai thác triệu chứng theo khởi phát, yếu tố làm nặng hoặc giảm, tính chất, vị trí hay hướng lan, mức độ và thời gian.
  • FIFE giữ lại góc nhìn của người bệnh qua cảm xúc, suy nghĩ, ảnh hưởng lên sinh hoạt và kỳ vọng.

Hai khung cùng các nhãn giai đoạn tạo ra một bản mô tả rõ hơn về cuộc hội thoại cần có. Tài liệu công khai chưa cung cấp kết quả chấm cho từng tiêu chí, danh sách người rà soát hay mức độ đồng thuận giữa họ. Vì thế, không thể suy ra rằng mọi mẫu đều bám đủ các yêu cầu này hoặc đã chính xác về lâm sàng.

Cần đo gì sau khi huấn luyện?

Muốn biết dữ liệu nhiều lượt có làm thay đổi hành vi của mô hình hay không, cần một so sánh có kiểm soát. Có thể giữ nguyên mô hình và quy trình huấn luyện, chỉ thay đổi dạng dữ liệu, rồi đánh giá chất lượng câu hỏi tiếp theo, khả năng nhớ đúng bối cảnh, lỗi kết luận khi thông tin chưa đủ và cách xử lý dấu hiệu khẩn cấp.

Người làm lâm sàng cũng phải xem hậu quả của lỗi. Một câu hỏi thừa và một câu hỏi bỏ sót dấu hiệu nguy hiểm không thể được tính như nhau.

Hiện tại, Meddies Consultant cho thấy dữ liệu tư vấn và dữ liệu hỏi-đáp có cấu trúc khác nhau. Bộ dữ liệu cung cấp nguyên liệu để thử xem khác biệt đó có tạo ra hành vi tốt hơn hay không. Bản phát hành chưa phải kết quả của phép thử.

Xem quy trình dự kiến

Xem lại quy trình dự kiến và một tình huống an toàn thuốc tổng hợp, với ranh giới bằng chứng được nêu rõ.

Đặt lịch demo