Quay lại Nghiên cứu
12 tháng 5, 2026Bộ dữ liệu8 phút đọc

Meddies Consultant: bộ dữ liệu tư vấn lâm sàng mã nguồn mở

AI y tế đạt điểm gần như tuyệt đối trên các bài thi y khoa, nhưng điểm thi không phản ánh chất lượng tư vấn thực tế. Meddies Consultant là bộ dữ liệu hội thoại lâm sàng tiếng Việt và tiếng Anh, được xây để mô hình học cách hỏi bệnh thay vì chỉ đưa ra kết luận.

Meddies Research

Clinical AI research at Meddies

Meddies Consultant: bộ dữ liệu tư vấn lâm sàng mã nguồn mở

Các mô hình AI ngày nay đạt điểm gần như tuyệt đối trên những bài thi y khoa. Trên MedQA, bộ câu hỏi theo chuẩn thi cấp chứng chỉ ở Mỹ, gần như mọi mô hình mới ra mắt đều vượt 95%, những cái tên dẫn đầu chạm khoảng 96%. Các bộ trắc nghiệm y khoa quen thuộc khác như MedMCQA hay PubMedQA cũng đang dần chạm trần theo cách tương tự.

Nhưng điểm cao trên các bài thi không nói lên chất lượng thực tế. Chính nhóm xây dựng HealthBench của OpenAI cũng nhận định các bộ đánh giá kiểu trắc nghiệm như vậy đã bão hòa, nên họ dựng một bộ đánh giá mới dựa trên hội thoại y tế thực tế do bác sĩ chấm. Trên bộ đánh giá đó, chính những mô hình hàng đầu lại chỉ đạt khoảng 60%. Những đánh giá về độ an toàn lâm sàng còn cho thấy lời khuyên do mô hình đưa ra đôi khi vẫn tiềm ẩn rủi ro gây hại. Khoảng cách giữa các con số cho thấy làm tốt một bài thi trắc nghiệm không giống với việc tiến hành một cuộc hỏi bệnh thật.

Khoảng cách đó không nằm ở kiến thức, mà ở cách mô hình được xây dựng. Phần lớn AI y tế hiện nay học từ dữ liệu hỏi-đáp dựa trên những ca lâm sàng mang tính học thuật, nơi mỗi mẫu chỉ gồm một mô tả bệnh và một kết luận tương ứng. Cách học đó tạo ra một mô hình đạt điểm cao trên các bài thi, nhưng chăm sóc thật không phải là đưa ra câu trả lời, mà là tiến hành một cuộc hỏi bệnh, nơi bác sĩ dựng nên bức tranh toàn cảnh về người bệnh trước khi đưa ra kết luận.

Một bác sĩ khi nghe người bệnh kể triệu chứng "đau ngực" sẽ không đưa ngay kết luận "nhồi máu cơ tim". Họ hỏi bệnh. Họ tư vấn. Họ tìm hiểu cơn đau bắt đầu khi nào, đau kiểu gì, có lan đi đâu không, và người bệnh đang lo sợ điều gì. Kết luận là bước cuối của một cuộc hỏi bệnh, không phải bước đầu.

Muốn xây những trợ lý ghi chép hay phân loại bệnh thật sự dùng được bên cạnh bác sĩ, chúng tôi cần hướng dẫn mô hình cách hỏi bệnh, chứ không phải cách đưa ra kết luận. Bộ dữ liệu Meddies Consultant là bước đầu cho việc đó: một bộ dữ liệu tổng hợp gồm các cuộc hỏi bệnh lâm sàng tiếng Việt và tiếng Anh, được xây để mô hình học cách tư vấn thay vì đưa ra kết luận lâm sàng.

Xây dựng AI làm bộ não thứ hai cho bác sĩ.

Với chúng tôi, một AI biết cách hỏi và đặt đúng những câu hỏi quan trọng để tìm ra điểm mù còn giá trị hơn một AI vội đưa ra kết luận. Quyền kết luận vẫn thuộc về bác sĩ. AI đóng vai một bộ não thứ hai, giúp bác sĩ nhìn ra những khả năng chưa nghĩ tới, những chẩn đoán ít gặp nhưng vẫn có thể xảy ra và thường bị bỏ sót.

Hai vấn đề lớn: quyền riêng tư và ngôn ngữ

Vấn đề thứ nhất là quyền riêng tư. Cách trực tiếp nhất để dạy mô hình hỏi bệnh là cho nó học từ bản ghi hội thoại giữa bác sĩ và người bệnh thật. Nhưng những bản ghi đó gắn liền với thông tin định danh của người bệnh, và trong y tế, loại dữ liệu này gần như không thể chia sẻ công khai. Cả ngành y tế đang gặp một điểm nghẽn: mô hình ngày càng giỏi suy luận, nhưng gần như không có dữ liệu hội thoại thật giữa bác sĩ và người bệnh để học cách trò chuyện trong môi trường lâm sàng.

Vấn đề thứ hai là ngôn ngữ. Phần lớn dữ liệu y tế chất lượng cao đều bằng tiếng Anh, nên cách quen thuộc để có dữ liệu cho một ngôn ngữ khác là dùng dịch máy để dịch lại một bộ dữ liệu phương Tây. Nhưng với y khoa, đây là một lối tắt nhiều rủi ro. Cách một người bệnh mô tả cơn đau là dữ kiện lâm sàng, không phải lớp vỏ ngôn từ.

Tiếng Việt có rất nhiều cách diễn tả sắc thái của cùng một triệu chứng. Đau nhức là cái đau âm ỉ, sâu. Đau buốt là cái đau nhói, sắc, chợt đến chợt đi. Đau thắt là cái đau co rút, bóp nghẹt, là từ khiến bác sĩ phải nghĩ tới lồng ngực và dừng lại chú ý. Nếu dịch cả ba thành "aching, sharp, tight", không chỉ sắc thái biến mất mà ranh giới để phân loại bệnh cũng biến mất theo.

Đây là lý do chính chúng tôi tự xây dựng quy trình tạo sinh dữ liệu. Nhờ vậy, chúng tôi kiểm soát được toàn bộ quá trình, từ bối cảnh người bệnh đến cách cuộc hỏi bệnh diễn ra. Quan trọng hơn, chúng tôi có thể bắt đầu từ một thực tế khác: người bệnh Việt Nam đến từ nhiều hoàn cảnh, có người là nông dân, có người là nhân viên văn phòng, mỗi người giải thích triệu chứng theo một cách riêng, dùng những từ ngữ thường ngày mang màu sắc vùng miền của mình.

Cách chúng tôi tạo ra bộ dữ liệu

Thách thức của việc tạo dữ liệu hỏi bệnh không nằm ở số lượng. Một câu lệnh đơn giản đưa cho một mô hình ngôn ngữ có thể tạo sinh rất nhiều hội thoại, nhưng chúng dễ rơi vào một vài khuôn quen thuộc: cùng kiểu mở đầu, cùng độ dài, cùng một dạng người bệnh ngoan ngoãn dễ hỏi. Karpathy đã chỉ ra rủi ro này của dữ liệu tổng hợp được tạo sinh bằng LLM: từng mẫu riêng lẻ trông hợp lý, nhưng cả tập dữ liệu co cụm quanh vài khuôn câu và vài tình huống quen thuộc. Tập dữ liệu nhìn thì lớn, nhưng độ đa dạng thật gần như không tăng, và mô hình dễ học theo vài khuôn mẫu lặp lại thay vì học được độ rộng của thực hành lâm sàng.

Vì vậy, thay vì chỉ viết câu lệnh, chúng tôi ràng buộc cả đầu vào lẫn quá trình tạo sinh, để mỗi cuộc hỏi bệnh buộc phải khác nhau và buộc phải giống một buổi khám thật. Có ba ràng buộc chính.

Chân dung nhân vật. Dùng chân dung nhân vật là một cách đã được chứng minh để đưa độ đa dạng vào dữ liệu sinh: PersonaHub cho thấy một tập chân dung đủ lớn có thể tạo ra dữ liệu tổng hợp đa dạng ở quy mô lớn. Nhưng những tập chân dung công khai tốt nhất, như Nemotron-Personas-USA, được xây quanh người Mỹ, bằng tiếng Anh, và mô tả đời sống chung chung. Những tập đó mang lại sự đa dạng về con người, nhưng không có bối cảnh lâm sàng. Một bộ dữ liệu hỏi bệnh cần nhiều hơn sự đa dạng về nhân khẩu, nó cần sự đa dạng về tình huống lâm sàng. Vì vậy chúng tôi ghép mỗi chân dung với một bệnh lấy từ danh mục 1.236 bệnh và một trạng thái nội tâm do FIFE quy định, để mỗi người bệnh vừa khác nhau như người thật, vừa mang một bối cảnh lâm sàng cụ thể. Cùng hướng đi này, chúng tôi cũng phát triển một bộ chân dung người Việt riêng, Meddies Persona.

Ba khung lâm sàng chuẩn. Quá trình tạo sinh dữ liệu được ràng buộc theo ba khung trong giao tiếp y khoa:

  • Calgary-Cambridge định hình trình tự của buổi khám: mở đầu phiên, khai thác thông tin, tạo dựng quan hệ, và kết thúc.
  • OPQRST buộc bác sĩ AI khai thác triệu chứng có hệ thống: khởi phát, yếu tố tác động, tính chất, vị trí và hướng lan, mức độ, và diễn tiến theo thời gian.
  • FIFE mô tả trạng thái nội tâm của người bệnh: cảm xúc, suy nghĩ, ảnh hưởng lên sinh hoạt, và kỳ vọng.

OPQRST giữ cho bác sĩ AI luôn chặt chẽ, còn FIFE giữ cho người bệnh luôn lộn xộn một cách rất người: biết lo, kể lan man, đôi khi cần được dẫn lại đúng hướng.

Một đặc điểm của bộ dữ liệu là mỗi lượt của bác sĩ AI đi kèm một đoạn suy luận, tự đặt tên giai đoạn Calgary-Cambridge đang diễn ra, bám theo OPQRST, và cập nhật FIFE sau mỗi câu trả lời của người bệnh. Đoạn suy luận này cho thấy cuộc hỏi bệnh được dẫn dắt bởi một cấu trúc lâm sàng, chứ không phải sinh ra tự do rồi gắn nhãn cho đẹp. Có thể thấy rõ điều này trong ví dụ ở phần sau.

Chân dung + bệnh
tạo sinh
Hội thoại thô
kiểm tra tự động
rà soát lâm sàng
Cuộc hỏi bệnh đạt
đạt
Meddies Consultant

Các tiêu chí đánh giá một cuộc hỏi bệnh

Sau khi tạo sinh, mỗi mẫu đi qua hai lớp kiểm soát để loại bỏ những cuộc hỏi bệnh chưa đạt.

Lớp thứ nhất là kiểm tra tự động: rà cấu trúc và định dạng của mẫu, bắt các bất thường khi phân tích cú pháp, và lọc trùng lặp ở cả mức từng tệp lẫn toàn bộ dữ liệu, để cùng một cuộc hỏi bệnh không bị đếm hai lần.

Lớp thứ hai là rà soát theo tiêu chí lâm sàng. Một cuộc hỏi bệnh đạt không chỉ là một đoạn văn trôi chảy, nên chúng tôi chấm mỗi mẫu trên nhiều tiêu chí:

Tiêu chíVì sao tiêu chí này quan trọng
Tính đầy đủCuộc hỏi bệnh có khai thác đủ thông tin lâm sàng cần thiết, hay dừng lại quá sớm.
Tính phù hợpLời tư vấn có hợp lý về mặt y khoa, không đưa ra điều sai hoặc nguy hiểm.
Tính tự nhiênNgười bệnh nghe có giống người thật không, hay giống một mẫu câu lặp lại.
Sự đồng cảmBác sĩ AI có ghi nhận nỗi lo của người bệnh, không chỉ xử lý triệu chứng.
Chất lượng OPQRSTTriệu chứng có được khai thác theo một trình tự rõ ràng.
Bám sát FIFETrạng thái nội tâm của người bệnh có được theo dõi suốt cuộc trò chuyện.
Mạch lạc cấu trúcCuộc hỏi bệnh có đi đúng các giai đoạn của một buổi khám.
An toànBác sĩ AI có biết giới hạn của mình, không đưa kết luận thay cho bác sĩ thật.

Điểm khác biệt giữa trả lời và tư vấn

Dưới đây là hai mẫu từ hai bộ dữ liệu. Bên trái là một mẫu thật từ ChatDoctor-HealthCareMagic-100k, một bộ dữ liệu hội thoại bác sĩ với người bệnh thu từ nền tảng tư vấn trực tuyến: người bệnh mô tả, bác sĩ trả lời, gọn trong một lượt. Bên phải là một mẫu của Meddies Consultant: một bé 12 tuổi với hạch sưng ở cổ, sốt nhẹ về chiều và sút cân nhẹ, được hỏi bệnh qua nhiều lượt theo khung lâm sàng.

ChatDoctor · HealthCareMagicthật · một lượt
I have a 5-month-old baby who is very congested with a terrible cough — rattly, raspy, croupy sounding. She started choking on her coughs and the mucus. She also has a fever and a runny nose. Should I take her to urgent care?
I would suggest you see your doctor. Your baby may have bronchiolitis, a lung infection common at this age and usually caused by a virus. Albuterol via nebulization should help relieve the wheezing and congestion, and a decongestant can be used for the cold. I would also advise a chest X-ray to rule out other diseases such as pneumonia.

Dữ liệu thật, nhưng mỗi mẫu chỉ là một lượt: một câu hỏi, một câu trả lời.

Meddies Consultanttổng hợp · nhiều lượt

Giai đoạn 1 · Mở đầu

Chào em, tôi là Meddies, trợ lý AI chuyên tư vấn sức khỏe. Hôm nay em cần tư vấn về vấn đề gì vậy? Ngoài vấn đề này, em còn lo lắng điều gì khác không?
Em chào bác sĩ ạ. Dạo gần đây em thấy có mấy hạch sưng ở cổ, chỗ dưới hàm và sau gáy. Em cũng hay sốt nhẹ về chiều, người thì mệt mỏi, hay ra mồ hôi trộm lắm. Em lo không biết có phải bị làm sao không ạ?

Giai đoạn 2 · Khai thác · FIFE: lo lắng

Cảm ơn em đã chia sẻ. Tôi hiểu em đang rất lo lắng. Để tư vấn tốt hơn, tôi cần biết thêm: hạch xuất hiện từ bao giờ và có thay đổi gì không, ví dụ to hơn, đau, hay đỏ da? Ngoài sốt và mệt, em có bị ho, đau họng, khó nuốt, hay nổi hạch ở chỗ khác không? Gần đây em có tiếp xúc với người bị bệnh không?
Hạch em để ý khoảng 2-3 tuần nay, lúc đầu vài cục nhỏ, giờ có vẻ to hơn một chút. May là không đau lắm, da cũng không đỏ. Em có ho khan, thỉnh thoảng đau họng nhẹ. Gần đây em có tiếp xúc với bạn bị cảm cúm.

Giai đoạn 2 · Khai thác

Cảm ơn em. Tôi cần hỏi thêm: em có bị sút cân không, ví dụ thấy người gầy đi hay quần áo rộng ra? Và trước khi nổi hạch, em có bị bệnh gì như viêm họng, hay tiêm phòng gì gần đây không?
Em không để ý cân nặng, nhưng thấy người gầy đi một chút, nhất là hai má. Em không phát ban hay ngứa, chỉ thỉnh thoảng đau nhức người. Trước đó khoảng một tháng em có bị viêm họng vài ngày rồi tự khỏi, và tháng trước có tiêm phòng cúm ở trường.

Giai đoạn 3 · Cung cấp cấu trúc · An toàn

Hạch là những "trạm kiểm soát" giúp cơ thể chống nhiễm trùng, nên có thể sưng khi cơ thể đang viêm. Dựa trên mô tả của em, đây có thể là một tình trạng viêm đường hô hấp trên. Tuy nhiên, vì hạch đã sưng hơn hai tuần và em có vẻ gầy đi, tôi không thể chẩn đoán chính xác qua màn hình. Em nên đi khám trong 1-2 ngày tới để bác sĩ kiểm tra, có thể làm xét nghiệm máu hoặc siêu âm hạch.

Dấu hiệu cần đến viện ngay

Em cần đến bệnh viện ngay nếu có: sốt cao trên 39°C, khó thở, hạch đỏ và đau nhiều hoặc vỡ ra, đau đầu dữ dội, hoặc xuất huyết dưới da.

Dữ liệu tổng hợp, nhưng mỗi mẫu là một cuộc hỏi bệnh nhiều lượt theo khung lâm sàng. Bệnh đích của mẫu này: lao hạch.

Khác biệt không nằm ở chỗ tốt hơn hay kém hơn, mà ở mục đích. Mẫu bên trái dạy mô hình đưa ra một câu trả lời hợp lý cho một lời than phiền. Mẫu bên phải dạy mô hình tiến hành một cuộc hỏi bệnh: cập nhật trạng thái lo lắng của người bệnh theo FIFE, khai thác triệu chứng có hệ thống, và quan trọng nhất là biết dừng lại đúng chỗ. Vì hạch đã sưng hơn hai tuần và người bệnh có vẻ sút cân, mô hình không cố chẩn đoán qua màn hình mà hướng người bệnh đi khám trực tiếp, kèm những dấu hiệu cần đến bệnh viện ngay.

Bệnh đích của mẫu bên phải là lao hạch, một chẩn đoán nghiêm trọng cần được loại trừ. Một mô hình vội trả lời "viêm họng" có thể bỏ sót; một mô hình biết hỏi sẽ nhận ra những dấu hiệu cảnh báo cần đi khám sâu hơn.

Bộ dữ liệu gồm những gì

Meddies Consultant được chia thành bốn tập con, mỗi tập phục vụ một mục đích huấn luyện khác nhau.

Tập conSố dòngLượt người bệnhLượt bác sĩ
English109.005826.308930.683
Vietnamese58.064329.728386.082
RandomQA67.37267.37267.372
RandomQuestion61.16261.1620

Hai tập English và Vietnamese là phần lõi, gồm những cuộc hỏi bệnh nhiều lượt. Tỷ lệ giữa số lượt và số dòng cho thấy mỗi mẫu là một cuộc trao đổi qua nhiều lượt, không phải một cặp hỏi đáp đơn lẻ.

RandomQA giữ vai trò giám sát kiến thức theo kiểu hỏi-đáp thông thường. Còn RandomQuestion là một tập đặc biệt: ở đây không có lượt trả lời nào của bác sĩ. Tập này được xây riêng để dạy mô hình lắng nghe chủ động và tự quyết định nên hỏi gì tiếp theo, thay vì vội đưa ra câu trả lời.

Phạm vi của bản phát hành

Meddies Consultant là dữ liệu tổng hợp, và cần được dùng như dữ liệu tổng hợp. Nó tốt cho việc dạy mô hình cách lắng nghe, cách khai thác thông tin và cách giữ một cuộc trò chuyện. Nó không phải là chuẩn mực thay cho phán đoán của bác sĩ.

Vì được tạo sinh ở quy mô lớn, dữ liệu vẫn còn lỗi. Chúng tôi công bố toàn bộ dữ liệu với mong muốn nhận được sự đóng góp từ cộng đồng để cùng hoàn thiện.

Bản phát hành này cũng chưa công bố toàn bộ quy trình tạo sinh và quy trình rà soát. Hãy xem đây là dữ liệu huấn luyện có tài liệu mô tả, chưa phải một bộ benchmark hoàn chỉnh. Khi áp dụng vào một bối cảnh lâm sàng cụ thể, nên kiểm định lại trên dữ liệu của chính bối cảnh đó trước khi tin vào một mô hình học từ bộ dữ liệu này.

Bộ dữ liệu này dùng vào việc gì

Cách dùng trực tiếp nhất là làm dữ liệu tinh chỉnh có giám sát (SFT) để dạy một mô hình nền cách hỏi bệnh. Ngoài ra, dữ liệu còn dùng được cho hai việc khác. Một là kiểm thử đối kháng (red-teaming): cho một chatbot y tế sẵn có đối mặt với những người bệnh tổng hợp hay lo lắng, kể lan man theo FIFE, để xem nó xử lý một ca khó ra sao. Hai là huấn luyện các mô hình ghi chép tự động, vì đầu ra đã có cấu trúc sẵn nên hợp để dạy mô hình viết bản tóm tắt lâm sàng đáng tin.

Meddies Consultant là bước đầu của một hạ tầng dữ liệu lâm sàng mà chúng tôi sẽ tiếp tục xây dựng. Nếu mô hình có thể đảm đương phần ghi chép và khai thác thông tin một cách đáng tin, bác sĩ sẽ bớt thời gian nhìn vào màn hình và có thêm thời gian nhìn vào người bệnh trước mặt.

Một bộ dữ liệu lâm sàng chỉ trưởng thành khi được nhiều người dùng thật kiểm chứng. Chúng tôi mong cộng đồng tải Meddies Consultant về, đưa vào bài toán của riêng mình, và chỉ cho chúng tôi những chỗ còn thiếu sót. Đó là cách chúng ta cùng xây một nền dữ liệu lâm sàng đáng tin cho y tế Việt Nam.

Dữ liệu

meddies-consultant
Vietnamese dialogues
58,064
English dialogues
109,005
Condition taxonomy
1,236
Configs
4
Mở trên Hugging Face

Xem quy trình dự kiến

Xem lại quy trình dự kiến và một tình huống an toàn thuốc tổng hợp, với ranh giới bằng chứng được nêu rõ.

Đặt lịch demo