Quay lại Bài viết
6 tháng 5, 2026Cập nhật 10 tháng 7, 2026Góc nhìn6 phút đọc

Bản địa hóa dữ liệu lâm sàng tiếng Việt còn thiếu gì?

Văn bản tiếng Việt chỉ là một phần của bản địa hóa dữ liệu lâm sàng. Ngôn ngữ, bối cảnh người bệnh và cách thiết kế bộ dữ liệu đều cần bằng chứng riêng; các bản phát hành hiện tại chưa hoàn chỉnh cả ba.

Meddies Research

Clinical AI research at Meddies

Bản địa hóa dữ liệu lâm sàng tiếng Việt còn thiếu gì?

Đưa một bộ dữ liệu tiếng Anh qua dịch máy sẽ tạo ra văn bản tiếng Việt. Nhưng những giả định về người bệnh, bối cảnh lâm sàng, dạng bài toán và tiêu chí rà soát bên trong bộ dữ liệu có thể vẫn giữ nguyên. Tạo sinh trực tiếp bằng tiếng Việt tránh được bước dịch ấy, nhưng cũng chưa đủ để gọi cả bộ dữ liệu là đã được bản địa hóa.

Bản cũ của bài này đã gộp những việc đó làm một. Chúng tôi dùng vài từ chỉ cơn đau để khẳng định dịch máy làm mất ranh giới chẩn đoán, rồi khái quát cách người bệnh Việt Nam kể bệnh. Chúng tôi không có bằng chứng đủ mạnh cho những kết luận đó, nên đã bỏ chúng.

Chúng tôi có thể kiểm tra những phần này ngay trong quy trình tạo dữ liệu. Bản địa hóa dữ liệu lâm sàng gồm ít nhất ba việc riêng, tương ứng với cách tạo văn bản tiếng Việt, cách xây dựng bối cảnh lâm sàng và hành vi mà bộ dữ liệu sẽ dạy cho mô hình.

Văn bản tiếng Việt được tạo ra thế nào

Dịch máy không mặc nhiên làm hỏng dữ liệu. Trong nghiên cứu MedEV năm 2024, các tác giả xây dựng khoảng 360.000 cặp câu y khoa Việt-Anh rồi so sánh nhiều hệ thống dịch. Kết quả tốt nhất đến từ một mô hình được tinh chỉnh riêng cho từng chiều dịch. Nghiên cứu này không so sánh dữ liệu được dịch với dữ liệu được tạo sinh trực tiếp. Nó chỉ ra rằng muốn đánh giá bản dịch y khoa thì phải thử trên đúng chuyên ngành và cặp ngôn ngữ.

Tạo sinh trực tiếp bằng tiếng Việt loại bỏ một bước chuyển đổi. Chúng tôi có thể xác nhận khác biệt đó từ quy trình. Nó chưa chứng minh rằng văn bản tự nhiên hơn, chính xác hơn về lâm sàng hay giữ được nhiều thông tin hơn. Muốn đưa ra những kết luận đó, cần so sánh các mẫu tương ứng và để người làm lâm sàng thông thạo cả tiếng Việt lẫn tiếng Anh rà soát độc lập.

Bối cảnh lâm sàng đến từ đâu

Một đoạn hội thoại có thể được viết hoàn toàn bằng tiếng Việt mà bối cảnh người bệnh vẫn đến từ nơi khác. Chính bản phát hành hiện tại của Meddies Consultant cho thấy ranh giới này. Tập con vietnamese có 58.064 cuộc tư vấn nhiều lượt bằng tiếng Việt. Tuy vậy, trường patient_persona trong một số mẫu đang hiển thị công khai vẫn viết bằng tiếng Anh và chứa tên riêng, địa danh hoặc sinh hoạt gắn với Hoa Kỳ.

Vì vậy, sẽ không chính xác nếu gọi toàn bộ quy trình hiện tại là thuần Việt từ đầu. Phần hội thoại là tiếng Việt, còn một phần bối cảnh đầu vào vẫn chưa được bản địa hóa. Meddies Persona được xây dựng như một bộ dữ liệu riêng cho khâu chuẩn bị bối cảnh người bệnh, với 150.000 chân dung bệnh nhân tổng hợp. Thẻ dữ liệu công khai cũng nêu rõ đây không phải mẫu đại diện cho dân số hay dịch tễ Việt Nam. Các tài liệu công khai hiện nay chưa cho thấy mọi dòng của Meddies Consultant đều dùng Meddies Persona làm đầu vào.

Bản địa hóa dữ liệu lâm sàng vì thế cần được kiểm tra riêng. Đội ngũ xây dựng phải nói rõ nguồn y khoa nào được dùng, bối cảnh người bệnh được tạo như thế nào, những giả định nào lấy từ thực tế của hệ thống y tế địa phương, và ai đã rà soát chúng. Chỉ nhìn vào phần văn bản tiếng Việt ở đầu ra không trả lời được những câu hỏi đó.

Bộ dữ liệu đang dạy mô hình điều gì

Dịch một cặp hỏi-đáp đơn sang tiếng Việt không biến nó thành một cuộc hỏi bệnh qua nhiều lượt. Dạng dữ liệu vẫn giữ nguyên. Meddies QA cung cấp các cặp hỏi-đáp hai lượt và một ngân hàng chỉ có câu hỏi. Meddies Consultant lại tổ chức hội thoại qua nhiều lượt, kèm một bệnh mục tiêu và chân dung bệnh nhân. Hai bộ dữ liệu dạy hai dạng hành vi khác nhau, dù cả hai đều có tiếng Việt.

Phần thứ ba là cách bộ dữ liệu được thiết kế. Cần xác định mô hình sẽ học trả lời, hỏi tiếp, tóm tắt hay phân loại. Cũng cần nói rõ dữ liệu có bao nhiêu lượt, tiêu chí nào dùng để loại mẫu, và lỗi nào vẫn còn sau khi rà soát. Ngôn ngữ không thay thế được những quyết định thiết kế đó.

Phần chúng tôi vẫn cần chứng minh

Muốn khẳng định tạo sinh trực tiếp bằng tiếng Việt giữ được nhiều tín hiệu lâm sàng hơn dịch máy, chúng tôi cần một thử nghiệm ghép cặp. Cùng một nội dung lâm sàng sẽ được tạo theo hai cách. Người rà soát sẽ không biết mẫu nào đến từ quy trình nào khi chấm độ chính xác, độ tự nhiên, lượng thông tin được giữ lại và những lỗi có thể ảnh hưởng đến cách hiểu ca bệnh.

Meddies chưa công bố phép so sánh như vậy. Vì thế, kết luận hiện tại phải hẹp hơn. Tạo sinh văn bản bằng tiếng Việt, xây dựng bối cảnh lâm sàng cho Việt Nam và thiết kế dạng dữ liệu là ba phần việc khác nhau. Chúng tôi đang làm cả ba, nhưng các bản phát hành hiện tại chưa đạt cùng một mức độ ở từng phần.

Khi đánh giá một bộ dữ liệu lâm sàng tiếng Việt, ngôn ngữ của văn bản chỉ là câu hỏi đầu tiên. Chúng tôi còn phải xem bối cảnh đến từ đâu, cấu trúc dữ liệu khiến mô hình học điều gì, ai đã rà soát, và phần nào vẫn chưa được kiểm chứng.

Xem quy trình dự kiến

Xem lại quy trình dự kiến và một tình huống an toàn thuốc tổng hợp, với ranh giới bằng chứng được nêu rõ.

Đặt lịch demo