Trong một mẫu, người bệnh nói cơn đau thắt lưng “lan xuống mông và đùi phải”. Cụm này có thể được đọc là mông cùng đùi phải, hoặc cả mông lẫn đùi bên phải. Bản tiếng Anh viết thành “the right buttock and thigh” và âm thầm chọn cách hiểu thứ hai.
Phép kiểm tra số không nhìn thấy lựa chọn đó. Cả 24 bản dịch đều giữ nguyên các con số trong câu nguồn, gồm thời gian, tần suất và mức đau. Nếu chỉ so chuỗi số, hệ thống đạt 24 trên 24. Khi đọc từng cặp theo phạm vi ý nghĩa, chúng tôi đánh dấu sáu điểm cần xem lại. Năm điểm đã được sửa thận trọng ở lớp biên tập: ba lỗi diễn đạt, một câu thêm cách hiểu không có trong nguồn, và một câu được làm tự nhiên hơn nhưng vẫn giữ nguyên sự mơ hồ. Điểm còn lại liên quan đến phạm vi của từ “phải”. Không có một câu tiếng Anh duy nhất vừa tự nhiên vừa giữ nguyên hai cách đọc, nên trường hợp này phải được làm rõ hoặc đi kèm ghi chú của người dịch.
Đây chưa phải kết quả đã được thẩm định lâm sàng. Năm bản hậu biên tập và một điểm cần làm rõ là quyết định biên tập trước khi người rà soát song ngữ chấm độc lập. Chúng tôi công bố cách dựng phép thử và giới hạn của nó trước, thay vì biến một vòng đọc nội bộ thành bằng chứng về độ an toàn của dịch máy.
Chúng tôi đã tạo các cặp như thế nào
Nguồn tiếng Việt đến từ cấu hình vietnamese của Meddies Consultant, một bộ dữ liệu tư vấn tổng hợp do Meddies phát hành. Đây không phải lời kể của người bệnh thật. Thẻ dữ liệu cảnh báo không nên mặc nhiên xem hai cấu hình tiếng Việt và tiếng Anh là cân bằng. Phép thử này cũng không dùng chúng như các cặp dịch tương ứng.
Chúng tôi lấy cố định 100 dòng đầu qua API hiển thị công khai, rồi chọn 24 lượt nói của người bệnh từ 24 cuộc tư vấn khác nhau. Mẫu được chọn có chủ đích để tìm lỗi ở các chi tiết dễ bị thay đổi khi dịch, gồm phủ định, thời điểm khởi phát, diễn tiến, mức độ, vị trí, bên cơ thể, hướng lan, yếu tố làm nặng hoặc giảm, thuốc và ảnh hưởng đến sinh hoạt.
Cách chọn này phục vụ việc dò lỗi. Nó không phải lấy mẫu ngẫu nhiên, không đại diện cho mọi cách người Việt kể triệu chứng và không cho phép ước tính tỷ lệ lỗi của mô hình.
Mỗi lượt nói được đưa riêng vào trình dịch. Nhãn bệnh mục tiêu và các lượt trước không được cung cấp, vì người dịch không nên dùng thông tin mà câu nguồn không chứa. Lần chạy ngày 10 tháng 7 năm 2026 dùng gemini-3.1-pro-preview, nhiệt độ 0 và mức suy luận thấp. Chúng tôi giữ lại yêu cầu đã được tuần tự hóa, phiên bản câu lệnh, thời điểm chạy và mã băm của câu lệnh lẫn tập nguồn. Lần chạy này không đặt hạt giống, nên một lần chạy khác không được kỳ vọng cho đầu ra giống từng ký tự.
Phiếu đối chiếu phải bắt đầu từ dữ kiện
Trước khi xem bản dịch, chúng tôi lập phiếu cho từng câu nguồn. Phiếu ghi những dữ kiện phải giữ, chẳng hạn “không sốt”, “đau tăng khi đứng lâu”, “lan xuống đùi phải” hoặc “đỡ khi nằm nghỉ”. Người rà soát sau đó kiểm tra năm câu hỏi.
- Bản dịch có giữ đủ dữ kiện trong câu nguồn không?
- Bản dịch có thêm một dữ kiện mà câu nguồn không nói không?
- Phủ định, mức độ, thời gian và bên cơ thể có còn đúng phạm vi không?
- Mức độ chắc chắn của người bệnh có bị biến thành một khẳng định không?
- Câu tiếng Anh có giống lời một người bệnh có thể nói, hay chỉ là bản ghép từ tương ứng?
Ngay ở bước chuẩn bị, phiếu đối chiếu của chúng tôi có bốn lỗi. Ba lỗi lấy nhầm thông tin từ một lượt nói trước đó. Một lỗi diễn giải từ tiếng Việt mạnh hơn mức câu nguồn cho phép. Chúng tôi sửa lớp nhãn, giữ nguyên đầu ra thô và ghi lại lý do sửa. Nếu âm thầm sửa đáp án sau khi nhìn kết quả, phép thử sẽ không còn cho biết lỗi nằm ở mô hình hay ở người chấm.
Đây cũng là lý do một bộ cặp song ngữ chưa tự động trở thành chuẩn vàng. Nghiên cứu VLSP 2025 về dịch máy y khoa Anh Việt kết hợp SacreBLEU với đánh giá của con người. Một nghiên cứu năm 2025 trên npj Digital Medicine lại dùng người làm ngôn ngữ, người làm lâm sàng và người chăm sóc để đánh giá bản dịch hướng dẫn xuất viện ở sáu ngôn ngữ. Các ngôn ngữ trong nghiên cứu đó không có tiếng Việt, nên kết quả của họ không cho biết mô hình sẽ hoạt động thế nào với tiếng Việt. Giá trị có thể dùng ở đây là thiết kế đánh giá nhiều góc nhìn.
Những gì vòng sàng lọc đã nhìn thấy
Cụm “mông và đùi phải” cho thấy một vấn đề khó hơn lỗi thiếu từ. Tên bên cơ thể vẫn xuất hiện, nhưng câu tiếng Anh đã chọn một phạm vi mà câu tiếng Việt để mở. Một bộ đếm từ khóa sẽ báo đạt.
Các điểm còn lại ít rõ hơn nhưng vẫn đáng kiểm tra. Từ xưng hô “con” trong một câu được dịch thành “child”, tạo ra tiếng Anh cứng và làm thay đổi quan hệ giữa người nói với người nghe. Cụm “nuốt vướng” được chuyển thành “feel a lump when swallowing”, có thể biến cảm giác nuốt không trơn thành một khối cụ thể hơn. Câu “người nhẹ đi một chút” được dịch sát thành “my body is a bit lighter”, giữ được sự mơ hồ nhưng không còn tự nhiên. Hai câu khác giữ đúng lượng và mức độ nhưng dùng cách diễn đạt tiếng Anh không giống lời người bệnh.
Những điểm này chưa được gán mức độ gây hại. Người rà soát cần xem cả câu, bối cảnh sử dụng và quyết định nào có thể bị ảnh hưởng. Một cụm từ vụng về không mặc nhiên là lỗi lâm sàng. Ngược lại, một câu rất trôi chảy vẫn có thể âm thầm chọn một cách hiểu cho cụm từ còn mơ hồ.
Khung triển khai dịch có hỗ trợ máy năm 2025 đề xuất đánh giá độ chính xác, độ trôi chảy, thuật ngữ, mức độ phù hợp với ngữ cảnh địa phương và mức độ nghiêm trọng của lỗi, thay vì chỉ dùng một điểm kỹ thuật. Một nghiên cứu tiến cứu năm 2026 về dịch lời nói Anh Tây Ban Nha dùng người làm lâm sàng song ngữ, che nguồn bản dịch và vẫn cung cấp bối cảnh tình huống cho người chấm. Đây là hai ví dụ ngoài Việt Nam. Chúng gợi ý cách tổ chức vòng rà soát, không phải bằng chứng rằng cùng một kết quả sẽ lặp lại với tiếng Việt.
Phần rà soát còn thiếu
Bước tiếp theo là để người thông thạo cả tiếng Việt và tiếng Anh chấm đầu ra thô của đủ 24 cặp mà không xem nhận định hoặc bản hậu biên tập của chúng tôi. Với mỗi điểm khác biệt, người chấm cần ghi phần văn bản liên quan, loại lỗi, dữ kiện bị thay đổi và hậu quả có thể xảy ra nếu câu dịch được dùng trong hỏi bệnh, tóm tắt hoặc chuyển giao chăm sóc. Một người thứ hai nên chấm độc lập trước khi hai bên phân xử bất đồng.
Sau vòng đó, báo cáo mới có thể cho biết bao nhiêu cặp đạt, lỗi tập trung ở nhóm nào và những điểm nào có ý nghĩa lâm sàng. Với 24 cặp chọn có chủ đích, kết quả vẫn chỉ là một phép thăm dò. Nó không chứng minh một mô hình an toàn, không so sánh các hệ thống dịch và không đại diện cho tiếng Việt nói chung.
Kết luận hiện tại hẹp hơn. Dịch máy có thể giữ nguyên mọi con số mà vẫn thu hẹp một cụm từ mơ hồ còn một cách hiểu. Người chấm cũng có thể đưa thông tin ngoài câu nguồn vào đáp án mà không nhận ra. Muốn biết bản dịch đã giữ đúng lời người bệnh chưa, chúng ta phải kiểm tra cả hai phía.
