Trong vài năm gần đây, lĩnh vực xuất bản học thuật đã nổi lên một vấn đề ngày càng nghiêm trọng: các bài báo khoa học chứa trích dẫn từ tài liệu tham khảo giả mạo do AI tạo ra (fake/ hallucinated/ fabricated citations). AI tạo ra các trích dẫn rất thuyết phục, hoàn chỉnh với tiêu đề, tên tác giả và định dạng tạp chí hợp lý, mặc dù các nguồn hoàn toàn là hư cấu. Hiện tượng này đặc biệt đáng lo ngại trong nghiên cứu y sinh, nơi mà các trích dẫn không chính xác có thể ảnh hưởng đến các nghiên cứu trong tương lai và tiềm ẩn nguy cơ tác động đến hiểu biết lâm sàng.
Một nghiên cứu về vấn đề này vừa được công bố trên tạp chí nổi tiếng The Lancet, số 407 (10541) ngày 09/5/2026. Bài báo "Fabricated citations: an audit across 2·5 million biomedical papers" (Trích dẫn ngụy tạo: một cuộc kiểm tra trên 2,5 triệu bài báo y sinh), do Maxim Topaz từ Viện Khoa học Dữ liệu, Đại học Columbia, Mỹ cùng các cộng sự quốc tế từ Phần Lan, Israel thực hiện.
Nhóm nghiên cứu đã quét 2,5 triệu bài báo trong lĩnh vực y sinh thuộc danh mục Truy cập mở của PubMed Central (PMC) xuất bản từ ngày 01/01/2023 đến 18/02/2026 bằng một hệ thống xác thực tài liệu tham khảo tự động dựa trên trí tuệ nhân tạo (AI) để tìm kiếm các trích dẫn giả mạo. Kết quả đã xác định được 4.046 trích dẫn bị ngụy tạo nằm trong 2.810 bài báo đã qua quy trình phản biện – những trích dẫn ghi tên các tài liệu không thể truy tìm được nguồn gốc từ các ấn phẩm đã biết.
Nghiên cứu cho thấy xu hướng gia tăng mạnh mẽ tài liệu giả mạo trong vòng 2 năm qua xem bảng và hình). Như vậy, tỷ lệ giả mạo đã tăng khoàng 12 lần từ 4/10.000 bài (2023) lên 56,9/10.000 bài (đầu năm 2026).
|
Thời gian |
Tần suất xuất hiện TLTK giả mạo |
Tỷ lệ TLTK giả trên 10000 bài báo |
|
Năm
2023 |
1 trong 2828 bài báo |
~ 4,0 |
|
Năm
2025 |
1 trong 458 bài báo |
~ 21,8 |
|
Quý
4 năm 2025 |
- |
51,3 |
|
7
tuần đầu năm 2026 |
1 trong 277 bài báo |
56,9 |
Sự gia tăng mạnh mẽ nhất bắt đầu từ giữa năm 2024, trùng hợp với thời điểm các công cụ hỗ trợ viết bài bằng AI được thương mại hóa rộng rãi và tích hợp sâu vào quy trình viết báo cáo nghiên cứu. Trong khi năm 2023 các mô hình ngôn ngữ như ChatGPT mới chỉ được đưa vào sử dụng.
Sự xâm nhập của trích dẫn giả mạo vào các tạp chí y sinh không chỉ là vấn đề vi phạm liêm chính học thuật, mà còn là một nguy cơ trực tiếp đe dọa sức khỏe cộng đồng thông qua việc làm sai lệch hướng dẫn lâm sàng. Các phác đồ điều trị và tổng quan hệ thống (systematic reviews) dựa trên sự tin tưởng rằng các nghiên cứu tiền đề là có thật và đáng tin cậy. Nếu dữ liệu giả lọt lưới, sai sót y khoa có thể đi thẳng vào quy trình chăm sóc người bệnh mà không bị phát hiện.
Các tác giả đã đề xuất 4 hành động cho vấn đề này:
Thứ nhất, các nhà xuất bản nên tích hợp việc xác minh tài liệu tham khảo tự động vào quy trình nộp bài trước khi bắt đầu phản biện. Các công cụ xác minh hiện đã có, rào cản đối với việc áp dụng là do yếu tố thể chế chứ không phải công nghệ.
Thứ hai, các dịch vụ lập chỉ mục nên thêm siêu dữ liệu về tính liêm chính vào hồ sơ bài báo để người dùng sau này có thể đánh giá độ tin cậy của tài liệu tham khảo.
Thứ ba, các nhà xuất bản nên sàng lọc lại các ấn phẩm hiện có và đưa ra các bản đính chính hoặc thu hồi khi các tài liệu tham khảo giả mạo làm ảnh hưởng đến kết luận của bài báo.
Thứ tư, các tài liệu tham khảo giả mạo hiện không tồn tại như một danh mục riêng biệt trong các cơ sở dữ liệu về liêm chính khoa học; việc thiết lập danh mục này sẽ cho phép theo dõi và giải trình một cách có hệ thống.
Nguồn:
Nhận xét
Đăng nhận xét