Cuando los copilotos confabulan: una revisión crítica de las alucinaciones en la escritura científica asistida por inteligencia artificial

Autor/innen

DOI:

https://doi.org/10.71112/gpqkd594

Schlagwörter:

modelos de lenguaje de gran escala, alucinación, confabulación, fabricación de referencias, escritura científica, copilotos de IA

Abstract

Antecedentes: Los modelos de lenguaje de gran escala se han incorporado como copilotos
en la escritura científica, pero presentan una limitación crítica: la alucinación, entendida
como contenido plausible sin sustento factual. Objetivo: Revisar críticamente la frecuencia,
tipología, métodos de detección y estrategias de mitigación de las alucinaciones en
copilotos de escritura y sus implicaciones para la integridad científica. Métodos: Se realizó
una revisión crítica de literatura con búsqueda sistematizada entre enero de 2023 y junio de
2025, organizada según PRISMA 2020; el corpus final quedó constituido por ocho trabajos.
Resultados: Los estudios mostraron marcada heterogeneidad según la tarea y la definición
operacional: 1,47% de alucinaciones en resúmenes clínicos estructurados, frente a
proporciones de referencias inexistentes de 18% a 91,4% en generación abierta según el modelo. Conclusiones: La evidencia no respalda el uso autónomo de copilotos de IA en la
producción científica; la verificación humana de las fuentes citadas resulta indispensable.

Downloads

Download-Daten sind nocht nicht verfügbar.

Literaturhinweise

Alkaissi, H., y McFarlane, S. I. (2023). Artificial hallucinations in ChatGPT: Implications in scientific writing. Cureus, 15(2), e35179. https://doi.org/10.7759/cureus.35179

Anh-Hoang, D., Tran, V., y Nguyen, L.-M. (2025). Survey and analysis of hallucinations in large language models: Attribution to prompting strategies or model behavior. Frontiers in Artificial Intelligence, 8, 1622292. https://doi.org/10.3389/frai.2025.1622292

Asgari, E., Montana-Brown, N., Dubois, M., Khalil, S., Balloch, J., Au Yeung, J., y Pimenta, D. (2025). A framework to assess clinical safety and hallucination rates of LLMs for medical text summarisation. npj Digital Medicine, 8, 274. https://doi.org/10.1038/s41746-025-01670-7

Azamfirei, R., Kudchadkar, S. R., y Fackler, J. (2023). Large language models and the perils of their hallucinations. Critical Care, 27, 120. https://doi.org/10.1186/s13054-023-04393-x

Bhattacharyya, M., Miller, V. M., Bhattacharyya, D., y Miller, L. E. (2023). High rates of fabricated and inaccurate references in ChatGPT-generated medical content. Cureus, 15(5), e39238. https://doi.org/10.7759/cureus.39238

Chelli, M., Descamps, J., Lavoue, V., Trojani, C., Azar, M., Deckert, M., Raynier, J.-L., Clowez, G., Boileau, P., y Ruetsch-Chelli, C. (2024). Hallucination rates and reference accuracy of ChatGPT and Bard for systematic reviews: Comparative analysis. Journal of Medical Internet Research, 26, e53164. https://doi.org/10.2196/53164

Committee on Publication Ethics. (2023). Authorship and AI tools [Declaración de posición]. https://doi.org/10.24318/cCVRZBms

Farquhar, S., Kossen, J., Kuhn, L., y Gal, Y. (2024). Detecting hallucinations in large language models using semantic entropy. Nature, 630, 625-630. https://doi.org/10.1038/s41586-024-07421-0

Ganjavi, C., Eppler, M. B., Pekcan, A., Biedermann, B., Abreu, A., Collins, G. S., Gill, I. S., y Cacciamani, G. E. (2024). Publishers' and journals' instructions to authors on use of generative artificial intelligence in academic and scientific publishing: Bibliometric analysis. BMJ, 384, e077192. https://doi.org/10.1136/bmj-2023-077192

Huang, L., Yu, W., Ma, W., Zhong, W., Feng, Z., Wang, H., Chen, Q., Peng, W., Feng, X., Qin, B., y Liu, T. (2025). A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions. ACM Transactions on Information Systems, 43(2), Artículo 42. https://doi.org/10.1145/3703155

Ji, Z., Lee, N., Frieske, R., Yu, T., Su, D., Xu, Y., Ishii, E., Bang, Y. J., Madotto, A., y Fung, P. (2023). Survey of hallucination in natural language generation. ACM Computing Surveys, 55(12), Artículo 248. https://doi.org/10.1145/3571730

Liu, Y., Kong, W., y Merve, K. (2025). ChatGPT applications in academic writing: A review of potential, limitations, and ethical challenges. Arquivos Brasileiros de Oftalmologia, 88(3), e2024-0269. https://doi.org/10.5935/0004-2749.2024-0269

Lund-Tonnesen, M., Vahr Lauridsen, S., y Rosenberg, J. (2025). Evaluating Microsoft Copilot in Qualitative Health Research: Accurate for Manifest Content Coding but Limited in Latent Interpretation. Cureus, 17(10), e95719. https://doi.org/10.7759/cureus.95719

Manakul, P., Liusie, A., y Gales, M. J. F. (2023). SelfCheckGPT: Zero-resource black-box hallucination detection for generative large language models. Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing, 9004-9017. https://doi.org/10.18653/v1/2023.emnlp-main.557

Nordling, L. (2023). How ChatGPT is transforming the postdoc experience. Nature, 622(7983), 655-657. https://doi.org/10.1038/d41586-023-03235-8

Page, M. J., McKenzie, J. E., Bossuyt, P. M., Boutron, I., Hoffmann, T. C., Mulrow, C. D., Shamseer, L., Tetzlaff, J. M., Akl, E. A., Brennan, S. E., Chou, R., Glanville, J., Grimshaw, J. M., Hróbjartsson, A., Lalu, M. M., Li, T., Loder, E. W., Mayo-Wilson, E., McDonald, S., McGuinness, L. A., Stewart, L. A., Thomas, J., Tricco, A. C., Welch, V. A., Whiting, P., y Moher, D. (2021). The PRISMA 2020 statement: An updated guideline for reporting systematic reviews. BMJ, 372, n71. https://doi.org/10.1136/bmj.n71

Shuster, K., Poff, S., Chen, M., Kiela, D., y Weston, J. (2021). Retrieval augmentation reduces hallucination in conversation. Findings of the Association for Computational Linguistics: EMNLP 2021, 3784-3803. https://doi.org/10.18653/v1/2021.findings-emnlp.320

Singhal, K., Azizi, S., Tu, T., Mahdavi, S. S., Wei, J., Chung, H. W., Scales, N., Tanwani, A., Cole-Lewis, H., Pfohl, S., Payne, P., Seneviratne, M., Gamble, P., Kelly, C., Babiker, A., Schärli, N., Chowdhery, A., Mansfield, P., Demner-Fushman, D., ... Natarajan, V. (2023). Large language models encode clinical knowledge. Nature, 620, 172-180. https://doi.org/10.1038/s41586-023-06291-2

Smith, A. L., Greaves, F., y Panch, T. (2023). Hallucination or confabulation? Neuroanatomy as metaphor in large language models. PLOS Digital Health, 2(11), e0000388. https://doi.org/10.1371/journal.pdig.0000388

Walters, W. H., y Wilder, E. I. (2023). Fabrication and errors in the bibliographic citations generated by ChatGPT. Scientific Reports, 13, 14045. https://doi.org/10.1038/s41598-023-41032-5

Yoo, J. H. (2025). Defining the boundaries of AI use in scientific writing: A comparative review of editorial policies. Journal of Korean Medical Science, 40(23), e187. https://doi.org/10.3346/jkms.2025.40.e187

Anexo. Estrategia de búsqueda reproducible (material suplementario)

Con el propósito de facilitar la reproducibilidad del proceso descrito en la Sección 2.2, se detalla a continuación la estrategia de búsqueda utilizada. La última ejecución de las búsquedas en todas las bases y plataformas indicadas se realizó el 3 de agosto de 2025.

Ecuación utilizada en PubMed/MEDLINE: (hallucination[Title/Abstract] OR confabulation[Title/Abstract] OR "reference fabrication"[Title/Abstract] OR factuality[Title/Abstract] OR faithfulness[Title/Abstract] OR misinformation[Title/Abstract]) AND ("large language model*"[Title/Abstract] OR ChatGPT[Title/Abstract] OR GPT[Title/Abstract] OR Bard[Title/Abstract] OR "AI writing assistant*"[Title/Abstract]) AND ("scientific writing"[Title/Abstract] OR "academic writing"[Title/Abstract] OR "systematic review*"[Title/Abstract] OR "clinical documentation"[Title/Abstract] OR "biomedical research"[Title/Abstract])

Esta ecuación se adaptó a la sintaxis específica de cada plataforma (Scopus, Web of Science Core Collection, ACM Digital Library, Google Scholar, ScienceDirect y JSTOR), conservando los tres núcleos conceptuales descritos en la Sección 2.2 —fenómeno de interés, modelos o sistemas analizados y contextos de aplicación— y ajustando operadores booleanos y truncamientos según las capacidades de cada motor de búsqueda. Los términos vinculados con procedimientos específicos de evaluación se utilizaron en búsquedas complementarias cuando resultó pertinente. El desglose del número de registros aportado individualmente por cada base de datos no fue conservado de forma sistemática durante la búsqueda original y constituye una limitación para la reproducibilidad detallada de la estrategia de búsqueda. El número total de registros identificados (171) y el proceso posterior de cribado se documentan en la Sección 2.4 y en la Figura 1.

Veröffentlicht

2026-10-02

Ausgabe

Rubrik

Ciencias Computacionales

Zitationsvorschlag

Guerschberg, L. ., & Gutiérrez, Y. E. . (2026). Cuando los copilotos confabulan: una revisión crítica de las alucinaciones en la escritura científica asistida por inteligencia artificial. Revista Multidisciplinar Epistemología De Las Ciencias, 3(4), 149-175. https://doi.org/10.71112/gpqkd594