¿Qué tan confiables son las citas generadas por IA? Lo que dice la evidencia
Pedirle a un modelo de lenguaje que genere referencias bibliográficas para un texto científico es una de las formas más comunes —y más riesgosas— de usar IA en contenido médico. Un estudio publicado en JMIR evaluó la exactitud de las citas generadas por ChatGPT (GPT-3.5) en dos dominios académicos distintos y encontró que, de 102 citas generadas en total, el 72,7% en ciencias naturales y el 76,6% en humanidades correspondían a publicaciones que efectivamente existían [1].
El dato más preocupante de ese mismo estudio no es cuántas citas existen, sino cuántas son exactas: solo el 32,7% de las citas en ciencias naturales resultaron completamente correctas al verificar autor, título y demás metadatos contra la fuente real [1]. Es decir, una cita puede corresponder a un artículo real y aun así tener autoría, año o detalles equivocados —un error mucho más difícil de detectar que una referencia inventada desde cero.
Un análisis comparativo sobre el uso de ChatGPT y Bard para apoyar revisiones sistemáticas llega a una conclusión clara sobre el riesgo de este tipo de error: no se recomienda desplegar estos modelos como herramienta principal o exclusiva para conducir revisiones sistemáticas, y cualquier referencia generada por ellos exige una validación exhaustiva por parte de los investigadores [2]. El mismo análisis señala que la alta frecuencia de alucinaciones en estos modelos evidencia la necesidad de perfeccionar su entrenamiento y funcionamiento antes de usarlos con confianza para fines académicos rigurosos [2].
Para un equipo médico o científico que integra IA en su flujo de trabajo, la conclusión práctica no es evitar estas herramientas, sino diseñar el proceso alrededor de su limitación conocida: ninguna cita generada por IA —exista o no el artículo referenciado— debería incorporarse a un manuscrito, dossier o presentación médica sin que un experto humano la verifique contra la fuente original, confirmando autoría, año, revista y que el contenido citado respalde efectivamente la afirmación hecha.
Referencias
- Mugaanyi J, Cai L, Cheng S, Lu C, Huang J. Evaluation of Large Language Model Performance and Reliability for Citations and References in Scholarly Writing: Cross-Disciplinary Study. J Med Internet Res. 2024. doi:10.2196/52935. Disponible en: https://www.ncbi.nlm.nih.gov/pmc/articles/PMC11031695/
- Hallucination Rates and Reference Accuracy of ChatGPT and Bard for Systematic Reviews: Comparative Analysis. PMC. Disponible en: https://www.ncbi.nlm.nih.gov/pmc/articles/PMC11153973/