¿Qué son las alucinaciones de IA?
Una alucinación de IA es una declaración factualmente falsa o fabricada generada por un LLM con aparente confianza. El modelo produce texto que viola la realidad — nombres incorrectos, fuentes inventadas, fechas imposibles, URLs ficticias — usando el mismo lenguaje fluido que la información precisa.
Esto difiere fundamentalmente de un modelo que expresa incertidumbre. Las alucinaciones se caracterizan por afirmaciones seguras y detalladas sobre cosas que no existen o eventos que no ocurrieron. Un modelo puede citar un artículo publicado en una revista que no existe, inventar detalles biográficos, indicar una fecha histórica incorrecta en siglos, o describir una característica de producto que nunca se construyó.
En una oración: Las alucinaciones son declaraciones falsas y fluidas que los modelos de lenguaje generan porque predicen patrones de texto en lugar de recuperar hechos de un almacén confiable.
Por qué los modelos de lenguaje alucinan
Los LLMs funcionan prediciendo la siguiente palabra en una secuencia. No consultan una base de datos ni verifican hechos contra la verdad fundamental. Calculan probabilidades basadas en patrones en los datos de entrenamiento. Este diseño central — muy efectivo para tareas de lenguaje — crea inherentemente presión para alucinan.
Los mecanismos centrales
- Predicción del siguiente token, no recuperación de hechos. La arquitectura del modelo está optimizada para la generación de lenguaje, no para la verificación de hechos. Cuando un prompt hace una pregunta, el objetivo del modelo es producir una continuación coherente y plausible del texto. La coherencia y la veracidad no son lo mismo.
- Lagunas y vencimiento de los datos de entrenamiento. Los modelos se entrenan con datos con una fecha final específica. Las lagunas de información crean vacíos. Cuando se les pregunta sobre estas lagunas, el modelo carece de patrones verídicos para predecir a partir de ellos. Inventa detalles que suenan plausibles en lugar de decir "No tengo esta información".
- Sin mecanismo de confianza explícito. Los modelos no generan una puntuación de confianza junto a cada output. Producen texto sin una señal interna que diga "Estoy 30% seguro de esta afirmación."
- Presión de prompts que exigen respuestas. Los prompts como "Explica todo sobre tema" comunican implícitamente: debes responder, incluso si no estás seguro. El modelo responde inventando detalles para satisfacer la solicitud.
- Context window limitado y pérdida de información. Los LLMs solo pueden retener una cantidad finita de contexto en memoria. Los documentos o conversaciones largas hacen que los detalles anteriores se desvanezcan.
- Confabulación en el razonamiento de varios pasos. Para problemas que requieren múltiples pasos de razonamiento, el modelo puede perder el hilo de los resultados intermedios e inventar un paso de apoyo para justificar una conclusión.
Tipos comunes de alucinaciones
Las alucinaciones siguen patrones reconocibles. Identificar el tipo te ayuda a elegir estrategias de mitigación específicas.
Fuentes inventadas
- Ejemplo:
- Citar una revista académica que no existe; nombres de autores y años de publicación inventados
- Por qué ocurre:
- El modelo fue entrenado con millones de citas y aprendió patrones similares a las citas, luego inventa nuevas
- Severidad:
- Muy alta
Hechos incorrectos (fechas, números, nombres)
- Ejemplo:
- Nombrar un evento histórico en el año incorrecto; detalles biográficos erróneos
- Por qué ocurre:
- Los datos de entrenamiento son incompletos o contradictorios; el modelo elige un número que suena plausible
- Severidad:
- Muy alta
URLs y emails falsos
- Ejemplo:
- Proporcionar un enlace o dirección de email que no funciona o no pertenece a la organización reclamada
- Por qué ocurre:
- El modelo aprendió patrones de URL y email y genera nuevos que son realistas pero ficticios
- Severidad:
- Alta
Pérdida de contexto
- Ejemplo:
- Responder una pregunta como si el modelo hubiera entendido el contexto anterior, pero en realidad perdió el hilo
- Por qué ocurre:
- El context window es finito; los documentos largos hacen que los detalles anteriores se desvanezcan de la atención del modelo
- Severidad:
- Alta
Cambio de rol
- Ejemplo:
- Comenzar con un rol (analista) y gradualmente cambiar a otro (narrador), inventando detalles para llenar los huecos
- Por qué ocurre:
- El modelo pierde el hilo de la instrucción original y vuelve a la coincidencia de patrones pura
- Severidad:
- Media
Generalización con exceso de confianza
- Ejemplo:
- Decir "Todos los X hacen Y" cuando solo los ejemplos de entrenamiento específicos lo muestran
- Por qué ocurre:
- El modelo generaliza demasiado ampliamente a partir de datos de entrenamiento limitados sin verificación de confianza
- Severidad:
- Media
Contradicción interna
- Ejemplo:
- Hacer afirmaciones contradictorias dentro de la misma respuesta
- Por qué ocurre:
- El modelo no tiene mecanismo para rastrear la consistencia en múltiples oraciones
- Severidad:
- Media
Los siete tipos de alucinaciones son: fuentes inventadas, hechos incorrectos, URLs y emails falsos, pérdida de contexto, cambio de rol, generalización con exceso de confianza y contradicciones internas.
Cómo el diseño del prompt afecta al riesgo de alucinación
Tus prompts alientan o desalientan las alucinaciones. La diferencia es medible.
Prompts que aumentan el riesgo de alucinación:
- "Cuéntame todo sobre tema" — sin límites, sin permiso para decir "no lo sé"
- "Asegúrate de incluir muchos detalles" — presión explícita para llenar el espacio con información inventada
- "Escribe como si fueras un experto líder" — fomenta las afirmaciones seguras, incluso en reclamaciones inciertas
- "Responde aunque no estés completamente seguro" — elimina el freno a las alucinaciones
Prompts que reducen el riesgo de alucinación:
- "Puedes decir 'No lo sé' si no estás seguro" — permiso explícito para admitir lagunas de conocimiento
- "Usa solo información del contexto a continuación" — restringe la respuesta a los datos proporcionados, no al conocimiento inventado
- "Distingue hechos de opiniones. Marca las afirmaciones inciertas INCIERTO" — obliga al modelo a diferenciar
- "Cita tu fuente para cada afirmación factual" — hace que las citas inventadas sean visiblemente obvias
- "Si no puedes verificar esta afirmación, no la incluyas" — restricción explícita de afirmaciones no verificadas
Buena estructura de prompt
Los buenos prompts combinan cuatro elementos: un rol o contexto claro (¿qué marco debe adoptar el modelo?), una tarea específica (¿qué output necesito?), datos de input reales (¿qué información se proporciona?) y restricciones explícitas (¿qué NO puede hacer el modelo?). Esta estructura reduce la presión de alucinan eliminando la ambigüedad sobre lo que el modelo debe hacer.
Técnicas para reducir las alucinaciones
Tres enfoques complementarios reducen las alucinaciones: - A nivel de prompt: Añade restricciones y permiso para admitir la incertidumbre en tus prompts - A nivel de sistema: Usa RAG, function calling o recuperación para fundamentar las respuestas en datos reales - A nivel de modelo: Ejecuta el mismo prompt en varios modelos independientes para detectar alucinaciones mediante consenso
1. Permiso explícito para decir "No lo sé"
Dile al modelo: "Si no estás seguro o no tienes la información, dilo. No adivines."
Esto elimina la presión de inventar respuestas. Muchos modelos están entrenados para ser útiles e intentarán responder incluso cuando estén completamente inseguros. Liberarlos explícitamente de esta expectativa les da permiso para declinar.
2. Pedir fuentes o evidencias
Exige: "Cita la fuente de cada afirmación factual" o "Proporciona URL y fecha de publicación para cada referencia."
Esto hace que las citas inventadas sean obvias (no funcionan o apuntan a fuentes inexistentes) y obliga al modelo a ser más cuidadoso al afirmar hechos.
3. Autocrítica y verificación de contradicciones
Pide al modelo que revise su propio output:
> "Después de completar tu respuesta, revísala en busca de contradicciones o afirmaciones que contradigan algo que dijiste antes. Señala cualquier inconsistencia que encuentres."
Los modelos a menudo captan sus propios errores cuando se les pide reflexionar.
4. Usa instrucciones negativas
Especifica explícitamente lo que el modelo NO puede hacer:
- "Nunca inventes fuentes, URLs o nombres de autores bajo ninguna circunstancia"
- "No adivines fechas si no estás seguro — deja la fecha en blanco en lugar de adivinar"
- "No añadas información que no esté en el contexto proporcionado"
El enfoque negativo a veces funciona mejor que el enfoque positivo para prevenir errores específicos.
5. Razonamiento paso a paso con verificación
Para tareas complejas, pide:
> "Resuelve esto paso a paso. Después de cada paso, verifica que el paso anterior sea correcto antes de continuar con el siguiente."
Dividir la tarea en fragmentos más pequeños con pasos de verificación le da al modelo oportunidades de detectar inconsistencias antes de que se acumulen.
6. Formato de salida estructurado con sección de evidencia
Pide al modelo que separe respuesta, razonamiento y evidencia en secciones distintas:
``` RESPUESTA: Respuesta directa
RAZONAMIENTO: Cómo llegaste a esto
EVIDENCIA: Fuentes, hechos o citas que lo respaldan
CONFIANZA: ¿Qué tan seguro estás, y por qué? ```
Esta estructura hace que las alucinaciones sean fáciles de detectar: las afirmaciones sin respaldo tendrán secciones de EVIDENCIA vacías o vagas, y valores de CONFIANZA bajos.
Estrategias a nivel de sistema más allá del diseño de prompts
Los prompts por sí solos no bastan para el trabajo de alto riesgo. Añade estas herramientas y flujos de trabajo.
- Retrieval-Augmented Generation (RAG). Proporciona al modelo un documento, base de conocimiento o dataset específico y pídele que responda solo usando ese contenido. Esto fundamenta las respuestas en datos reales en lugar de los datos de entrenamiento del modelo y elimina las alucinaciones sobre información faltante. Herramientas como LangChain, el prompt caching de Anthropic y las bases de datos vectoriales implementan este patrón. Consulta nuestra guía completa sobre RAG: cómo fundamentar las respuestas de la IA en datos reales.
- Tool calling y uso de funciones. Permite que el modelo llame a funciones externas para cálculos, consultas a bases de datos o verificación de hechos. En lugar de inventar una estadística, el modelo llama a una función para obtenerla. Esto elimina por completo la tentación de alucinar en dominios específicos.
- Revisión humana y verificación experta. Para decisiones críticas — médicas, legales, financieras, de seguridad — siempre haz que una persona (preferiblemente un experto) verifique las respuestas generadas por IA. Ninguna técnica de prompting reemplaza el juicio experto.
- Flujos de verificación de hechos automatizados. Pasa las respuestas del modelo por sistemas automatizados (APIs de fact-checking, validación de URLs, verificación de citas) antes de mostrárselas a los usuarios. Esto detecta alucinaciones a escala sin revisión manual de cada respuesta.
Múltiples modelos y detección por consenso
Un solo modelo puede alucinar con total confianza. Pero cuando le haces la misma pregunta a varios modelos independientes, a menudo no están de acuerdo en las afirmaciones alucinadas.
Si cinco modelos producen respuestas similares de forma independiente a una pregunta, esa respuesta es mucho más probable que sea correcta que si un solo modelo respondiera. Si solo un modelo afirma algo y otros cuatro no lo mencionan, esa afirmación es altamente sospechosa y requiere verificación.
Este es el principio detrás de la puntuación de consenso: enviar el mismo prompt a muchos modelos (GPT-5.6, Claude Opus 5, Gemini 3.1 Pro, Mistral Large, Llama 3, DeepSeek, etc.) y analizar dónde están de acuerdo y dónde no.
Prueba de consenso de PromptQuorum
Probado en PromptQuorum — 15 prompts propensos a alucinaciones enviados a GPT-5.6, Claude Opus 5 y Gemini 3.1 Pro: GPT-5.6 fabricó por completo 1 cita; Claude Opus 5 se negó a citar artículos no verificados; Gemini 3.1 Pro citó 3 artículos reales pero 1 con un año incorrecto. Solo 1 cita apareció en las tres respuestas de los modelos. Esta prueba demuestra que el consenso entre modelos es una señal significativa de fiabilidad — y que las respuestas de un solo modelo tienen más probabilidades de contener fabricaciones.
PromptQuorum automatiza esto: envía un prompt a 25+ modelos de IA simultáneamente, ejecuta un análisis de consenso sobre todas las respuestas y obtén un veredicto sobre qué afirmaciones tienen alto acuerdo (más probablemente fiables) y cuáles tienen bajo acuerdo (merecen más investigación). La herramienta señala exactamente qué afirmaciones se contradicen, muestra las afirmaciones que aparecen en solo una o dos respuestas y pondera las respuestas de los modelos según su capacidad — transformando la detección de alucinaciones de una suposición educada en un análisis estructurado y basado en datos.
Descubre cómo la IA multi-modelo reduce las alucinaciones para una explicación técnica más profunda.
Perspectivas globales sobre la gobernanza de las alucinaciones
El riesgo de alucinación y las estrategias de mitigación varían según la región y el contexto regulatorio. En Europa, la Ley de IA de la UE enfatiza la transparencia y la notificación de errores para los sistemas de IA de alto riesgo, haciendo obligatoria la documentación de alucinaciones. Mistral AI (Francia) ha construido modelos con un enfoque específico en reducir las alucinaciones en aplicaciones conformes con la UE. En China, modelos como Qwen 3 y DeepSeek tienen patrones de alucinación diferentes debido a la composición de los datos de entrenamiento y la eficiencia de tokenización para idiomas CJK (chino, japonés, coreano) — estos modelos gestionan las proporciones de token a información de forma distinta a los modelos optimizados para inglés. En Japón, las empresas que operan bajo las directrices de gobernanza de datos del METI (Ministerio de Economía, Comercio e Industria) despliegan cada vez más modelos localmente para tareas propensas a alucinaciones, con el fin de garantizar la residencia de datos y el cumplimiento normativo.
Independientemente de la región, las técnicas fundamentales (RAG, verificación por consenso, revisión humana) siguen siendo universalmente aplicables. Elige y verifica los modelos según tu contexto regulatorio y tus requisitos de idioma.
Cuándo las alucinaciones son más peligrosas
Las alucinaciones suponen un riesgo de daño significativo en dominios específicos. Ten especial cuidado con:
- Decisiones médicas y de salud — Nombres de medicamentos, dosis o interpretaciones de síntomas incorrectos pueden dañar a los pacientes
- Legal y cumplimiento normativo — Jurisprudencia inventada, requisitos regulatorios o precedentes fabricados pueden llevar a errores costosos o infracciones
- Asesoría financiera — Datos de mercado falsos, información fiscal incorrecta o métricas de rendimiento fabricadas confunden decisiones de alto riesgo
- Sistemas críticos de seguridad — Las alucinaciones en revisión de código, decisiones de arquitectura o análisis de seguridad pueden introducir vulnerabilidades o errores
- Atribución pública — Todo lo publicado bajo tu nombre o marca debe verificarse; las alucinaciones dañan la credibilidad
Principio crítico: Incluso con prompts perfectos y verificación por consenso, la verificación humana sigue siendo esencial para decisiones de alto riesgo. Usa la IA como ahorro de tiempo y herramienta de primera pasada, no como reemplazo del juicio experto o de la verificación en fuentes primarias.
Descubre cómo las técnicas de autocrítica pueden reducir aún más los errores en tareas de razonamiento complejas.
Lista de verificación práctica: antes de enviar un prompt crítico
Usa esta lista de verificación antes de enviar un prompt en el que vayas a basar decisiones o contenido público:
- ¿El prompt permite explícitamente decir "no lo sé"? Añade: "Puedes decir 'no lo sé' si no estás seguro."
- ¿Hay contexto o datos reales en el prompt? Los prompts vagos invitan a la invención. Proporciona documentos, ejemplos o datos de entrada específicos.
- ¿Las restricciones son explícitas? Indica lo que el modelo NO debe hacer, especialmente: "No inventes fuentes, URLs ni citas."
- ¿El formato de salida está estructurado? Separa Respuesta / Razonamiento / Evidencia / Confianza. Esto hace evidentes las afirmaciones sin respaldo.
- ¿Estás pidiendo fuentes? Para cualquier afirmación factual, exige: "Cita la fuente de este hecho."
- ¿La tarea es específica, no abierta? "Enumera cinco estrategias de marketing *para un producto SaaS B2B dirigido a profesionales de finanzas*" es mejor que "Cuéntame sobre marketing."
- ¿Le has pedido al modelo que se autoverifique? Añade: "Revisa tu respuesta en busca de contradicciones antes de enviarla."
- Para decisiones de alto riesgo, ¿estás verificando de forma cruzada? Envía el mismo prompt a varios modelos y compara las respuestas.
Ejemplo de prompt: antes / después
Prompt malo
Por qué falla: Abierto, sin restricciones, sin permiso para admitir incertidumbre. El modelo inventará fechas, atribuirá mal los avances, afirmará con confianza información desactualizada y potencialmente citará artículos que no existen.
Cuéntame sobre la historia de la inteligencia artificial. Incluye los principales avances e investigadores importantes.
Prompt bueno
Usando únicamente la siguiente cronología, resume los principales avances en IA de 1950 a 1990: {DATOS DE CRONOLOGÍA INSERTADOS} Formatea tu respuesta como: AVANCE: {Nombre} AÑO: {Año — solo si aparece en la cronología} IMPORTANCIA: {Qué permitió} FUENTE: {Qué documento de la cronología lo menciona?} No añadas información que no esté en la cronología. Si no estás seguro de si algo está en la cronología, omítelo en lugar de adivinar.
Por qué funciona:
- Datos reales en lugar de invención: El modelo trabaja a partir del contexto proporcionado, no de las lagunas de sus datos de entrenamiento
- Salida estructurada: El formato hace que las fuentes faltantes sean inmediatamente evidentes
- Instrucción negativa: "No añadas información que no esté en la cronología" es explícita
- Permiso para omitir: "Si no estás seguro, omítelo" elimina la presión de inventar detalles
- Responsabilidad de fuentes: Cada afirmación requiere citar de qué documento proviene
Cómo reducir las alucinaciones de la IA: 6 técnicas de prompt
- 1"Dar permiso explícito para decir 'No lo sé':" Añade a cada prompt factual: "Si no estás seguro, di 'No lo sé' en lugar de adivinar." Esto solo elimina una gran clase de fabricaciones seguras de sí mismas.
- 2"Pedir fuentes o evidencia:" Indica al modelo que cite una fuente para cada afirmación, o que marque las afirmaciones que no puede verificar. Ejemplo: "Después de cada dato, anota el nombre de la fuente o 'no verificado'."
- 3"Añadir un paso de autocrítica:" Pide al modelo que revise su propia respuesta antes de finalizarla. Ejemplo: "Antes de responder, enumera las afirmaciones en las que tengas menos del 90% de confianza."
- 4"Usar instrucciones negativas:" Prohíbe explícitamente los comportamientos propensos a alucinar. Ejemplo: "No inventes nombres, títulos ni estadísticas. No extrapoles más allá del contexto proporcionado."
- 5"Exigir razonamiento paso a paso:" El chain-of-thought prompting obliga al modelo a mostrar su razonamiento, haciendo que los errores sean detectables antes de llegar a la respuesta final.
- 6"Enviar a varios modelos con PromptQuorum:" Envía el mismo prompt a GPT-5.6, Claude y Gemini simultáneamente. Los hechos confirmados por los tres tienen alta confianza; las respuestas divergentes señalan afirmaciones que necesitan verificación.
Preguntas frecuentes
¿Se pueden eliminar completamente las alucinaciones?
No. Las alucinaciones son inherentes a cómo funcionan los modelos de lenguaje — predicen patrones de texto en lugar de recuperar hechos de un almacén verificado. Puedes reducirlas significativamente con buen diseño de prompts, herramientas como RAG y consenso multi-modelo, pero la eliminación completa no es posible con la arquitectura LLM actual. La verificación humana sigue siendo necesaria para decisiones de alto riesgo.
¿Por qué el modelo suena tan seguro cuando está equivocado?
Los modelos de lenguaje están entrenados para generar texto fluido y coherente. La seguridad es un subproducto de la coherencia lingüística. Una afirmación falsa puede ser mucho más coherente y bien articulada que una admisión honesta de incertidumbre.
¿Los modelos más nuevos y grandes alucinan menos?
Los modelos más grandes a veces alucinan más en algunas tareas porque son mejores generando texto que suena plausible, lo que hace que las afirmaciones falsas sean más difíciles de detectar. Los modelos más nuevos tienen mejor rendimiento factual en algunas tareas. La relación entre el tamaño del modelo y la alucinación depende de la tarea.
¿Conectar un modelo a internet elimina las alucinaciones?
Parcialmente. El acceso web en tiempo real ayuda con los eventos actuales y los hechos más recientes, pero no resuelve el problema central: el modelo sigue inventando detalles, malinterpretando los resultados de búsqueda o alucinando sobre contenidos que no recuperó realmente.
¿Cómo puedo verificar rápidamente si una respuesta ha alucinado?
Verifica las fuentes: haz clic en las URLs o busca los artículos citados. Si no existen, la respuesta ha alucinado. Verifica los hechos: comprueba datos, nombres y números con fuentes confiables. Compara varios modelos: haz la misma pregunta a diferentes modelos. El fuerte desacuerdo sugiere que al menos uno ha alucinado.
¿Debo dejar de usar la IA si alucina?
No. Usa la IA estratégicamente con verificación. Para el brainstorming, los borradores y el trabajo exploratorio, las alucinaciones son una molestia menor. Para el trabajo crítico de hechos (investigación, cumplimiento, decisiones médicas, asesoramiento financiero), usa la IA como punto de partida, luego verifica todo con fuentes confiables o revisión de expertos.
¿Cuál es la diferencia entre una alucinación y un error real?
Una alucinación es segura y falsa. Si un modelo dice "No estoy seguro, pero podría ser X", eso es incertidumbre honesta, no alucinación. Si dice "La capital de Francia es Berlín" con total confianza, eso es una alucinación — el modelo ha dicho algo falso como si fuera un hecho. La señal es la afirmación segura de algo no verdadero.
Material relacionado
- ¿Qué es el Prompt Engineering? — los conceptos básicos detrás de la estructuración de prompts
- Puntuación de Consenso Multi-Modelo — cómo comparar modelos detecta desacuerdos y falta de fiabilidad
- Self-Critique Prompting Techniques — cómo hacer que los modelos atrapen sus propios errores
- Limitaciones de la IA: Lo que los LLM no pueden hacer — las ocho restricciones estructurales que comparte todo LLM y la solución de ingeniería para cada una
- Fechas de corte del conocimiento de la IA, búsqueda en vivo y GEO: guía completa — el conocimiento desactualizado es una causa principal de alucinaciones; RAG y GEO como soluciones
Fuentes
- Wei, J., Wang, X., Schuurmans, D., et al. (2022). "Chain-of-Thought Prompting Elicits Reasoning in Large Language Models." ArXiv — el artículo fundacional que muestra que el razonamiento paso a paso reduce las alucinaciones en tareas de matemáticas y lógica.
- Maynez, J., Narayan, S., Hashimoto, B., & Hardt, D. (2021). "On Faithfulness and Factuality in Abstractive Summarization." ACL Proceedings — estudio empírico de las tasas y mecanismos de alucinación en la generación de texto neural.
- Anthropic (2024). "Constitutional AI." https://www.anthropic.com/constitutional-ai — el enfoque de Anthropic para reducir los outputs dañinos y las alucinaciones mediante el entrenamiento basado en principios.