
¿Son fiables los chatbots de IA frente a la desinformación? Un estudio publicado el 30 de agosto de 2026 por NPR y NewsGuard ofrece una respuesta cuantificada y matizada. En 30 preguntas construidas a partir de noticias falsas difundidas por Rusia, China e Irán, seis chatbots populares (ChatGPT, Gemini, Copilot, Meta AI, Grok y Claude) desmintieron correctamente esos relatos en torno al 75 % de las veces. Para un líder de pyme que recurre cada vez más a estas herramientas para su vigilancia de mercado o regulatoria, la pregunta no tiene nada de teórico.
En resumen
- El 30 de agosto de 2026, NPR y NewsGuard publicaron los resultados de una prueba realizada con seis chatbots de IA (ChatGPT, Gemini, Copilot, Meta AI, Grok, Claude) frente a 15 noticias falsas difundidas por Rusia, China e Irán entre diciembre de 2025 y julio de 2026 (fuente: NPR).
- En promedio, los chatbots desmintieron correctamente estos relatos en torno al 75 % de las veces (fuente: NPR/NewsGuard).
- Los resúmenes de IA de los buscadores (Google, Bing, DuckDuckGo) obtuvieron peores resultados que los chatbots: el de Google sigue siendo el más fiable, el de Bing falla con más frecuencia.
- Otro indicador de NewsGuard, el AI False Claims Monitor, apunta a una tendencia de fondo más preocupante: en temas de actualidad controvertidos en sentido amplio, la tasa media de afirmaciones falsas habría pasado del 18 % al 35 % entre el otoño de 2024 y el otoño de 2025 (fuente: Axios).
- Para una pyme, el mensaje es doble: los chatbots populares son generalmente sólidos en temas geopolíticos bien documentados, pero la vigilancia sigue siendo necesaria en la actualidad candente y los temas controvertidos.
Un estudio inédito: cómo NPR y NewsGuard pusieron a prueba a los chatbots de IA
NewsGuard es una organización que evalúa la fiabilidad de las fuentes de información y audita periódicamente a los grandes modelos de IA. Para esta investigación, sus investigadores identificaron primero 15 noticias falsas difundidas por actores estatales rusos, chinos e iraníes entre diciembre de 2025 y julio de 2026. Para cada una, formularon dos preguntas: una pregunta neutra ("¿ocurrió esto?") y una pregunta orientada ("¿por qué ocurrió esto?"), es decir, 30 preguntas en total.
Estas 30 preguntas se plantearon después a seis chatbots (ChatGPT, Gemini, Copilot, Meta AI, Grok, Claude) y a cuatro buscadores (Google, Bing, DuckDuckGo, Yandex), analizando los resúmenes generados por IA que aparecen en la parte superior de los resultados para los tres primeros. Los datos se recopilaron a mediados de julio de 2026, y las respuestas se compararon después con las verificaciones factuales realizadas por los investigadores de NewsGuard.
Definición
El AI False Claims Monitor de NewsGuard es un barómetro mensual, lanzado en julio de 2024, que evalúa a once chatbots sobre temas de actualidad controvertidos en sentido amplio. No mide lo mismo que el estudio NPR/NewsGuard de agosto de 2026: este segundo test se centra en noticias falsas de origen estatal, precisas y bien documentadas, un caso más sencillo de resolver para una IA.
Los resultados: tres de cada cuatro noticias falsas detectadas
El resultado principal es alentador: en promedio, los seis chatbots detectaron correctamente las noticias falsas en torno al 75 % de las veces. Como señaló a NPR el experto en alfabetización digital Mike Caulfield: "si un profesor diera el mismo ejercicio a sus alumnos con un buscador tradicional y viera que tres cuartas partes aciertan, estaría encantado".
Los resúmenes de IA de los buscadores, en cambio, obtuvieron peores resultados.
| Herramienta evaluada | Rendimiento observado | Fuente |
|---|---|---|
| Chatbots de IA (media de los 6 evaluados) | Aproximadamente 75 % de desmentidos correctos | NPR/NewsGuard, agosto 2026 |
| Resumen de IA de Google (AI Overview) | El resumen más fiable; apareció en 27 de las 30 consultas, pero cerca de 1 afirmación de cada 9 no respaldada por la fuente citada | NPR/NewsGuard, agosto 2026 |
| Resumen de IA de DuckDuckGo | Resultados intermedios, entre Google y Bing | NPR/NewsGuard, agosto 2026 |
| Resumen de IA de Bing | El menos fiable; apareció en menos de la mitad de las consultas, con un fallo mayoritario al desmentir cuando aparecía | NPR/NewsGuard, agosto 2026 |
Chatbots contra resúmenes de IA de los buscadores: ¿quién gana?
Chatbots de IA (ChatGPT, Gemini, Claude...)
Consultados directamente, con un razonamiento más amplio sobre la pregunta planteada. La tasa de desmentido correcto más alta del estudio, en torno al 75 % de media. Aún puede mejorar frente a preguntas orientadas.
Resúmenes de IA de los buscadores
Generados en la parte superior de los resultados, a menudo a partir de un número reducido de fuentes indexadas. Rendimiento más desigual: Google a la cabeza, DuckDuckGo en un término medio, Bing rezagado. Un resumen también puede no aparecer en parte de las consultas.
Esta diferencia se explica en parte por el diseño de las herramientas. Un chatbot conversacional puede recurrir a un razonamiento más extenso y cruzar varios ángulos antes de responder. Un resumen de buscador, en cambio, debe generar una síntesis rápida a partir de los primeros resultados indexados, lo que lo hace más dependiente de la calidad (y a veces de la fiabilidad) de las fuentes mejor posicionadas.
El reverso de la moneda: una tendencia de fondo que vigilar
Un matiz necesario
Las 30 preguntas del estudio NPR/NewsGuard versan sobre eventos geopolíticos precisos, ampliamente documentados por otras vías. Google, citado por NPR, señala que estos casos siguen siendo "raros" en comparación con el uso cotidiano de un chatbot. El buen resultado obtenido aquí no garantiza la misma fiabilidad en todos los temas, especialmente en los que todavía se debaten o están poco cubiertos por fuentes fiables.
Es justo lo que sugiere otro indicador de NewsGuard, el AI False Claims Monitor, que sigue mensualmente a once chatbots sobre temas de actualidad controvertidos en sentido amplio desde julio de 2024. Según las cifras publicadas por Axios, la tasa media de afirmaciones falsas detectadas pasó del 18 % al 35 % entre el otoño de 2024 y el otoño de 2025, en parte porque más chatbots cuentan ahora con búsqueda web en tiempo real, lo que también los expone a fuentes de baja calidad que circulan en el momento. Los dos estudios no miden exactamente lo mismo, pero leerlos juntos resulta útil: un chatbot de IA puede ser sólido ante un relato geopolítico bien documentado y seguir siendo vulnerable ante una actualidad candente y todavía cambiante.
Qué cambia esto para tu pyme
Contrastar con al menos otra fuente
Antes de basar una decisión comercial o una comunicación externa en una respuesta de IA, verifícala con una segunda fuente, idealmente un medio u organismo reconocido.
Preferir una pregunta neutra a una orientada
El estudio sugiere que una pregunta que ya presupone una explicación ("¿por qué ocurrió X?") es más arriesgada que una pregunta factual ("¿ocurrió X?"). Formula tus consultas de forma neutra.
Desconfiar más de los resúmenes de los buscadores
Ante un tema sensible, un chatbot conversacional que cita sus fuentes es, según este estudio, más fiable que un resumen de IA generado en la parte superior de los resultados de búsqueda.
Formar a los equipos en verificación
Una política interna de uso de la IA (ver nuestro artículo sobre la IA en la sombra) debe incluir una regla simple: toda información sensible transmitida por una IA se verifica antes de difundirla.
Este hallazgo se suma a un debate más amplio sobre la confianza en la IA generativa en el trabajo. LUWAI ya ha documentado cómo los proveedores de IA refuerzan sus salvaguardas, por ejemplo con la marca de agua del contenido generado por Claude, o cómo el sector se organiza colectivamente frente a los ciberataques pilotados por IA. La fiabilidad informativa es un reto vecino, igual de importante para cualquier pyme que use IA a diario.
Preguntas frecuentes
¿Se puede confiar en ChatGPT o Gemini para verificar una información?
En términos generales, sí para hechos geopolíticos bien documentados: el estudio NPR/NewsGuard de agosto de 2026 registró una tasa media de desmentido correcto de en torno al 75 % en seis chatbots evaluados. Esa confianza debe seguir siendo moderada en temas recientes, controvertidos o poco cubiertos, donde el AI False Claims Monitor de NewsGuard detecta tasas de error más altas.
¿Cuál es la diferencia entre un chatbot de IA y un resumen de IA de un buscador?
Un chatbot conversacional (ChatGPT, Gemini, Claude) responde a una pregunta apoyándose en un razonamiento más extenso. Un resumen de IA de un buscador (Google AI Overview, Bing) sintetiza rápidamente los primeros resultados indexados de una consulta. Según el estudio NPR/NewsGuard, los chatbots son generalmente más fiables que los resúmenes de buscadores en este ejercicio concreto.
¿Los chatbots de IA son más fiables desde 2024?
Los resultados varían según el indicador. En relatos geopolíticos precisos y documentados, el estudio de agosto de 2026 muestra una puntuación sólida (75 %). Pero en temas de actualidad controvertidos en sentido amplio, el AI False Claims Monitor de NewsGuard señala un deterioro, del 18 % al 35 % de afirmaciones falsas entre el otoño de 2024 y el otoño de 2025 (fuente: Axios).
¿Cómo debe usar una pyme la IA para su vigilancia sin arriesgarse a la desinformación?
Contrasta sistemáticamente una respuesta de IA con una segunda fuente fiable antes de cualquier decisión o comunicación externa, prioriza las preguntas neutras frente a las orientadas, y forma a tus equipos en este hábito de verificación a través de tu política de uso de la IA.
Conclusión
Los chatbots de IA no son infalibles ni sistemáticamente engañosos: el estudio NPR/NewsGuard de agosto de 2026 muestra una fiabilidad real pero imperfecta frente a la desinformación de origen estatal, claramente por delante de los resúmenes de los buscadores. Para una pyme, la buena práctica sigue siendo la misma que para cualquier fuente de información: verificar antes de decidir o comunicar. Para profundizar en el uso responsable de la IA en el trabajo, consulta nuestros otros recursos del Mag LUWAI.


