FactNinja es una herramienta para el análisis de contenido visual, como carteles, memes, capturas de pantalla de comunicaciones en redes sociales, fotografías con texto, materiales de propaganda, campañas publicitarias políticas u otros tipos de visuales digitales. Tras cargar una imagen, el sistema inicia un conjunto de análisis especializados que se complementan entre sí y juntos proporcionan una visión integral del contenido examinado.
Cada análisis se centra en un aspecto diferente del material gráfico. Por ejemplo, el sistema identifica el texto contenido en la imagen, evalúa qué emociones, actitudes u opiniones el material intenta provocar en el público, reconoce afirmaciones verificables adecuadas para la verificación de hechos, evalúa la probabilidad de uso de inteligencia artificial generativa en la creación del contenido, valora la credibilidad y el carácter potencialmente engañoso del mensaje, y detecta posibles técnicas de manipulación o persuasión. El análisis también incluye la detección de metadatos disponibles, por ejemplo, a través del análisis EXIF, y la evaluación de posibles manipulaciones de la imagen, como cambios en la compresión de archivos JPG.
Esta multilayeridad es intencional. Un veredicto simple como "verdad" o "mentira" podría ser engañoso: la propaganda a menudo trabaja con declaraciones verdaderas enmarcadas de manera manipulativa, mientras que incluso la comunicación honesta puede contener formulaciones inexactas o torpes. En lugar de una conclusión definitiva, ofrecemos un desglose del contenido en capas individuales que el usuario puede ensamblar para formar su propio juicio.
Este texto explica cómo funcionan nuestras herramientas internamente: en qué principios científicos se basan, cuáles son sus fortalezas y dónde están sus límites.
Qué sucede cuando cargas una imagen para análisis
En el momento en que haces clic en Analizar, el sistema inicia en segundo plano una cascada de tareas independientes. Cada una aborda un aspecto de la imagen y se ejecuta de manera independiente: el fallo de una capa no afecta significativamente a las demás. Por ejemplo, si el reconocimiento de texto falla técnicamente en un meme muy estilizado, el análisis principal y el análisis emocional continúan. Toda la cascada suele durar desde unos pocos segundos hasta unos pocos minutos, dependiendo de la complejidad de la imagen y la carga de los servicios de IA. Mientras esperas, ves indicadores en vivo de lo que está sucediendo.
Asistentes y perspectivas de análisis
Cuando eliges un asistente al solicitar un análisis, no eliges principalmente entre diferentes modelos de lenguaje grandes (LLM), sino entre diferentes roles y perspectivas analíticas. Cada asistente está definido por un conjunto distinto de instrucciones que determinan sus prioridades, su forma de interpretar el contenido y los aspectos en los que se centra durante el análisis. El modelo representa el "motor" del análisis, mientras que el asistente determina cómo se utilizará este motor al evaluar la imagen.
El asistente predeterminado de FactNinja ofrece una perspectiva equilibrada y revisa los aspectos clave del análisis. Otros asistentes tienen sus propias especializaciones y enfoques, que se describen directamente en la aplicación al seleccionarlos.
Por lo tanto, la misma imagen analizada por diferentes asistentes puede llevar a diferentes acentos, y eso es intencional, no un error. Un material visual puede interpretarse legítimamente desde múltiples ángulos y su efecto puede variar significativamente según el público, el contexto cultural o las posturas personales del receptor.
Por ejemplo, el humor negro puede provocar diversión, alegría o un sentido de pertenencia en un grupo, mientras que en otro grupo puede causar ira, repulsión o indignación, especialmente si simpatiza con la persona o grupo que la imagen caricaturiza. Ambas reacciones pueden ser legítimas y reflejan cómo las personas perciben el mismo contenido de manera diversa. Tal diversidad de interpretaciones es una parte natural de la comunicación humana y no representa un error en el análisis.
El panel Visual Insights resume las perspectivas existentes sobre el material analizado, pero su función principal es explicar qué emociones, actitudes y reacciones el contenido puede intentar provocar en el público. No se trata solo de un resumen de análisis anteriores, sino de una capa interpretativa independiente que ayuda a comprender el efecto psicológico y comunicativo del visual.
Esta parte se basa en varios modelos científicos de trabajo con emociones e impacto mediático, que explicaremos en detalle más adelante en el texto. Gracias a esto, el mismo material puede ser visto no solo desde el punto de vista de la corrección factual, sino también desde cómo afecta a diferentes grupos de audiencia.
Cómo FactNinja analiza materiales gráficos
FactNinja utiliza varios tipos de herramientas de inteligencia artificial para analizar contenido visual. La base son modelos de lenguaje multimodales capaces de trabajar con imágenes y texto, actualmente principalmente los modelos GPT-5 y GPT-5-nano de OpenAI. Estos modelos pueden leer texto en la imagen, describir elementos visuales, reconocer relaciones entre ellos e interpretar el contenido en lenguaje natural.
Por ejemplo, si el sistema analiza un cartel con Lenin, no se trata solo de reconocer una cara conocida. El modelo también observa el estilo gráfico, la tipografía, los colores, la composición, los elementos retóricos y las conexiones históricas. Puede identificar referencias al constructivismo soviético, el lenguaje propagandístico o patrones visuales típicos de ciertos materiales políticos o ideológicos.
El análisis también incluye herramientas especializadas, como Google Vision AI y las herramientas de verificación de hechos de Google. Estas ayudan a complementar la interpretación lingüística con información técnica y contextual: pueden, por ejemplo, reconocer objetos y texto en la imagen, buscar la aparición de una imagen similar o idéntica en internet, determinar cuándo y dónde apareció la imagen, y verificar si ya ha sido evaluada en el pasado como falsa, engañosa o relacionada con noticias falsas.
Sin embargo, es importante enfatizar que la IA "no ve" la imagen de la misma manera que un humano. No tiene experiencia propia, intuición ni sensibilidad cultural en el sentido humano. Trabaja con patrones y conexiones aprendidas que ha desarrollado durante el entrenamiento en grandes conjuntos de datos textuales y visuales. Gracias a esto, puede reconocer patrones visuales, lingüísticos y significativos repetitivos, pero no es infalible.
A veces, el sistema puede atribuir un significado a la imagen que en realidad no tiene. Otras veces, puede pasar por alto un pequeño detalle, una referencia cultural, una ironía o un contexto local que un observador humano captaría de inmediato. Por lo tanto, es necesario entender el resultado del análisis como una interpretación calificada, no como un veredicto definitivo.
⚠ Principio clave: FactNinja es un asistente analítico, no un juez. Sus resultados deben servir como punto de partida para el pensamiento crítico propio. Por eso combinamos múltiples perspectivas analíticas, modelos científicos y una metodología transparente: para que el usuario tenga suficientes bases para formar su propio juicio informado.
Además del análisis textual principal, FactNinja también devuelve un resultado estructurado de los elementos clave del material analizado. Esto es importante porque permite trabajar con los resultados: visualizarlos, por ejemplo, en gráficos, mapas o diagramas de resumen, filtrarlos por categorías y utilizarlos para un procesamiento analítico adicional.
Los datos estructurados capturan varias capas clave del análisis. Temas clave representan una lista de elementos que el sistema ha reconocido en la imagen, desde objetos y personas específicos hasta estilos visuales, conceptos abstractos, marcos ideológicos o motivos de comunicación.
Afirmaciones verificables son declaraciones específicas que pueden verificarse de manera independiente utilizando fuentes disponibles. Cada afirmación puede ser etiquetada con un estado, por ejemplo, como verdadera, parcialmente verdadera, falsa, engañosa o no verificable. Esta capa ayuda a separar el nivel factual del mensaje de su impacto emocional o retórico.
Falacias lógicas detectadas señalan errores de argumentación o formas problemáticas de persuasión que pueden aparecer en el material. Están vinculadas a nuestro glosario de falacias lógicas para que las técnicas individuales puedan explicarse fácilmente, compararse y situarse en un contexto más amplio de alfabetización mediática.
El resultado estructurado también incluye un resumen laico: una explicación breve y comprensible destinada a una persona que no conoce el contexto más amplio del material analizado. Su objetivo es acercar rápidamente de qué trata la imagen, qué mensaje probablemente transmite y por qué puede ser relevante.
Visual Insights: mapeo del impacto emocional
Visual Insights es una de las funciones principales de FactNinja. Merece una explicación separada porque no se basa solo en la interpretación libre de la imagen, sino que se basa en modelos científicos utilizados en la psicología de las emociones y el análisis mediático. Estos modelos ayudan a describir qué emociones, actitudes y reacciones el material visual puede intentar provocar en el público.
La función Visual Insights se puede acceder desde cualquier análisis a través del botón Visual Insights, que abre una página separada con el perfil emocional del material analizado.
🎯 Principio clave: Visual Insights no dice lo que sientes personalmente. Describe qué efecto emocional el material probablemente intenta provocar. El mismo cartel puede despertar orgullo en un espectador, mientras que en otro puede provocar repulsión o ira. Por lo tanto, el análisis no se centra en la reacción individual de una persona específica, sino en la intención comunicativa probable y la construcción emocional del material.
La rueda de emociones de Plutchik
Uno de los modelos en los que se basa Visual Insights es la rueda de emociones de Plutchik. El psicólogo estadounidense Robert Plutchik presentó en 1980 la teoría psicoevolutiva de las emociones, según la cual las emociones no son solo construcciones culturales, sino reacciones profundamente arraigadas que se desarrollaron como parte de la supervivencia humana.
El miedo, por ejemplo, nos alerta del peligro, la ira moviliza energía para la defensa o resistencia, la alegría fomenta los lazos sociales y la confianza permite la cooperación. Plutchik distinguió ocho emociones básicas, de las cuales, según su modelo, se componen estados emocionales más complejos de manera similar a como los colores se componen de varios tonos básicos.
Estas emociones las organizó en un círculo: las emociones que están juntas tienen un significado cercano, mientras que las emociones opuestas forman antónimos. Este modelo permite describir mejor si el material trabaja, por ejemplo, con miedo, ira, repulsión, confianza, alegría o sus combinaciones.
En la aplicación, para cada una de las ocho emociones, indicamos la intensidad en una escala de 0 a 100, según la fuerza con la que el material provoca esa emoción. En el gráfico de la rueda de Plutchik, esto se muestra como una "flor florecida": cuanto más largo es el pétalo de un color determinado, más fuerte es el llamado emocional de ese tipo. Un retrato heroico de un líder con una bandera típicamente muestra altos valores de alegría, confianza y anticipación. Un cartel que advierte sobre un enemigo muestra un fuerte miedo, repulsión e ira (como en la ilustración anterior).
Diadas: emociones compuestas
La teoría de Plutchik también trabaja con combinaciones de emociones básicas. Si dos emociones adyacentes en su modelo se combinan, se crean las llamadas diadas: estados emocionales compuestos con su propio significado.
Por ejemplo, la alegría combinada con la confianza crea amor, el miedo combinado con la sorpresa puede llevar al asombro, la tristeza con repulsión crea pesar y la ira en combinación con la anticipación puede estar relacionada con la agresividad.
La sección Diadas en Visual Insights muestra cuáles de estas combinaciones emocionales son más fuertes en el material analizado. Estas emociones compuestas a menudo reflejan mejor la intención comunicativa que las emociones básicas por sí solas. El material generalmente no trabaja solo con una emoción aislada, sino con su combinación: por ejemplo, con miedo y anticipación, ira y repulsión o alegría y confianza.
Modelo de Russell: valencia y activación
El segundo fundamento científico de Visual Insights es el modelo de emociones de Russell, publicado también en 1980. El psicólogo estadounidense James A. Russell propuso que las emociones pueden describirse mediante dos dimensiones básicas: valencia y activación.
Valencia expresa si la experiencia emocional es más bien placentera o desagradable. Por ejemplo, la alegría, la confianza o la esperanza tienen una valencia positiva, mientras que el miedo, la ira o la repulsión tienen una valencia negativa.
Activación se refiere al grado de excitación o movilización interna. Algunas emociones son más tranquilas y atenuadas, como la tristeza o la confianza. Otras son altamente activadoras, como la ira, el miedo, el pánico o el entusiasmo. Esta dimensión es especialmente importante en materiales propagandísticos y políticos, que a menudo no solo buscan transmitir información, sino movilizar al público hacia una postura o acción determinada.
El modelo de Russell ayuda a distinguir no solo si el material tiene un efecto positivo o negativo, sino también si calma o activa al espectador. La combinación de valencia y activación permite comprender mejor la estrategia emocional del visual analizado.
Por ejemplo, un cartel de guerra a menudo se dirige a la zona de emociones desagradables y al mismo tiempo activadoras, es decir, al espacio de ansiedad, ira o movilización. Un cartel con un líder heroico puede dirigirse a la zona de activación positiva, como el entusiasmo, el orgullo o la alegría. Un material que muestra un país destruido y niños hambrientos probablemente se moverá hacia la ansiedad, la tristeza, la ira o la impotencia.
El mapa circular de Plutchik y el mapa bidimensional de Russell se complementan entre sí. El primer modelo ayuda a nombrar emociones básicas y compuestas específicas, el segundo muestra su orientación general según la agradabilidad o desagradabilidad y el grado de activación. Juntos, proporcionan una imagen más precisa de la estrategia emocional del visual analizado.
Nivel de manipulación
Además del análisis emocional, Visual Insights también evalúa el nivel de manipulación general. Se trata de una evaluación sintética que combina varias capas de análisis: la intensidad de las emociones provocadas, el número y tipo de técnicas retóricas o manipulativas utilizadas y la fuerza general del efecto persuasivo del material.
El indicador de manipulación de cuatro niveles muestra el nivel general de impacto manipulativo. La flecha indica dónde se encuentra el análisis actual. Un valor alto no significa automáticamente que el material mienta; muestra principalmente la fuerza del aparato persuasivo.
Por lo tanto, el nivel de manipulación no mide la veracidad del contenido. Mide la intensidad de los medios con los que el material intenta influir en la interpretación, las emociones o la reacción del público.
OCR: ¿cómo obtenemos texto de las imágenes?
Muchos materiales visuales contienen una parte significativa del mensaje directamente en el texto. Por eso, uno de los primeros pasos del análisis es su reconocimiento automático mediante tecnología OCR (Reconocimiento Óptico de Caracteres).
FactNinja utiliza modelos multimodales para el reconocimiento de texto, capaces de trabajar simultáneamente con imágenes y lenguaje. Estos sistemas no solo manejan la tipografía estándar de impresión, sino también la tipografía estilizada, elementos manuscritos, texto fotografiado en ángulo o texto capturado en baja calidad, como en capturas de pantalla de móviles.
Extracción literal
El principio básico de nuestro OCR es la fidelidad a la fuente original. Transcribimos el texto exactamente como aparece en la imagen, sin corregir errores tipográficos, sin añadir palabras faltantes y sin modificaciones lingüísticas.
Si en el cartel se utiliza una ortografía anticuada, una puntuación inusual o incluso un error tipográfico, se conserva en el resultado del OCR. Este enfoque es intencional. Consideramos el OCR principalmente como una forma de documentar la fuente, no como una transcripción editorial.
Estos detalles pueden ser importantes, por ejemplo, al fechar materiales, determinar su origen o verificar su autenticidad. Para historiadores, periodistas, investigadores y verificadores de hechos, las desviaciones lingüísticas aparentemente menores pueden representar pistas valiosas.
Traducción automática
Si el texto reconocido está en un idioma diferente al que usas en la interfaz de la aplicación, FactNinja puede mostrar tanto el texto original como su traducción.
Siempre dejamos el texto original disponible porque representa la fuente primaria de información y conserva el valor forense del material. La traducción sirve como una herramienta auxiliar para comprender el contenido y facilita el trabajo a los usuarios que no dominan el idioma en cuestión.
Gracias a la combinación de OCR, detección de idioma y traducción automática, es posible analizar materiales provenientes de diferentes entornos lingüísticos y culturales sin necesidad de utilizar herramientas de traducción externas.
Detección de IA: ¿creó la imagen inteligencia artificial?
Con la creciente disponibilidad de inteligencia artificial generativa, es importante distinguir si la imagen analizada probablemente captura una escena real o si pudo haber sido creada artificialmente. En el contexto de la propaganda, la desinformación y la comunicación política, esta es una información crucial: una fotografía de un evento real tiene un valor probatorio diferente al de una imagen generada por inteligencia artificial, incluso si a primera vista parecen similares.
Para detectar contenido generado por IA, utilizamos el servicio externo Sightengine, que devuelve la probabilidad de que la imagen haya sido creada o modificada mediante inteligencia artificial generativa. El resultado se presenta en porcentajes y sirve como un indicador orientativo, no como una prueba definitiva.
El sistema evalúa signos típicos de modelos generativos, como artefactos de imagen inusuales, irregularidades en la estructura de los objetos, detalles problemáticos en rostros, manos, texto o fondo y otros patrones visuales que aparecen con más frecuencia en imágenes sintéticamente creadas que en fotografías comunes.
Es importante enfatizar que la detección de IA no es infalible. Las imágenes generadas de alta calidad pueden parecer muy auténticas, mientras que las fotografías reales pueden, debido a la compresión, filtros, ediciones o baja calidad, contener signos similares a los artefactos de IA. Por lo tanto, el resultado de la detección de IA siempre se entiende como una de las señales contextuales que deben leerse junto con otras capas de análisis.
Es importante saber qué es lo que la detección de IA no puede hacer. Las generaciones fotorrealistas de los modelos más recientes a veces pasan desapercibidas con baja probabilidad. Las fotografías reales modificadas (Photoshop, deepfakes basados en imágenes reales) pueden no ser detectadas. Y en general, un 70 % de probabilidad de IA no significa "seguramente IA", significa "la señal de IA es fuerte, pero se necesita juicio humano". La puntuación es una herramienta para enfocar tu atención, no un veredicto automático.
Multilingüismo: análisis disponible en varios idiomas
FactNinja admite seis idiomas: checo, inglés, eslovaco, polaco, alemán y español. Los textos de los análisis y los comentarios se traducen automáticamente entre estos idiomas en segundo plano. Si un autor crea un análisis, por ejemplo, en checo, el sistema lo pone automáticamente a disposición también en los otros idiomas admitidos.
Los usuarios pueden leer el contenido en el idioma que corresponde a su configuración o preferencias. Un análisis checo de un cartel propagandístico ruso puede así ser comprensible también para el público en inglés, eslovaco, polaco, alemán o español, sin que el autor tenga que crear múltiples versiones lingüísticas manualmente.
Limitaciones de la herramienta: qué no hace FactNinja
Para poder trabajar correctamente con los resultados, es importante decir claramente lo que no se puede esperar de FactNinja. La confianza acrítica en las herramientas de IA puede llevar a conclusiones erróneas. Las expectativas correctamente establecidas las convierten en asistentes analíticos útiles.
No evaluamos la "verdad" en su totalidad
FactNinja no concluye el análisis con un veredicto simple como "verdad" o "mentira". Un material visual puede contener afirmaciones verdaderas enmarcadas de manera manipulativa, afirmaciones falsas presentadas en un tono neutral o mensajes simbólicos para los cuales la cuestión de la veracidad no tiene un sentido simple.
Visual Insights describe el impacto emocional y persuasivo del material. Los datos aumentados ayudan a identificar afirmaciones verificables específicas. Sin embargo, el juicio general queda en manos del usuario.
No capturamos todo
Los sistemas de IA pueden cometer errores. A veces atribuyen un significado al material que no tiene, otras veces pasan por alto un detalle importante, una referencia cultural o un contexto local. Por lo tanto, siempre se necesita juicio propio, comparación con otras fuentes y, en casos importantes, también consulta con expertos.
FactNinja ayuda a acelerar, clarificar y estructurar el análisis. Sin embargo, no reemplaza el pensamiento crítico humano.
No somos un sustituto del trabajo periodístico ni especializado
El análisis de un visual propagandístico o sospechoso en FactNinja no termina. La búsqueda inversa de imágenes puede ayudar a determinar de dónde proviene el material. Las bases de datos de archivos pueden mostrar cuándo apareció la imagen por primera vez. La consulta con historiadores, expertos regionales o verificadores de hechos puede complementar el contexto que la IA por sí sola puede no conocer.
FactNinja es un punto de partida. El trabajo adicional sigue siendo humano.
Fundamentos científicos
FactNinja se basa en varias teorías comprobadas en el campo de la psicología de las emociones, estudios de medios, retórica y análisis de propaganda.
Emociones y propaganda
La base del análisis emocional incluye, entre otros, el trabajo de Robert Plutchik, quien en 1980 formuló la teoría psicoevolutiva de las emociones y el modelo de ocho emociones básicas. Un punto de partida importante es también el modelo circumplex de emociones de Russell, que describe las emociones mediante dos dimensiones: valencia y activación. El trabajo de Paul Ekman sobre las emociones básicas a través de culturas también se conecta con el debate más amplio sobre las emociones universales.
Técnicas retóricas y manipulativas
Al describir los mecanismos persuasivos, nos basamos en trabajos clásicos del campo de la psicología de la persuasión y la argumentación. Robert B. Cialdini describió los principios de la influencia social, como la autoridad, la reciprocidad, la prueba social o la escasez. Steven A. McCornack formuló la teoría de la manipulación de la información, que muestra que se puede manipular no solo con mentiras, sino también con omisión, ambigüedad o desplazamiento de relevancia. Douglas Walton sistematizó el campo de la lógica informal y las falacias argumentativas.
Propaganda visual y medios
Para el análisis de la propaganda, también nos basamos en trabajos clásicos y contemporáneos de estudios de medios. Jacques Ellul es uno de los autores clave de la teoría moderna de la propaganda. Un marco más contemporáneo lo ofrece, por ejemplo, el trabajo de Jowett y O'Donnell, quienes describen la propaganda como un intento sistemático de influir en las actitudes, percepciones y comportamientos del público.
Cómo leer el análisis críticamente: tres reglas
1. Visual Insights describe la intención, no la verdad
Un alto grado de miedo, ira o ansiedad puede significar que el material trabaja con un llamado alarmante. Tal llamado puede ser justificado, por ejemplo, como una advertencia ante una amenaza real, o abusado si crea pánico artificial. Visual Insights muestra la estrategia emocional del material; la interpretación correcta la determina el contexto más amplio.
2. Manipulación no es lo mismo que mentira
Un alto nivel de manipulación significa que el material moldea fuertemente la interpretación, las emociones o la reacción del público. Sin embargo, esto no significa automáticamente que contenga falsedad. Una campaña pública bien preparada puede ser altamente persuasiva y aún así ser factualmente correcta. Por otro lado, un texto formulado tranquilamente puede contener una afirmación falsa.
Por lo tanto, entendemos la manipulación como el grado de impacto persuasivo, no como una designación automática de algo malo.
3. Más perspectivas llevan a un mejor juicio
Un material visual puede analizarse desde múltiples perspectivas. Los análisis de asistentes, Visual Insights, OCR, traducciones, datos aumentados, detección de contenido de IA o búsqueda inversa de imágenes forman capas individuales de un rompecabezas más amplio.
Ninguna de estas capas es la palabra final. El propósito de FactNinja es proporcionar herramientas, describir la metodología de manera transparente y ofrecer bases fundamentadas científicamente. La interpretación final queda en manos del usuario.
— Equipo FactNinja