¿Puede una marca manipular su visibilidad en la IA? Un estudio científico advierte sobre los límites de las métricas actuales

¿Puede una marca manipular su visibilidad en la IA? Un estudio científico advierte sobre los límites de las métricas actuales

La publicación científica Latitude: Multidisciplinary Research Journal, dirigida por Quality Leadership University (QLU) en Ciudad de Panamá, dio a conocer dentro de su volumen 2, número 24 (2026), el estudio titulado «Medición de la presencia de marca en la optimización para motores generativos: una revisión de alcance sobre métricas y validez», el cual fue elaborado por Néstor Romero-Ramos, Yulianna Lobach, David Abreu-Abreu, Isaac Castillo-Hernández, Juan Carlos García-Cordero y Daniel García-Cordero. Dicha investigación, accesible libremente en la web, constituye el producto inicial de la línea de estudio centrada en Generative Engine Optimization (GEO) que impulsa Centria Group en colaboración con diversas entidades académicas y universitarias de cuatro naciones.

El artículo responde a una pregunta que el marketing digital todavía no sabe contestar con rigor: cuando un asistente de inteligencia artificial recomienda un banco, un seguro o un hotel, ¿cómo se mide si una marca está presente en esa respuesta, con qué prominencia y con qué fiabilidad? Para responderla, el equipo realizó una revisión de alcance (scoping review) siguiendo la metodología del Joanna Briggs Institute (JBI) y reportada conforme a la extensión PRISMA-ScR, que mapea de forma sistemática cómo la literatura emergente mide la presencia, la visibilidad y la citación de fuentes y marcas en los motores generativos.

«Durante casi dos décadas, la visibilidad digital se midió por una capacidad muy concreta: aparecer (y ser pulsado) en una lista de resultados. Hoy el usuario ya no recibe diez enlaces azules: recibe una respuesta sintetizada que integra y reformula varias fuentes, y que las cita de forma parcial o desigual. La pregunta relevante ha dejado de ser si mi enlace aparece y se pulsa, y ha pasado a ser si mi contenido está presente dentro de la respuesta que el usuario realmente lee», explica Néstor Romero, autor corresponsal del estudio y COO de Centria Group.

Del clic a la respuesta: por qué las métricas del SEO dejan de servir

El artículo parte de una constatación que el propio corpus revisado respalda con evidencia empírica: las fuentes citadas por un motor generativo coinciden escasamente con aquellas que posicionan en el buscador tradicional, mientras que la lógica de selección cambia de una plataforma a otra. Dicho de otro modo, aparecer en Google no garantiza visibilidad en un asistente conversacional, lo que descarta la transferencia directa de métricas y exige replantear tanto los indicadores como los métodos de medición. A lo anterior se añade el fenómeno «cero clics», impulsado por los resúmenes generativos que ya incorporan los buscadores: hoy en día, un porcentaje considerable de las búsquedas se satisface sin que el usuario llegue a navegar por ninguna página web.

«La proporción de citas constituye el indicador fundamental para el ejercicio profesional, mientras que el ámbito académico lo reduce a una sola investigación. Dicho abismo entre el sector y la academia representa un descubrimiento en sí mismo», expresó Néstor Romero.

 Las cinco preguntas de investigación y sus respuestas

RQ

Pregunta

Respuesta del estudio

RQ1

¿Qué familias de métricas se emplean?

Se utilizan siete conjuntos de indicadores que se superponen parcialmente —aparición/citación, relevancia/ubicación, absorción/impacto, posición en clasificaciones, consistencia, tono/encuadre y proporción de citas—, careciendo de un marco unificador común.

RQ2

¿Sobre qué unidad de análisis se operacionalizan?

Falta unanimidad: el objeto de estudio se desplaza desde el origen o URL —herencia clásica del SEO— hasta la firma o entidad, el archivo, el artículo y, en las investigaciones más recientes, el recorrido de navegación de los agentes. Aquellos análisis con elementos distintos no resultan directamente comparables.

RQ3

¿Cómo se controla la variabilidad estocástica de los motores?

Tan solo una pequeña parte implementa réplicas o un tratamiento formal de la aleatoriedad. La mayor parte recurre a una única consulta o limita un periodo de tiempo, omitiendo la medición del margen de error.

RQ4

¿Qué evidencia de fiabilidad y validez se reporta?

Ninguna investigación de la muestra somete su herramienta a contrastación psicométrica. Se observan supervisiones colaterales y fragmentadas (consistencia, precisión en la autoría, triangulación metodológica, resistencia frente al orden). El grado de acuerdo entre evaluadores rara vez se documenta.

RQ5

¿Existe un instrumento integrado y validado de presencia generativa?

Negativo. Las pruebas estándar miden el rendimiento de estrategias o variaciones de posición, mas no la validez conceptual de un índice; los trabajos originales desarrollan parámetros prácticos pero incompletos y carentes de fiabilidad comprobada.

Cómo se hizo: cuatro rutas de búsqueda y una política explícita de preprints

Para contrarrestar las limitaciones individuales de cada estrategia, la búsqueda integró cuatro vías complementarias: un buscador impulsado por inteligencia artificial, consultas multilingües y replicables en OpenAlex, seguimiento de referencias a partir de nodos clave, y cotejo en un repositorio indexado (Web of Science; Scopus quedó fuera de alcance). Una vez eliminados los duplicados mediante el DOI —evitando el título debido a la elevada coincidencia de denominaciones genéricas en esta disciplina—, dos evaluadores examinaron los resúmenes por separado, zanjando los desacuerdos de común acuerdo. En total, se analizaron 36 documentos íntegros, seleccionándose 23 investigaciones originales junto a un par de revisiones catalogadas de manera independiente a modo de marco teórico.

«Una gran porción del saber producido en castellano acerca de este asunto no logra trascender hacia los ámbitos internacionales. Rescatarlo va más allá de un simple afán de completitud: pone al descubierto un prejuicio idiomático latente dentro de la disciplina», puntualizó Néstor Romero.

Siete grupos de indicadores y ningún modelo que los unifique

Siete familias de métricas parcialmente solapadas —aparición/citación, prominencia/posición, absorción/influencia, ranking en listas, estabilidad, sentimiento/encuadre y cuota de citación— quedan mapeadas en la investigación, conviviendo sin un marco integrador compartido. Asimismo, el análisis subraya que la división conceptual más fecunda dentro de este ámbito radica en diferenciar la citación (la simple selección de una fuente) de la absorción (la asimilación efectiva de sus contenidos en la respuesta), fragmentando de este modo en dos capas lo que previamente se cuantificaba mediante una lógica binaria.

La unidad de análisis cambia de enfoque: pasa de la URL a la marca y a la trayectoria de los actores

Todavía no hay acuerdo acerca de qué se mide con precisión. Los textos muestran un cambio paulatino que va desde la procedencia o la dirección web (como legado clásico del posicionamiento web) hasta la firma o entidad, el archivo, el artículo y, en las investigaciones más recientes, hacia elementos más amplios como los recorridos de navegación de los usuarios. Dicha evolución evidencia el traslado del interrogante dentro de este ámbito, aunque esto conlleva un precio: las investigaciones basadas en elementos diferentes no se pueden contrastar de forma directa, lo cual consolida la imposibilidad de llevar a cabo un metaanálisis.

Tipología de la evidencia disponible

Grado de evidencia

Casos prácticos

Incidencia en el corpus

Evaluación por benchmark

GEO-Bench (Nimase et al., 2026); SAGEO Arena (Kim et al., 2026); E-GEO (Bagga et al., 2025); C-SEO Bench (Puerto et al., 2025)

Predominante

Métrica directa (plataformas reales)

How to Dominate (Chen et al., 2025); Strategic GEO (Khedekar y Bansal, 2026); Quintana-Gómez (2026)

Escasa

Investigación aplicada / sectorial

GEO at Scale (Kumar, 2026); Brand Notability UK (Oruesagasti, 2026)

Restringida

Fuente: Romero-Ramos et al. (2026), Tabla 3 del artículo original. Traducción propia.

La IA no siempre contesta lo mismo, y prácticamente nadie lo evalúa

Debido a que los motores generativos funcionan de manera estocástica, son capaces de arrojar contestaciones diferentes frente a una idónea consulta idéntica. Por consiguiente, lograr una evaluación confiable demanda replicar las mediciones o representar formalmente la incertidumbre. Pese a ello, tan solo una minoría de las investigaciones adopta este enfoque de modo metódico. Entre los pocos que lo implementan sobresalen proyectos que realizan cinco corridas por cada consulta, que efectúan doscientos exámenes junto con permutaciones de orden, que llevan a cabo análisis de sensibilidad orientados al idioma y a las paráfrasis, o bien aquellos que abordan la visibilidad en calidad de distribución en vez de un número estático. El resto de los trabajos, en su mayor parte, confía en una sola ejecución.

«En este ámbito, evaluar un único intento resulta epistemológicamente frágil. Todo instrumento sólido debe integrar la repetición y el cálculo de la incertidumbre desde el inicio, y no como un simple añadido», apunta Romero.

El descubrimiento principal: un campo que abarca demasiado pero certifica muy poco

La conclusión determinante del estudio es que ningún trabajo del corpus somete su instrumento de medición a validación psicométrica en sentido estricto. Lo que existe son controles adyacentes y aislados (métricas de estabilidad, fidelidad de la atribución, triangulación por diseño o robustez al orden), y la fiabilidad intercodificadores, requisito básico de cualquier instrumento, apenas se reporta. La validez, cuando se argumenta, descansa en la coherencia interna de benchmarks creados ad hoc antes que en propiedades de medición. De ahí la conclusión central del mapeo: no existe todavía un instrumento integrado y validado para medir la presencia generativa de marca.

Criterios de elegibilidad

Criterio

Inclusión

Exclusión

Foco

Medición u operacionalización de presencia, visibilidad, citación o influencia en motores generativos

SEO clásico, diseño generativo (CAD), GAN, sistemas de recomendación u otros usos ajenos al dominio

Ventana temporal

2023-2026 (campo born-digital)

Anterior a 2023

Idioma

Español e inglés

Otros idiomas sin traducción disponible

Tipo

Estudio primario de medición, benchmark de evaluación o estudio aplicado con métricas

Editoriales, artículos de opinión, contenido promocional

Estatus

Preprints admitidos bajo política de sensibilidad

Literatura gris autopublicada sin control editorial

Fuente: Romero-Ramos et al. (2026), Tabla 1 del artículo original. Traducción propia.

«Hallamos un terreno que cuantifica en exceso pero acredita de manera escasa. No escasean las propuestas de medición —de hecho, sobran—; lo que escasea es la validez de constructo junto a una fiabilidad debidamente acreditada. Cabe precisarlo con rigor, puesto que equiparar un parámetro de referencia con una herramienta contrastada eleva artificialmente la supuesta madurez metodológica de la disciplina. Precisamente ese hueco constituye la gran ocasión científica», sostiene Néstor Romero.

Una distancia considerable entre la praxis profesional y la academia

El texto expone una discrepancia notable entre aquello que el sector valora como prioritario y lo que la investigación académica ha consolidado. La participación en citas (citation share) —un indicador al que la actividad laboral otorga un carácter determinante y ve como un candidato ideal para lograr validez convergente— se sustenta fundamentalmente en una única investigación. Del mismo modo, el conjunto vinculado al sentimiento y al encuadre cuenta con un respaldo igual de limitado, a pesar de que la investigación más amplia del conjunto, la cual examina más de un centenar de marcas, la señala como el indicador más volátil de todos.

«La visibilidad en Google no garantiza la presencia en un asistente generativo, lo que invalida la transferencia directa de métricas y exige replantear tanto qué evaluamos como la manera de hacerlo».

«La visibilidad generativa se puede manipular, lo cual impone a la medición una exigencia que por regla general no se le pide: la solidez ante la manipulación en calidad de atributo del instrumento.»

La ciencia en español, invisible: una lección metodológica

Asimismo, este análisis arroja una aportación metodológica de suma relevancia para los investigadores de habla hispana. Hay un corpus de estudios en español, divulgado en publicaciones de Documentación y Biblioteconomía, que examina la exposición ante la inteligencia artificial generativa desde perspectivas diversas —tales como la inestabilidad de las marcas dentro de las sugerencias turísticas elaboradas por IA, o bien el ajuste de los repositorios académicos para facilitar su indexación por parte de plataformas generativas—, aspectos que los textos anglosajones hegemónicos suelen soslayar. Su rescate únicamente se logró por medio de consultas en varios idiomas, lo cual pone de manifiesto un sesgo idiomático subyacente en esta disciplina.

A esto se añade una segunda enseñanza derivada del propio procedimiento: el cotejo en una base indexada arrojó 360 entradas en bruto, de las cuales se examinaron las 136 disponibles en abierto —en su gran mayoría interferencias temáticas debidas a la coincidencia de palabras—, sin que se sumara ninguna nueva investigación válida de medición. En resumen, el ámbito se caracteriza por priorizar los preprints y sufrir una cobertura insuficiente en los índices convencionales; de hecho, el 64 % de los textos preliminares se divulga mediante arXiv o SSRN, mientras que el 98 % carece de un cuartil catalogado.

«Este resultado lo reportamos como hallazgo metodológico y no como una limitación escondida. En un campo born-digital, la revista no funciona como indicador de calidad, y las herramientas de descubrimiento asistidas por IA tienden a infracubrir precisamente la evidencia revisada por pares y los benchmarks más relevantes. Hay que complementarlas con rastreo de citas y fuentes reproducibles», explica el investigador.

Flujo de selección de estudios (PRISMA-ScR, dos ramas)

Fase

Resultado

Rama de descubrimiento (Consensus)

Se identificaron 70 registros; 23 se descartaron antes del filtrado (duplicados por DOI, depuración y falsos positivos debidos a colisión de siglas); 47 se sometieron a cribado por resumen; 26 se desecharon; 21 avanzaron a texto completo

Rama de otros métodos

Se sumaron 18 registros adicionales (mediante rastreo de citas, OpenAlex y comprobación en base indexada); se obtuvieron 15 candidatos para análisis de texto completo

Verificación en Web of Science

Arrojó 360 registros brutos; se revisaron 136 (por acceso abierto); no se halló ningún estudio de medición elegible nuevo

Evaluación a texto completo

Se analizaron 36 informes; 13 se descartaron por quedar fuera del alcance o carecer de medición directa de la presencia

Inclusión final

Se integraron 23 investigaciones primarias en la síntesis, además de 2 revisiones incorporadas como marco conceptual

Fuente: elaboración propia a partir de la Figura 1 y del apartado «Selection process» de Romero-Ramos et al. (2026). Las cifras de identificación y cribado se muestran definitivas, mientras que los datos de evaluación a texto completo e inclusión resultan provisionales, de acuerdo con la declaración de los autores.

Se puede manipular la visibilidad generativa

Cierta parte de la investigación analizada evidencia que la exposición en los motores generativos resulta manipulable de manera adversarial, ya sea a través de tácticas de alteración de posiciones en los buscadores conversacionales o mediante la optimización discreta de prompts. Dicha investigación traslada esta conclusión al ámbito de la métrica: la solidez frente a los intentos de manipulación tendría que integrar el conjunto de atributos indispensables para cualquier herramienta de visibilidad.

«Un benchmark evalúa si una táctica funciona o si un ítem cambia de rango; no si una métrica mide válidamente un constructo. Confundir los dos niveles infla la madurez aparente del campo».

«En este ámbito, evaluar basándose en una única prueba resulta epistemológicamente endeble, ya que los motores generativos son capaces de ofrecer respuestas diferentes ante una misma consulta».

Qué viene ahora: del diagnóstico al instrumento

Los investigadores concluyen que la carencia hallada —en lo referente a la validez de constructo y a la fiabilidad constatada— representa el resquicio que legitima la creación y validación formal de un indicador específico de presencia generativa, planteando dicha labor como la prolongación lógica del estudio difundido, y descartándola como una hipótesis ya ratificada. Se trata justamente de la senda en la que el grupo se encuentra laborando durante la etapa posterior.

«El propósito que perseguimos consiste en transitar desde el diagnóstico hasta la herramienta práctica: diseñar y contrastar un indicador accesible para cualquier tipo de empresa, sin importar su dimensión, permitiéndole medir con rigor científico el impacto de su marca en las respuestas generadas por la inteligencia artificial», señala Néstor Romero.

Limitaciones expresadas por los creadores

El texto deja claros sus propios confines: la fragilidad de los datos en una disciplina tan novísima y dominada por preprints, lo cual vuelve provisorias las deducciones; la imposibilidad de replicar el trayecto de hallazgo originario —contrarrestada, si bien no suprimida, mediante OpenAlex, el seguimiento de citas y el cotejo indexado—; el acotado radio idiomático al inglés y al castellano junto con la carencia de validación en Scopus debido a la ausencia de convenios universitarios; un etiquetado efectuado en parte sobre los resúmenes, con métricas de admisión sujetas a revisión; el riesgo de incurrir en circularidad, puesto que múltiples investigaciones utilizan inteligencias artificiales evaluadoras de su propia evaluación; y la caducidad temporal que afecta a cualquier radiografía de un ámbito sustentado en herramientas propietarias en mutación permanente.

Estas limitaciones son fundamentales para interpretar adecuadamente los resultados y comprender el alcance de la evidencia disponible. Para consultar en profundidad la metodología, los datos analizados y las conclusiones de la investigación, descarga el informe completo «La banca panameña ante la inteligencia artificial».

Por Pedro A. Silva

Noticias Relacionadas