La revista científica Latitude: Multidisciplinary Research Journal, editada por Quality Leadership University (QLU) en Ciudad de Panamá, ha publicado en su volumen 2, número 24 (2026), el estudio «Medición de la presencia de marca en la optimización para motores generativos: una revisión de alcance sobre métricas y validez», firmado por Néstor Romero-Ramos, Yulianna Lobach, David Abreu-Abreu, Isaac Castillo-Hernández, Juan Carlos García-Cordero y Daniel García-Cordero. El trabajo, disponible en acceso abierto, es el primer resultado publicado de la línea de investigación sobre Generative Engine Optimization (GEO) que Centria Group desarrolla junto a instituciones académicas y universitarias de cuatro países.
El artículo responde a una pregunta que el marketing digital todavía no sabe contestar con rigor: cuando un asistente de inteligencia artificial recomienda un banco, un seguro o un hotel, ¿cómo se mide si una marca está presente en esa respuesta, con qué prominencia y con qué fiabilidad? Para responderla, el equipo realizó una revisión de alcance (scoping review) siguiendo la metodología del Joanna Briggs Institute (JBI) y reportada conforme a la extensión PRISMA-ScR, que mapea de forma sistemática cómo la literatura emergente mide la presencia, la visibilidad y la citación de fuentes y marcas en los motores generativos.
«Por espacio de cerca de veinte años, la presencia en la red se evaluaba mediante una destreza muy específica: salir en un índice de opciones y recibir clics. Actualmente, las personas ya no se encuentran con diez vínculos azules; ahora obtienen una contestación condensada que agrupa y reelabora múltiples procedencias, mencionándolas de manera fragmentaria o desequilibrada. El cuestionamiento fundamental ya no se centra en si mi dirección web figura y es seleccionada, sino en si mis materiales forman parte de la contestación que el consumidor verdaderamente visualiza», señala Néstor Romero, investigador firmante de la investigación y COO de Centria Group.
Del clic a la respuesta: por qué las métricas del SEO dejan de servir
El artículo parte de una constatación que el propio corpus revisado respalda con evidencia empírica: las fuentes que cita un motor generativo se solapan poco con las que posicionan en la búsqueda tradicional, y la lógica de selección varía de un motor a otro. Dicho de otro modo, la visibilidad en Google no predice la visibilidad en un asistente generativo, lo que invalida la transferencia directa de indicadores y obliga a repensar qué se mide y cómo. A ello se suma el fenómeno «cero clics», acelerado por los resúmenes generativos integrados en los buscadores: una parte sustancial de las consultas se resuelve hoy sin que el usuario visite ningún sitio web.
«La proporción de citas constituye el indicador fundamental para el ejercicio profesional, mientras que el ámbito académico lo reduce a una sola investigación. Dicho abismo entre el sector y la academia representa un descubrimiento en sí mismo», expresó Néstor Romero.
Las cinco preguntas de investigación junto con sus respuestas
|
RQ |
Pregunta |
Respuesta del estudio |
|
RQ1 |
¿Qué familias de métricas se emplean? |
Se utilizan siete conjuntos parcialmente coincidentes —menciones o citas, relevancia o ubicación, impacto o alcance, posición en listados, consistencia, tono o enfoque, y porcentaje de citación— carentes de un esquema unificador común. |
|
RQ2 |
¿Sobre qué unidad de análisis se operacionalizan? |
Falta unanimidad: el objeto de estudio transita desde la dirección o fuente web —heredada directamente del SEO— hasta la firma o entidad, el archivo, el artículo y, en las investigaciones más actuales, el recorrido de navegación de los agentes. Aquellas investigaciones con objetos diferentes carecen de comparabilidad directa. |
|
RQ3 |
¿Cómo se controla la variabilidad estocástica de los motores? |
Únicamente una fracción menor implementa réplicas o cálculos formales del azar. La gran mayoría recurre a una única consulta o limita un periodo de tiempo, omitiendo la medición de la incertidumbre. |
|
RQ4 |
¿Qué evidencia de fiabilidad y validez se reporta? |
Ninguna investigación del conjunto somete su herramienta a comprobación psicométrica. Se observan supervisiones periféricas y fragmentarias (constancia, precisión en la fuente, contraste metodológico, solidez ante alteraciones). La consistencia entre evaluadores rara vez se documenta. |
|
RQ5 |
¿Existe un instrumento integrado y validado de presencia generativa? |
Negativo. Las pruebas estándar miden el rendimiento de estrategias o variaciones de posición, mas no la consistencia teórica de un indicador; las investigaciones iniciales desarrollan mediciones prácticas pero fragmentadas y carentes de fiabilidad comprobada. |
Cómo se hizo: cuatro rutas de búsqueda y una política explícita de preprints
Para contrarrestar las limitaciones individuales de cada estrategia, la búsqueda integró cuatro vías complementarias: un buscador impulsado por inteligencia artificial, consultas multilingües y replicables en OpenAlex, seguimiento de referencias a partir de nodos clave, y cotejo en un repositorio indexado (Web of Science; Scopus quedó fuera de alcance). Una vez eliminados los duplicados mediante el DOI —evitando el título debido a la elevada coincidencia de denominaciones genéricas en esta disciplina—, dos evaluadores examinaron los resúmenes por separado, zanjando los desacuerdos de común acuerdo. En total, se analizaron 36 documentos íntegros, seleccionándose 23 investigaciones originales junto a un par de revisiones catalogadas de manera independiente a modo de marco teórico.
«Buena parte del conocimiento generado en español sobre esta materia no llega a los circuitos internacionales. Recuperarlo no es una cuestión de exhaustividad: revela un sesgo lingüístico latente en el campo», recalcó Néstor Romero.
Siete grupos de indicadores y ningún modelo que los unifique
Siete familias de métricas parcialmente solapadas —aparición/citación, prominencia/posición, absorción/influencia, ranking en listas, estabilidad, sentimiento/encuadre y cuota de citación— quedan mapeadas en la investigación, conviviendo sin un marco integrador compartido. Asimismo, el análisis subraya que la división conceptual más fecunda dentro de este ámbito radica en diferenciar la citación (la simple selección de una fuente) de la absorción (la asimilación efectiva de sus contenidos en la respuesta), fragmentando de este modo en dos capas lo que previamente se cuantificaba mediante una lógica binaria.
La unidad de análisis cambia: de la URL a la marca y a la trayectoria de los agentes
Todavía no hay acuerdo acerca de qué se mide con precisión. Los textos muestran un cambio paulatino que va desde la procedencia o la dirección web (como legado clásico del posicionamiento web) hasta la firma o entidad, el archivo, el artículo y, en las investigaciones más recientes, hacia elementos más amplios como los recorridos de navegación de los usuarios. Dicha evolución evidencia el traslado del interrogante dentro de este ámbito, aunque esto conlleva un precio: las investigaciones basadas en elementos diferentes no se pueden contrastar de forma directa, lo cual consolida la imposibilidad de llevar a cabo un metaanálisis.
Tipología de la evidencia disponible
|
Nivel de evidencia |
Ejemplos |
Peso en el corpus |
|
Benchmark de evaluación |
GEO-Bench (Nimase et al., 2026); SAGEO Arena (Kim et al., 2026); E-GEO (Bagga et al., 2025); C-SEO Bench (Puerto et al., 2025) |
Dominante |
|
Medición primaria (motores reales) |
How to Dominate (Chen et al., 2025); Strategic GEO (Khedekar y Bansal, 2026); Quintana-Gómez (2026) |
Minoritaria |
|
Estudio aplicado / comercial |
GEO at Scale (Kumar, 2026); Brand Notability UK (Oruesagasti, 2026) |
Limitada |
Fuente: Romero-Ramos et al. (2026), Tabla 3 del artículo original. Traducción propia.
La IA no responde siempre lo mismo, y casi nadie lo mide
Debido a su naturaleza estocástica, los motores generativos son capaces de arrojar contestaciones diferentes frente a una idéntica consulta. Una evaluación certera demanda, por consecuencia, reiterar las mediciones o representar de forma explícita la incertidumbre; no obstante, una minoría escasa de las investigaciones adopta este enfoque de manera metódica. Dentro del grupo que efectivamente lo implementa sobresalen proyectos que realizan cinco ejecuciones por cada pregunta, completan doscientos exámenes junto con permutaciones de orden, aplican análisis de sensibilidad para idiomáticas y paráfrasis, o bien conciben la visibilidad bajo la forma de una distribución y no de un dato aislado. El resto de los estudios, en su gran mayoría, confía en una sola ejecución.
«Dentro de este ámbito, registrar una única ejecución carece de solidez epistemológica. Todo instrumento fiable necesita integrar la repetición y el análisis de la incertidumbre como una exigencia fundamental, más allá de considerarlo un simple detalle opcional», puntualiza Romero.
El hallazgo central: un campo que mide mucho y valida poco
El hallazgo definitivo del análisis indica que ningún artículo del corpus somete su herramienta de medición a un proceso de validación psicométrica rigurosa. En su lugar, se implementan revisiones accesorias y fragmentadas (como índices de estabilidad, certeza en la atribución, contraste metodológico por diseño o solidez frente al orden), mientras que la concordancia entre evaluadores, que constituye una condición elemental para cualquier instrumento, rara vez se documenta. Por otra parte, la validez, cuando se defiende, se apoya en la consistencia interna de referencias diseñadas específicamente para la ocasión en lugar de apoyarse en atributos de medición propiamente dichos. De este modo, se desprende la premisa fundamental del mapeo: todavía carecemos de un mecanismo unificado y contrastado capaz de cuantificar la huella generativa de marca.
Criterios de elegibilidad
|
Parámetro |
Adisión |
Descarte |
|
Enfoque |
Cuantificación u operacionalización del impacto, la presencia, la visibilidad o las menciones dentro de plataformas generativas |
Posicionamiento web tradicional, diseño asistido por ordenador (CAD), redes generativas antagónicas (GAN), motores recomendadores y demás aplicaciones ajenas a este ámbito |
|
Periodo |
2023-2026 (ámbito nativo digital) |
Previo a 2023 |
|
Idioma |
Castellano e inglés |
Idiomas restantes que carezcan de traducción accesible |
|
Clasificación |
Investigaciones originales de medición, pruebas comparativas de desempeño o análisis prácticos provistos de métricas |
Artículos de opinión, editoriales y material de índole comercial |
|
Condición |
Se aceptan preprints conforme a los criterios de sensibilidad establecidos |
Documentación informal difundida sin supervisión editorial |
Fuente: Romero-Ramos et al. (2026), Tabla 1 del artículo original. Traducción propia.
«Encontramos un campo que mide mucho y valida poco. Lo que falta no son ideas de medición, que abundan: lo que falta es validez de constructo y fiabilidad documentada. Y conviene decirlo con precisión, porque confundir un benchmark con un instrumento validado infla la aparente madurez metodológica del campo. Ese vacío es, exactamente, la oportunidad científica», afirma Néstor Romero.
Una distancia considerable entre la praxis profesional y la academia
El artículo documenta un desajuste llamativo entre lo que la industria considera central y lo que la ciencia ha formalizado. La cuota de citación (citation share) —métrica que la práctica profesional trata como decisiva y candidata natural a validez convergente— está formalizada en esencialmente un solo estudio. Y la familia de sentimiento y encuadre es igualmente escasa, pese a que el trabajo de mayor escala del corpus, que analiza más de un centenar de marcas, la identifica como la señal más inestable de todas.
«La visibilidad en Google no anticipa la presencia en un asistente generativo. Esto anula la transferencia directa de métricas y obliga a replantearse qué evaluamos y de qué manera».
«La visibilidad generativa es manipulable, y esto traslada a la medición un requisito que normalmente no se le exige: la robustez frente a la manipulación como propiedad del instrumento».
La ciencia en español, invisible: una lección metodológica
Adicionalmente, este análisis arroja una valiosa aportación metodológica que interpela directamente a los investigadores hispanohablantes. Cierta producción científica en castellano, difundida en publicaciones de Biblioteconomía y Documentación, examina la visibilidad ante la inteligencia artificial generativa desde perspectivas complementarias, tales como la inestabilidad de las marcas en sugerencias turísticas automatizadas o el acondicionamiento de repositorios universitarios para facilitar su indexación por motores conversacionales, aspectos que los estudios anglosajones hegemónicos suelen soslayar. Dicho corpus solo afloró gracias a consultas multilingües, lo que pone de manifiesto un sesgo idiomático subyacente en esta disciplina.
A esto se añade otra enseñanza derivada del procedimiento: la búsqueda en un repositorio indexado arrojó 360 resultados preliminares, de los cuales se analizaron los 136 disponibles en abierto —en su mayor parte interferencias temáticas debido a coincidencias terminológicas—, sin que se sumara ninguna nueva investigación evaluable. En pocas palabras, el ámbito se caracteriza por priorizar los preprints y sufrir una cobertura deficiente en los índices convencionales; el 64 % del conjunto inicial se publica mediante arXiv o SSRN, mientras que el 98 % carece de un cuartil catalogado.
«Este resultado lo reportamos como hallazgo metodológico y no como una limitación escondida. En un campo born-digital, la revista no funciona como indicador de calidad, y las herramientas de descubrimiento asistidas por IA tienden a infracubrir precisamente la evidencia revisada por pares y los benchmarks más relevantes. Hay que complementarlas con rastreo de citas y fuentes reproducibles», explica el investigador.
Proceso de elección de estudios (PRISMA-ScR, dos ramas)
|
Etapa |
Resultado |
|
Rama de descubrimiento (Consensus) |
70 registros identificados; 23 eliminados antes del cribado (duplicados por DOI, limpieza y falsos positivos por colisión de siglas); 47 cribados por resumen; 26 excluidos; 21 pasan a texto completo |
|
Rama de otros métodos |
18 registros adicionales (rastreo de citas, OpenAlex y verificación en base indexada); 15 candidatos a texto completo |
|
Verificación en Web of Science |
360 registros brutos; 136 revisados (acceso abierto); ningún estudio de medición elegible nuevo |
|
Evaluación a texto completo |
36 informes evaluados; 13 excluidos (fuera de alcance o sin medición directa de la presencia) |
|
Inclusión final |
23 estudios primarios incluidos en la síntesis, más 2 revisiones registradas como marco conceptual |
Fuente: elaboración propia a partir de la Figura 1 y del apartado «Selection process» de Romero-Ramos et al. (2026). Los autores detallan que las cifras correspondientes a la identificación y el cribado son definitivas, mientras que aquellas relativas a la evaluación del texto íntegro y la incorporación siguen siendo provisionales.
Se puede manipular la visibilidad generativa
Cierta parte de la investigación analizada evidencia que la exposición en los motores generativos resulta manipulable de manera adversarial, ya sea a través de tácticas de alteración de posiciones en los buscadores conversacionales o mediante la optimización discreta de prompts. Dicha investigación traslada esta conclusión al ámbito de la métrica: la solidez frente a los intentos de manipulación tendría que integrar el conjunto de atributos indispensables para cualquier herramienta de visibilidad.
«Un benchmark evalúa si una táctica funciona o si un ítem cambia de rango; no si una métrica mide válidamente un constructo. Confundir los dos niveles infla la madurez aparente del campo».
«En este ámbito, evaluar basándose en una única prueba resulta epistemológicamente endeble, ya que los motores generativos son capaces de ofrecer respuestas diferentes ante una misma consulta».
Qué viene ahora: del diagnóstico al instrumento
Los creadores del estudio deducen que el déficit hallado, concretamente en la fiabilidad documentada y en la validez de constructo, representa el hueco idóneo que legitima la creación y validación formal de un indicador propio centrado en la presencia generativa. Del mismo modo, consideran esta labor como el paso lógico que sucede al artículo difundido, descartando que se trate de un hecho ya comprobado. Precisamente, este es el camino que el grupo investiga en la etapa venidera.
«Buscamos transitar del análisis a la solución práctica: diseñar y contrastar una métrica que cualquier entidad, sin importar su magnitud, logre aplicar para medir con rigor científico el impacto de su marca cuando la inteligencia artificial genera respuestas sobre ella», señala Néstor Romero.
Limitaciones expresadas por los creadores
El texto deja claros sus propios confines: la fragilidad de los datos en un ámbito tan incipiente y plagado de preprints, lo cual vuelve provisionales sus deducciones; la imposibilidad de replicar el trayecto de hallazgo originario —contrarrestada, si bien no suprimida, mediante OpenAlex, el seguimiento de referencias y el cotejo indexado—; la acotada cobertura idiomática al inglés y al español junto a la carencia de acceso institucional para constatar en Scopus; el etiquetado efectuado de manera parcial sobre los resúmenes, con métricas de incorporación sujetas a revisión; un riesgo de circularidad, puesto que múltiples investigaciones utilizan modelos de lenguaje para evaluar su propia ejecución; y la caducidad temporal intrínseca a cualquier análisis de un sector fundamentado en tecnologías propietarias en mutación constante.
Estas restricciones resultan esenciales para interpretar correctamente los hallazgos y dimensionar el alcance de las pruebas existentes. Si deseas profundizar en la metodología, las cifras examinadas y las conclusiones del estudio, descarga el informe completo «La banca panameña ante la inteligencia artificial».