La publicación científica Latitude: Multidisciplinary Research Journal, dirigida por Quality Leadership University (QLU) en Ciudad de Panamá, dio a conocer en su volumen 2, número 24 (2026), el estudio titulado «Medición de la presencia de marca en la optimización para motores generativos: una revisión de alcance sobre métricas y validez», el cual cuenta con las firmas de Néstor Romero-Ramos, Yulianna Lobach, David Abreu-Abreu, Isaac Castillo-Hernández, Juan Carlos García-Cordero y Daniel García-Cordero. Dicha investigación, accesible libremente en la web, constituye el pionero de los frutos difundidos dentro de la línea de estudio centrada en Generative Engine Optimization (GEO) que Centria Group impulsa de la mano de diversas entidades universitarias y académicas de cuatro naciones.
Este texto aborda una cuestión que el marketing digital actual aún no logra resolver con precisión: al sugerir un hotel, un seguro o una entidad bancaria, ¿de qué manera se evalúa la aparición de una firma en dicha contestación, qué nivel de protagonismo ostenta y cuán confiable resulta? Con el fin de despejar esta duda, el grupo llevó a cabo una revisión sistemática exploratoria (scoping review) basada en la metodología del Joanna Briggs Institute (JBI) y documentada de acuerdo con la pauta PRISMA-ScR, examinando de manera ordenada la forma en que los estudios recientes evalúan la visibilidad, la mención y la inclusión de marcas y fuentes dentro de los motores basados en inteligencia artificial.
«Casi veinte años atrás, la presencia en el entorno digital dependía de una destreza muy específica: figurar, y recibir clics, en un índice de resultados. En la actualidad, el internauta ya no se topa con diez vínculos azules, sino que obtiene una contestación elaborada que agrupa y reelabora múltiples procedencias, mencionándolas de manera fragmentaria o desequilibrada. El dilema central ya no radica en si nuestro hipervínculo sale y es accionado, sino en si la información se integra en la contestación que la persona efectivamente visualiza», señala Néstor Romero, investigador firmante del informe y COO de Centria Group.
Del clic a la respuesta: por qué las métricas del SEO dejan de servir
El texto arranca a partir de una premisa que la propia muestra analizada corrobora mediante datos empíricos: las referencias empleadas por una herramienta conversacional coinciden escasamente con los resultados orgánicos del buscador convencional, al tiempo que los criterios de elección difieren entre plataformas. En otras palabras, aparecer en los primeros puestos de Google no garantiza la presencia en un agente conversacional, circunstancia que anula la extrapolación de métricas y exige replantizar las estrategias de medición. A este escenario se une la tendencia de las búsquedas sin clics, impulsada por las síntesis automáticas dentro de los navegadores: gran parte de las dudas de los internautas se satisfacen actualmente sin que accedan a ninguna página web.
«La proporción de citas se considera una métrica clave en el ámbito profesional, mientras que en la investigación científica aparece sistematizada en una única investigación. Dicho desfase entre el sector y la academia constituye un descubrimiento por derecho propio», afirmó Néstor Romero.
Las cinco preguntas de investigación y sus respuestas
|
RQ |
Pregunta |
Respuesta del estudio |
|
RQ1 |
¿Qué familias de métricas se emplean? |
Se utilizan siete conjuntos de indicadores que se superponen parcialmente —aparición/citación, relevancia/ubicación, absorción/impacto, posición en clasificaciones, consistencia, tono/encuadre y proporción de citas—, careciendo de un marco unificador común. |
|
RQ2 |
¿Sobre qué unidad de análisis se operacionalizan? |
Falta unanimidad: el objeto de estudio se desplaza desde el origen o URL —herencia clásica del SEO— hasta la firma o entidad, el archivo, el artículo y, en las investigaciones más recientes, el recorrido de navegación de los agentes. Aquellos análisis con elementos distintos no resultan directamente comparables. |
|
RQ3 |
¿Cómo se controla la variabilidad estocástica de los motores? |
Tan solo una pequeña parte implementa réplicas o un tratamiento formal de la aleatoriedad. La mayor parte recurre a una única consulta o limita un periodo de tiempo, omitiendo la medición del margen de error. |
|
RQ4 |
¿Qué evidencia de fiabilidad y validez se reporta? |
Ninguna investigación de la muestra somete su herramienta a contrastación psicométrica. Se observan supervisiones colaterales y fragmentadas (consistencia, precisión en la autoría, triangulación metodológica, resistencia frente al orden). El grado de acuerdo entre evaluadores rara vez se documenta. |
|
RQ5 |
¿Existe un instrumento integrado y validado de presencia generativa? |
Negativo. Las pruebas estándar miden el rendimiento de estrategias o variaciones de posición, mas no la validez conceptual de un índice; los trabajos originales desarrollan parámetros prácticos pero incompletos y carentes de fiabilidad comprobada. |
Cómo se hizo: cuatro rutas de búsqueda y una política explícita de preprints
Cuatro vías complementarias integraron la búsqueda, ideadas para contrarrestar los puntos débiles de cada método: un sistema de hallazgo impulsado por inteligencia artificial, búsquedas multilingües y replicables en OpenAlex, seguimiento de referencias mediante nodos clave y comprobación en una plataforma indexada (Web of Science; Scopus no estuvo disponible). Una vez eliminados los duplicados por DOI —evitando el título debido a los frecuentes conflictos entre denominaciones genéricas dentro de esta disciplina—, dos evaluadores filtraron los registros analizando los resúmenes de manera autónoma, logrando acuerdos consensuados ante cualquier desacuerdo. Treinta y seis informes completos fueron valorados, seleccionándose veintitrés investigaciones principales, además de un par de revisiones catalogadas de forma independiente a modo de sustento teórico.
«Una gran porción del saber producido en español acerca de este tema no logra trascender hacia los circuitos globales. Rescatarlo va más allá de un asunto de mera exhaustividad: pone de manifiesto un sesgo idiomático subyacente en la disciplina», subrayó Néstor Romero.
Siete grupos de indicadores y ningún modelo que los unifique
Siete familias de métricas parcialmente solapadas —aparición/citación, prominencia/posición, absorción/influencia, ranking en listas, estabilidad, sentimiento/encuadre y cuota de citación— quedan mapeadas en la investigación, conviviendo sin un marco integrador compartido. Asimismo, el análisis subraya que la división conceptual más fecunda dentro de este ámbito radica en diferenciar la citación (la simple selección de una fuente) de la absorción (la asimilación efectiva de sus contenidos en la respuesta), fragmentando de este modo en dos capas lo que previamente se cuantificaba mediante una lógica binaria.
La unidad de análisis cambia: de la URL a la marca y a la trayectoria de los agentes
No existe acuerdo universal acerca de lo que se mide con precisión. El corpus muestra una evolución constante que parte de la fuente o la URL —como legado tradicional del SEO— y avanza hacia la marca o entidad, el documento, el artículo y, en las investigaciones más recientes, alcanza unidades de categoría superior como el recorrido de navegación de los agentes. Dicho cambio pone de manifiesto la transformación de la cuestión analítica, aunque esto conlleva un precio: las investigaciones basadas en unidades diversas no resultan directamente equiparables, lo cual imposibilita la ejecución de un metaanálisis.
Clasificación de los datos probatorios accesibles
|
Grado de evidencia |
Casos prácticos |
Incidencia en el corpus |
|
Evaluación por benchmark |
GEO-Bench (Nimase et al., 2026); SAGEO Arena (Kim et al., 2026); E-GEO (Bagga et al., 2025); C-SEO Bench (Puerto et al., 2025) |
Predominante |
|
Métrica directa (plataformas reales) |
How to Dominate (Chen et al., 2025); Strategic GEO (Khedekar y Bansal, 2026); Quintana-Gómez (2026) |
Escasa |
|
Investigación aplicada / sectorial |
GEO at Scale (Kumar, 2026); Brand Notability UK (Oruesagasti, 2026) |
Restringida |
Fuente: Romero-Ramos et al. (2026), Tabla 3 del manuscrito original. Versión propia.
La IA no responde siempre lo mismo, y casi nadie lo mide
Los motores generativos son estocásticos: pueden ofrecer respuestas distintas ante la misma pregunta. Una medición fiable exige, por tanto, repetir las mediciones o modelar explícitamente la incertidumbre. Sin embargo, solo una minoría de los estudios lo hace de forma sistemática. Entre quienes sí lo aplican destacan trabajos con cinco ejecuciones por consulta, con 200 evaluaciones y permutaciones de orden, con análisis de sensibilidad para idioma y paráfrasis, o que tratan la visibilidad como una distribución en lugar de como un valor puntual. La mayoría restante se apoya en una única ejecución.
«Una medición de una sola ejecución es, en este dominio, epistemológicamente frágil. Cualquier instrumento robusto tiene que incorporar la repetición y la modelización de la incertidumbre como requisito, no como un refinamiento opcional», señala Romero.
El descubrimiento principal: un campo que abarca demasiado pero certifica muy poco
El hallazgo fundamental de la investigación revela que ningún análisis del conjunto somete su herramienta de medición a un proceso riguroso de validación psicométrica. En su lugar, se implementan revisiones periféricas y fragmentadas (indicadores de estabilidad, consistencia en la asignación, contrastación metodológica o resistencia a alteraciones secuenciales), mientras que la concordancia entre evaluadores —un estándar elemental para cualquier recurso de este tipo— rara vez se documenta. Por otro lado, cuando se justifica la validez, esta se apoya en la consistencia interna de referencias diseñadas específicamente para la ocasión en lugar de basarse en atributos métricos formales. De este modo, la deducción principal del mapeo es contundente: todavía no se cuenta con un instrumento consolidado y contrastado que permita evaluar la huella generativa de marca.
Requisitos de admisión
| Criterio | Inclusión | Exclusión |
| Foco | Medición u operacionalización de presencia, visibilidad, citación o influencia en motores generativos | SEO clásico, diseño generativo (CAD), GAN, sistemas de recomendación u otros usos ajenos al dominio |
| Ventana temporal | 2023-2026 (campo born-digital) | Anterior a 2023 |
| Idioma | Español e inglés | Otros idiomas sin traducción disponible |
| Tipo | Estudio primario de medición, benchmark de evaluación o estudio aplicado con métricas | Editoriales, artículos de opinión, contenido promocional |
| Estatus | Preprints admitidos bajo política de sensibilidad | Literatura gris autopublicada sin control editorial |
Fuente: Romero-Ramos et al. (2026), Tabla 1 del artículo original. Traducción propia.
«Hallamos un terreno que cuantifica en exceso pero acredita de manera escasa. No escasean las propuestas de medición —de hecho, sobran—; lo que escasea es la validez de constructo junto a una fiabilidad debidamente acreditada. Cabe precisarlo con rigor, puesto que equiparar un parámetro de referencia con una herramienta contrastada eleva artificialmente la supuesta madurez metodológica de la disciplina. Precisamente ese hueco constituye la gran ocasión científica», sostiene Néstor Romero.
Existe una separación entre la enseñanza académica y la labor profesional
El texto expone una discrepancia notable entre aquello que el sector valora como prioritario y lo que la investigación académica ha consolidado. La participación en citas (citation share) —un indicador al que la actividad laboral otorga un carácter determinante y ve como un candidato ideal para lograr validez convergente— se sustenta fundamentalmente en una única investigación. Del mismo modo, el conjunto vinculado al sentimiento y al encuadre cuenta con un respaldo igual de limitado, a pesar de que la investigación más amplia del conjunto, la cual examina más de un centenar de marcas, la señala como el indicador más volátil de todos.
«a visibilidad en Google no predice la visibilidad en un asistente generativo. Eso invalida la transferencia directa de indicadores y obliga a repensar qué medimos y cómo».
«La visibilidad generativa es manipulable, y esto traslada a la medición un requisito que normalmente no se le exige: la robustez frente a la manipulación como propiedad del instrumento».
La ciencia en español, invisible: una lección metodológica
Asimismo, este análisis arroja una aportación metodológica de suma relevancia para los investigadores de habla hispana. Hay un corpus de estudios en español, divulgado en publicaciones de Documentación y Biblioteconomía, que examina la exposición ante la inteligencia artificial generativa desde perspectivas diversas —tales como la inestabilidad de las marcas dentro de las sugerencias turísticas elaboradas por IA, o bien el ajuste de los repositorios académicos para facilitar su indexación por parte de plataformas generativas—, aspectos que los textos anglosajones hegemónicos suelen soslayar. Su rescate únicamente se logró por medio de consultas en varios idiomas, lo cual pone de manifiesto un sesgo idiomático subyacente en esta disciplina.
A esto se añade otra enseñanza derivada del procedimiento: el cotejo en una base de datos indexada arrojó 360 entradas en bruto, de las cuales se examinaron 136 de libre acceso —en su gran mayoría interferencias temáticas debidas a la coincidencia de palabras—, sin que se sumara ninguna investigación de medición apta y novedosa. En resumen, este ámbito prioriza los preprints y su cobertura en los índices convencionales resulta insuficiente; de hecho, el 64 % del conjunto de candidatos se publica mediante arXiv o SSRN, mientras que el 98 % carece de un cuartil indexado.
«Este resultado lo reportamos como hallazgo metodológico y no como una limitación escondida. En un campo born-digital, la revista no funciona como indicador de calidad, y las herramientas de descubrimiento asistidas por IA tienden a infracubrir precisamente la evidencia revisada por pares y los benchmarks más relevantes. Hay que complementarlas con rastreo de citas y fuentes reproducibles», explica el investigador.
Proceso de elección de los estudios (PRISMA-ScR, dos vías)
|
Etapa |
Resultado |
|
Rama de descubrimiento (Consensus) |
70 registros identificados; 23 eliminados antes del cribado (duplicados por DOI, limpieza y falsos positivos por colisión de siglas); 47 cribados por resumen; 26 excluidos; 21 pasan a texto completo |
|
Rama de otros métodos |
18 registros adicionales (rastreo de citas, OpenAlex y verificación en base indexada); 15 candidatos a texto completo |
|
Verificación en Web of Science |
360 registros brutos; 136 revisados (acceso abierto); ningún estudio de medición elegible nuevo |
|
Evaluación a texto completo |
36 informes evaluados; 13 excluidos (fuera de alcance o sin medición directa de la presencia) |
|
Inclusión final |
23 estudios primarios incluidos en la síntesis, más 2 revisiones registradas como marco conceptual |
Fuente: elaboración propia a partir de la Figura 1 y del apartado «Selection process» de Romero-Ramos et al. (2026). Las cifras de identificación y cribado se muestran definitivas, mientras que los datos de evaluación a texto completo e inclusión resultan provisionales, de acuerdo con la declaración de los autores.
Se puede manipular la visibilidad generativa
Un subconjunto de los trabajos revisados demuestra que la visibilidad en motores generativos es manipulable de forma adversarial, mediante técnicas de manipulación del ranking en buscadores conversacionales o mediante optimización sigilosa de prompts. El estudio traslada esa evidencia al terreno de la medición: la robustez frente a la manipulación debería formar parte de las propiedades exigibles a cualquier instrumento de presencia.
«Una prueba de rendimiento comprueba si una estrategia da resultado o si un elemento varía de posición, pero no determina si un indicador mide con validez un concepto. Mezclar ambos planos exagera la falsa sensación de madurez de la disciplina».
«En este ámbito, evaluar basándose en una única prueba resulta epistemológicamente endeble, ya que los motores generativos son capaces de ofrecer respuestas diferentes ante una misma consulta».
Qué viene ahora: del diagnóstico al instrumento
Los autores concluyen que el vacío detectado —en validez de constructo y en fiabilidad documentada— constituye la apertura que justifica desarrollar y validar formalmente un índice específico de presencia generativa, y sitúan esa tarea como la continuación natural del trabajo publicado, y no como una afirmación ya demostrada. Es precisamente la línea en la que el equipo trabaja en la fase siguiente.
«Nuestro propósito consiste en transitar desde el diagnóstico hasta la utilidad práctica: diseñar y contrastar un indicador que cualquier entidad, independientemente de su dimensión, logre emplear para medir con rigor científico el posicionamiento de su marca cada vez que la inteligencia artificial emita una respuesta al respecto», señala Néstor Romero.
Limitaciones expresadas por los creadores
El artículo reconoce abiertamente sus propias fronteras: la precariedad de los cimientos empíricos en una disciplina tan novísima y copada por preprints, lo cual vuelve provisorias las deducciones; la imposibilidad de replicar el trayecto de hallazgo original —atenuada, sin desaparecer por completo, gracias a OpenAlex, el seguimiento de citas y el cotejo indexado—; el acotamiento idiomático a inglés y castellano junto con la carencia de acceso institucional para validar en Scopus; un etiquetado ejecutado en parte sobre los resúmenes, con métricas de incorporación sujetas a revisión; un riesgo inminente de circularidad, puesto que múltiples investigaciones utilizan modelos de lenguaje para evaluar su propio desempeño; y la caducidad temporal intrínseca a cualquier radiografía de un sector que se sustenta sobre herramientas propietarias en mutación permanente.
Resulta indispensable considerar estas restricciones con el fin de evaluar correctamente los hallazgos y dimensionar el alcance de las pruebas existentes. Si deseas profundizar en la metodología, las cifras examinadas y las conclusiones del estudio, descarga el informe completo «La banca panameña ante la inteligencia artificial».


