La publicación científica Latitude: Multidisciplinary Research Journal, dirigida por Quality Leadership University (QLU) en Ciudad de Panamá, dio a conocer en su volumen 2, número 24 (2026), el estudio titulado «Medición de la presencia de marca en la optimización para motores generativos: una revisión de alcance sobre métricas y validez», el cual cuenta con las firmas de Néstor Romero-Ramos, Yulianna Lobach, David Abreu-Abreu, Isaac Castillo-Hernández, Juan Carlos García-Cordero y Daniel García-Cordero. Dicha investigación, accesible libremente en la web, constituye el pionero de los frutos difundidos dentro de la línea de estudio centrada en Generative Engine Optimization (GEO) que Centria Group impulsa de la mano de diversas entidades universitarias y académicas de cuatro naciones.
Este texto aborda una cuestión que el marketing digital actual aún no logra resolver con precisión: al sugerir un hotel, un seguro o una entidad bancaria, ¿de qué manera se evalúa la aparición de una firma en dicha contestación, qué nivel de protagonismo ostenta y cuán confiable resulta? Con el fin de despejar esta duda, el grupo llevó a cabo una revisión sistemática exploratoria (scoping review) basada en la metodología del Joanna Briggs Institute (JBI) y documentada de acuerdo con la pauta PRISMA-ScR, examinando de manera ordenada la forma en que los estudios recientes evalúan la visibilidad, la mención y la inclusión de marcas y fuentes dentro de los motores basados en inteligencia artificial.
«Por espacio de cerca de veinte años, la presencia en la red se evaluaba mediante una destreza muy específica: salir en un índice de opciones y recibir clics. Actualmente, las personas ya no se encuentran con diez vínculos azules; ahora obtienen una contestación condensada que agrupa y reelabora múltiples procedencias, mencionándolas de manera fragmentaria o desequilibrada. El cuestionamiento fundamental ya no se centra en si mi dirección web figura y es seleccionada, sino en si mis materiales forman parte de la contestación que el consumidor verdaderamente visualiza», señala Néstor Romero, investigador firmante de la investigación y COO de Centria Group.
Del clic a la respuesta: por qué las métricas del SEO dejan de servir
El artículo parte de una constatación que el propio corpus revisado respalda con evidencia empírica: las fuentes citadas por un motor generativo coinciden escasamente con aquellas que posicionan en el buscador tradicional, mientras que la lógica de selección cambia de una plataforma a otra. Dicho de otro modo, aparecer en Google no garantiza visibilidad en un asistente conversacional, lo que descarta la transferencia directa de métricas y exige replantear tanto los indicadores como los métodos de medición. A lo anterior se añade el fenómeno «cero clics», impulsado por los resúmenes generativos que ya incorporan los buscadores: hoy en día, un porcentaje considerable de las búsquedas se satisface sin que el usuario llegue a navegar por ninguna página web.
«La cuota de citación es la métrica que la práctica profesional trata como central, y en la literatura académica está formalizada en un único estudio. Esa brecha entre industria y academia es en sí misma un hallazgo», dijo Néstor Romero.
Las cinco preguntas de investigación junto con sus respuestas
|
RQ |
Pregunta |
Respuesta del estudio |
|
RQ1 |
¿Qué familias de métricas se emplean? |
Siete familias parcialmente solapadas —aparición/citación, prominencia/posición, absorción/influencia, ranking en listas, estabilidad, sentimiento/encuadre y cuota de citación— sin ningún marco integrador compartido. |
|
RQ2 |
¿Sobre qué unidad de análisis se operacionalizan? |
No hay consenso: la unidad migra de la fuente/URL —herencia directa del SEO— hacia la marca o entidad, el documento, el producto y, en los trabajos más recientes, la trayectoria de navegación de agentes. Estudios con unidades distintas no son directamente comparables. |
|
RQ3 |
¿Cómo se controla la variabilidad estocástica de los motores? |
Solo una minoría aplica repetición o modelización explícita de la incertidumbre. La mayoría se apoya en una única ejecución o en acotar una ventana temporal, sin cuantificar la incertidumbre. |
|
RQ4 |
¿Qué evidencia de fiabilidad y validez se reporta? |
Ningún estudio del corpus somete su instrumento a validación psicométrica. Existen controles adyacentes y aislados (estabilidad, fidelidad de la atribución, triangulación por diseño, robustez al orden). La fiabilidad intercodificadores apenas se reporta. |
|
RQ5 |
¿Existe un instrumento integrado y validado de presencia generativa? |
No. Los benchmarks evalúan la eficacia de tácticas o cambios de rango, no la validez de constructo de una medida; los estudios primarios operacionalizan métricas útiles pero parciales y sin fiabilidad documentada. |
Cómo se hizo: cuatro rutas de búsqueda y una política explícita de preprints
Para contrarrestar las limitaciones individuales de cada estrategia, la búsqueda integró cuatro vías complementarias: un buscador impulsado por inteligencia artificial, consultas multilingües y replicables en OpenAlex, seguimiento de referencias a partir de nodos clave, y cotejo en un repositorio indexado (Web of Science; Scopus quedó fuera de alcance). Una vez eliminados los duplicados mediante el DOI —evitando el título debido a la elevada coincidencia de denominaciones genéricas en esta disciplina—, dos evaluadores examinaron los resúmenes por separado, zanjando los desacuerdos de común acuerdo. En total, se analizaron 36 documentos íntegros, seleccionándose 23 investigaciones originales junto a un par de revisiones catalogadas de manera independiente a modo de marco teórico.
«Buena parte del conocimiento generado en español sobre esta materia no llega a los circuitos internacionales. Recuperarlo no es una cuestión de exhaustividad: revela un sesgo lingüístico latente en el campo», recalcó Néstor Romero.
Siete grupos de indicadores y ningún modelo que los unifique
El mapeo identifica siete familias de métricas parcialmente solapadas —aparición/citación, prominencia/posición, absorción/influencia, ranking en listas, estabilidad, sentimiento/encuadre y cuota de citación— que conviven sin un marco integrador compartido. El estudio destaca además que la frontera conceptual más fértil del campo es la distinción entre citación (que una fuente sea seleccionada) y absorción (que su contenido se incorpore efectivamente al texto de la respuesta), un desdoblamiento en dos capas de lo que antes se medía como un binario.
El foco analítico se desplaza: de la URL hacia la marca y el recorrido de los agentes
Todavía no hay acuerdo acerca de qué se mide con precisión. Los textos muestran un cambio paulatino que va desde la procedencia o la dirección web (como legado clásico del posicionamiento web) hasta la firma o entidad, el archivo, el artículo y, en las investigaciones más recientes, hacia elementos más amplios como los recorridos de navegación de los usuarios. Dicha evolución evidencia el traslado del interrogante dentro de este ámbito, aunque esto conlleva un precio: las investigaciones basadas en elementos diferentes no se pueden contrastar de forma directa, lo cual consolida la imposibilidad de llevar a cabo un metaanálisis.
Tipología de la evidencia disponible
|
Nivel de evidencia |
Ejemplos |
Peso en el corpus |
|
Benchmark de evaluación |
GEO-Bench (Nimase et al., 2026); SAGEO Arena (Kim et al., 2026); E-GEO (Bagga et al., 2025); C-SEO Bench (Puerto et al., 2025) |
Dominante |
|
Medición primaria (motores reales) |
How to Dominate (Chen et al., 2025); Strategic GEO (Khedekar y Bansal, 2026); Quintana-Gómez (2026) |
Minoritaria |
|
Estudio aplicado / comercial |
GEO at Scale (Kumar, 2026); Brand Notability UK (Oruesagasti, 2026) |
Limitada |
Fuente: Romero-Ramos et al. (2026), Tabla 3 del manuscrito original. Versión propia.
La Inteligencia Artificial no contesta de forma idéntica todo el tiempo, y prácticamente nadie evalúa este fenómeno
Los motores generativos son estocásticos: pueden ofrecer respuestas distintas ante la misma pregunta. Una medición fiable exige, por tanto, repetir las mediciones o modelar explícitamente la incertidumbre. Sin embargo, solo una minoría de los estudios lo hace de forma sistemática. Entre quienes sí lo aplican destacan trabajos con cinco ejecuciones por consulta, con 200 evaluaciones y permutaciones de orden, con análisis de sensibilidad para idioma y paráfrasis, o que tratan la visibilidad como una distribución en lugar de como un valor puntual. La mayoría restante se apoya en una única ejecución.
«En este ámbito, evaluar un único intento resulta epistemológicamente frágil. Todo instrumento sólido debe integrar la repetición y el cálculo de la incertidumbre desde el principio, y no como un simple añadido opcional», apunta Romero.
El hallazgo central: un campo que mide mucho y valida poco
El hallazgo definitivo del análisis indica que ningún artículo del corpus somete su herramienta de medición a un proceso de validación psicométrica rigurosa. En su lugar, se implementan revisiones accesorias y fragmentadas (como índices de estabilidad, certeza en la atribución, contraste metodológico por diseño o solidez frente al orden), mientras que la concordancia entre evaluadores, que constituye una condición elemental para cualquier instrumento, rara vez se documenta. Por otra parte, la validez, cuando se defiende, se apoya en la consistencia interna de referencias diseñadas específicamente para la ocasión en lugar de apoyarse en atributos de medición propiamente dichos. De este modo, se desprende la premisa fundamental del mapeo: todavía carecemos de un mecanismo unificado y contrastado capaz de cuantificar la huella generativa de marca.
Requisitos de admisión
|
Parámetro |
Adisión |
Descarte |
|
Enfoque |
Cuantificación u operacionalización del impacto, la presencia, las menciones o la visibilidad dentro de los motores generativos |
Posicionamiento tradicional en buscadores, diseño asistido por computadora (CAD), redes generativas antagónicas (GAN), motores de recomendación y aplicaciones ajenas a este ámbito |
|
Rango temporal |
2023-2026 (ámbito de nacimiento digital) |
Precedente al año 2023 |
|
Lengua |
Castellano e inglés |
Idiomas restantes que carezcan de traducción accesible |
|
Clasificación |
Investigación empírica de medición, evaluación comparativa o trabajo práctico dotado de métricas |
Artículos de opinión, editoriales y material comercial o publicitario |
|
Condición |
Preprints aceptados conforme a los criterios de sensibilidad |
Documentación informal difundida sin supervisión editorial |
Fuente: Romero-Ramos et al. (2026), Tabla 1 del artículo original. Traducción propia.
«Encontramos un campo que mide mucho y valida poco. Lo que falta no son ideas de medición, que abundan: lo que falta es validez de constructo y fiabilidad documentada. Y conviene decirlo con precisión, porque confundir un benchmark con un instrumento validado infla la aparente madurez metodológica del campo. Ese vacío es, exactamente, la oportunidad científica», afirma Néstor Romero.
Existe una separación entre la enseñanza académica y la labor profesional
El artículo documenta un desajuste llamativo entre lo que la industria considera central y lo que la ciencia ha formalizado. La cuota de citación (citation share) —métrica que la práctica profesional trata como decisiva y candidata natural a validez convergente— está formalizada en esencialmente un solo estudio. Y la familia de sentimiento y encuadre es igualmente escasa, pese a que el trabajo de mayor escala del corpus, que analiza más de un centenar de marcas, la identifica como la señal más inestable de todas.
«a visibilidad en Google no predice la visibilidad en un asistente generativo. Eso invalida la transferencia directa de indicadores y obliga a repensar qué medimos y cómo».
«La visibilidad generativa resulta manipulable, lo cual impone a la medición una exigencia que usualmente no se le demanda: la solidez ante la manipulación en calidad de atributo del instrumento».
La ciencia en español, invisible: una lección metodológica
Adicionalmente, este análisis arroja una valiosa aportación metodológica que interpela directamente a los investigadores hispanohablantes. Cierta producción científica en castellano, difundida en publicaciones de Biblioteconomía y Documentación, examina la visibilidad ante la inteligencia artificial generativa desde perspectivas complementarias, tales como la inestabilidad de las marcas en sugerencias turísticas automatizadas o el acondicionamiento de repositorios universitarios para facilitar su indexación por motores conversacionales, aspectos que los estudios anglosajones hegemónicos suelen soslayar. Dicho corpus solo afloró gracias a consultas multilingües, lo que pone de manifiesto un sesgo idiomático subyacente en esta disciplina.
A ello se suma una segunda lección del propio proceso: la verificación en una base indexada aportó 360 registros brutos, de los que se revisaron los 136 en acceso abierto, en su mayoría ruido temático por colisión de términos, y no incorporó ningún estudio de medición elegible nuevo. El campo es, en definitiva, preprint-first y está infracubierto por la indexación tradicional: el 64 % del corpus candidato se difunde a través de arXiv o SSRN y el 98 % carece de cuartil indexado.
«Este resultado lo reportamos como hallazgo metodológico y no como una limitación escondida. En un campo born-digital, la revista no funciona como indicador de calidad, y las herramientas de descubrimiento asistidas por IA tienden a infracubrir precisamente la evidencia revisada por pares y los benchmarks más relevantes. Hay que complementarlas con rastreo de citas y fuentes reproducibles», explica el investigador.
Flujo de selección de estudios (PRISMA-ScR, dos ramas)
|
Fase |
Resultado |
|
Rama de descubrimiento (Consensus) |
Se identificaron 70 registros; 23 se descartaron antes del filtrado (duplicados por DOI, depuración y falsos positivos debidos a colisión de siglas); 47 se sometieron a cribado por resumen; 26 se desecharon; 21 avanzaron a texto completo |
|
Rama de otros métodos |
Se sumaron 18 registros adicionales (mediante rastreo de citas, OpenAlex y comprobación en base indexada); se obtuvieron 15 candidatos para análisis de texto completo |
|
Verificación en Web of Science |
Arrojó 360 registros brutos; se revisaron 136 (por acceso abierto); no se halló ningún estudio de medición elegible nuevo |
|
Evaluación a texto completo |
Se analizaron 36 informes; 13 se descartaron por quedar fuera del alcance o carecer de medición directa de la presencia |
|
Inclusión final |
Se integraron 23 investigaciones primarias en la síntesis, además de 2 revisiones incorporadas como marco conceptual |
Fuente: elaboración propia a partir de la Figura 1 y del apartado «Selection process» de Romero-Ramos et al. (2026). Los datos de identificación y cribado se consideran definitivos, mientras que los correspondientes a la evaluación a texto completo y a la inclusión tienen carácter provisional, tal como señalan los autores.
Se puede manipular la visibilidad generativa
Un subconjunto de los trabajos revisados demuestra que la visibilidad en motores generativos es manipulable de forma adversarial, mediante técnicas de manipulación del ranking en buscadores conversacionales o mediante optimización sigilosa de prompts. El estudio traslada esa evidencia al terreno de la medición: la robustez frente a la manipulación debería formar parte de las propiedades exigibles a cualquier instrumento de presencia.
«Una prueba de rendimiento comprueba si una estrategia da resultado o si un elemento varía de posición, pero no determina si un indicador mide con validez un concepto. Mezclar ambos planos exagera la falsa sensación de madurez de la disciplina».
«Una medición de una sola ejecución es, en este dominio, epistemológicamente frágil: los motores generativos pueden responder distinto a la misma pregunta».
Qué viene ahora: del diagnóstico al instrumento
Los investigadores concluyen que la carencia hallada —en lo referente a la validez de constructo y a la fiabilidad constatada— representa el resquicio que legitima la creación y validación formal de un indicador específico de presencia generativa, planteando dicha labor como la prolongación lógica del estudio difundido, y descartándola como una hipótesis ya ratificada. Se trata justamente de la senda en la que el grupo se encuentra laborando durante la etapa posterior.
«Nuestro objetivo es pasar del diagnóstico a la herramienta: construir y validar un índice que cualquier organización, del tamaño que sea, pueda usar para saber con base científica qué presencia tiene su marca cuando la inteligencia artificial responde por ella», adelanta Néstor Romero.
Limitaciones expresadas por los creadores
El artículo reconoce abiertamente sus propias fronteras: la precariedad de los cimientos empíricos en una disciplina tan novísima y copada por preprints, lo cual vuelve provisorias las deducciones; la imposibilidad de replicar el trayecto de hallazgo original —atenuada, sin desaparecer por completo, gracias a OpenAlex, el seguimiento de citas y el cotejo indexado—; el acotamiento idiomático a inglés y castellano junto con la carencia de acceso institucional para validar en Scopus; un etiquetado ejecutado en parte sobre los resúmenes, con métricas de incorporación sujetas a revisión; un riesgo inminente de circularidad, puesto que múltiples investigaciones utilizan modelos de lenguaje para evaluar su propio desempeño; y la caducidad temporal intrínseca a cualquier radiografía de un sector que se sustenta sobre herramientas propietarias en mutación permanente.
Dichas restricciones resultan esenciales para valorar correctamente los hallazgos y entender el alcance de la información existente. Si deseas examinar con mayor detalle el procedimiento, las cifras evaluadas y las deducciones del estudio, descarga el informe completo «La banca panameña ante la inteligencia artificial».
