Nuestro sitio web utiliza cookies para mejorar y personalizar su experiencia y para mostrar anuncios (si los hay). Nuestro sitio web también puede incluir cookies de terceros como Google Adsense, Google Analytics, Youtube. Al utilizar el sitio web, usted acepta el uso de cookies. Hemos actualizado nuestra Política de Privacidad. Haga clic en el botón para consultar nuestra Política de privacidad.

Néstor Romero: «Todavía no existe una forma científicamente validada de saber qué dice la IA de tu marca»

Néstor Romero: «Todavía no existe una forma científicamente validada de saber qué dice la IA de tu marca»

La revista científica Latitude: Multidisciplinary Research Journal, editada por Quality Leadership University (QLU) en Ciudad de Panamá, ha publicado en su volumen 2, número 24 (2026), el estudio «Medición de la presencia de marca en la optimización para motores generativos: una revisión de alcance sobre métricas y validez», firmado por Néstor Romero-Ramos, Yulianna Lobach, David Abreu-Abreu, Isaac Castillo-Hernández, Juan Carlos García-Cordero y Daniel García-Cordero. El trabajo, disponible en acceso abierto, es el primer resultado publicado de la línea de investigación sobre Generative Engine Optimization (GEO) que Centria Group desarrolla junto a instituciones académicas y universitarias de cuatro países.

El artículo responde a una pregunta que el marketing digital todavía no sabe contestar con rigor: cuando un asistente de inteligencia artificial recomienda un banco, un seguro o un hotel, ¿cómo se mide si una marca está presente en esa respuesta, con qué prominencia y con qué fiabilidad? Para responderla, el equipo realizó una revisión de alcance (scoping review) siguiendo la metodología del Joanna Briggs Institute (JBI) y reportada conforme a la extensión PRISMA-ScR, que mapea de forma sistemática cómo la literatura emergente mide la presencia, la visibilidad y la citación de fuentes y marcas en los motores generativos.

«Durante casi dos décadas, la visibilidad digital se midió por una capacidad muy concreta: aparecer (y ser pulsado) en una lista de resultados. Hoy el usuario ya no recibe diez enlaces azules: recibe una respuesta sintetizada que integra y reformula varias fuentes, y que las cita de forma parcial o desigual. La pregunta relevante ha dejado de ser si mi enlace aparece y se pulsa, y ha pasado a ser si mi contenido está presente dentro de la respuesta que el usuario realmente lee», explica Néstor Romero, autor corresponsal del estudio y COO de Centria Group.

Del clic a la respuesta: por qué las métricas del SEO dejan de servir

El texto arranca a partir de una realidad que la propia muestra analizada corrobora mediante datos empíricos: los enlaces seleccionados por una herramienta generativa coinciden escasamente con los resultados del posicionamiento orgánico clásico, al tiempo que los criterios de elección difieren entre plataformas. En otras palabras, aparecer en los primeros puestos de Google no garantiza la presencia en un chat inteligente, lo cual invalida la extrapolación automática de métricas y exige replantificar los métodos y objetos de medición. Adicionalmente, este escenario se ve potenciado por la tendencia de «cero clics», impulsada por las respuestas sintéticas incrustadas en los propios buscadores: un porcentaje elevado de las búsquedas actuales se satisface plenamente sin que el internauta llegue a navegar por ninguna página.

«La cuota de citación es la métrica que la práctica profesional trata como central, y en la literatura académica está formalizada en un único estudio. Esa brecha entre industria y academia es en sí misma un hallazgo», dijo Néstor Romero.

 Las cinco preguntas de investigación junto con sus respuestas

RQ Pregunta Respuesta del estudio
RQ1 ¿Qué familias de métricas se emplean? Existen siete conjuntos de indicadores parcialmente coincidentes —frecuencia de citación, relevancia posicional, impacto de absorción, clasificación en listados, consistencia, polarización temática y proporción de referencias—, carentes de un enfoque metodológico unificador.
RQ2 ¿Sobre qué unidad de análisis se operacionalizan? Falta un acuerdo generalizado: el objeto de estudio se desplaza desde el dominio o URL —herencia clásica del posicionamiento web— hacia la entidad corporativa, el informe, el artículo y, en las investigaciones más recientes, los recorridos automatizados de los agentes. Aquellos trabajos con objetos diferentes carecen de comparabilidad directa.
RQ3 ¿Cómo se controla la variabilidad estocástica de los motores? Tan solo una pequeña parte de los autores implementa réplicas o cálculos formales para gestionar la aleatoriedad. La mayor parte de la literatura recurre a una única consulta o limita el análisis a un periodo específico, obviando la medición del error.
RQ4 ¿Qué evidencia de fiabilidad y validez se reporta? Ninguna investigación analizada somete sus herramientas a pruebas de validación psicométrica. Tan solo se aprecian supervisiones puntuales y complementarias (consistencia temporal, precisión en las fuentes, validación cruzada y resistencia al sesgo secuencial). La concordancia entre evaluadores apenas se documenta.
RQ5 ¿Existe un instrumento integrado y validado de presencia generativa? En absoluto. Las pruebas estandarizadas miden el rendimiento de tácticas o variaciones de posición, mas no la validez conceptual de los indicadores; asimismo, las investigaciones principales utilizan parámetros prácticos pero incompletos y carentes de fiabilidad probada.

Cómo se hizo: cuatro rutas de búsqueda y una política explícita de preprints

Cuatro vías complementarias integraron la búsqueda, ideadas para contrarrestar los puntos débiles de cada método: un sistema de hallazgo impulsado por inteligencia artificial, búsquedas multilingües y replicables en OpenAlex, seguimiento de referencias mediante nodos clave y comprobación en una plataforma indexada (Web of Science; Scopus no estuvo disponible). Una vez eliminados los duplicados por DOI —evitando el título debido a los frecuentes conflictos entre denominaciones genéricas dentro de esta disciplina—, dos evaluadores filtraron los registros analizando los resúmenes de manera autónoma, logrando acuerdos consensuados ante cualquier desacuerdo. Treinta y seis informes completos fueron valorados, seleccionándose veintitrés investigaciones principales, además de un par de revisiones catalogadas de forma independiente a modo de sustento teórico.

«Una gran porción del saber producido en castellano acerca de este asunto no logra trascender hacia los ámbitos internacionales. Rescatarlo va más allá de un simple afán de completitud: pone al descubierto un prejuicio idiomático latente dentro de la disciplina», puntualizó Néstor Romero.

Siete conjuntos de métricas y ausencia de un marco unificado

En el mapeo se distinguen siete grupos de métricas con ciertos solapamientos —aparición/citación, prominencia/posición, absorción/influencia, ranking en listas, estabilidad, sentimiento/encuadre y cuota de citación— que operan careciendo de un esquema unificador común. Asimismo, la investigación subraya que el límite conceptual más productivo dentro de esta disciplina radica en separar la citación (el hecho de que se elija una fuente) de la absorción (la asimilación real de su contenido en el texto resultante), dividiendo de este modo en dos planos lo que anteriormente se evaluaba como una simple dicotomía.

La unidad de análisis cambia de enfoque: pasa de la URL a la marca y a la trayectoria de los actores

Todavía no hay acuerdo acerca de qué se mide con precisión. Los textos muestran una evolución constante que parte de la procedencia o la URL —legado directo del posicionamiento orgánico— para centrarse en la firma o entidad, el archivo, el artículo y, en las investigaciones más recientes, en elementos más amplios como el recorrido de navegación de los usuarios. Dicha transformación evidencia un cambio en el enfoque de la disciplina, aunque esto conlleva un precio: al emplear parámetros diferentes, las investigaciones pierden comparabilidad directa, lo cual imposibilita la elaboración de metaanálisis.

Clasificación de los datos probatorios accesibles

Nivel de evidencia

Ejemplos

Peso en el corpus

Benchmark de evaluación

GEO-Bench (Nimase et al., 2026); SAGEO Arena (Kim et al., 2026); E-GEO (Bagga et al., 2025); C-SEO Bench (Puerto et al., 2025)

Dominante

Medición primaria (motores reales)

How to Dominate (Chen et al., 2025); Strategic GEO (Khedekar y Bansal, 2026); Quintana-Gómez (2026)

Minoritaria

Estudio aplicado / comercial

GEO at Scale (Kumar, 2026); Brand Notability UK (Oruesagasti, 2026)

Limitada

Fuente: Romero-Ramos et al. (2026), Tabla 3 del artículo original. Traducción propia.

La inteligencia artificial no siempre contesta igual, y prácticamente nadie lo evalúa

Debido a su naturaleza estocástica, los motores generativos son capaces de arrojar contestaciones diferentes frente a una idéntica consulta. Una evaluación certera demanda, por consecuencia, reiterar las mediciones o representar de forma explícita la incertidumbre; no obstante, una minoría escasa de las investigaciones adopta este enfoque de manera metódica. Dentro del grupo que efectivamente lo implementa sobresalen proyectos que realizan cinco ejecuciones por cada pregunta, completan doscientos exámenes junto con permutaciones de orden, aplican análisis de sensibilidad para idiomáticas y paráfrasis, o bien conciben la visibilidad bajo la forma de una distribución y no de un dato aislado. El resto de los estudios, en su gran mayoría, confía en una sola ejecución.

«Una medición de una sola ejecución es, en este dominio, epistemológicamente frágil. Cualquier instrumento robusto tiene que incorporar la repetición y la modelización de la incertidumbre como requisito, no como un refinamiento opcional», señala Romero.

El hallazgo central: un campo que mide mucho y valida poco

El hallazgo fundamental de la investigación revela que ningún análisis del conjunto somete su herramienta de medición a un proceso de validación psicométrica riguroso. En su lugar, se implementan supervisiones periféricas y fragmentadas (como índices de estabilidad, certeza en la asignación, contrastación metodológica o solidez ante secuencias), mientras que la concordancia entre evaluadores —un estándar elemental para cualquier dispositivo— rara vez se documenta. Por su parte, la validez, al momento de defenderse, se sustenta en la armonía interna de referencias diseñadas específicamente para la ocasión en lugar de apoyarse en atributos métricos. De este modo se desprende la premisa principal del análisis: aún no se cuenta con un mecanismo consolidado y verificado para cuantificar el impacto generativo de marca.

Requisitos para participar

Parámetro

Adisión

Descarte

Enfoque

Cuantificación u operacionalización del impacto, la presencia, las menciones o la visibilidad dentro de los motores generativos

Posicionamiento tradicional en buscadores, diseño asistido por computadora (CAD), redes generativas antagónicas (GAN), motores de recomendación y aplicaciones ajenas a este ámbito

Rango temporal

2023-2026 (ámbito de nacimiento digital)

Precedente al año 2023

Lengua

Castellano e inglés

Idiomas restantes que carezcan de traducción accesible

Clasificación

Investigación empírica de medición, evaluación comparativa o trabajo práctico dotado de métricas

Artículos de opinión, editoriales y material comercial o publicitario

Condición

Preprints aceptados conforme a los criterios de sensibilidad

Documentación informal difundida sin supervisión editorial

Fuente: Romero-Ramos et al. (2026), Tabla 1 del artículo original. Traducción propia.

«Encontramos un campo que mide mucho y valida poco. Lo que falta no son ideas de medición, que abundan: lo que falta es validez de constructo y fiabilidad documentada. Y conviene decirlo con precisión, porque confundir un benchmark con un instrumento validado infla la aparente madurez metodológica del campo. Ese vacío es, exactamente, la oportunidad científica», afirma Néstor Romero.

Existe una separación entre la enseñanza académica y la labor profesional

El artículo documenta una discrepancia notable entre aquello que la industria prioriza y lo que la investigación científica ha consolidado. La cuota de citación (citation share) —un indicador al que el sector otorga un valor determinante y presupone como una opción idónea para la validez convergente— se reduce, en la práctica, a un único estudio formalizado. Por otra parte, las categorías de sentimiento y encuadre muestran una escasez similar, a pesar de que el análisis de mayor envergadura dentro del corpus, el cual evalúa más de cien marcas, las señala como los indicios más volátiles de todo el conjunto.

«La visibilidad en Google no garantiza la presencia en un asistente generativo, lo que invalida la transferencia directa de métricas y exige replantear tanto qué evaluamos como la manera de hacerlo».

«La visibilidad generativa es manipulable, y eso traslada a la medición un requisito que normalmente no se le exige: la robustez frente a la manipulación como propiedad del instrumento».

La ciencia en español, invisible: una lección metodológica

Asimismo, este análisis arroja una aportación metodológica de suma relevancia para los investigadores de habla hispana. Hay un corpus de estudios en español, divulgado en publicaciones de Documentación y Biblioteconomía, que examina la exposición ante la inteligencia artificial generativa desde perspectivas diversas —tales como la inestabilidad de las marcas dentro de las sugerencias turísticas elaboradas por IA, o bien el ajuste de los repositorios académicos para facilitar su indexación por parte de plataformas generativas—, aspectos que los textos anglosajones hegemónicos suelen soslayar. Su rescate únicamente se logró por medio de consultas en varios idiomas, lo cual pone de manifiesto un sesgo idiomático subyacente en esta disciplina.

A ello se suma una segunda lección del propio proceso: la verificación en una base indexada aportó 360 registros brutos, de los que se revisaron los 136 en acceso abierto, en su mayoría ruido temático por colisión de términos, y no incorporó ningún estudio de medición elegible nuevo. El campo es, en definitiva, preprint-first y está infracubierto por la indexación tradicional: el 64 % del corpus candidato se difunde a través de arXiv o SSRN y el 98 % carece de cuartil indexado.

«Este resultado lo reportamos como hallazgo metodológico y no como una limitación escondida. En un campo born-digital, la revista no funciona como indicador de calidad, y las herramientas de descubrimiento asistidas por IA tienden a infracubrir precisamente la evidencia revisada por pares y los benchmarks más relevantes. Hay que complementarlas con rastreo de citas y fuentes reproducibles», explica el investigador.

Proceso de elección de los estudios (PRISMA-ScR, dos vías)

Etapa

Resultado

Rama de descubrimiento (Consensus)

70 registros identificados; 23 eliminados antes del cribado (duplicados por DOI, limpieza y falsos positivos por colisión de siglas); 47 cribados por resumen; 26 excluidos; 21 pasan a texto completo

Rama de otros métodos

18 registros adicionales (rastreo de citas, OpenAlex y verificación en base indexada); 15 candidatos a texto completo

Verificación en Web of Science

360 registros brutos; 136 revisados (acceso abierto); ningún estudio de medición elegible nuevo

Evaluación a texto completo

36 informes evaluados; 13 excluidos (fuera de alcance o sin medición directa de la presencia)

Inclusión final

23 estudios primarios incluidos en la síntesis, más 2 revisiones registradas como marco conceptual

Fuente: elaboración propia a partir de la Figura 1 y del apartado «Selection process» de Romero-Ramos et al. (2026). Las cifras de identificación y cribado son firmes; las de evaluación a texto completo e inclusión, provisionales, según declaran los autores.

La visibilidad generativa se puede manipular

Cierta parte de la investigación analizada evidencia que la exposición en los motores generativos resulta manipulable de manera adversarial, ya sea a través de tácticas de alteración de posiciones en los buscadores conversacionales o mediante la optimización discreta de prompts. Dicha investigación traslada esta conclusión al ámbito de la métrica: la solidez frente a los intentos de manipulación tendría que integrar el conjunto de atributos indispensables para cualquier herramienta de visibilidad.

«Una prueba de rendimiento comprueba si una estrategia da resultado o si un elemento varía de posición, pero no determina si un indicador mide con validez un concepto. Mezclar ambos planos exagera la falsa sensación de madurez de la disciplina».

«En este ámbito, evaluar un único intento resulta epistemológicamente endeble; los sistemas generativos son capaces de ofrecer respuestas diferentes ante idéntica consulta».

Qué viene ahora: del diagnóstico al instrumento

Los autores concluyen que el vacío detectado —en validez de constructo y en fiabilidad documentada— constituye la apertura que justifica desarrollar y validar formalmente un índice específico de presencia generativa, y sitúan esa tarea como la continuación natural del trabajo publicado, y no como una afirmación ya demostrada. Es precisamente la línea en la que el equipo trabaja en la fase siguiente.

«Nuestro propósito consiste en transitar desde el diagnóstico hasta la utilidad práctica: diseñar y contrastar un indicador que cualquier entidad, independientemente de su dimensión, logre emplear para medir con rigor científico el posicionamiento de su marca cada vez que la inteligencia artificial emita una respuesta al respecto», señala Néstor Romero.

Limitaciones declaradas por los autores

El texto deja claros sus propios confines: la fragilidad de los datos en una disciplina tan novísima y dominada por preprints, lo cual vuelve provisorias las deducciones; la imposibilidad de replicar el trayecto de hallazgo originario —contrarrestada, si bien no suprimida, mediante OpenAlex, el seguimiento de citas y el cotejo indexado—; el acotado radio idiomático al inglés y al castellano junto con la carencia de validación en Scopus debido a la ausencia de convenios universitarios; un etiquetado efectuado en parte sobre los resúmenes, con métricas de admisión sujetas a revisión; el riesgo de incurrir en circularidad, puesto que múltiples investigaciones utilizan inteligencias artificiales evaluadoras de su propia evaluación; y la caducidad temporal que afecta a cualquier radiografía de un ámbito sustentado en herramientas propietarias en mutación permanente.

Dichas restricciones resultan esenciales para valorar correctamente los hallazgos y entender el alcance de la información existente. Si deseas examinar con mayor detalle el procedimiento, las cifras evaluadas y las deducciones del estudio, descarga el informe completo «La banca panameña ante la inteligencia artificial».

Por Yenny Paredes

You May Also Like