

Funcionamiento del rastreo, diferencias entre el posicionamiento clásico y el posicionamiento en modelos de lenguaje, auditoría técnica de cucumbercomics.com y plan de implantación.
Google, OpenAI, Microsoft, Anthropic y Perplexity operan desde sus servidores flotas de programas automatizados que recorren internet de forma continua. Se llaman crawlers o bots. Todo lo que sigue depende de ellos.
Un crawler es un programa que accede a una web, lee su código, extrae todos los enlaces que encuentra y los recorre uno a uno, repitiendo el proceso de forma recursiva. Funciona como un escáner permanente de la red: no interpreta el diseño ni la parte visual, procesa el código fuente y la estructura de enlaces.
sitemap.xml, que es el índice de URLs que el sitio declara para rastreo.JSON-LD. No ve la maquetación: ve el marcado.href del documento y lo añade a una cola de rastreo. Una URL a la que no apunta ningún enlace ni ningún sitemap no entra en esa cola: para el bot no existe.Rastrear la web cuesta dinero. Cada petición que hace un bot consume ancho de banda, ciclos de procesador y electricidad en los centros de datos de quien lo opera. Con cientos de millones de dominios en circulación, ninguna compañía puede permitirse rastrearlo todo, todo el rato.
La solución de la industria es el presupuesto de rastreo: a cada dominio se le asigna una cantidad limitada de peticiones por ciclo. Cuando ese presupuesto se agota, el bot se marcha, haya visto lo importante o no, y no vuelve hasta el siguiente ciclo. El presupuesto no es fijo: se ajusta según el comportamiento del dominio.
Aplicado a este dominio: las 21 URLs que el sitemap declara devuelven error. Cada ciclo de rastreo se consume en direcciones que no existen, mientras el catálogo real no está declarado en ningún sitio. El presupuesto se gasta entero sin llegar a lo que se quiere posicionar.
No hay un solo rastreador. Cada compañía opera los suyos, con nombres identificables en los registros del servidor y con funciones distintas.
| Bot | Operador | Para qué se usa |
|---|---|---|
| Googlebot | Índice de Google Search. Alimenta además las respuestas de AI Overviews y de Gemini | |
| Bingbot | Microsoft | Índice de Bing. Es la base de búsqueda web de ChatGPT |
| GPTBot | OpenAI | Recopilación de datos para el conocimiento de los modelos |
| OAI-SearchBot ChatGPT-User | OpenAI | Consulta en tiempo real cuando ChatGPT busca en la web durante una conversación |
| PerplexityBot | Perplexity | Índice propio. Es el motor con el ciclo de actualización más corto |
| ClaudeBot | Anthropic | Recopilación y consulta para los modelos Claude |
Lo que el modelo aprendió durante su entrenamiento queda almacenado internamente. Un negocio abierto en 2026 no está en esa memoria: los datos de entrenamiento tienen fecha de corte anterior.
Cuando el modelo activa búsqueda web, consulta índices actuales (Google, Bing o el suyo propio) y cita las fuentes que recupera. Esta es la vía realista para un negocio reciente, y depende por completo de que el sitio sea rastreable.
Conviene distinguir tres momentos distintos, porque se confunden con frecuencia y determinan qué se puede influir y qué no.
Se procesa un corpus enorme de texto y el modelo ajusta sus parámetros internos. Lo aprendido queda fijado. No es una base de datos que se pueda consultar ni editar.
Cuando el modelo activa la búsqueda web, el sistema recupera documentos del índice y los inyecta junto a la pregunta. Es la vía por la que entra información actual.
El modelo produce el texto palabra a palabra, calculando en cada paso la continuación más probable a partir de lo aprendido y de los documentos recuperados.
Por qué esto importa: durante la inferencia el modelo no consulta un listado de negocios, genera texto probable. Nombra una entidad cuando tiene señal suficiente y coherente sobre ella, y tiende a omitirla cuando los datos son ambiguos o no están corroborados, porque afirmar algo no respaldado es un error costoso para el sistema. De ahí que la consistencia y la verificabilidad de los datos pesen más que el volumen de contenido publicado.
Cada motor tiene su propia frecuencia de rastreo y su propio retardo hasta que un cambio se refleja en las respuestas. Son rangos observados, no garantías.
| Motor | Primeras señales | Posicionamiento consolidado |
|---|---|---|
| Perplexity | 2 a 4 semanas | 1 a 3 meses |
| Google Search y Gemini | 2 a 6 semanas | 3 a 6 meses |
| ChatGPT (vía Bing) | 2 a 8 semanas | 3 a 6 meses |
Alta en Bing Webmaster Tools: impacto directo sobre el modo de búsqueda web de ChatGPT, al apoyarse en el índice de Bing.
El posicionamiento en modelos de lenguaje no sustituye al SEO: se construye encima. La capa base sigue siendo obligatoria, porque si el sitio no es rastreable no hay nada que evaluar. La diferencia está en la capa que se añade.
| Criterio | Posicionamiento clásico (SEO) | Posicionamiento en IA (AEO / GEO) |
|---|---|---|
| Unidad que se posiciona | La página. Cada URL compite por una consulta | La entidad. El negocio como objeto identificable, con sus atributos |
| Objetivo | Aparecer en un listado de diez resultados | Ser nombrado dentro de una respuesta única, donde solo caben unos pocos |
| Qué se optimiza | Palabras clave, contenido, enlaces entrantes, rendimiento | Datos estructurados, consistencia de atributos, corroboración externa, fragmentos citables |
| Cómo se evalúa la confianza | Autoridad de dominio y perfil de enlaces | Entity Authority: coincidencia de los mismos datos en fuentes independientes |
| Formato que consume | Documento completo, con su maquetación | Fragmentos autocontenidos, extraíbles fuera de contexto |
| Medición | Posición media, clics e impresiones | Aparición y descripción de la entidad en un conjunto fijo de consultas |
AEO: optimización para respuestas. GEO: optimización para motores generativos. En la práctica se trabajan juntas, y ambas se apoyan sobre el SEO técnico.
Un sitio puede cumplir la capa 1 y seguir sin aparecer en respuestas de IA. Al revés no funciona: sin la capa 1 resuelta, la capa 2 no llega a evaluarse porque el contenido no se ha podido rastrear.
Una entidad es un objeto identificable con atributos propios: un negocio, una persona, un producto. Los sistemas de recuperación trabajan sobre entidades, no sobre documentos sueltos. Entity Authority es el grado de solidez con el que un sistema puede identificar, verificar y describir esa entidad.
Tipo de negocio, dirección postal, teléfono, horario y perfiles oficiales, declarados en el marcado del sitio con LocalBusiness y sameAs. Es la fuente primaria.
Los mismos atributos repetidos en fuentes independientes: ficha de negocio, directorios sectoriales, prensa. La coincidencia entre fuentes es lo que eleva la confianza.
Material propio que solo puede producir quien conoce el sector, estructurado en bloques citables. Es lo que hace que el modelo tenga algo concreto que extraer y atribuir.
Es el estándar de calidad que Google define en sus directrices para evaluadores y que los sistemas de IA replican en la práctica al decidir qué fuentes citar.
| Componente | Qué se evalúa |
|---|---|
| Experience | Experiencia directa demostrable: material propio del negocio, no descripciones genéricas |
| Expertise | Conocimiento específico del sector reflejado en el contenido |
| Authoritativeness | Reconocimiento por parte de terceros: menciones, directorios, enlaces, prensa |
| Trustworthiness | Verificabilidad: datos de contacto reales, coherentes y contrastables entre fuentes |
A fecha de esta medición, la entidad Cucumber Comics no está declarada como negocio local en el marcado del sitio, no tiene perfiles enlazados mediante sameAs y su presencia en fuentes externas se limita a una publicación en prensa local. Los detalles y las mediciones están en la sección siguiente.
Datos obtenidos por inspección directa del dominio el 23 de julio de 2026: peticiones HTTP, análisis del código servido, ficheros de control y comprobación de respuesta ante distintos agentes de usuario. Todo es reproducible, y cada hallazgo enlaza a su fuente para que se pueda comprobar en el momento.
| Parámetro | Valor medido |
|---|---|
| Plataforma | PrestaShop, con e-commerce operativo (carrito, precios y pasarelas activas) |
| Renderizado | ✓HTML servido desde el servidor. El contenido no depende de la ejecución de JavaScript en el cliente, por lo que los bots reciben el documento completo |
| Respuesta a bots de IA | ✓GPTBot, ClaudeBot y PerplexityBot reciben HTTP 200. No hay bloqueo por agente de usuario |
| Datos estructurados en fichas de producto | ✓Las fichas emiten Product, Offer y Brand de serie |
Consecuencia sobre el alcance: al servirse el HTML ya renderizado y existir marcado de producto, la intervención no requiere reconstruir el sitio. Se trabaja sobre configuración y capa de datos.
PrestaShop se instala con un conjunto de productos de ejemplo destinado a validar la maquetación. El sitemap disponible en /1_es_0_sitemap.xml, con fecha de generación de 3 de marzo de 2026, sigue declarando ese conjunto.
Las 21 URLs declaradas devuelven HTTP 500. Las categorías que el mismo fichero declara devuelven HTTP 404. La ruta por defecto /sitemap.xml devuelve 404. Ninguna referencia del catálogo real figura en el fichero.
| Parámetro | Estado medido |
|---|---|
| Sitemap en ruta por defecto | ✗/sitemap.xml devuelve 404 |
| Última generación del sitemap disponible | ✗3 de marzo de 2026, sin regeneración posterior |
| Crawl budget | ✗Las peticiones que el bot dedica al dominio se consumen en URLs que devuelven error |
Los datos estructurados son el bloque en formato JSON-LD que la web incrusta en su código para declarar a las máquinas qué es este negocio. Es lo que un buscador lee para saber que se trata de una tienda, dónde está y cuándo abre, sin tener que deducirlo del texto. Se puede consultar en directo con los validadores oficiales:
| Error | Consecuencia |
|---|---|
| ✗Declarado como Organization genérico | Falta el tipo LocalBusiness que identifica un comercio físico: para las máquinas no sois una tienda, sois un nombre |
| ✗Sin address, telephone ni openingHours | La dirección de José García Sánchez 29, el teléfono y el horario no existen en el marcado: un sistema no puede verificar dónde estáis ni cuándo abrís |
| ✗Sin geo (coordenadas) | Sin posición declarada para las consultas de proximidad ("cerca de mí", "en Delicias") |
| ✗Sin sameAs | Vuestros perfiles de Instagram y X existen pero no están vinculados a la entidad: cada uno flota por separado |
| ✗Sin @id estable | Los sistemas no tienen un identificador único con el que referenciar la entidad entre fuentes |
| Fichero | Estado medido |
|---|---|
| robots.txt | El de serie de la plataforma. ✗No declara ningún sitemap (la línea Sitemap: no existe en el fichero) y no contiene directivas para agentes de IA |
| llms.txt | ✗HTTP 404. Verificado contra ruta de control para descartar falso positivo |
| Perfiles enlazados sameAs | ✗Ninguno declarado, pese a existir perfiles activos en redes |
Muestreo inicial sobre consultas de tienda de cómics en Zaragoza. Orden de aparición registrado:
Método: consultas de sector formuladas a motores con búsqueda web activa, sin sesión iniciada. El orden exacto varía entre consultas y entre ejecuciones: es el efecto de la inferencia (sección 01), cada respuesta se genera de nuevo. Lo estable es el patrón: los cuatro veteranos entran casi siempre y Cucumber Comics, cuando entra, aparece en las últimas posiciones. El muestreo se ampliará a un conjunto mayor de consultas antes de fijar la línea base, con capturas fechadas.
Diagnóstico: el dominio presenta un problema de indexabilidad (el catálogo no se declara para rastreo) y de definición de entidad (el negocio no está descrito en un formato que los sistemas puedan verificar). La corrección tiene dos frentes: los fallos de indexabilidad se arreglan sobre la propia instalación, y la definición de entidad se resuelve construyendo la capa de entrada del dominio. El motor de la tienda no se toca.
Vuestra instalación es PrestaShop, escrito en PHP: el servidor arma la página consultando una base de datos cada vez que alguien la pide. Es el modelo más extendido del comercio electrónico. Frente a él está el modelo de aplicación en React, el que usan las plataformas grandes. La diferencia se nota en lo que llega al rastreador y en cuánto presupuesto de rastreo consume.
Comprobado en vuestro servidor: las cabeceras de respuesta del dominio emiten una cookie PHPSESSID junto a la cookie de sesión de PrestaShop, sobre un servidor Apache. Es la confirmación directa de que la tienda se ejecuta en PHP.
PrestaShop se amplía instalando módulos de terceros, igual que otras plataformas construidas en PHP. Cada uno añade su propio código, sus hojas de estilo y sus consultas a base de datos, y se cargan aunque la página concreta no los use. Ese exceso de código acumulado es lo que se conoce como bloatware, y tiene tres consecuencias medibles.
| Factor | PrestaShop (PHP + módulos) | Aplicación con componentes |
|---|---|---|
| Generación de la página | El servidor la arma en cada petición, consultando base de datos | Se genera una vez y se sirve ya construida: carga más rápida |
| Semántica del marcado | Contenedores genéricos: el significado hay que deducirlo | Elementos con nombre y función explícitos |
| Peso y dependencias | Crece con cada módulo instalado | Solo se entrega el código que la página usa |
Vuestra tienda no se migra ni se reconstruye: PrestaShop sigue siendo el motor de venta y el panel desde el que gestionáis el catálogo, exactamente igual que hoy.
Lo que se construye con arquitectura de componentes es la capa de entrada del dominio: la home y las páginas de entidad. El rastreo empieza siempre por la raíz, y es ahí donde el bot extrae la información del negocio: quién es, dónde está, qué vende y por qué es relevante. Las fichas de PrestaShop quedan enlazadas desde esa capa como catálogo y canal de compra, donde el sistema verifica producto y precio. Es el mismo modelo que aplicamos en el caso de la sección 07.
Se implanta el Vextria System completo con el modelo de capa: la tienda no se migra (PrestaShop se conserva como motor de venta y panel de gestión) y el desarrollo se concentra en la capa de entrada del dominio más la corrección de la instalación. Es el mismo sistema del caso de la sección 07.
Todo se implementa siguiendo los estándares oficiales y las mejores prácticas del sector: el protocolo sitemaps.org para los mapas de URLs, el vocabulario schema.org validado con las herramientas de Google para los datos estructurados, la especificación de llms.txt para agentes de IA y las directrices de Google Search Central para indexabilidad y negocio local. Nada queda a criterio propio ni depende de trucos: todo es verificable con las herramientas públicas de cada proveedor.
El Vextria System es nuestro sistema completo de implantación, con ocho módulos. En este caso se implanta entero. La particularidad está en el módulo de desarrollo: no se reconstruye la tienda, se construye la capa de entrada del dominio.
| Módulo | En este alcance | Cómo se aplica aquí | |
|---|---|---|---|
| 01 | Plan estratégico | Sí | Auditoría propia y de competidores, estrategia y línea base de medición |
| 02 | Desarrollo web | Sí | Capa AI-native en la raíz del dominio; la tienda PrestaShop se conserva como motor de venta |
| 03 | SEO técnico | Sí | Indexabilidad, sitemap, corrección de errores y enlazado interno |
| 04 | SEO local | Sí | Ficha de negocio, directorios sectoriales y consistencia de NAP |
| 05 | AEO y GEO | Sí | Definición de entidad, datos estructurados, contenido citable y ficheros para agentes de IA |
| 06 | Neuro-conversión | Sí | La capa nueva se diseña orientada a conversión: jerarquía, llamadas a la acción y camino claro hacia la compra |
| 07 | Chatbot IA | Sí | Asistente sobre el negocio y el catálogo, integrado en la capa nueva |
| 08 | Analítica y tracking | Sí | Instalación y configuración de la medición en la semana de cierre |
Comercio minorista especializado en Zaragoza, con catálogo amplio y sin visibilidad previa en modelos de lenguaje. Situación de partida equivalente: entidad no declarada y catálogo no consolidado en los índices.
Al consultar a distintos modelos por la entidad, la mayoría no la identificaba y los que devolvían una descripción la clasificaban en un sector que no era el suyo. Sin aparición en ninguna de las consultas de su sector.
Aparición en las diez consultas medidas, en los dos motores auditados, con cuatro primeras posiciones. Los modelos describen la entidad con los atributos declarados en la intervención y citan el dominio como fuente.
Verificable en directo: basta ejecutar las consultas del sector sobre cualquier motor con búsqueda web activa.
Se implanta el Vextria System completo con el modelo de capa: mantenéis vuestro PrestaShop tal cual está y construimos encima la entrada del dominio. Es el mismo modelo del caso de la sección 07.
La home nueva y las páginas de entidad. Es el primer sitio al que accede el rastreo y de donde los sistemas extraen la información del negocio: identidad, especialidad, contenido citable y datos estructurados.
Catálogo, carrito, pagos y panel de gestión siguen exactamente igual. Las fichas quedan enlazadas desde la capa y ahí es donde el sistema verifica producto, precio y disponibilidad.
Los descuentos de lanzamiento están sujetos a una condición: documentar y publicar el proceso como caso de éxito, con testimonio. Es la oferta que aplicamos a los primeros casos de cada vertical; en el vuestro, tiendas de cómics.
Sin permanencia. Todo lo implantado en el sistema permanece en el dominio con independencia de que se contrate o no el plan mensual.
Plazo de ejecución desde la entrega de accesos. Cada semana cierra con un entregable verificable.
Dedicación requerida por vuestra parte: entrega de accesos al inicio y sesión de revisión a la entrega.
El plazo de ejecución no coincide con el plazo de efecto. Una vez publicados los cambios, el reflejo depende del ciclo de rastreo de cada motor, que es externo y no acelerable.
Los bots vuelven a pasar, encuentran el catálogo declarado y lo incorporan al índice. Primer movimiento observable.
Los sistemas de recuperación empiezan a resolver la entidad con los atributos declarados y las fuentes externas.
Repetición del conjunto de consultas de la semana 1 en idénticas condiciones. Comparativa documentada.