Vibeset

SiteIndex

Mira primero lo que ya tienes hecho, pregunta solo lo que no puede ver, y de ahí saca el plan para posicionar tu web o tu producto digital.

Cuándo se usa

Al publicar una web nueva, al preparar un lanzamiento, cuando llevas semanas y no sales en Google, o cuando quieres posicionar y no sabes por dónde empezar.

SKILL.md

# SiteIndex

Que la web sea descubrible (que los rastreadores entren y entiendan qué es cada
página), merecedora (que haya un motivo para enseñarla por encima de otra) y
medible (que al final se compruebe con datos).

## Lo primero es mirar, no recomendar

La fase 0 lanza un barrido contra el dominio de verdad y lee lo que sirve el
servidor, que muchas veces no es lo que hay en el código: si www y http acaban
todas en la misma dirección, qué bloquea el robots.txt y qué bots de IA nombra,
cuántas URLs tiene el sitemap y si llevan fecha, la cabecera entera, los tipos de
JSON-LD que ya están, qué analítica hay instalada, cuántas palabras trae el HTML
sin ejecutar JavaScript, y los registros del DNS que delatan si la web ya está
dada de alta en Search Console y en Bing.

Solo después pregunta, de una vez y como mucho ocho cosas, lo que el barrido no
puede ver: si alguien entra en Search Console y qué dice, quién es el cliente y
qué escribiría para encontrarte, qué páginas dan dinero, contra quién compites,
si hay ritmo de publicación y qué se intentó antes sin éxito.

Todo lo que salga del barrido se escribe en una hoja de estado con tres columnas
(ya está, falta, no aplica) y con quién puede arreglar cada cosa: el agente en el
código, o tú en un panel donde el agente no entra. Cada línea del informe empieza
por su estado real, así que nadie te vuelve a proponer lo que hiciste hace un año.

## Regla 0: los números se verifican, nunca se recitan

Todo lo que lleve un número caduca: longitudes recomendadas de título, umbrales
de Core Web Vitals, campos obligatorios de los datos estructurados y, sobre todo,
los nombres de los bots. Se comprueban en la fuente oficial en el momento. Si no
se puede verificar, se dice que no está verificado. No se inventa.

## Que puedan entrar

**Los porteros.** Lee el robots.txt que ya hay antes de escribir nada. Bloquea
solo lo inútil o duplicado, y sobre todo los filtros de catálogo, que generan una
URL por cada combinación. Es un cartel, no un candado, y bloquear ahí más poner
noindex se anula solo: el bot nunca llega a leer la etiqueta. Nunca se bloquea el
CSS ni el JavaScript que la página necesita para pintarse.

**La decisión de IA, que es del cliente y no tuya.** Hay dos grupos y las
consecuencias son distintas. Los de entrenamiento (GPTBot, ClaudeBot, CCBot,
Google-Extended, Bytespider, Applebot-Extended, meta-externalagent, Amazonbot) se
pueden bloquear sin perder visibilidad. Los de búsqueda y respuesta
(OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot,
Perplexity-User) te borran de las respuestas de IA si los bloqueas. La trampa
clásica: Google-Extended NO afecta a tu posición en Google, solo al entrenamiento
de Gemini. Y la contraria, que casi nadie sabe: bloquearlo tampoco te saca de las
AI Overviews, porque esas beben del índice normal de la Búsqueda.

**Cimientos que no se negocian.** HTTPS, una sola versión canónica del dominio
con 301 desde la otra, contenido presente en la versión móvil, 404 de verdad, y
contenido visible en el HTML servido y no solo tras ejecutar JavaScript. Si la
web lleva movimiento, cruza aquí con FrontLaxWeb: el storytelling al scroll es
donde ese fallo nace, porque el texto acaba dentro de algo que solo existe cuando
monta el JavaScript.

## Que entiendan qué es cada página

**La cabecera, página a página.** Título y descripción propios, un solo h1,
canonical cuando el mismo contenido es alcanzable por varias URLs, texto
alternativo en las imágenes, y Open Graph con imagen, que es lo que se ve al
pegar el enlace en un chat.

**Varios idiomas.** Cada idioma con su propia URL (/es/, /en/), que es lo que
significa esa barra que ves en tantas direcciones: no es detección, es que son
páginas distintas. Se anotan con hreflang, y las tres reglas que más se rompen
son que cada versión se liste a sí misma, que los enlaces sean de ida y vuelta, y
que haya un x-default. El canonical de cada idioma apunta a SÍ MISMO: si el de
/es/ apunta a /en/, acabas de sacar la versión española del índice. Y nada de
redirigir automáticamente por idioma o por país, que es el error gordo: Googlebot
rastrea sin cabecera Accept-Language y sobre todo desde IPs de Estados Unidos,
así que cae siempre en la misma versión y las demás no se indexan nunca.

**JSON-LD.** Que describa lo que se VE en la página, y validado antes de darlo
por bueno. Eso sí: Google dice por escrito que los datos estructurados no hacen
falta para salir en sus funciones de IA, así que no se venden como truco.

**Arquitectura y enlaces internos.** Lo que da dinero, a pocos clics de la
portada. Cero páginas huérfanas, porque el sitemap no sustituye a un enlace.
Texto de enlace descriptivo, enlaces de verdad y no botones de JavaScript, y
grupos por tema con la página principal y las específicas enlazadas en las dos
direcciones.

## Que merezca la pena enseñarla

**El contenido, que es lo que de verdad posiciona.** Se sacan las preguntas
reales (las de los clientes, las del buscador interno, las de Search Console), se
clasifican por intención (saber, comparar, ir, comprar), y cada intención tiene
UNA página. Se responde arriba, en las dos o tres primeras frases. Se firma y se
fecha de verdad. Y se revisa lo viejo antes de escribir lo nuevo, que suele rendir
más. Con las preguntas de autoevaluación que publica Google delante, y sabiendo
que E-E-A-T no es una etiqueta que se activa.

**Velocidad.** LCP, INP y CLS, medidos con visitantes reales y no con una
simulación. Imágenes, tipografías, JavaScript y servidor, por ese orden. La
velocidad no te saca del pozo si el contenido no responde, pero decide entre dos
páginas parecidas.

**Producto digital, si lo que vendes o regalas es software.** Nadie busca tu nombre hasta
que ya te conoce, así que la portada se gana por categoría y problema, no por la marca.
Las páginas que traen usuarios son los casos de uso, la comparativa, el "alternativa a X",
los precios, la descarga, la documentación indexable y el changelog con fechas reales. Un
asistente solo te recomienda si puede leer en la página qué es, en qué sistema funciona,
cuánto cuesta, con qué licencia, qué datos toca y cómo se instala. Y la mitad del
descubrimiento pasa fuera de tu web: gestores de paquetes, directorios de alternativas,
plataformas de lanzamiento y GitHub. Ojo con generar cien páginas "alternativa a" desde
una plantilla: eso es abuso de contenido a escala y páginas puerta a la vez.

**Negocio local, si atiendes en una zona.** Google dice que el resultado local se
decide por relevancia, distancia y popularidad. La distancia no se toca; el perfil
de empresa completo, los datos coherentes en toda la web y las reseñas atendidas,
sí. Y no se puede pagar por salir mejor: lo dice Google con esas palabras.

## Que se sepa y se compruebe

**Alta y avisos.** Search Console con propiedad de dominio, Bing Webmaster Tools
como segunda opinión, e IndexNow para avisar en cuanto publicas. Google no
participa en IndexNow, así que complementa, no sustituye.

**Que te citen las IA.** Google publicó su guía oficial en mayo de 2026 y es
tajante: no hay algoritmo aparte, sus funciones de IA se apoyan en los mismos
sistemas de la Búsqueda, y no hacen falta archivos especiales ni marcado ni
Markdown para aparecer. Lo que sí controla lo que pueden usar de tu página son las
etiquetas de fragmento, y cortarlas es cortar tu propia presencia. AEO y GEO,
hechos bien, son SEO.

**Medir, que es donde acaba el trabajo.** Search Console comparando dos periodos,
las consultas donde ya sales en posición baja (la lista de trabajo más rentable
que existe), PageSpeed, los logs del servidor, y preguntar tú mismo a los
asistentes una vez al mes para ver si te citan y junto a quién. Con la fecha
anotada, que si no, no se puede comparar.

## Los consejos que más rinden

Empieza por las consultas que ya están en la página dos de Google, que es donde menos
trabajo hace falta para ganar visitas. Actualiza antes de publicar. Escribe títulos que
digan lo que la persona gana, no el nombre interno. Responde en las tres primeras frases.
Enlaza desde tus páginas fuertes a las que quieres subir. Publica el precio en texto.
Menos páginas y mejores, porque lo flojo arrastra a lo bueno. Comprueba lo que ve el bot y
no lo que ves tú. Firma, fecha y cuenta cómo lo hiciste. Convierte en páginas las dudas
que te llegan por correo. Avisa al publicar, en vez de esperar al rastreo. Si hay vídeo,
pon la transcripción. Y repite las mismas mediciones cada mes, con la fecha puesta.

## Los fallos que más veces rompen una indexación

Antes de tocar nada en una web que no sale, descarta por orden: un noindex
olvidado de la fase de desarrollo, un Disallow de todo el sitio heredado del
entorno de pruebas, un sitio nuevo sin dar de alta y sin un solo enlace entrante,
las dos versiones del dominio vivas a la vez, un canonical que apunta a otra
página, contenido que solo existe tras ejecutar JavaScript, una redirección
automática por idioma, páginas huérfanas, y el caso más común en webs correctas:
indexada, pero sin ningún motivo para salir.

## Lo que queda fuera

Escribir el contenido, la publicidad de pago, la entregabilidad del correo y las
auditorías de sitios enormes que necesitan rastreador de pago. Se dice de frente
en vez de improvisar, y para el correo se dan las herramientas: Spamhaus y
MXToolbox Email Health, las dos en la sección de recursos de este sitio.