CDN y SEO: cómo afecta una CDN al rastreo, la caché y la velocidad
Tabla de contenidos
Una CDN puede bajarte el TTFB a la mitad y, a la vez, dejar a Googlebot fuera de tu sitio sin que lo notes. Esta guía de CDN y SEO separa lo que de verdad acelera de lo que te saca del índice.
Una CDN no es un factor de ranking: es infraestructura. Pero toca dos cosas que sí importan, cómo te rastrea Google y cuánto tarda en cargarse tu página. Aquí tienes qué hace, cómo cambia el rastreo, qué cabeceras de caché entiende y los errores que desindexan.
Qué es una CDN (y qué no)
Es una red de servidores intermedios entre tu origen y el usuario final. Google la define como un intermediario entre tu servidor de origen y el usuario final. Hace tres cosas que suelen mezclarse:
- Caché: entrega una copia guardada sin tocar tu origen.
- Filtrado: DDoS, WAF y limitación de peticiones.
- Disponibilidad: absorbe picos y sirve estáticos si el origen cae.
Las tres afectan al crawler: la caché decide qué HTML ve Googlebot, el WAF decide si lo ve y la disponibilidad cuánto puede rastrear. El patrón común es siempre el mismo: Cache-Control en el origen y reglas en el edge.
Cómo una CDN mejora la velocidad que Google mide
Menos latencia significa mejor TTFB y, en cadena, mejor LCP: la CDN sirve desde una ubicación cercana y se ahorra el viaje alrededor del mundo. No prometas cifras: no hay un porcentaje universal, depende de tu audiencia y de tu origen. Mide Core Web Vitals de campo antes y después.
¿Hostname aparte o el host principal detrás de la CDN?
Separar los estáticos en cdn.example.com puede ayudar al servicio de renderizado de Google, pero cada hostname extra cuesta una conexión y puede empeorar la experiencia de página. Con el host principal detrás de la CDN evitas ese coste, y su infraestructura de rastreo soporta ambas opciones.
Cómo cambia el rastreo cuando usas una CDN
Google permite tasas de rastreo más altas a los sitios respaldados por una CDN, y lo deduce de la IP del servicio que sirve las URLs. Es decir, la CDN puede darte un rastreo más agresivo, lo que se cruza con tu crawl budget. Está en su doctrina pública sobre CDN y rastreo.
La caché fría: el detalle que se olvida
La primera vez que se pide una URL, el edge está vacío: tu origen tiene que servirla al menos una vez. Al lanzar muchas URLs nuevas a la vez (catálogo, migración, sitemap gigante) el crawl rate será alto durante días aunque tengas CDN, y si el origen no aguanta esa primera pasada Google aplica throttling. La CDN no te ahorra la caché fría; solo la acorta.
Cómo verificar que Googlebot entra por la CDN
Google publica los rangos de IP de sus crawlers en JSON y los regenera a diario, y admite la verificación por DNS inverso: el hostname debe terminar en googlebot.com, google.com o googleusercontent.com, y el DNS directo debe devolver la misma IP. Ojo: Google rastrea desde Estados Unidos y, si detecta bloqueo desde ahí, puede cambiar de país. Si tu CDN geobloquea, te afecta.
La caché que sí entienden los rastreadores de Google
No confundas las capas: la CDN cachea para el usuario y Google además admite peticiones condicionales al rastrear. Un dato revelador: solo alrededor del 0,017% de sus fetches eran resolubles desde caché, cuando diez años antes era el 0,026%.
ETag con If-None-Match y Last-Modified con If-Modified-Since
Google soporta caché heurística con ETag en la respuesta e If-None-Match en la petición, y con Last-Modified e If-Modified-Since. Sus recomendaciones: usa ETag porque es menos propenso a errores, envía los dos validadores si puedes y exige refresco solo ante cambios significativos.
Cache-Control: max-age y la respuesta 304
Declara Cache-Control: max-age con los segundos que esperas que el contenido no cambie: le dice al crawler cuándo volver a rastrear. Si el validador coincide, responde 304 Not Modified sin cuerpo, y el crawler reutiliza su copia sin gastar recursos en tu servidor. Matiz: si el edge responde 200 desde su caché, la validación nunca llega al origen y el max-age que ve Google lo decide el edge.
HTTP/2, HTTP/3 y compresión: qué cambia de verdad
La documentación de los crawlers soporta HTTP/1.1 y HTTP/2 (por defecto, HTTP/1.1) y aclara que HTTP/2 no da ningún beneficio de producto: ninguna mejora de posicionamiento. HTTP/3 y QUIC aceleran a los usuarios, pero no están en la lista de protocolos de rastreo. Google acepta gzip, deflate y brotli.
Los errores de CDN que te sacan del índice
Es doctrina de Google y casi nadie la cita en español: la protección anti-flood de la CDN puede meter en su WAF a los bots que sí quieres, y esa blocklist puede crecer sola sin que lo sepas.
Bloqueos duros: 429, 503, timeouts y el peor de todos
- 503 y 429 son la forma preferida de bloquear temporalmente: Google lo entiende como temporal y te deja reaccionar sin perder URLs.
- Timeout de red de la CDN: error terminal. Las URLs afectadas se eliminan del índice y el crawl rate se hunde. Es el peor escenario silencioso.
- Error servido con HTTP 200: el más dañino. Si Google no lo identifica como error duro, las páginas con el mismo mensaje pueden eliminarse como duplicadas.
La tabla de códigos de Google confirma que los 4xx salvo el 429 no afectan al crawl rate, que no se debe usar 401 ni 403 para limitar el rastreo y que los 5xx y el 429 sí lo frenan.
Bloqueos suaves: el confirma que eres humano
El interstitial de verificación de bot o el CAPTCHA del WAF son un bloqueo blando: los crawlers solo ven el reto, no tu página. Pide a la CDN que devuelva 503 a los clientes automatizados cuando lo muestre, así el contenido no se elimina del índice. Detéctalo con la inspección de URL de Search Console: si la imagen renderizada sale vacía, hay que hablar con el proveedor.
Geotargeting: la CDN y las redirecciones por IP
Estar cerca del usuario no cambia tu país objetivo: con CDN distribuidas, la IP del servidor deja de ser una señal definitiva de audiencia. Lo que sí rompe el SEO son las redirecciones automáticas por IP o idioma, porque impiden que usuarios y buscadores vean todas las versiones. La alternativa son URLs por idioma más hreflang y un selector. Y cuidado con geo-bloquear países, porque Googlebot rastrea desde Estados Unidos.
Cómo auditar tu CDN en 10 minutos
- Mira las cabeceras reales de una URL de contenido:
Age,Cache-Control,ETagyX-Cache. ¿Viene del edge o del origen? - Prueba el validador: pide la URL con
curl -Iy conIf-None-Match. Un 304 sin cuerpo es el objetivo. - Compara lo que ve un navegador y lo que ve un crawler: revisa reglas por user-agent y un
Varymal puesto. - Inspecciona la URL en Search Console: es la forma oficial de detectar bloqueos duros y suaves.
- Revisa el WAF: blocklists y retos activos, y saca los rangos de Googlebot.
- Mira el crawl rate en Search Console y en los logs del servidor tras un cambio de reglas.
- Prueba un despliegue: ¿el purge afecta a Googlebot? ¿queda cacheado un canonical viejo?
- Mantén el mismo contenido para bots y personas: servir otra versión al crawler es cloaking, no caché.
Checklist: CDN y SEO sin romper nada
- Un solo hostname público: el principal detrás de la CDN.
- ETag y Last-Modified en HTML y recursos, con max-age según su cambio real.
- Estáticos inmutables con caché larga y versión en el nombre.
- stale-while-revalidate nunca para HTML que cambia.
- Compresión activa y sin reempaquetados raros.
- WAF con los rangos de Googlebot permitidos y revisión mensual.
- Nunca 403 ni 401 para limitar el rastreo; si hay que bloquear, 503 o 429.
- Cero interstitials de verificación servidos con 200 a crawlers.
- Sin redirecciones automáticas por IP o idioma: hreflang más selector.
- Medición antes y después con inspección de URL, Core Web Vitals e impresiones.
Una CDN bien puesta es de las inversiones de infraestructura con mejor retorno para tu rastreo: más crawl, menos latencia y menos carga en el origen. El riesgo no está en usarla, sino en dejarla decidir sola qué le responde a Googlebot.