Cómo crear un robots.txt correcto en 2026: directivas, errores comunes y crawlers de IA
Tabla de contenidos
Un robots.txt mal escrito puede frenar la indexación de tu web sin que lo notes: basta una línea disallow mal colocada. En 2026 Google fue claro sobre qué directivas lee y cuáles ignora, y los crawlers de IA cambiaron las reglas del juego. Esta guía te dice cómo escribir el tuyo sin errores.
Qué directivas lee Google en tu robots.txt (y cuáles ignora)
Antes de tocar nada conviene recordar el propósito real del archivo: según la documentación oficial de Google, el robots.txt sirve para controlar el rastreo y evitar la sobrecarga del servidor, y no es un mecanismo para ocultar páginas de los resultados de búsqueda. Si necesitas la base, lee primero qué es el archivo robots.txt y por qué es importante para el SEO. Aquí vamos directo a las reglas que de verdad importan en 2026.
Directivas soportadas
Google solo reconoce un puñado de campos. Estos son los que puedes usar con seguridad:
user-agent: es obligatoria. Define a qué crawler aplica el grupo de reglas que le sigue y puede repetirse una o más veces.disallowyallow: permiten o bloquean rutas. Cuando hay varias reglas, gana la más específica (lo vemos en el siguiente apartado).sitemap: no está atada a ningún user-agent y se pueden declarar varios sitemaps sin límite. El nombre del campo no distingue mayúsculas, pero el valor sí. Los crawlers ignoran esta línea al evaluar reglas de bloqueo.
Directivas que Google NO soporta
Google ignora varios campos que aparecen en guías antiguas: crawl-delay (en febrero de 2026 Google aclaró oficialmente que no lo soporta), host, request-rate, visit-time, y sobre todo noindex y nofollow, que solo funcionan en meta robots o cabeceras HTTP.
Revisa tu archivo actual y quita esas líneas muertas. No hacen daño técnico, pero confunden a quien lo lee y dan una falsa sensación de control.
Cómo decide Google si una URL está bloqueada
La regla se llama "más específico gana" (most-specific match) y quedó estandarizada en el RFC 9309 de 2022. Si una URL coincide con varias reglas, gana la coincidencia más larga; allow y disallow tienen la misma prioridad, así que lo que decide es cuál encaja mejor, no el orden en que aparecen.
También hay dos comodines: * representa cualquier secuencia de caracteres y $ marca el fin de la URL. Y un detalle que se olvida: las rutas del robots.txt distinguen mayúsculas de minúsculas.
User-agent: *
Disallow: /admin
Allow: /admin/public
# /admin/public/* queda permitido porque el Allow coincide mejor
Errores comunes de robots.txt que cuestan indexación
La mayoría de los problemas no vienen de una directiva rara, sino de malentendidos básicos. Estos son los que más indexación cuestan:
- Bloquear CSS y JavaScript: impide que Google renderice la página. El screenshot de la Inspección de URL te mostrará una versión rota. Los recursos no se bloquean con robots.txt, sino con noindex o cabeceras.
- Poner
noindexdentro del robots.txt: no funciona; Google lo ignora. Para no indexar se usanoindexen meta robots o cabecera HTTP, como explica la propia guía de Google para bloquear la indexación. - Usar robots.txt para "ocultar" páginas privadas: además de no funcionar para ocultar, consume rastreo. Para contenido sensible se usa autenticación del lado del servidor.
- Bloquear secciones que sí quieres indexar: un
Disallow: /mal puesto o una regla demasiado amplia con*puede frenar todo el sitio. - Confundir user-agents: querer bloquear a Google-Extended (IA) y bloquear por error a
Googlebot(búsqueda). Son user-agents distintos, como verás en el apartado de crawlers de IA. - Olvidar la línea
Sitemap:: apuntar al sitemap XML complementa el envío en Search Console. Si necesitas repasar cómo armarlo, mira la guía de cómo configurar Google XML Sitemaps.
Cómo detectarlos
La señal típica aparece en el informe de cobertura de Search Console: "Página bloqueada por robots.txt" (Blocked by robots.txt). Si ves ese estado en URLs que deberían indexarse, el archivo es el sospechoso número uno.
robots.txt frente a noindex: cuándo usar cada uno
La diferencia se resume en dos palabras: rastreo e indexación. El robots.txt controla el rastreo, es decir, qué consume recursos de tu servidor. El noindex controla la indexación, es decir, qué aparece en Google.
Regla práctica: si una página no debe aparecer en Google, usa noindex (la URL se puede rastrear y descartar). Si una sección es enorme y no aporta valor, como filtros de un ecommerce, ahí sí tiene sentido un disallow.
Un aviso importante: una página bloqueada por robots.txt puede seguir apareciendo en los resultados si tiene enlaces externos, porque Google puede indexarla sin rastrear su contenido. Por eso "ocultar" páginas con robots.txt no se logra; para eso existe la autenticación.
Crawlers de IA en 2026: qué bloquear y qué permitir
Los proveedores de IA separan cada vez más los crawlers de entrenamiento de los de búsqueda. Según seguimientos de mayo de 2026, alrededor del 30% de los sitios top bloquean el entrenamiento y permiten la búsqueda, para optar a citas en las respuestas de IA sin ceder contenido para entrenar modelos.
Bots de entrenamiento (bloquear si no quieres que usen tu contenido)
GPTBot(OpenAI)Google-Extended(entrenamiento de Gemini y Vertex; no afecta tu ranking en Google Search)ClaudeBotyanthropic-ai(Anthropic)CCBot(Common Crawl)Bytespider(ByteDance)PerplexityBot(según la política de cada sitio)Applebot-Extended(Apple)
Bots de búsqueda y retrieval (conviene permitir)
OAI-SearchBot(búsqueda de ChatGPT)Claude-SearchBot(búsqueda de Claude)PerplexityBot(Perplexity)
Nota: Google-Extended no es un bot de búsqueda. Permitir a los bots de retrieval te hace elegible para ser citado en respuestas de IA sin entregar contenido al entrenamiento, una política defendible según el panorama de user-agents de IA de 2026.
El matiz de 2026: no todos respetan robots.txt
El RFC 9309 es un estándar de cumplimiento voluntario. Agentes como Google-Agent y algunos fetchers automáticos ignoran robots.txt. Si necesitas restringirlos de verdad, hazlo del lado del servidor: autenticación, rate limiting o bloqueo por IP o ASN.
Plantilla mínima para bloquear entrenamiento sin tocar la búsqueda
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: Bytespider
Disallow: /
Fíjate en lo que no está: ni OAI-SearchBot, ni PerplexityBot, ni Claude-SearchBot. Si los dejas libres, sigues siendo elegible para aparecer en respuestas de IA.
Cómo probar tu robots.txt en 2026
El robots.txt Tester de Search Console se retiró en diciembre de 2023. Hoy se prueba URL por URL con la herramienta Inspección de URL, que muestra si el rastreo está bloqueado, por qué regla, y el screenshot renderizado de la página.
Una verificación rápida manual es pedir el archivo directamente: curl -s https://tudominio.com/robots.txt (o abrirlo en el navegador) para confirmar que responde 200 y que el archivo visible es el correcto.
Checklist de prueba:
- ¿El archivo responde con HTTP 200?
- ¿El grupo
User-agent: *no bloquea secciones públicas? - ¿CSS y JavaScript son accesibles para Googlebot?
- ¿La línea
Sitemap:apunta a la URL correcta del sitemap XML? - ¿Los user-agents de IA están separados de
Googlebot?
Plantilla: un robots.txt de ejemplo para 2026
Este archivo permite a Googlebot y a los bots de búsqueda de IA, bloquea el entrenamiento de los principales proveedores y deja fuera secciones privadas reales. Es una plantilla genérica: cada sitio ajusta las rutas según su estructura.
User-agent: *
Disallow: /admin
Disallow: /api/privado
User-agent: Googlebot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
Sitemap: https://tudominio.com/sitemap.xml
Mantén Googlebot separado de los bots de entrenamiento. Si algún día decides permitir la IA de entrenamiento, basta con borrar esos grupos.
Preguntas frecuentes sobre robots.txt
¿robots.txt afecta al posicionamiento?
Indirectamente. Mal escrito puede impedir la indexación de páginas que sí quieres en Google; bien escrito solo gestiona el rastreo y no mejora ni empeora posiciones por sí mismo.
¿Debo bloquear Google-Extended?
Depende de si quieres que tu contenido se use para entrenar Gemini y Vertex. Bloquearlo no afecta tu posición en Google Search, porque es un user-agent de entrenamiento, no de búsqueda.
¿Dónde debe estar el archivo?
En la raíz del dominio: https://tudominio.com/robots.txt. Hay un solo archivo por dominio, subdominio y protocolo, así que cada variante necesita el suyo.
Si quieres profundizar en por qué el rastreo importa, revisa la guía sobre crawl budget y cómo optimizarlo.