SEO técnico

Robots.txt para SEO: reglas, rastreadores de IA y errores

Robots.txt indica a los rastreadores qué URLs pueden solicitar. Controla el rastreo, no la indexación: para sacar una página de Google usa noindex y nunca bloquees el CSS, el JS ni las páginas que quieres posicionar.

Por Equipo de investigación de SEORecheck, auditores SEOPublicado 10 min de lectura

Robots.txt es un archivo de texto plano, ubicado en la raíz de tu dominio, que indica a los rastreadores de buscadores y de IA qué URLs pueden solicitar. Para el SEO es clave entender que controla el rastreo, no la indexación. Bien configurado, mantiene a los bots alejados de URLs de poco valor. Pero una sola línea equivocada puede ocultar todo tu sitio a Google o a buscadores con IA como ChatGPT search.

En esta guía verás qué admite realmente Google, cómo gestionar la creciente lista de rastreadores de IA y los errores de robots.txt que más aparecen en auditorías reales.

Qué es robots.txt y qué hace realmente

Cuando un rastreador que respeta las normas llega a https://example.com, primero solicita https://example.com/robots.txt y lee las reglas de su user agent. Si una URL está bloqueada, el rastreador la omite. Eso es todo lo que hace el archivo. No elimina páginas de los resultados de búsqueda, no protege nada y no transmite señales de posicionamiento.

La documentación de Google lo dice sin rodeos: robots.txt "no es un mecanismo para impedir que una página web aparezca en Google". Una página bloqueada "puede indexarse igualmente si otros sitios enlazan a ella". En ese caso aparece en los resultados sin descripción, porque Google nunca tuvo permiso para leerla. Para mantener una página fuera del índice, Google recomienda noindex o protegerla con contraseña.

De aquí se derivan algunas consecuencias prácticas:

  • Cada host necesita su propio archivo. blog.example.com y example.com son independientes, igual que http y https.
  • El archivo debe estar en la raíz. /carpeta/robots.txt se ignora.
  • Las rutas distinguen entre mayúsculas y minúsculas. Disallow: /Admin/ no bloquea /admin/.

Sintaxis de robots.txt: qué admite Google

Según Google Search Central, Google solo reconoce cuatro campos: user-agent, allow, disallow y sitemap. Otros campos, como crawl-delay, no los admite Google, aunque algunos otros rastreadores sí los respetan.

Un archivo típico y sano para la web de una pequeña empresa tiene este aspecto:

User-agent: *
Disallow: /cart/
Disallow: /checkout/
Disallow: /search
Disallow: /*?sort=
Allow: /wp-admin/admin-ajax.php
Disallow: /wp-admin/

Sitemap: https://example.com/sitemap.xml

Cómo funcionan los comodines y los conflictos

  • * coincide con cualquier secuencia de caracteres. $ marca el final de una URL. Por ejemplo, Disallow: /*.pdf$ bloquea las URLs que terminan en .pdf.
  • Cuando coinciden a la vez una regla allow y una disallow, Google aplica la más específica, es decir, la de la ruta coincidente más larga. Si son igual de específicas, aplica la menos restrictiva.
  • Un rastreador solo sigue el grupo User-agent más específico que le corresponda. Si creas un grupo User-agent: Googlebot, Googlebot ignorará todo lo que haya bajo User-agent: *. Tendrás que repetir las reglas comunes dentro del grupo de Googlebot.

Límites, caché y errores del servidor

Situación Cómo lo gestiona Google (según Search Central)
Archivo de más de 500 KiB Se ignora el contenido que supere los 500 KiB
Editas el archivo Google suele almacenarlo en caché hasta 24 horas
robots.txt devuelve 4xx (salvo 429) Se trata como si no existiera robots.txt, así que todo puede rastrearse
robots.txt devuelve 5xx El rastreo se detiene 12 horas y después Google usa la copia en caché hasta 30 días
Línea noindex dentro de robots.txt No se admite, así que se ignora

La fila del 5xx es la que más sorprende. Un servidor o una CDN que da error en /robots.txt puede pausar el rastreo de todo tu sitio, aunque cada página por separado cargue sin problemas.

¿Conviene bloquear los rastreadores de IA en robots.txt?

Esta pregunta aparece ya en casi todas las auditorías. La mayoría de las empresas de IA usan varios bots distintos: uno recopila datos de entrenamiento, otro indexa contenido para su buscador con IA y otro obtiene páginas en tiempo real cuando un usuario hace una consulta. Bloquear el equivocado puede sacarte sin hacer ruido de las respuestas de IA.

Empresa Bot Finalidad ¿Respeta robots.txt?
Google Googlebot Búsqueda de Google, incluidas las funciones de IA en la Búsqueda Sí
Google Google-Extended Token que controla el entrenamiento de Gemini y el grounding en las apps de Gemini Sí
OpenAI OAI-SearchBot Mostrar sitios en ChatGPT search Sí
OpenAI GPTBot Entrenamiento de modelos fundacionales Sí
OpenAI ChatGPT-User Accesos iniciados por el usuario Las reglas de robots.txt "pueden no aplicarse"
Anthropic Claude-SearchBot Indexación para resultados de búsqueda en Claude Sí
Anthropic ClaudeBot Entrenamiento de modelos Sí
Anthropic Claude-User Obtención de páginas para consultas de usuarios Sí, según Anthropic
Perplexity PerplexityBot Mostrar y enlazar sitios en Perplexity Sí
Perplexity Perplexity-User Accesos iniciados por el usuario En general ignora robots.txt

Fuentes: documentación de rastreadores de Google, página de bots de OpenAI, centro de ayuda de Anthropic y documentación de rastreadores de Perplexity, consultadas en octubre de 2026.

Qué cambia realmente al bloquear cada bot

La propia documentación de cada proveedor explica las consecuencias:

  • Google-Extended "no afecta a la inclusión de un sitio en la Búsqueda de Google ni se usa como señal de posicionamiento", según Google. Bloquearlo te excluye del entrenamiento y el grounding de Gemini. No te saca de los AI Overviews (resúmenes creados con IA), que dependen del rastreo normal de Googlebot. La palanca de robots.txt para eso sería bloquear Googlebot, lo que también te sacaría de la Búsqueda. Los controles de fragmentos como nosnippet son la herramienta más precisa.
  • OpenAI indica que cada ajuste es independiente. Puedes permitir OAI-SearchBot para aparecer en las respuestas de ChatGPT search y bloquear GPTBot para que tu contenido no se use en el entrenamiento.
  • Anthropic advierte que bloquear Claude-SearchBot o Claude-User "puede reducir la visibilidad de tu sitio" en los resultados de búsqueda de Claude.

Para la mayoría de las empresas que quieren visibilidad orgánica y en IA, una configuración razonable por defecto es permitir los bots de búsqueda y de usuario, y tomar una decisión de negocio consciente sobre los bots de entrenamiento:

# Opt out of model training, stay visible in AI search
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: *
Disallow: /cart/
Disallow: /checkout/

Sitemap: https://example.com/sitemap.xml

Aquí OAI-SearchBot, Claude-SearchBot y PerplexityBot no tienen grupo propio, así que recurren a User-agent: * y pueden rastrear tu contenido. Ten en cuenta que llms.txt es un archivo distinto y no tiene ningún efecto en la Búsqueda de Google. Robots.txt es el archivo que los rastreadores consultan de verdad. Para una visión más amplia de la visibilidad en IA, consulta nuestra checklist de optimización para buscadores con IA.

Robots.txt vs noindex vs canonical: ¿cuál usar?

Cada una de estas herramientas cumple una función distinta, y confundirlas es uno de los errores de SEO técnico más habituales.

Objetivo Herramienta adecuada Por qué
Ahorrar rastreo en filtros infinitos o en la búsqueda interna Disallow en robots.txt Detiene las propias solicitudes de rastreo
Mantener una página fuera de los resultados de búsqueda Metaetiqueta noindex o cabecera X-Robots-Tag Elimina la página del índice, pero solo si Google puede rastrearla para ver la etiqueta
Consolidar URLs duplicadas rel="canonical" Transmite las señales a la versión preferida (consulta nuestra guía de la etiqueta canonical)
Ocultar contenido privado Contraseña o autenticación Robots.txt es público y cualquiera puede leerlo

Por qué falla combinar robots.txt y noindex en la misma página

Cuando una página está bloqueada en robots.txt, Google nunca la descarga, así que nunca ve la etiqueta noindex. Si otros sitios enlazan a esa URL, puede seguir indexada indefinidamente como un resultado sin fragmento. La solución parece ir al revés, pero funciona: quita primero el disallow, deja que Google rastree la página y procese el noindex, y después vuelve a añadir el bloqueo si todavía lo necesitas. Lo mismo ocurre con las canonical: Google no puede leer una etiqueta canonical en una página que no tiene permiso para rastrear.

Los errores más comunes en robots.txt

Estos son los problemas que aparecen una y otra vez en las auditorías técnicas, ordenados aproximadamente según el daño que causan.

  1. Un Disallow: / heredado del entorno de staging. Un desarrollador bloquea el sitio de pruebas y el archivo pasa a producción con el lanzamiento. El tráfico cae en los días siguientes a medida que Google deja de volver a rastrear. Es una de las primeras cosas que hay que revisar al diagnosticar una caída de tráfico web.
  2. Bloquear carpetas de CSS, JavaScript o imágenes. Reglas antiguas de la época de WordPress como Disallow: /wp-includes/ o Disallow: /assets/ impiden que Google renderice bien la página. Google ve entonces un diseño roto y puede evaluar mal la adaptación a móviles o pasar por alto contenido que carga JavaScript.
  3. Bloquear páginas que quieres posicionar. Una regla amplia como Disallow: /product también afecta a /products/ y /product-guides/, porque las reglas coinciden por prefijo de URL.
  4. Un robots.txt que devuelve 5xx o agota el tiempo de espera. Como muestra la tabla anterior, esto puede detener el rastreo de todo el sitio.
  5. Bloquear parámetros que contienen contenido real. Si tus páginas de categoría se paginan con ?page=2, bloquear /*? impide que se descubran esos productos.
  6. Bloquear por accidente los bots de búsqueda con IA. Un fragmento genérico para "bloquear toda la IA" copiado de un foro suele incluir OAI-SearchBot, Claude-SearchBot o PerplexityBot, lo que te saca de esos motores de respuesta.
  7. Confiar en directivas no admitidas. Noindex:, Crawl-delay: (para Google) y los comentarios en formatos no estándar no tienen ningún efecto en Googlebot.
  8. Una URL de sitemap relativa. La línea Sitemap: debe usar una URL absoluta completa, como https://example.com/sitemap.xml.

¿Cómo probar tu archivo robots.txt?

La prueba lleva unos 15 minutos y conviene repetirla después de cada publicación de cambios en el sitio.

  1. Abre el archivo en producción en tudominio.com/robots.txt. Comprueba que devuelve HTTP 200 y que el contenido es el esperado, y hazlo para cada subdominio y variante de protocolo.
  2. Revisa el informe de robots.txt en Google Search Console (Ajustes → robots.txt). Muestra qué archivos robots.txt ha encontrado Google, cuándo los descargó por última vez y cualquier error de obtención o advertencia de análisis. Sustituyó al antiguo Probador de robots.txt independiente.
  3. Usa la Inspección de URLs en tus páginas más importantes. Si una página aparece como "Bloqueada por robots.txt", localiza la regla responsable.
  4. Cruza los datos con tu sitemap. Cualquier URL incluida en tu sitemap XML pero bloqueada en robots.txt envía señales contradictorias a Google y debe corregirse.
  5. Revisa los logs del servidor o la configuración de bots de tu CDN. Algunas CDN y plugins de seguridad bloquean los rastreadores de IA en el firewall, diga lo que diga robots.txt. Confirma que los bots que quieres reciben respuestas 200.

Si páginas clave aparecen como "Descubierta: actualmente sin indexar" junto con restricciones de rastreo, nuestra guía sobre Descubierta: actualmente sin indexar explica cómo interactúan el presupuesto de rastreo y los recursos bloqueados.

Cómo revisa SEORecheck el robots.txt en una auditoría SEO

Los problemas de robots.txt son fáciles de pasar por alto a simple vista, porque el archivo parece correcto hasta que lo comparas con lo que realmente hay en tu sitio. Una auditoría automatizada descarga el archivo y luego contrasta con él cada URL rastreada. Señala las páginas importantes bloqueadas, los recursos de renderizado bloqueados, las URLs del sitemap que contradicen las reglas y los rastreadores de búsqueda con IA que se quedan fuera. Cada hallazgo incluye las URLs afectadas y la regla exacta que lo provoca. Puedes ver el formato en el informe de ejemplo.

Una vez corregido todo, una reauditoría 30–60 días después muestra qué problemas están resueltos, han mejorado, siguen sin resolver o son nuevos. Esto ayuda cuando un despliegue posterior vuelve a introducir sin avisar una regla antigua. Aquí tienes una comparación de ejemplo.

Conclusiones clave

  • Robots.txt controla el rastreo, no la indexación. Usa noindex o autenticación para mantener páginas fuera de Google.
  • Google solo admite user-agent, allow, disallow y sitemap. Ignora crawl-delay y noindex en robots.txt.
  • Un robots.txt que devuelve 5xx puede pausar el rastreo de todo tu sitio, así que vigílalo como una página crítica.
  • Nunca bloquees una página esperando que Google vea su noindex o su etiqueta canonical.
  • Las empresas de IA usan bots distintos para entrenamiento y para búsqueda. Bloquear GPTBot, ClaudeBot o Google-Extended no te saca de ChatGPT search, de la búsqueda de Claude ni de la Búsqueda de Google, pero bloquear OAI-SearchBot, Claude-SearchBot o PerplexityBot sí te saca de esas herramientas.
  • Prueba el archivo después de cada publicación: revisa el archivo en producción, el informe de robots.txt de Search Console y la Inspección de URLs de tus páginas clave.

Revisa tu robots.txt dentro de una auditoría SEO completa

Si no tienes claro si tu robots.txt está bloqueando páginas, recursos o rastreadores de búsqueda con IA importantes, una auditoría rápida te lo dirá. Solicita una vista previa gratuita de tu auditoría SEO para obtener tu puntuación SEO y varios problemas reales detectados en tus propias páginas, sin necesidad de crear una cuenta. Para ver todo lo que cubre una auditoría, consulta la checklist de auditoría SEO.

Todos los artículos

SEO técnico

Enlazado interno SEO: guía práctica para corregirlo

El enlazado interno SEO consiste en conectar tus propias páginas con enlaces rastreables y descriptivos para que Google pueda encontrarlas, entenderlas y saber cuáles importan más.

11 min de lectura