# Robots.txt para SEO: reglas, rastreadores de IA y errores

> Qué es robots.txt y cómo afecta al SEO: sintaxis, qué admite Google, cómo gestionar rastreadores de IA como GPTBot y los errores que bloquean tu tráfico.

URL: https://seorecheck.com/es/blog/robots-txt-seo-guide · Publicado: 2026-10-07 · [English](https://seorecheck.com/blog/robots-txt-seo-guide.md), [Українська](https://seorecheck.com/ua/blog/robots-txt-seo-guide.md)

**Robots.txt** es un archivo de texto plano, ubicado en la raíz de tu dominio, que indica a los rastreadores de buscadores y de IA qué URLs pueden solicitar. Para el **SEO** es clave entender que controla el *rastreo*, no la *indexación*. Bien configurado, mantiene a los bots alejados de URLs de poco valor. Pero una sola línea equivocada puede ocultar todo tu sitio a Google o a buscadores con IA como ChatGPT search.

En esta guía verás qué admite realmente Google, cómo gestionar la creciente lista de rastreadores de IA y los errores de robots.txt que más aparecen en auditorías reales.

## Qué es robots.txt y qué hace realmente

Cuando un rastreador que respeta las normas llega a `https://example.com`, primero solicita `https://example.com/robots.txt` y lee las reglas de su user agent. Si una URL está bloqueada, el rastreador la omite. Eso es todo lo que hace el archivo. No elimina páginas de los resultados de búsqueda, no protege nada y no transmite señales de posicionamiento.

La documentación de Google lo dice sin rodeos: robots.txt "no es un mecanismo para impedir que una página web aparezca en Google". Una página bloqueada "puede indexarse igualmente si otros sitios enlazan a ella". En ese caso aparece en los resultados sin descripción, porque Google nunca tuvo permiso para leerla. Para mantener una página fuera del índice, Google recomienda `noindex` o protegerla con contraseña.

De aquí se derivan algunas consecuencias prácticas:

- Cada host necesita su propio archivo. `blog.example.com` y `example.com` son independientes, igual que `http` y `https`.
- El archivo debe estar en la raíz. `/carpeta/robots.txt` se ignora.
- Las rutas distinguen entre mayúsculas y minúsculas. `Disallow: /Admin/` no bloquea `/admin/`.

## Sintaxis de robots.txt: qué admite Google

Según Google Search Central, Google solo reconoce cuatro campos: `user-agent`, `allow`, `disallow` y `sitemap`. Otros campos, como `crawl-delay`, no los admite Google, aunque algunos otros rastreadores sí los respetan.

Un archivo típico y sano para la web de una pequeña empresa tiene este aspecto:

```
User-agent: *
Disallow: /cart/
Disallow: /checkout/
Disallow: /search
Disallow: /*?sort=
Allow: /wp-admin/admin-ajax.php
Disallow: /wp-admin/

Sitemap: https://example.com/sitemap.xml
```

### Cómo funcionan los comodines y los conflictos

- `*` coincide con cualquier secuencia de caracteres. `$` marca el final de una URL. Por ejemplo, `Disallow: /*.pdf$` bloquea las URLs que terminan en `.pdf`.
- Cuando coinciden a la vez una regla `allow` y una `disallow`, Google aplica la **más específica**, es decir, la de la ruta coincidente más larga. Si son igual de específicas, aplica la **menos restrictiva**.
- Un rastreador solo sigue el grupo `User-agent` más específico que le corresponda. Si creas un grupo `User-agent: Googlebot`, Googlebot ignorará todo lo que haya bajo `User-agent: *`. Tendrás que repetir las reglas comunes dentro del grupo de Googlebot.

### Límites, caché y errores del servidor

| Situación | Cómo lo gestiona Google (según Search Central) |
|---|---|
| Archivo de más de 500 KiB | Se ignora el contenido que supere los 500 KiB |
| Editas el archivo | Google suele almacenarlo en caché hasta 24 horas |
| robots.txt devuelve 4xx (salvo 429) | Se trata como si no existiera robots.txt, así que todo puede rastrearse |
| robots.txt devuelve 5xx | El rastreo se detiene 12 horas y después Google usa la copia en caché hasta 30 días |
| Línea `noindex` dentro de robots.txt | No se admite, así que se ignora |

La fila del 5xx es la que más sorprende. Un servidor o una CDN que da error en `/robots.txt` puede pausar el rastreo de todo tu sitio, aunque cada página por separado cargue sin problemas.

## ¿Conviene bloquear los rastreadores de IA en robots.txt?

Esta pregunta aparece ya en casi todas las auditorías. La mayoría de las empresas de IA usan **varios bots distintos**: uno recopila datos de entrenamiento, otro indexa contenido para su buscador con IA y otro obtiene páginas en tiempo real cuando un usuario hace una consulta. Bloquear el equivocado puede sacarte sin hacer ruido de las respuestas de IA.

| Empresa | Bot | Finalidad | ¿Respeta robots.txt? |
|---|---|---|---|
| Google | Googlebot | Búsqueda de Google, incluidas las funciones de IA en la Búsqueda | Sí |
| Google | Google-Extended | Token que controla el entrenamiento de Gemini y el grounding en las apps de Gemini | Sí |
| OpenAI | OAI-SearchBot | Mostrar sitios en ChatGPT search | Sí |
| OpenAI | GPTBot | Entrenamiento de modelos fundacionales | Sí |
| OpenAI | ChatGPT-User | Accesos iniciados por el usuario | Las reglas de robots.txt "pueden no aplicarse" |
| Anthropic | Claude-SearchBot | Indexación para resultados de búsqueda en Claude | Sí |
| Anthropic | ClaudeBot | Entrenamiento de modelos | Sí |
| Anthropic | Claude-User | Obtención de páginas para consultas de usuarios | Sí, según Anthropic |
| Perplexity | PerplexityBot | Mostrar y enlazar sitios en Perplexity | Sí |
| Perplexity | Perplexity-User | Accesos iniciados por el usuario | En general ignora robots.txt |

*Fuentes: documentación de rastreadores de Google, página de bots de OpenAI, centro de ayuda de Anthropic y documentación de rastreadores de Perplexity, consultadas en octubre de 2026.*

### Qué cambia realmente al bloquear cada bot

La propia documentación de cada proveedor explica las consecuencias:

- **Google-Extended** "no afecta a la inclusión de un sitio en la Búsqueda de Google ni se usa como señal de posicionamiento", según Google. Bloquearlo te excluye del entrenamiento y el grounding de Gemini. **No** te saca de los AI Overviews (resúmenes creados con IA), que dependen del rastreo normal de Googlebot. La palanca de robots.txt para eso sería bloquear Googlebot, lo que también te sacaría de la Búsqueda. Los controles de fragmentos como `nosnippet` son la herramienta más precisa.
- **OpenAI** indica que cada ajuste es independiente. Puedes permitir OAI-SearchBot para aparecer en las respuestas de ChatGPT search y bloquear GPTBot para que tu contenido no se use en el entrenamiento.
- **Anthropic** advierte que bloquear Claude-SearchBot o Claude-User "puede reducir la visibilidad de tu sitio" en los resultados de búsqueda de Claude.

Para la mayoría de las empresas que quieren visibilidad orgánica y en IA, una configuración razonable por defecto es permitir los bots de búsqueda y de usuario, y tomar una decisión de negocio consciente sobre los bots de entrenamiento:

```
# Opt out of model training, stay visible in AI search
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: *
Disallow: /cart/
Disallow: /checkout/

Sitemap: https://example.com/sitemap.xml
```

Aquí OAI-SearchBot, Claude-SearchBot y PerplexityBot no tienen grupo propio, así que recurren a `User-agent: *` y pueden rastrear tu contenido. Ten en cuenta que `llms.txt` es un archivo distinto y no tiene ningún efecto en la Búsqueda de Google. Robots.txt es el archivo que los rastreadores consultan de verdad. Para una visión más amplia de la visibilidad en IA, consulta nuestra [checklist de optimización para buscadores con IA](https://seorecheck.com/es/blog/ai-search-optimization-checklist).

## Robots.txt vs noindex vs canonical: ¿cuál usar?

Cada una de estas herramientas cumple una función distinta, y confundirlas es uno de los errores de SEO técnico más habituales.

| Objetivo | Herramienta adecuada | Por qué |
|---|---|---|
| Ahorrar rastreo en filtros infinitos o en la búsqueda interna | `Disallow` en robots.txt | Detiene las propias solicitudes de rastreo |
| Mantener una página fuera de los resultados de búsqueda | Metaetiqueta `noindex` o cabecera `X-Robots-Tag` | Elimina la página del índice, pero solo si Google puede rastrearla para ver la etiqueta |
| Consolidar URLs duplicadas | `rel="canonical"` | Transmite las señales a la versión preferida (consulta nuestra [guía de la etiqueta canonical](https://seorecheck.com/es/blog/canonical-tag-guide)) |
| Ocultar contenido privado | Contraseña o autenticación | Robots.txt es público y cualquiera puede leerlo |

### Por qué falla combinar robots.txt y noindex en la misma página

Cuando una página está bloqueada en robots.txt, Google nunca la descarga, así que nunca ve la etiqueta `noindex`. Si otros sitios enlazan a esa URL, puede seguir indexada indefinidamente como un resultado sin fragmento. La solución parece ir al revés, pero funciona: **quita primero el disallow**, deja que Google rastree la página y procese el `noindex`, y después vuelve a añadir el bloqueo si todavía lo necesitas. Lo mismo ocurre con las canonical: Google no puede leer una etiqueta canonical en una página que no tiene permiso para rastrear.

## Los errores más comunes en robots.txt

Estos son los problemas que aparecen una y otra vez en las auditorías técnicas, ordenados aproximadamente según el daño que causan.

1. **Un `Disallow: /` heredado del entorno de staging.** Un desarrollador bloquea el sitio de pruebas y el archivo pasa a producción con el lanzamiento. El tráfico cae en los días siguientes a medida que Google deja de volver a rastrear. Es una de las primeras cosas que hay que revisar al [diagnosticar una caída de tráfico web](https://seorecheck.com/es/blog/website-traffic-drop-diagnosis).
2. **Bloquear carpetas de CSS, JavaScript o imágenes.** Reglas antiguas de la época de WordPress como `Disallow: /wp-includes/` o `Disallow: /assets/` impiden que Google renderice bien la página. Google ve entonces un diseño roto y puede evaluar mal la adaptación a móviles o pasar por alto contenido que carga JavaScript.
3. **Bloquear páginas que quieres posicionar.** Una regla amplia como `Disallow: /product` también afecta a `/products/` y `/product-guides/`, porque las reglas coinciden por prefijo de URL.
4. **Un robots.txt que devuelve 5xx o agota el tiempo de espera.** Como muestra la tabla anterior, esto puede detener el rastreo de todo el sitio.
5. **Bloquear parámetros que contienen contenido real.** Si tus páginas de categoría se paginan con `?page=2`, bloquear `/*?` impide que se descubran esos productos.
6. **Bloquear por accidente los bots de búsqueda con IA.** Un fragmento genérico para "bloquear toda la IA" copiado de un foro suele incluir OAI-SearchBot, Claude-SearchBot o PerplexityBot, lo que te saca de esos motores de respuesta.
7. **Confiar en directivas no admitidas.** `Noindex:`, `Crawl-delay:` (para Google) y los comentarios en formatos no estándar no tienen ningún efecto en Googlebot.
8. **Una URL de sitemap relativa.** La línea `Sitemap:` debe usar una URL absoluta completa, como `https://example.com/sitemap.xml`.

## ¿Cómo probar tu archivo robots.txt?

La prueba lleva unos 15 minutos y conviene repetirla después de cada publicación de cambios en el sitio.

1. **Abre el archivo en producción** en `tudominio.com/robots.txt`. Comprueba que devuelve HTTP 200 y que el contenido es el esperado, y hazlo para cada subdominio y variante de protocolo.
2. **Revisa el informe de robots.txt en Google Search Console** (Ajustes → robots.txt). Muestra qué archivos robots.txt ha encontrado Google, cuándo los descargó por última vez y cualquier error de obtención o advertencia de análisis. Sustituyó al antiguo Probador de robots.txt independiente.
3. **Usa la Inspección de URLs** en tus páginas más importantes. Si una página aparece como "Bloqueada por robots.txt", localiza la regla responsable.
4. **Cruza los datos con tu sitemap.** Cualquier URL incluida en tu sitemap XML pero bloqueada en robots.txt envía señales contradictorias a Google y debe corregirse.
5. **Revisa los logs del servidor o la configuración de bots de tu CDN.** Algunas CDN y plugins de seguridad bloquean los rastreadores de IA en el firewall, diga lo que diga robots.txt. Confirma que los bots que quieres reciben respuestas 200.

Si páginas clave aparecen como "Descubierta: actualmente sin indexar" junto con restricciones de rastreo, nuestra guía sobre [Descubierta: actualmente sin indexar](https://seorecheck.com/es/blog/discovered-currently-not-indexed-fix) explica cómo interactúan el presupuesto de rastreo y los recursos bloqueados.

## Cómo revisa SEORecheck el robots.txt en una auditoría SEO

Los problemas de robots.txt son fáciles de pasar por alto a simple vista, porque el archivo parece correcto hasta que lo comparas con lo que realmente hay en tu sitio. Una auditoría automatizada descarga el archivo y luego contrasta con él cada URL rastreada. Señala las páginas importantes bloqueadas, los recursos de renderizado bloqueados, las URLs del sitemap que contradicen las reglas y los rastreadores de búsqueda con IA que se quedan fuera. Cada hallazgo incluye las URLs afectadas y la regla exacta que lo provoca. Puedes ver el formato en el [informe de ejemplo](https://seorecheck.com/es/sample).

Una vez corregido todo, una reauditoría 30–60 días después muestra qué problemas están resueltos, han mejorado, siguen sin resolver o son nuevos. Esto ayuda cuando un despliegue posterior vuelve a introducir sin avisar una regla antigua. Aquí tienes una [comparación de ejemplo](https://seorecheck.com/es/sample/compare).

## Conclusiones clave

- Robots.txt controla el **rastreo, no la indexación**. Usa `noindex` o autenticación para mantener páginas fuera de Google.
- Google solo admite `user-agent`, `allow`, `disallow` y `sitemap`. Ignora `crawl-delay` y `noindex` en robots.txt.
- Un robots.txt que devuelve 5xx puede pausar el rastreo de todo tu sitio, así que vigílalo como una página crítica.
- Nunca bloquees una página esperando que Google vea su `noindex` o su etiqueta canonical.
- Las empresas de IA usan bots distintos para entrenamiento y para búsqueda. Bloquear GPTBot, ClaudeBot o Google-Extended no te saca de ChatGPT search, de la búsqueda de Claude ni de la Búsqueda de Google, pero bloquear OAI-SearchBot, Claude-SearchBot o PerplexityBot sí te saca de esas herramientas.
- Prueba el archivo después de cada publicación: revisa el archivo en producción, el informe de robots.txt de Search Console y la Inspección de URLs de tus páginas clave.

## Revisa tu robots.txt dentro de una auditoría SEO completa

Si no tienes claro si tu robots.txt está bloqueando páginas, recursos o rastreadores de búsqueda con IA importantes, una auditoría rápida te lo dirá. [Solicita una vista previa gratuita de tu auditoría SEO](https://seorecheck.com/es/request) para obtener tu puntuación SEO y varios problemas reales detectados en tus propias páginas, sin necesidad de crear una cuenta. Para ver todo lo que cubre una auditoría, consulta la [checklist de auditoría SEO](https://seorecheck.com/es/blog/seo-audit-checklist).

---

## ¿Quieres saber qué corregir en tu web?

Obtén una vista previa gratuita de la auditoría SEO: tu puntuación y problemas reales, con evidencias de tus páginas.

- [Obtener auditoría SEO gratis](https://seorecheck.com/es/request)
- [Ver informe de ejemplo](https://seorecheck.com/es/sample)
