Guía

robots.txt para crawlers de IA

Tu robots.txt es lo primero que consulta un crawler de IA antes de leerte. Muchas plantillas y CDNs bloquean por defecto a GPTBot, ClaudeBot o PerplexityBot sin que nadie lo recuerde: el resultado es que, cuando un asistente busca en vivo, tu contenido no está disponible para él. Esto es lo que conviene saber para decidir tu política con conocimiento de causa.

1. Entiende qué es robots.txt y quién lo respeta

Es un archivo de texto en la raíz de tu dominio (/robots.txt) que declara qué user-agents pueden acceder a qué rutas. No es un muro técnico: es una convención de buena fe. Los crawlers de IA documentados de OpenAI, Anthropic, Perplexity y Google afirman respetarlo; bloquear ahí sí frena a esos bots concretos.

2. Conoce los user-agents de IA que importan

Los principales: GPTBot y OAI-SearchBot (OpenAI), ClaudeBot (Anthropic), PerplexityBot (Perplexity), Google-Extended (entrenamiento de Gemini), CCBot (Common Crawl, dataset usado por muchos modelos) y Applebot-Extended (Apple). Cada uno tiene su propio nombre y su propia línea User-agent.

3. Distingue entrenamiento de búsqueda en vivo

No todos los bots hacen lo mismo. GPTBot o ClaudeBot recogen datos para entrenar e indexar; ChatGPT-User y Perplexity-User visitan tu página a petición de un usuario concreto. Bloquear el entrenamiento no impide que un asistente te cite cuando alguien pregunta por ti — y bloquear la navegación en vivo sí te deja fuera de esas respuestas.

4. Decide tu política de forma consciente

Permitir maximiza tu presencia: si quieres que las IAs te lean, entiendan y citen, déjalos entrar. Bloquear tiene sentido si no quieres que tu contenido alimente entrenamientos. Es una decisión legítima de negocio; lo que no conviene es bloquear por accidente y perder citaciones sin haberlo elegido.

5. Escribe reglas explícitas por user-agent

Añade un bloque User-agent por cada bot y su Allow o Disallow. Ser explícito evita sorpresas: una regla clara para GPTBot pesa más que confiar en el comodín User-agent: *. Declara lo que de verdad quieres, bot por bot.

6. Declara tu sitemap en el mismo archivo

Añade la línea Sitemap: https://tudominio.com/sitemap.xml al final del robots.txt. Ayuda a crawlers y agentes a descubrir tus páginas en vez de adivinarlas, y no cuesta nada.

7. Cuidado con el bloqueo por defecto

Muchos generadores, plugins de "privacidad" y configuraciones de CDN añaden Disallow para bots de IA sin avisar. Revisa tu robots.txt real —el que sirve tu dominio ahora mismo— y confirma que refleja tu decisión, no la de una plantilla.

8. Verifica que se aplica de verdad

Después de editarlo, comprueba el archivo servido en https://tudominio.com/robots.txt y valida qué bots quedan permitidos o bloqueados. Con nuestro checker gratuito ves, bot por bot, si tu política es la que crees que es.

No adivines si te bloqueas por accidente: comprueba tu robots.txt gratis y mira, bot de IA por bot de IA, quién puede leerte hoy — y de paso obtén tu Puntuación de Visibilidad IA completa.

FAQ

¿Si bloqueo GPTBot desaparezco de ChatGPT?

No del todo. Bloquear GPTBot frena la recolección de datos para entrenar e indexar, pero la navegación en vivo (ChatGPT-User) responde a otro user-agent. Aun así, bloquear el crawler reduce lo que el asistente sabe de ti y puede recortar tus citaciones. Decídelo a conciencia, no por descuido.

¿robots.txt protege legalmente mi contenido?

No. Es una convención de buena fe: los bots que la respetan la obedecen, pero no impide técnicamente el acceso de quien no la respete. Es una señal de tu voluntad, no un candado.

¿Qué pasa si no tengo robots.txt?

Sin robots.txt, los bots entran por defecto: no los bloqueas, pero tampoco declaras ninguna política ni tu sitemap. Añadir uno explícito es mejor que no tener nada.

¿Bloquear a los bots de IA ayuda a mi SEO?

No. Los crawlers de IA (GPTBot, ClaudeBot…) son distintos de Googlebot, que gobierna tu SEO tradicional. Bloquear a los de IA no cambia tu posición en Google; solo cambia tu visibilidad ante los asistentes de IA.