Si los asistentes de IA no pueden leer tu sitio web, no pueden recomendar tu negocio. Esa única frase explica por qué tu archivo robots.txt — un archivo de texto plano que la mayoría de los propietarios nunca ha abierto — decide en silencio parte de tu visibilidad en IA. Muchos sitios bloquean rastreadores de IA sin saberlo: un ajuste por defecto del CDN, el interruptor «bloquear bots de IA» de un plugin o una regla de robots.txt copiada de un blog en 2023 pueden hacerte invisible ante los sistemas a los que tus clientes piden recomendaciones.

Esta es una lista de referencia de los rastreadores de IA que importan en 2026: quién opera cada uno, qué hace realmente con tu contenido y cuáles debería permitir un negocio que quiere visibilidad en IA. Cada user agent de abajo está documentado por su operador; donde el operador no publica documentación, lo decimos.

Primero: los tres tipos de bot de IA

«Rastreador de IA» abarca tres comportamientos muy distintos, y la política correcta difiere según el tipo:

  • Rastreadores de entrenamiento: recogen contenido para entrenar futuros modelos. Bloquearlos limita lo que los modelos de mañana sabrán de ti; el efecto es lento y difuso.
  • Rastreadores de índice de búsqueda: construyen los índices de recuperación que los productos de búsqueda con IA citan en vivo. Bloquearlos te elimina de las respuestas de IA basadas en la web — un golpe rápido y directo a la visibilidad.
  • Recuperadores por petición de usuario: visitan una página porque un humano acaba de preguntar al asistente por ella. Bloquearlos significa que el asistente no puede verificar lo que afirmas — incluso cuando un cliente potencial pregunta «¿es de fiar este negocio?».

Para un negocio que quiere clientes, las dos últimas categorías son casi innegociables. La primera sí es una elección de política legítima.

OpenAI (ChatGPT)

OpenAI documenta tres bots (documentación oficial):

  • GPTBot — el rastreador de entrenamiento. Permitirlo deja que tu contenido informe a los futuros modelos GPT.
  • OAI-SearchBot — construye el índice de búsqueda detrás de la búsqueda web de ChatGPT. Bloquearlo puede dejarte fuera de las respuestas de ChatGPT que enlazan fuentes. Si el objetivo es la visibilidad en IA, permítelo.
  • ChatGPT-User — recupera páginas cuando la petición de un usuario requiere visitar tu sitio. Permítelo: al otro lado suele haber un cliente potencial real, a una pregunta de contactarte.

Anthropic (Claude)

Anthropic también documenta sus rastreadores y confirma que respetan robots.txt (documentación oficial):

  • ClaudeBot — el rastreador de entrenamiento.
  • Claude-User — recupera páginas en respuesta a la petición en vivo de un usuario.
  • Claude-SearchBot — indexa contenido para mejorar los resultados de búsqueda de Claude.

Aplica la misma lógica que con OpenAI: los bots de usuario y de búsqueda son los que determinan directamente si Claude puede leerte y citarte hoy.

Perplexity

Perplexity es un buscador de IA, así que sus rastreadores giran en torno a las respuestas en vivo (documentación oficial):

  • PerplexityBot — construye el índice de búsqueda de Perplexity.
  • Perplexity-User — visita una página cuando la pregunta de un usuario lo requiere.

Bloquearlos te elimina de una de las superficies de IA con más citas que existen — las respuestas de Perplexity muestran sus fuentes de forma prominente, que es exactamente el tipo de exposición que un negocio quiere.

Google (Gemini y funciones de IA)

Google-Extended no es un rastreador aparte — es un token de robots.txt que controla si el contenido que Googlebot ya rastreó puede usarse para entrenar los modelos Gemini (documentación oficial). Dos detalles importan:

  • Bloquear Google-Extended no afecta a tu posicionamiento en Google ni a si apareces en AI Overviews — eso lo gobiernan las reglas normales de Googlebot.
  • Permitirlo no cuesta tráfico de rastreo adicional, porque aprovecha el rastreo existente de Googlebot.

El resto de la lista

  • CCBot (Common Crawl) — un rastreador sin ánimo de lucro que construye un archivo abierto de la web (documentación oficial). No es una empresa de IA, pero los datos de Common Crawl han sido históricamente una fuente de entrenamiento importante para muchos modelos — bloquear CCBot reduce tu presencia en los conjuntos de datos con los que arrancan muchos laboratorios.
  • Meta-ExternalAgent (Meta) — el rastreador de Meta para entrenamiento de IA y mejora de producto (documentación oficial), relevante para Meta AI dentro de WhatsApp, Instagram y Facebook.
  • Bytespider (ByteDance) — el rastreador de ByteDance, asociado al entrenamiento de sus modelos. ByteDance no publica documentación oficial para él y tiene fama de rastrear con agresividad; si respeta robots.txt no es algo que el operador confirme públicamente. Lo incluimos por exhaustividad, no como aval.

Otros agentes que puedes ver en tus logs — Applebot-Extended (el token de exclusión de entrenamiento de IA de Apple), Amazonbot, DuckAssistBot y varios rastreadores de startups — siguen la misma lógica de tres vías: consulta la documentación del operador, identifica si es entrenamiento, búsqueda o petición de usuario, y decide en consecuencia.

Una política por defecto sensata

Para un negocio cuyo objetivo es ser encontrado y recomendado: permite todos los bots de índice de búsqueda y de petición de usuario, y permite los bots de entrenamiento de los grandes asistentes que usan tus clientes:

  • Permitir: GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-User, Claude-SearchBot, PerplexityBot, Perplexity-User, Google-Extended.
  • A criterio propio: CCBot y Meta-ExternalAgent (orientados a entrenamiento; permitirlos es un buen valor por defecto para la visibilidad, bloquearlos es una decisión defendible de derechos de contenido).
  • A criterio propio: Bytespider (sin documentación; bloquéalo si su tráfico te molesta — para la mayoría de las pequeñas empresas occidentales su beneficio de visibilidad es escaso).

Como las reglas de robots.txt permiten por defecto, el arreglo más común no es añadir líneas Allow — es eliminar un Disallow: / demasiado amplio que un plugin de seguridad o un preajuste del CDN añadió para estos user agents. Si aun así quieres reglas explícitas, este es el patrón mínimo:

User-agent: GPTBot
Allow: /

…repetido por bot. Una advertencia basada en sitios que hemos escaneado: algunos firewalls bloquean rastreadores de IA a nivel de red aunque robots.txt los permita, así que un robots.txt limpio no garantiza el acceso. Prueba el comportamiento real, no solo el archivo.

Comprueba tu sitio en 30 segundos

Puedes auditar tu robots.txt contra toda esta lista con nuestro verificador de rastreadores de IA gratuito — introduce tu dominio y muestra, bot a bot, quién está permitido, quién bloqueado y por qué regla.

Si prefieres la terminal (o quieres esto en CI para que un despliegue nunca vuelva a bloquear la IA en silencio), la misma comprobación viene en nuestra CLI de código abierto (GitHub): npx rankedbyai crawlers tusitio.com sale con código distinto de cero cuando cualquiera de los 11 grandes rastreadores de IA está bloqueado. Y para ver qué dicen realmente los asistentes de IA sobre tu negocio una vez que pueden leerte, ejecuta un escaneo gratuito de visibilidad en IA.

FAQ

¿Debería bloquear alguna vez los rastreadores de IA?

Depende de lo que valga tu contenido para ti. Los editores cuyo producto es el propio contenido suelen bloquear los rastreadores de entrenamiento para proteger su valor de licencia. Un negocio local es el caso contrario: tu contenido existe para ser encontrado, así que bloquear los sistemas a los que los clientes piden recomendaciones sobre todo te perjudica. Si quieres un camino intermedio, permite los bots de búsqueda y de petición de usuario y bloquea los de entrenamiento — las categorías de arriba hacen fácil esa división.

¿Permitir rastreadores de IA perjudica mi posicionamiento en Google?

No. Las reglas para rastreadores de IA en robots.txt son por user agent y no afectan a Googlebot. Google-Extended, en particular, está documentado explícitamente como sin efecto en el ranking de búsqueda — solo controla el entrenamiento de los modelos Gemini.

¿Cómo sé si mi sitio está bloqueando rastreadores de IA ahora mismo?

Revisa tu robots.txt en busca de reglas Disallow dirigidas a los user agents de arriba (incluido un genérico User-agent: * / Disallow: /) y verifica con el verificador de rastreadores. Revisa también los ajustes de tu CDN o de seguridad — Cloudflare, por ejemplo, ofrece un bloqueo de bots de IA de un clic que funciona con independencia de robots.txt.

¿Todos estos bots respetan realmente robots.txt?

OpenAI, Anthropic, Perplexity, Google, Common Crawl y Meta documentan que sus rastreadores listados respetan robots.txt. La conformidad de Bytespider no está documentada oficialmente, y hay administradores de sitios que reportan un comportamiento inconsistente — si bloquearlo te importa, plantéate una regla de firewall en lugar de confiar solo en robots.txt.