Saltar al contenido
eprimeweb

Rastreadores de IA: qué bots dejar entrar y para qué sirve llms.txt

Por el equipo de ePrime Web · Actualizada el · 6 min de lectura

En resumen

Los rastreadores de IA no son todos iguales: unos buscan páginas para responder en el momento (como OAI-SearchBot o PerplexityBot) y otros recogen contenido para entrenar modelos (como GPTBot o ClaudeBot). Si quieres que te citen, deja entrar a los primeros; los segundos son una decisión aparte. El archivo llms.txt es una propuesta sin respaldo confirmado de los grandes buscadores: es barato ponerlo, pero no hace milagros.

Dos tipos de rastreadores

Cuando se habla de «bloquear a las IA» se mezclan dos cosas distintas:

  • Rastreadores de búsqueda y de usuario: visitan tu web para responder a una pregunta en ese momento y te citan. Bloquearlos te saca de sus respuestas.
  • Rastreadores de entrenamiento: recogen contenido para entrenar futuros modelos. Bloquearlos no te saca de las respuestas con búsqueda.

Los principales, uno por uno

RastreadorEmpresaPara qué
OAI-SearchBotOpenAIBúsqueda de ChatGPT
ChatGPT-UserOpenAIVisitas que pide un usuario en la conversación
GPTBotOpenAIEntrenamiento de modelos
Claude-SearchBotAnthropicBúsqueda de Claude
Claude-UserAnthropicVisitas que pide un usuario
ClaudeBotAnthropicEntrenamiento de modelos
PerplexityBotPerplexityÍndice de búsqueda de Perplexity
Perplexity-UserPerplexityVisitas que pide un usuario
Google-ExtendedGoogleUso del contenido para los modelos Gemini (no afecta a la búsqueda ni a los resúmenes de IA)
BingbotMicrosoftBuscador Bing, del que se alimentan Copilot y, en parte, ChatGPT

Google-Extended no es un rastreador que visite tu web: es un nombre que Google lee en tu robots.txt para saber si puede usar tu contenido en Gemini. Los resúmenes de IA de la búsqueda usan el rastreador normal, Googlebot.

Cómo se configura en robots.txt

Cada rastreador se nombra con su propia línea User-agent y sus reglas. Un ejemplo que deja entrar a los de búsqueda y bloquea los de entrenamiento:

  • User-agent: OAI-SearchBot → Allow: /
  • User-agent: PerplexityBot → Allow: /
  • User-agent: GPTBot → Disallow: /
  • User-agent: ClaudeBot → Disallow: /

Cuidado con escribir varias líneas User-agent seguidas: forman un solo grupo y comparten las reglas que vienen después. Un error ahí puede bloquear lo que no querías.

Qué es llms.txt y si merece la pena

llms.txt es un archivo de texto en la raíz de la web (tuweb.es/llms.txt) que resume en formato Markdown qué es la empresa y enlaza a sus páginas más importantes. Es una propuesta publicada en 2024 para facilitar que los modelos de lenguaje lean una web.

Lo honesto: ningún gran buscador ha confirmado que lo use para decidir a quién citar, y Google ha dicho que no lo necesita. Como cuesta poco hacerlo y no perjudica, tiene sentido ponerlo, pero no esperes resultados por él solo.

Cómo decidir

  • Si vives de que te encuentren (servicios, tiendas, profesionales): deja entrar a los rastreadores de búsqueda sin dudarlo.
  • Si tu contenido es tu producto (un medio, un curso de pago): tiene sentido bloquear los de entrenamiento y valorar caso por caso.
  • En cualquier caso, revisa tu robots.txt: muchas webs bloquean a todos sin saberlo por una plantilla o un plugin.

Preguntas frecuentes

¿Respetan los rastreadores de IA el robots.txt?

+

Los de las grandes empresas (OpenAI, Anthropic, Google, Microsoft, Perplexity) dicen respetarlo para sus rastreadores declarados. Las visitas que pide un usuario directamente pueden tratarse de otra forma según la empresa.

¿Bloquear a las IA mejora mi SEO en Google?

+

No. El posicionamiento en Google depende de Googlebot. Bloquear GPTBot o ClaudeBot no cambia nada en Google.

¿Tengo que crear un llms.txt?

+

No es obligatorio ni está confirmado que ayude. Es barato y no perjudica, así que en webs de empresa lo solemos poner, pero la prioridad es que las páginas se lean y se entiendan bien.

Sigue leyendo