Rastreadores de IA: qué bots dejar entrar y para qué sirve llms.txt
Por el equipo de ePrime Web · Actualizada el · 6 min de lectura
En resumen
Los rastreadores de IA no son todos iguales: unos buscan páginas para responder en el momento (como OAI-SearchBot o PerplexityBot) y otros recogen contenido para entrenar modelos (como GPTBot o ClaudeBot). Si quieres que te citen, deja entrar a los primeros; los segundos son una decisión aparte. El archivo llms.txt es una propuesta sin respaldo confirmado de los grandes buscadores: es barato ponerlo, pero no hace milagros.
Dos tipos de rastreadores
Cuando se habla de «bloquear a las IA» se mezclan dos cosas distintas:
- Rastreadores de búsqueda y de usuario: visitan tu web para responder a una pregunta en ese momento y te citan. Bloquearlos te saca de sus respuestas.
- Rastreadores de entrenamiento: recogen contenido para entrenar futuros modelos. Bloquearlos no te saca de las respuestas con búsqueda.
Los principales, uno por uno
| Rastreador | Empresa | Para qué |
|---|---|---|
| OAI-SearchBot | OpenAI | Búsqueda de ChatGPT |
| ChatGPT-User | OpenAI | Visitas que pide un usuario en la conversación |
| GPTBot | OpenAI | Entrenamiento de modelos |
| Claude-SearchBot | Anthropic | Búsqueda de Claude |
| Claude-User | Anthropic | Visitas que pide un usuario |
| ClaudeBot | Anthropic | Entrenamiento de modelos |
| PerplexityBot | Perplexity | Índice de búsqueda de Perplexity |
| Perplexity-User | Perplexity | Visitas que pide un usuario |
| Google-Extended | Uso del contenido para los modelos Gemini (no afecta a la búsqueda ni a los resúmenes de IA) | |
| Bingbot | Microsoft | Buscador Bing, del que se alimentan Copilot y, en parte, ChatGPT |
Google-Extended no es un rastreador que visite tu web: es un nombre que Google lee en tu robots.txt para saber si puede usar tu contenido en Gemini. Los resúmenes de IA de la búsqueda usan el rastreador normal, Googlebot.
Cómo se configura en robots.txt
Cada rastreador se nombra con su propia línea User-agent y sus reglas. Un ejemplo que deja entrar a los de búsqueda y bloquea los de entrenamiento:
- User-agent: OAI-SearchBot → Allow: /
- User-agent: PerplexityBot → Allow: /
- User-agent: GPTBot → Disallow: /
- User-agent: ClaudeBot → Disallow: /
Cuidado con escribir varias líneas User-agent seguidas: forman un solo grupo y comparten las reglas que vienen después. Un error ahí puede bloquear lo que no querías.
Qué es llms.txt y si merece la pena
llms.txt es un archivo de texto en la raíz de la web (tuweb.es/llms.txt) que resume en formato Markdown qué es la empresa y enlaza a sus páginas más importantes. Es una propuesta publicada en 2024 para facilitar que los modelos de lenguaje lean una web.
Lo honesto: ningún gran buscador ha confirmado que lo use para decidir a quién citar, y Google ha dicho que no lo necesita. Como cuesta poco hacerlo y no perjudica, tiene sentido ponerlo, pero no esperes resultados por él solo.
Cómo decidir
- Si vives de que te encuentren (servicios, tiendas, profesionales): deja entrar a los rastreadores de búsqueda sin dudarlo.
- Si tu contenido es tu producto (un medio, un curso de pago): tiene sentido bloquear los de entrenamiento y valorar caso por caso.
- En cualquier caso, revisa tu robots.txt: muchas webs bloquean a todos sin saberlo por una plantilla o un plugin.