Permitir y guiar a los rastreadores de IA: robots.txt y llms.txt para tu práctica de terapia
Los motores de búsqueda de IA solo leerán tu sitio si permites sus rastreadores. Este artículo explica qué hacen GPTBot, ClaudeBot, PerplexityBot, Google-Extended y Grok, cómo permitirlos a través de robots.txt y cómo llms.txt ayuda a citar mejor tu contenido.
Dit artikel hoort bij: Hacerte Encontrable como Terapeuta: El Manual SEO Completo
- +Terapeutas con un sitio web funcional que desean ser visibles en motores de búsqueda de IA
- +Consultorios que aún no han configurado su robots.txt o llms.txt
- +Quien desee entender qué hace cada rastreador, sin dejar la parte técnica a un desarrollador
- -Quien desee proteger su contenido del entrenamiento de IA (entonces elige la ruta opuesta intencionalmente)
- -Terapeutas sin un sitio web propio (no se tiene control de robots.txt en un perfil de Therapieland)
Muchos sitios web bloquean los rastreadores de IA sin darse cuenta. Una instalación estándar de WordPress, un tema de Squarespace o un robots.txt antiguo de 2022 pueden excluir a ChatGPT, Claude y Perplexity. Resultado: tu sitio existe para el Google clásico, pero nunca se te citará en una respuesta de IA. Este artículo muestra cómo verificarlo y solucionarlo.
Qué hace cada rastreador
No todos los bots de IA hacen lo mismo. Algunos rastrean para entrenar (tu contenido se incluirá en un modelo futuro), otros rastrean en vivo para respuestas de búsqueda. Querrás permitir ambos, pero es bueno conocer la diferencia.
OpenAI (ChatGPT)
GPTBot rastrea para el entrenamiento del modelo. OAI-SearchBot rastrea en vivo cuando alguien hace una pregunta en ChatGPT que requiere búsqueda web. ChatGPT-User rastrea cuando un usuario comparte explícitamente una URL o solicita una visita. Para la visibilidad en las respuestas de ChatGPT, OAI-SearchBot es el más importante.
Anthropic (Claude)
ClaudeBot rastrea para el entrenamiento del modelo. anthropic-ai es la categoría de bot más amplia. Claude-SearchBot y Claude-User rastrean en vivo para la búsqueda web y las solicitudes directas de URL. Desde 2025, Claude utiliza activamente la búsqueda web para preguntas donde es útil.
Perplexity
PerplexityBot rastrea tanto para la indexación como para las respuestas en vivo. Perplexity-User rastrea cuando un usuario hace clic en algo. Perplexity es el motor más transparente en cuanto a las fuentes que utiliza entre todos.
Googlebot realiza la indexación clásica y también sirve los AI Overviews. Google-Extended es la opción de inclusión por separado para su uso en Bard, Gemini y futuros productos de IA. Si quieres ser encontrado en Gemini, permite explícitamente Google-Extended.
xAI (Grok)
Grok es diferente al resto: está entrelazado con X (Twitter) y utiliza la Búsqueda en Vivo para obtener la web actual con cada pregunta. El rastreador se llama Grok (algunas fuentes también ven GrokBot). Para las prácticas de terapia, esto significa dos cosas: permite explícitamente Grok en tu robots.txt y asegúrate de que tu contenido irradie frescura (fecha reciente, actualizaciones regulares). Un perfil de X activo y honesto también ayuda, ya que Grok pondera las señales sociales de X más que otros motores.
Paso 1: verifica tu robots.txt actual
Escribe en tu navegador: tudominio.es/robots.txt. Si recibes un 404 (no encontrado), tu sitio no bloquea nada y todos son admitidos. Si recibes un archivo con reglas de 'Disallow', léelo atentamente. Una regla como 'User-agent: GPTBot' seguida de 'Disallow: /' bloquea completamente ChatGPT. Busca reglas para GPTBot, ClaudeBot, PerplexityBot, Google-Extended y anthropic-ai.
Paso 2: permite explícitamente los rastreadores de IA
Agrega el siguiente bloque al principio de tu robots.txt (reemplaza o agrega, pero no dejes un 'Disallow' opuesto):
User-agent: GPTBot , Allow: / | User-agent: OAI-SearchBot , Allow: / | User-agent: ChatGPT-User , Allow: / | User-agent: ClaudeBot , Allow: / | User-agent: anthropic-ai , Allow: / | User-agent: PerplexityBot , Allow: / | User-agent: Google-Extended , Allow: / | User-agent: Grok , Allow: / | User-agent: GrokBot , Allow: /. Termina con una regla de Sitemap que apunte a tu sitemap.xml.
Una nota: estas reglas de 'Allow' son una solicitud amable, no una barrera técnica. Quien quiera hacer daño puede ignorarlas. El verdadero objetivo es que los rastreadores oficiales de OpenAI, Anthropic, Perplexity, Google y xAI vean que son bienvenidos y no se retiren de antemano.
Paso 3: agrega un llms.txt
llms.txt es un formato estándar propuesto (ver llmstxt.org) que proporciona un mapa legible de tu sitio a los modelos de IA. A diferencia de sitemap.xml (solo URLs para rastreadores), llms.txt contiene descripciones breves por página, agrupadas por tema. Un modelo de IA puede leerlo en medio segundo y saber inmediatamente dónde buscar qué.
Estructura llms.txt de la siguiente manera: H1 con el nombre de tu práctica, una cita en bloque con una frase que describa lo que haces, un párrafo de introducción breve, luego secciones H2 (por ejemplo, Servicios, Metodología, Preguntas frecuentes, Base de conocimientos) con una lista de viñetas de enlaces de markdown con una breve explicación para cada uno. Coloca el archivo en tudominio.es/llms.txt.
Paso 4: prueba si realmente eres localizable
Espera una semana (los rastreadores necesitan tiempo para ver las nuevas reglas) y luego prueba en Perplexity, Claude, ChatGPT y Grok (en X) con una pregunta de búsqueda que tus clientes también harían. ¿Se te cita? Si no, primero verifica si los rastreadores mencionados anteriormente están bloqueados en otro lugar de tu sitio (la configuración de CDN, el firewall de Cloudflare, la configuración de Vercel aún pueden bloquear a pesar de un robots.txt correcto).
Cuando NO quieres que la IA use tu contenido
Una nota honesta: hay terapeutas que, por principio, no quieren que su trabajo termine en el entrenamiento de IA. Por ejemplo, porque valoran el contacto humano a humano, o porque protegen contenido de pago. En ese caso, bloquea GPTBot, ClaudeBot, Google-Extended y Grok (bots de entrenamiento) pero permite OAI-SearchBot, Claude-SearchBot y PerplexityBot. De esta manera, seguirás siendo localizable en las respuestas de IA, pero tu contenido no se incluirá en modelos futuros. Ten en cuenta: Grok obtiene contenido principalmente en vivo, por lo que bloquearlo por completo también significa que no habrá citas en las respuestas de Grok.
Para leer más
Este artículo forma parte del pilar 'Hacerte Localizable como Terapeuta'. Para el aspecto del contenido de la localizabilidad, lee 'E-E-A-T para contenido de salud'. Si después quieres medir si funciona, consulta 'Medir las citas de IA'. Y asegúrate de no ser penalizado accidentalmente evitando errores GEO.
Wil je zien welke zoekwoorden cliënten in jouw stad gebruiken?
Het Cliënt Kompas geeft je in 5 minuten een live overzicht van zoekvolumes en drukte op zoektermen voor jouw praktijk.
Start het Cliënt KompasGerelateerde pagina's
Verder lezen in deze pilaar
Veelgestelde vragen
¿Debo editar mi robots.txt yo mismo o lo hará mi desarrollador web?
En WordPress, generalmente puedes hacerlo tú mismo a través de un plugin de SEO (Yoast, Rank Math). En Squarespace y Wix, robots.txt se puede gestionar parcialmente a través de la configuración. Si tienes un sitio personalizado o si dudas: pídele a tu desarrollador web que agregue los tres bloques anteriores. Es un cambio de un minuto.
¿Es obligatorio un llms.txt?
No. Es un formato estándar propuesto que cada vez más modelos de IA utilizan, pero no es un estándar oficial del W3C. Vemos que los sitios con un llms.txt bien estructurado son citados con una frecuencia notablemente mayor, por lo que el esfuerzo es bajo y el rendimiento positivo.
¿Qué sucede si no hago nada?
Si tu robots.txt no contiene actualmente reglas de 'Disallow' para los rastreadores de IA, es probable que ya seas accesible. Pero sin llms.txt y sin reglas explícitas de 'Allow', te perderás la señal de que tu contenido es bienvenido para ser citado. No es un gran problema a corto plazo, pero es una oportunidad perdida a medio plazo.
¿Puedo cambiar de opinión más tarde?
Sí. robots.txt y llms.txt se pueden modificar en vivo. Agrega un 'Disallow' y la mayoría de los rastreadores lo respetarán dentro de una semana. Ten en cuenta: el contenido que ya ha sido incluido en un modelo de IA permanecerá allí hasta que el modelo sea reentrenado. Por lo tanto, es mejor tomar la decisión de forma consciente ahora.
¿Por qué Grok es diferente de ChatGPT, Claude o Perplexity?
Grok de xAI está entrelazado con X (Twitter) y utiliza la Búsqueda en Vivo para obtener la web actual con cada pregunta. Dos cosas tienen un peso adicional: la frescura de tu contenido (fecha reciente, actualizaciones regulares) y tu presencia en X. Para las prácticas de terapia que no están activas en X, la ganancia es limitada; para quienes comparten contenido tranquilamente y honestamente en X, Grok puede convertirse en un canal en crecimiento.