El 18,5% de las clínicas publica un archivo para las IA. El 4,9% publica lo que las IA leen
Nadie había medido en España qué publican las clínicas privadas para los buscadores con inteligencia artificial. Hemos medido 1.615 dominios sorteados del registro del Ministerio de Sanidad. Casi ninguna bloquea a los rastreadores, una de cada cinco publica el archivo de moda, y solo una de cada veinte dice en su código que es un centro sanitario.
El permiso no es el problema
Casi ninguna clínica española ha cerrado la puerta a los buscadores con inteligencia artificial
La conversación del sector da por hecho que hay una decisión que tomar sobre si dejar entrar a estos rastreadores. En la sanidad privada española esa decisión no se ha tomado casi nunca. De los 1.615 dominios medidos, 76 bloquean a alguno de los ocho rastreadores que comprobamos. Son el 4,7%.
Sirve de contraste el resto de la web: las cifras publicadas sitúan el bloqueo de GPTBot cerca del 8% en el conjunto de internet y por encima del 50% entre los medios de comunicación, que sí han decidido y han decidido que no. Una clínica que no aparece en una respuesta no está fuera por haberse excluido.
| Rastreador | Clínicas que lo bloquean | Sobre las 1.615 medidas |
|---|---|---|
| Claude (ClaudeBot, anthropic-ai) | 65 | 4,0% |
| Meta (facebookbot, meta-externalagent) | 65 | 4,0% |
| Common Crawl (CCBot) | 63 | 3,9% |
| ChatGPT (GPTBot, OAI-SearchBot) | 62 | 3,8% |
| Apple (Applebot-Extended) | 57 | 3,5% |
| Google (Google-Extended) | 56 | 3,5% |
| Perplexity (PerplexityBot) | 29 | 1,8% |
| Bing y Copilot (bingbot) | 4 | 0,2% |
El 90,5% de las webs tiene un robots.txt. Casi todos los bloqueos que encontramos vienen de una regla general que cierra el sitio entero, no de una regla escrita pensando en estos rastreadores.
Lo que sí publican
Una de cada cinco clínicas publica un llms.txt, y Google ha dicho que no lo admite
El 18,5% de las clínicas privadas españolas con web publica un archivo llms.txt, con un margen de ±2,0 puntos. Son 275 clínicas. Es una cifra alta: entre las 549 webs alcanzables del top 1.000 mundial de Tranco la tasa es del 15,8%, y en un análisis de unos 300.000 dominios se queda en el 10,13%. Clínicas de barrio de tres empleados van por delante de la media de internet en el archivo que el sector lleva un año recomendando.
El problema es que no hay ningún buscador que se haya comprometido a leerlo. Gary Illyes, de Google, declaró en Search Central Live que no tienen planes de admitirlo, y la documentación de Google dice que no hace falta ningún archivo especial para aparecer en sus respuestas generadas. OpenAI no lo pide cuando rastrea. Anthropic publica uno propio pero no ha confirmado que sus rastreadores lo consuman.
Y la medición más amplia que existe es concluyente: Ahrefs revisó 137.210 dominios y encontró que el 97% de los archivos llms.txt publicados no recibe ninguna petición. Ni de los rastreadores de inteligencia artificial ni de nadie.
Tampoco es mérito de las clínicas. Al mirar con qué está hecha cada web, los archivos aparecen en sitios de Wix, de GoDaddy y de WordPress con determinados complementos instalados. BuiltWith contabilizó unas 193.000 webs con el archivo en mayo de 2026 y describe la mayoría como generadas automáticamente. Casi ninguna de estas clínicas decidió publicarlo: se lo puso su gestor de contenidos.
Lo que no publican
Solo el 4,9% dice en su código que es un centro sanitario
Los datos estructurados en formato schema.org son lo que un buscador lee para saber qué es un negocio sin tener que deducirlo del texto. El 74,6% de estas clínicas lleva algún marcado, que suena bien hasta que se mira qué dice: casi siempre es el genérico que instala el gestor de contenidos y que describe una página web, no una clínica.
Cuando se pregunta por lo que un paciente quiere saber, las cifras se caen. El 18,3% publica su dirección postal en formato estructurado, el 13,3% su horario y el 4,9% declara ser un centro sanitario. Un motor al que le preguntan si esta es una clínica dental en Marbella y a qué hora abre no recibe nada estructurado que responda.
| Lo que publica la portada | Clínicas | Sobre las medidas | Estimación nacional | Margen |
|---|---|---|---|---|
| Algún marcado schema.org | 1.162 | 74,8% | 74,6% | ±2,2 pp |
| Un enlace tel: en el código | 805 | 51,8% | 51,3% | ±2,5 pp |
| Dirección postal estructurada | 286 | 18,4% | 18,3% | ±1,9 pp |
| Horario de apertura estructurado | 208 | 13,4% | 13,3% | ±1,7 pp |
| Tipo de negocio sanitario | 77 | 5,0% | 4,9% | ±1,1 pp |
El 2,9% de las webs no muestra prácticamente ningún texto hasta que se ejecutan sus scripts. La mediana de caracteres legibles en una portada es de 5.016, así que el problema general no es que haya poco que leer: es que lo que hay no está etiquetado.
El cruce
253 clínicas hicieron el trabajo que no sirve y se saltaron el que sí
Las dos cifras juntas dicen más que por separado. De las 275 clínicas que publican un llms.txt, 253 no declaran ser un centro sanitario en sus datos estructurados. Es el 92,0%. Solo 22 clínicas de las 1.478 con base válida publican las dos cosas.
Dicho de otra forma: el esfuerzo de presencia en las respuestas está puesto casi entero en el archivo que ningún buscador se ha comprometido a leer, y casi nada en el marcado que todos documentan que usan. Y 1.152 clínicas, el 77,9%, no publican ninguna de las dos.
No es un reproche a las clínicas. Es lo que pasa cuando una recomendación se difunde más rápido que la evidencia que la respalda, y cuando la parte difícil requiere tocar el código y la fácil viene activada de fábrica.
Por comunidad
Asturias y Canarias publican el triple que Aragón
El reparto por comunidad no sigue al tamaño del mercado, y esa es la señal de que no responde a una estrategia. Si publicar un llms.txt fuera una decisión de negocio, las comunidades con más competencia irían primero. Van primero las que tienen más webs hechas con los gestores que lo generan solos.
| Comunidad | Dominios medidos | Publica llms.txt | Se declara centro sanitario |
|---|---|---|---|
| Cataluña | 227 | 15,9% | 3,5% |
| Andalucía | 203 | 12,8% | 4,9% |
| Comunidad de Madrid | 178 | 28,1% | 7,3% |
| Comunitat Valenciana | 166 | 16,9% | 6,0% |
| Galicia | 118 | 16,9% | 2,5% |
| País Vasco | 89 | 22,5% | 6,7% |
| Castilla y León | 70 | 15,7% | 1,4% |
| Canarias | 69 | 30,4% | 5,8% |
| Castilla-La Mancha | 63 | 17,5% | 6,3% |
| Aragón | 58 | 10,3% | 3,4% |
| Región de Murcia | 47 | 12,8% | 2,1% |
| Principado de Asturias | 39 | 33,3% | 2,6% |
| Illes Balears | 38 | 21,1% | 13,2% |
| Extremadura | 37 | 18,9% | 0,0% |
| Cantabria | 26 | 19,2% | 3,8% |
| Comunidad Foral de Navarra | 25 | 12,0% | 4,0% |
Se muestran las comunidades con 25 dominios o más. La Rioja, Ceuta y Melilla quedan fuera de la tabla por tamaño de muestra, aunque sí entran en la estimación nacional ponderada.
Por especialidad
La nutrición se identifica tres veces mejor que la media, y nadie sabe por qué
La odontología es el grupo más grande de la muestra y se queda en la media. El dato que se sale es la nutrición: el 14,6% declara ser un centro sanitario, tres veces la media nacional, sobre 48 dominios. Con esa muestra conviene tratarlo como una pista y no como un hecho.
| Especialidad | Dominios medidos | Publica llms.txt | Se declara centro sanitario |
|---|---|---|---|
| Odontología | 475 | 16,4% | 6,3% |
| Fisioterapia | 348 | 17,0% | 4,0% |
| Psicología | 179 | 21,8% | 3,4% |
| Podología | 158 | 18,4% | 4,4% |
| Medicina estética | 147 | 17,7% | 8,8% |
| Traumatología | 66 | 13,6% | 1,5% |
| Nutrición | 48 | 16,7% | 14,6% |
| Oftalmología | 45 | 17,8% | 2,2% |
| Dermatología | 39 | 17,9% | 5,1% |
Una clínica puede tener más de una especialidad, así que los grupos se solapan y no suman 1.615. Se muestran los que tienen 30 dominios o más.
Método
De 85.587 centros a 1.615 dominios
Es la misma muestra que usamos en el informe de precios y en el de accesibilidad, sorteada del registro estatal de centros sanitarios del Ministerio de Sanidad y estratificada por comunidad autónoma. Un dominio solo entra cuando lleva el teléfono, el código postal o la calle que consta en el registro, para no medir la web de otra empresa con nombre parecido.
| Paso | Centros | Qué significa |
|---|---|---|
| Centros privados en el registro | 85.587 | Población del estudio, la misma que en los informes de precios y accesibilidad |
| Centros sorteados | 4.054 | Muestra aleatoria estratificada por comunidad autónoma |
| Con web verificada | 1.691 | Lleva el teléfono, el código postal o la calle del registro |
| Dominios distintos | 1.615 | Se agrupan los centros que comparten web con otro de la muestra |
| Webs que respondieron | 1.554 | 61 agotaron el tiempo de espera o rechazaron la petición |
| Base válida para llms.txt | 1.478 | Se excluyen 76 servidores que responden 200 a cualquier ruta inventada |
Los 76 servidores que se inventan el archivo
Hay servidores que responden 200 a cualquier dirección que se les pida. Preguntarles por /llms.txt devuelve una página, y contarla haría subir la cifra sin que nadie haya publicado nada. Por eso en la misma pasada pedimos a cada dominio un archivo .txt inventado con nombre aleatorio: los 76 que también respondieron 200 quedan fuera de la base del llms.txt. Sin este control la tasa saldría 3,4 puntos más alta.
Honestidad
Lo que este informe no puede decir
Medimos la portada, no la web entera
Los datos estructurados de una clínica pueden estar en su página de contacto y no en la portada. Nuestras tasas describen lo que un buscador encuentra en la primera página que visita, que es también la que más se enlaza y la que primero se rastrea, pero una clínica marcada como centro sanitario solo en una página interior cuenta aquí como no marcada. Para el marcado sanitario, la cifra real del sector es algo más alta que el 4,9%.
Que un buscador pueda leer algo no prueba que lo use
Sabemos lo que estas webs publican y lo que permiten rastrear. No sabemos qué pesa cada motor al elegir a quién cita, porque ninguno lo publica. Lo que sí está documentado es lo contrario: Google ha dicho que no admite llms.txt, y el análisis de Ahrefs sobre 137.210 dominios encontró que el 97% de los archivos llms.txt no recibe ninguna petición. Nuestra afirmación es que el esfuerzo está mal repartido, no que el marcado garantice una cita.
Solo llegamos a las clínicas con web localizable
De los 4.054 centros sorteados verificamos la web de 1.691. El resto no tiene web, la tiene con un nombre que no se puede resolver sin riesgo de equivocarse de empresa, o no respondió. Las tasas de este informe describen a las clínicas privadas españolas que tienen web, no a todas.
El archivo puede existir y estar vacío de contenido útil
Comprobamos que el archivo existe, que lo sirve el propio dominio y que no es una página de error disfrazada. No juzgamos si su contenido está bien formado ni si describe la clínica con precisión. Es la misma limitación que declara Ahrefs en su estudio. Si midiéramos la calidad, el 18,5% solo podría bajar.
Un robots.txt permisivo no es una decisión consciente
El 4,7% que bloquea a algún motor sí ha tomado una decisión. Del 95,3% restante no podemos decir que haya decidido nada: lo más probable es que nunca se lo haya planteado y que el archivo venga como viene por defecto. Que casi nadie bloquee no significa que casi todos quieran salir.
Preguntas frecuentes
Preguntas frecuentes sobre llms.txt y datos estructurados
¿Qué es el archivo llms.txt?
Es un archivo de texto que se coloca en la raíz de una web, en la dirección /llms.txt, con un resumen del sitio escrito para que lo lean modelos de lenguaje. Lo propuso Jeremy Howard en 2024 y desde entonido se ha extendido como recomendación en el sector del posicionamiento. No es un estándar aprobado por ningún organismo ni por ningún buscador.
¿Sirve de algo publicar un llms.txt en 2026?
Hoy no hay evidencia de que sirva. Google ha declarado que no tiene planes de admitirlo, OpenAI no lo pide al rastrear, y el análisis de Ahrefs sobre 137.210 dominios encontró que el 97% de estos archivos no recibe ninguna petición. Publicarlo cuesta muy poco, así que tampoco hace daño, pero no sustituye a los datos estructurados y no debería consumir el presupuesto que les corresponde.
¿Cuántas clínicas españolas tienen un llms.txt?
El 18,5% de las clínicas privadas españolas con web, con un margen de ±2,0 puntos. Son 275 de las 1.478 webs con base válida que medimos en agosto de 2026. Como referencia, entre las 549 webs alcanzables del top 1.000 mundial de Tranco la tasa es del 15,8%, así que las clínicas españolas están en la media alta pese a ser negocios muy pequeños. El motivo no es una estrategia: el archivo lo generan solos gestores como Wix, GoDaddy y varios complementos de WordPress.
¿Qué datos estructurados necesita la web de una clínica?
Los que identifican al negocio: el tipo de centro sanitario que es, la dirección postal, el teléfono y el horario, en formato schema.org. Es lo que permite a un buscador responder si una clínica es dental, dónde está y cuándo abre sin tener que deducirlo del texto. El 74,6% de las clínicas medidas lleva algún marcado, casi siempre el genérico que instala su gestor de contenidos, pero solo el 4,9% declara que es un centro sanitario.
¿Bloquean las clínicas españolas a ChatGPT y a los demás buscadores con inteligencia artificial?
Casi ninguna. El 3,8% bloquea a GPTBot, el 4,0% a ClaudeBot y el 1,8% a PerplexityBot en su robots.txt, y solo el 4,7% bloquea a alguno de los ocho rastreadores que comprobamos. La falta de presencia de las clínicas en las respuestas no viene de haber cerrado la puerta.
Reproducibilidad
Cómo comprobar cualquier cifra de este informe
Cualquiera puede repetir la parte pública de esta medición sobre su propia web. Pidasu-dominio.com/llms.txt ysu-dominio.com/robots.txt en el navegador. Para el marcado, busqueapplication/ld+json en el código fuente de la portada y compruebe si el campo@type dice lo que es su clínica, por ejemplo Dentist oMedicalClinic, y no soloWebSite.
Antes de dar por bueno un llms.txt, pida al mismo dominio un archivo .txt inventado. Si también responde, su servidor contesta a todo y el llms.txt que creía tener no existe.
Medición realizada el 15 de agosto de 2026. Fuentes externas citadas: el análisis de Ahrefs sobre 137.210 dominios, el seguimiento de adopción de Rankability sobre el top 1.000 de Tranco, el análisis de SE Ranking sobre unos 300.000 dominios, el recuento de BuiltWith de mayo de 2026 y las declaraciones públicas de Google sobre llms.txt. Los datos de partida son el registro estatal de centros sanitarios del Ministerio de Sanidad.
Cómo citar este informe
Este informe está depositado con un identificador permanente y se puede citar y reutilizar libremente con atribución, bajo licencia CC BY 4.0.
Comino, Alberto (2026). llms.txt y datos estructurados en las clínicas privadas españolas: el 18,5% publica el archivo que ningún motor lee y el 4,9% publica el marcado que sí leen. 360 Clinic Consulting. https://doi.org/10.5281/zenodo.22002690
- DOI
- 10.5281/zenodo.22002690
- Archivo
- Zenodo (CERN)
Solicita un diagnóstico gratuito de captación
Te mostramos dónde estás perdiendo pacientes, cuánto te cuesta realmente cada primera visita y qué podríamos mejorar en los próximos 30 días.
Sin compromiso. Te respondemos en menos de 24 horas.
