Saltar al contenido
Informe · Datos propios

El 18,5% de las clínicas publica un archivo para las IA. El 4,9% publica lo que las IA leen

Nadie había medido en España qué publican las clínicas privadas para los buscadores con inteligencia artificial. Hemos medido 1.615 dominios sorteados del registro del Ministerio de Sanidad. Casi ninguna bloquea a los rastreadores, una de cada cinco publica el archivo de moda, y solo una de cada veinte dice en su código que es un centro sanitario.

Portada del informe: llms.txt y datos estructurados en las clínicas españolas
18,5%
Publica un archivo llms.txt
Estimación nacional ponderada por comunidad, ±2,0 pp
4,9%
Declara que es un centro sanitario
En los datos estructurados que los buscadores sí leen
4,7%
Bloquea a algún buscador con inteligencia artificial
El permiso no es el problema
92,0%
De las que publican llms.txt no publica lo otro
253 de 275 clínicas
1.615
Dominios de clínicas medidos
Sorteados del registro estatal de centros sanitarios
77,9%
No publica ninguna de las dos cosas
1.152 de las 1.478 webs con base válida

El permiso no es el problema

Casi ninguna clínica española ha cerrado la puerta a los buscadores con inteligencia artificial

La conversación del sector da por hecho que hay una decisión que tomar sobre si dejar entrar a estos rastreadores. En la sanidad privada española esa decisión no se ha tomado casi nunca. De los 1.615 dominios medidos, 76 bloquean a alguno de los ocho rastreadores que comprobamos. Son el 4,7%.

Sirve de contraste el resto de la web: las cifras publicadas sitúan el bloqueo de GPTBot cerca del 8% en el conjunto de internet y por encima del 50% entre los medios de comunicación, que sí han decidido y han decidido que no. Una clínica que no aparece en una respuesta no está fuera por haberse excluido.

Rastreadores bloqueados en el robots.txt de 1.615 dominios de clínicas
RastreadorClínicas que lo bloqueanSobre las 1.615 medidas
Claude (ClaudeBot, anthropic-ai)654,0%
Meta (facebookbot, meta-externalagent)654,0%
Common Crawl (CCBot)633,9%
ChatGPT (GPTBot, OAI-SearchBot)623,8%
Apple (Applebot-Extended)573,5%
Google (Google-Extended)563,5%
Perplexity (PerplexityBot)291,8%
Bing y Copilot (bingbot)40,2%

El 90,5% de las webs tiene un robots.txt. Casi todos los bloqueos que encontramos vienen de una regla general que cierra el sitio entero, no de una regla escrita pensando en estos rastreadores.

Lo que sí publican

Una de cada cinco clínicas publica un llms.txt, y Google ha dicho que no lo admite

El 18,5% de las clínicas privadas españolas con web publica un archivo llms.txt, con un margen de ±2,0 puntos. Son 275 clínicas. Es una cifra alta: entre las 549 webs alcanzables del top 1.000 mundial de Tranco la tasa es del 15,8%, y en un análisis de unos 300.000 dominios se queda en el 10,13%. Clínicas de barrio de tres empleados van por delante de la media de internet en el archivo que el sector lleva un año recomendando.

El problema es que no hay ningún buscador que se haya comprometido a leerlo. Gary Illyes, de Google, declaró en Search Central Live que no tienen planes de admitirlo, y la documentación de Google dice que no hace falta ningún archivo especial para aparecer en sus respuestas generadas. OpenAI no lo pide cuando rastrea. Anthropic publica uno propio pero no ha confirmado que sus rastreadores lo consuman.

Y la medición más amplia que existe es concluyente: Ahrefs revisó 137.210 dominios y encontró que el 97% de los archivos llms.txt publicados no recibe ninguna petición. Ni de los rastreadores de inteligencia artificial ni de nadie.

Tampoco es mérito de las clínicas. Al mirar con qué está hecha cada web, los archivos aparecen en sitios de Wix, de GoDaddy y de WordPress con determinados complementos instalados. BuiltWith contabilizó unas 193.000 webs con el archivo en mayo de 2026 y describe la mayoría como generadas automáticamente. Casi ninguna de estas clínicas decidió publicarlo: se lo puso su gestor de contenidos.

Lo que no publican

Solo el 4,9% dice en su código que es un centro sanitario

Los datos estructurados en formato schema.org son lo que un buscador lee para saber qué es un negocio sin tener que deducirlo del texto. El 74,6% de estas clínicas lleva algún marcado, que suena bien hasta que se mira qué dice: casi siempre es el genérico que instala el gestor de contenidos y que describe una página web, no una clínica.

Cuando se pregunta por lo que un paciente quiere saber, las cifras se caen. El 18,3% publica su dirección postal en formato estructurado, el 13,3% su horario y el 4,9% declara ser un centro sanitario. Un motor al que le preguntan si esta es una clínica dental en Marbella y a qué hora abre no recibe nada estructurado que responda.

Datos estructurados presentes en la portada de 1.554 webs de clínicas
Lo que publica la portadaClínicasSobre las medidasEstimación nacionalMargen
Algún marcado schema.org1.16274,8%74,6%±2,2 pp
Un enlace tel: en el código80551,8%51,3%±2,5 pp
Dirección postal estructurada28618,4%18,3%±1,9 pp
Horario de apertura estructurado20813,4%13,3%±1,7 pp
Tipo de negocio sanitario775,0%4,9%±1,1 pp

El 2,9% de las webs no muestra prácticamente ningún texto hasta que se ejecutan sus scripts. La mediana de caracteres legibles en una portada es de 5.016, así que el problema general no es que haya poco que leer: es que lo que hay no está etiquetado.

El cruce

253 clínicas hicieron el trabajo que no sirve y se saltaron el que sí

Las dos cifras juntas dicen más que por separado. De las 275 clínicas que publican un llms.txt, 253 no declaran ser un centro sanitario en sus datos estructurados. Es el 92,0%. Solo 22 clínicas de las 1.478 con base válida publican las dos cosas.

Dicho de otra forma: el esfuerzo de presencia en las respuestas está puesto casi entero en el archivo que ningún buscador se ha comprometido a leer, y casi nada en el marcado que todos documentan que usan. Y 1.152 clínicas, el 77,9%, no publican ninguna de las dos.

No es un reproche a las clínicas. Es lo que pasa cuando una recomendación se difunde más rápido que la evidencia que la respalda, y cuando la parte difícil requiere tocar el código y la fácil viene activada de fábrica.

Por comunidad

Asturias y Canarias publican el triple que Aragón

El reparto por comunidad no sigue al tamaño del mercado, y esa es la señal de que no responde a una estrategia. Si publicar un llms.txt fuera una decisión de negocio, las comunidades con más competencia irían primero. Van primero las que tienen más webs hechas con los gestores que lo generan solos.

llms.txt y marcado sanitario por comunidad autónoma
ComunidadDominios medidosPublica llms.txtSe declara centro sanitario
Cataluña22715,9%3,5%
Andalucía20312,8%4,9%
Comunidad de Madrid17828,1%7,3%
Comunitat Valenciana16616,9%6,0%
Galicia11816,9%2,5%
País Vasco8922,5%6,7%
Castilla y León7015,7%1,4%
Canarias6930,4%5,8%
Castilla-La Mancha6317,5%6,3%
Aragón5810,3%3,4%
Región de Murcia4712,8%2,1%
Principado de Asturias3933,3%2,6%
Illes Balears3821,1%13,2%
Extremadura3718,9%0,0%
Cantabria2619,2%3,8%
Comunidad Foral de Navarra2512,0%4,0%

Se muestran las comunidades con 25 dominios o más. La Rioja, Ceuta y Melilla quedan fuera de la tabla por tamaño de muestra, aunque sí entran en la estimación nacional ponderada.

Por especialidad

La nutrición se identifica tres veces mejor que la media, y nadie sabe por qué

La odontología es el grupo más grande de la muestra y se queda en la media. El dato que se sale es la nutrición: el 14,6% declara ser un centro sanitario, tres veces la media nacional, sobre 48 dominios. Con esa muestra conviene tratarlo como una pista y no como un hecho.

llms.txt y marcado sanitario por especialidad
EspecialidadDominios medidosPublica llms.txtSe declara centro sanitario
Odontología47516,4%6,3%
Fisioterapia34817,0%4,0%
Psicología17921,8%3,4%
Podología15818,4%4,4%
Medicina estética14717,7%8,8%
Traumatología6613,6%1,5%
Nutrición4816,7%14,6%
Oftalmología4517,8%2,2%
Dermatología3917,9%5,1%

Una clínica puede tener más de una especialidad, así que los grupos se solapan y no suman 1.615. Se muestran los que tienen 30 dominios o más.

Método

De 85.587 centros a 1.615 dominios

Es la misma muestra que usamos en el informe de precios y en el de accesibilidad, sorteada del registro estatal de centros sanitarios del Ministerio de Sanidad y estratificada por comunidad autónoma. Un dominio solo entra cuando lleva el teléfono, el código postal o la calle que consta en el registro, para no medir la web de otra empresa con nombre parecido.

Del registro estatal a la muestra final
PasoCentrosQué significa
Centros privados en el registro85.587Población del estudio, la misma que en los informes de precios y accesibilidad
Centros sorteados4.054Muestra aleatoria estratificada por comunidad autónoma
Con web verificada1.691Lleva el teléfono, el código postal o la calle del registro
Dominios distintos1.615Se agrupan los centros que comparten web con otro de la muestra
Webs que respondieron1.55461 agotaron el tiempo de espera o rechazaron la petición
Base válida para llms.txt1.478Se excluyen 76 servidores que responden 200 a cualquier ruta inventada

Los 76 servidores que se inventan el archivo

Hay servidores que responden 200 a cualquier dirección que se les pida. Preguntarles por /llms.txt devuelve una página, y contarla haría subir la cifra sin que nadie haya publicado nada. Por eso en la misma pasada pedimos a cada dominio un archivo .txt inventado con nombre aleatorio: los 76 que también respondieron 200 quedan fuera de la base del llms.txt. Sin este control la tasa saldría 3,4 puntos más alta.

Honestidad

Lo que este informe no puede decir

Medimos la portada, no la web entera

Los datos estructurados de una clínica pueden estar en su página de contacto y no en la portada. Nuestras tasas describen lo que un buscador encuentra en la primera página que visita, que es también la que más se enlaza y la que primero se rastrea, pero una clínica marcada como centro sanitario solo en una página interior cuenta aquí como no marcada. Para el marcado sanitario, la cifra real del sector es algo más alta que el 4,9%.

Que un buscador pueda leer algo no prueba que lo use

Sabemos lo que estas webs publican y lo que permiten rastrear. No sabemos qué pesa cada motor al elegir a quién cita, porque ninguno lo publica. Lo que sí está documentado es lo contrario: Google ha dicho que no admite llms.txt, y el análisis de Ahrefs sobre 137.210 dominios encontró que el 97% de los archivos llms.txt no recibe ninguna petición. Nuestra afirmación es que el esfuerzo está mal repartido, no que el marcado garantice una cita.

Solo llegamos a las clínicas con web localizable

De los 4.054 centros sorteados verificamos la web de 1.691. El resto no tiene web, la tiene con un nombre que no se puede resolver sin riesgo de equivocarse de empresa, o no respondió. Las tasas de este informe describen a las clínicas privadas españolas que tienen web, no a todas.

El archivo puede existir y estar vacío de contenido útil

Comprobamos que el archivo existe, que lo sirve el propio dominio y que no es una página de error disfrazada. No juzgamos si su contenido está bien formado ni si describe la clínica con precisión. Es la misma limitación que declara Ahrefs en su estudio. Si midiéramos la calidad, el 18,5% solo podría bajar.

Un robots.txt permisivo no es una decisión consciente

El 4,7% que bloquea a algún motor sí ha tomado una decisión. Del 95,3% restante no podemos decir que haya decidido nada: lo más probable es que nunca se lo haya planteado y que el archivo venga como viene por defecto. Que casi nadie bloquee no significa que casi todos quieran salir.

Preguntas frecuentes

Preguntas frecuentes sobre llms.txt y datos estructurados

¿Qué es el archivo llms.txt?

Es un archivo de texto que se coloca en la raíz de una web, en la dirección /llms.txt, con un resumen del sitio escrito para que lo lean modelos de lenguaje. Lo propuso Jeremy Howard en 2024 y desde entonido se ha extendido como recomendación en el sector del posicionamiento. No es un estándar aprobado por ningún organismo ni por ningún buscador.

¿Sirve de algo publicar un llms.txt en 2026?

Hoy no hay evidencia de que sirva. Google ha declarado que no tiene planes de admitirlo, OpenAI no lo pide al rastrear, y el análisis de Ahrefs sobre 137.210 dominios encontró que el 97% de estos archivos no recibe ninguna petición. Publicarlo cuesta muy poco, así que tampoco hace daño, pero no sustituye a los datos estructurados y no debería consumir el presupuesto que les corresponde.

¿Cuántas clínicas españolas tienen un llms.txt?

El 18,5% de las clínicas privadas españolas con web, con un margen de ±2,0 puntos. Son 275 de las 1.478 webs con base válida que medimos en agosto de 2026. Como referencia, entre las 549 webs alcanzables del top 1.000 mundial de Tranco la tasa es del 15,8%, así que las clínicas españolas están en la media alta pese a ser negocios muy pequeños. El motivo no es una estrategia: el archivo lo generan solos gestores como Wix, GoDaddy y varios complementos de WordPress.

¿Qué datos estructurados necesita la web de una clínica?

Los que identifican al negocio: el tipo de centro sanitario que es, la dirección postal, el teléfono y el horario, en formato schema.org. Es lo que permite a un buscador responder si una clínica es dental, dónde está y cuándo abre sin tener que deducirlo del texto. El 74,6% de las clínicas medidas lleva algún marcado, casi siempre el genérico que instala su gestor de contenidos, pero solo el 4,9% declara que es un centro sanitario.

¿Bloquean las clínicas españolas a ChatGPT y a los demás buscadores con inteligencia artificial?

Casi ninguna. El 3,8% bloquea a GPTBot, el 4,0% a ClaudeBot y el 1,8% a PerplexityBot en su robots.txt, y solo el 4,7% bloquea a alguno de los ocho rastreadores que comprobamos. La falta de presencia de las clínicas en las respuestas no viene de haber cerrado la puerta.

Reproducibilidad

Cómo comprobar cualquier cifra de este informe

Cualquiera puede repetir la parte pública de esta medición sobre su propia web. Pidasu-dominio.com/llms.txt ysu-dominio.com/robots.txt en el navegador. Para el marcado, busqueapplication/ld+json en el código fuente de la portada y compruebe si el campo@type dice lo que es su clínica, por ejemplo Dentist oMedicalClinic, y no soloWebSite.

Antes de dar por bueno un llms.txt, pida al mismo dominio un archivo .txt inventado. Si también responde, su servidor contesta a todo y el llms.txt que creía tener no existe.

Medición realizada el 15 de agosto de 2026. Fuentes externas citadas: el análisis de Ahrefs sobre 137.210 dominios, el seguimiento de adopción de Rankability sobre el top 1.000 de Tranco, el análisis de SE Ranking sobre unos 300.000 dominios, el recuento de BuiltWith de mayo de 2026 y las declaraciones públicas de Google sobre llms.txt. Los datos de partida son el registro estatal de centros sanitarios del Ministerio de Sanidad.

Cómo citar este informe

Este informe está depositado con un identificador permanente y se puede citar y reutilizar libremente con atribución, bajo licencia CC BY 4.0.

Comino, Alberto (2026). llms.txt y datos estructurados en las clínicas privadas españolas: el 18,5% publica el archivo que ningún motor lee y el 4,9% publica el marcado que sí leen. 360 Clinic Consulting. https://doi.org/10.5281/zenodo.22002690

DOI
10.5281/zenodo.22002690
Archivo
Zenodo (CERN)

Solicita un diagnóstico gratuito de captación

Te mostramos dónde estás perdiendo pacientes, cuánto te cuesta realmente cada primera visita y qué podríamos mejorar en los próximos 30 días.

Sin compromiso. Te respondemos en menos de 24 horas.