El bot
Un solo User-Agent identificado con URL y correo; robots.txt obedecido por host; una petición cada 3-5 segundos por dominio; un 403 cierra el recurso sin reintentos, sin otro cliente y sin navegador. No entrena modelos ni redistribuye texto.
Esta página existe para los responsables técnicos de los medios que aparecen en sus registros y para cualquiera que quiera saber cómo recogemos los datos. Su contenido no cambia aunque cambie el nombre del proyecto: el bot se identifica siempre por este dominio.
Quién es
- User-Agent:
HemeroscopioBot/1.0 (+https://hemeroscopio.org/bot; bot@hemeroscopio.org). Es el único que usamos; no rotamos identidades ni imitamos navegadores. - Dirección IP de salida: todavía sin dirección fija publicada; la anotaremos aquí en cuanto el servidor esté desplegado. Todas las peticiones salen de un único servidor en la Unión Europea.
- Correo: bot@hemeroscopio.org (cuestiones técnicas) · editores@hemeroscopio.org (exclusiones y réplicas) · privacidad@hemeroscopio.org (protección de datos). Respondemos en 24 horas laborables.
- Quién lo opera: una persona, sin ánimo de lucro. Ver Quiénes somos.
Qué lee
- Feeds RSS/Atom y sitemaps de noticias que cada cabecera publica: son nuestro canal preferente, porque es el que el editor expone para lectura mecánica. Feeds cada 10 minutos; sitemaps cada 15.
- La portada, tal como se sirve sin JavaScript a un navegador de escritorio, cada 15, 30 o 60 minutos según la hora y el ritmo de cambio de cada cabecera. En dos cabeceras cuya portada no tiene HTML estático suficiente usamos un navegador automatizado a 1280×900, con anuncios y terceros bloqueados y sin guardar capturas.
- Las páginas de artículo enlazadas desde feeds, sitemaps y portada, para leer sus metadatos (JSON-LD, canonical) y, cuando el artículo es de acceso abierto, su cuerpo en memoria.
Ritmo: una petición cada 3-5 segundos por servidor, y más lento si el robots.txt declara un Crawl-delay. Entre la 01:00 y las 06:00 la portada se captura solo cada hora.
Qué guarda y qué no
Guardamos la dirección del artículo, la cabecera, las horas (la que declara el medio y la primera vez que lo vimos), la sección declarada, el titular tal como aparece en cada momento, la posición en la portada y unos cuantos derivados (rasgos lingüísticos del titular, una huella numérica para agrupar noticias que se borra a las 72 horas, un resumen numérico del cuerpo abierto para detectar teletipos, y la letra y la puntuación que un modelo local da al encuadre de cada titular, guardadas junto a la huella del titular y no junto a su texto).
No guardamos, en ningún soporte: el cuerpo de los artículos, las entradillas, el HTML de las páginas, capturas de pantalla, imágenes ni logotipos. El texto que leemos se procesa en memoria y se descarta en la misma pasada. Es la forma en que respetamos las reservas de derechos sobre minería de textos (art. 67.3 LPI) que varios grupos han publicado: no conservando textos.
robots.txt
Obedecemos el robots.txt de cada servidor (también el de los servidores que alojan los feeds) según la RFC 9309, con caché de 24 horas. Si un robots.txt responde con un error 4xx, tratamos ese servidor como «sin robots legible» y dejamos de leerlo (es más estricto que la norma). Si responde con un error 5xx, usamos la copia guardada hasta 24 horas y después paramos.
Para excluir a este bot, añade a tu robots.txt:
User-agent: HemeroscopioBot
Disallow: /
Lo comprobamos cada día y lo aplicamos en menos de 24 horas. Si prefieres una exclusión parcial (por ejemplo, solo dejar de mostrar tus titulares literales), usa Editores: se aplica en menos de 15 minutos cuando llega por el formulario automático y en menos de 24 horas laborables cuando llega por correo.
Cuando nos bloqueáis
Un 403 cierra el recurso: no reintentamos, no cambiamos de cliente ni de dirección, no usamos un navegador automatizado para «pasar». Si más del 40 % de las capturas de una cabecera fallan durante siete días, la cabecera pasa a «sin posición» o «sin cuerpo» y lo decimos en Estado. Tampoco usamos cuentas, cookies, el nombre de otros bots, versiones AMP ni cachés para leer contenido cerrado; no leemos ningún cuerpo de pago aunque viaje en el HTML.
Lo que sí hacemos es preguntar de vez en cuando si el bloqueo sigue ahí, para no dar por perdida una portada que hoy vuelve a estar abierta. Cuando la portada de una cabecera queda cerrada, hacemos una sola petición por servidor y hora, con este mismo User-Agent, comprobando antes tu robots.txt y sin reintentos. Si responde, la cabecera vuelve a medirse sola; si no, se anota el intento y se espera a la hora siguiente. En Estado y en la ficha de cada cabecera publicamos desde cuándo está cerrada su portada y qué porcentaje de esos intentos respondió en los últimos siete días. Si prefieres que dejemos de preguntar, dínoslo en Editores o bloquéanos por nombre en tu robots.txt: en ambos casos no se vuelve a pedir nada.
Sobre las reglas dirigidas a bots de inteligencia artificial
Varias cabeceras bloquean por nombre a rastreadores de empresas de IA (GPTBot, CCBot, ClaudeBot, Google-Extended y otros) y permiten a los agentes genéricos. Nuestra lectura: esas reglas se dirigen a rastreadores que entrenan modelos generativos o construyen corpus redistribuibles. Este bot no entrena ningún modelo, no redistribuye texto y no conserva contenidos; los únicos modelos que usamos son de pesos abiertos, se ejecutan en nuestro propio servidor y producen derivados (un descriptor propio de cada noticia, rasgos de los titulares) sobre datos que se descartan en la misma pasada. La RFC 9309 asigna las reglas por nombre de agente, y la voluntad del editor sobre la minería de textos se expresa en su reserva del art. 67.3, que respetamos como se explica arriba. Esta interpretación ha sido revisada por asesoramiento jurídico independiente antes de incorporar las cabeceras afectadas, y cualquier editor que no la comparta puede excluirnos por nombre en su robots.txt o desde Editores sin discutirla.
Reservas de minería legibles por máquina
Publicamos nuestra propia declaración en /.well-known/tdmrep.json. Comprobamos en cada servidor el fichero tdmrep.json, la cabecera HTTP tdm-reservation y la etiqueta <meta name="tdm-reservation"> de cada página; si aparecen, las respetamos automáticamente y las registramos.
Avisos legales
Releemos cada mes los avisos legales de las cabeceras configuradas y guardamos una copia cuando cambian. Si una cabecera bloquea a nuestro bot, su aviso lo lee una persona en un navegador normal o se toma de una copia de archivo público; nunca con un navegador automatizado tras un bloqueo.
Qué hacemos con los modelos
Ningún servicio externo de inteligencia artificial recibe datos de las cabeceras. Los modelos (procesamiento de lenguaje, agrupación de noticias, redacción del descriptor propio, clasificación del encuadre de cada titular en una letra) son de pesos abiertos, están publicados con su huella criptográfica y se ejecutan en nuestro servidor. Al modelo que clasifica el encuadre le llega el titular sin el nombre de la cabecera, sin firma y sin dirección. No se entrena ni se ajusta ningún modelo con contenido de las cabeceras. Un editor puede sacar su cabecera de estos modelos con el alcance «sin anotación de modelo» de Editores.
Cómo excluirse o replicar
- Exclusión: Editores. Cuatro alcances (sin titulares literales, sin anotación de modelo, sin posición, total). Se aplica en menos de 15 minutos (formulario automático) o de 24 horas laborables (correo), se confirma en 72 horas y queda registrada públicamente.
- Réplica: cualquier cabecera puede enviar una réplica que publicamos íntegra en su página en un plazo de 3 días. Ver Réplicas.
- Periodistas: si no quieres ver tu firma junto a un titular citado, escribe a privacidad@hemeroscopio.org; retiramos la firma y el titular queda citado «sin firma a petición del autor». Ver Privacidad.
Última revisión de esta página: 7 de septiembre de 2026 (versión 0.12.0; 0.10.0: 4 de septiembre; 0.9.0: 3 de septiembre de 2026). Los cambios se anotan en Correcciones.