Saltar al contenido

Datos abiertos

Todo lo que se publica en el panel se puede descargar: métricas con n, IC y sensibilidades; posiciones y bandas; horas; historias y descriptores propios; versiones de titular como hash + URL; encuadre por titular como hash, letras y puntuación. Sin titulares literales, sin firmas y sin prior.

Catálogo

Licencia CC BY 4.0 · generado el mar 8 sep 15:54 · diccionario de variables

Cómo citar

Hemeroscopio (2026). Datos abiertos del observatorio de portadas de la prensa digital española, exportación del mar 8 sep 15:54. https://hemeroscopio.org/datos/. Licencia CC BY 4.0. Cita el fichero por su ruta y su sha256.

estimado Tablas del método de encuadre todavía sin publicar (encuadre_titular, encuadre_historia_cabecera, encuadre_cabecera): aparecen aquí, sin texto de titular (solo hashes), cuando la corrida pasa sus puertas.

Todo lo que ves en este sitio existe antes como fichero público. Aquí puedes descargarlo.

Licencia

CC BY 4.0 (Creative Commons Reconocimiento 4.0 Internacional). Puedes copiar, redistribuir, transformar y construir sobre estos datos, incluso con fines comerciales, citando la fuente: «Hemeroscopio, hemeroscopio.org, [fecha de descarga]» y, si usas un volcado anual, su DOI.

Qué hay

Ficheros Parquet particionados por día (dia=AAAA-MM-DD/) y un catálogo index.json con ruta, partición, filas, huella SHA-256 y esquema de cada fichero, más un diccionario de variables:

Fichero Qué contiene Marca
articulo Dirección normalizada y canónica, cabecera, idioma, sección declarada, tema (modelo), horas declarada y observada, si es opinión o directo, si el cuerpo era accesible, huella del titular (titular_sha256) ■ hechos (salvo tema_iptc)
tramo_portada Cada periodo en que un artículo estuvo en la portada de una cabecera: inicio y fin efectivos, orden en el DOM, banda (apertura / 2-10 / 11-30 / resto), si la banda se sostuvo ≥ 2 capturas, bloque
historia Cada agrupación de artículos sobre la misma noticia: apertura y cierre, número de cabeceras y artículos, descriptor propio, sección dominante, versión del algoritmo ◆ modelo
articulo_historia Asignación de cada artículo a su historia, con similitud, si fue provisional o laxa, y si la hizo el modelo o una persona
metrica_cabecera Cada métrica comparativa: valor del modelo de efectos fijos, intervalo, las tres sensibilidades, p ajustada, n, ventana, versión del método
afinidad Asociación corregida por marginales entre pares de cabeceras, con intervalo y n
conteo_frase y frase_partidista Conteo por artículo de coincidencias con una lista congelada de frases parlamentarias (de datos abiertos del Congreso y ParlaMint), y la lista misma con su versión ◆ (desde el 22-2-2027)
composicion_ventana Composición nominal y efectiva de la muestra por familia de métricas y ventana gobernanza
encuadre_titular Cada titular juzgado por el modelo de encuadre: huella SHA-256 del titular, cabecera, historia, letra en cada orden de la escala, puntuación (−1 a +1), probabilidad de «no aplica», si aplica, si es inconsistente entre órdenes, valencia, versión del método. Sin texto de titular: solo huellas, y sin identificadores internos de versión ◆ estimado · encuadre
encuadre_historia_cabecera Una fila por noticia y cabecera: puntuación media de sus piezas, banda (mínimo-máximo), número de piezas y de piezas que aplican, inconsistentes, valencia media, si es teletipo compartido
encuadre_cabecera Una fila por cabecera y ventana de 90 días: desviación respecto al conjunto (cruda y encogida), intervalo, sensibilidades S1-S4, p ajustada, lectura fija, n de noticias, días y titulares, tasas de inconsistencia y «no aplica», si es publicable y por qué no ◆ (solo cabeceras publicables; las demás salen con publicable = false y sin cifra)

Los ficheros JSON que alimentan el panel (hoy.json, estado.json, dia/<fecha>.json, historia/<id>.json, cabecera/<slug>.json) también son públicos, con la misma licencia; su esquema está en data-contracts/. Los campos del encuadre viajan con prefijo m_ (m_encuadre en cada noticia, m_mapa_medios en hoy.json, m_tendencia y su serie en cada cabecera) y llevan siempre su intervalo y su n; cuando no hay cifra publicable el campo es null y va acompañado de su motivo.

Qué no hay, y por qué

  • Titulares literales: en los datos abiertos el titular va como huella SHA-256 + dirección canónica + cabecera. Quien necesite el texto lo obtiene del original. Los titulares literales solo se muestran, como cita, en la página de cada noticia del sitio.
  • Cuerpos ni entradillas: no los almacenamos en ningún soporte (ver Nuestro bot).
  • Firmas de periodistas: nunca en los datos abiertos.
  • El valor del prior externo (CIS, MBFC…) que usamos para componer la muestra: se publica en Método con su fuente, pero no viaja en los datos, para que nadie lo use como etiqueta.
  • Un corpus: no cedemos reproducciones a nadie. Quien quiera un corpus de investigación lo reconstruye con el código y la lista de direcciones bajo su propia excepción legal.

Descarga

  • Catálogo: https://hemeroscopio.org/datos/d/index.json (se regenera cada día a las 05:00, hora peninsular, tras la agregación de las 04:30).
  • Ficheros: la ruta que indica el catálogo, o https://hemeroscopio.org/datos/d/<ruta>.
  • Diccionario de variables: https://hemeroscopio.org/datos/d/diccionario.md (o data-contracts/ en el repositorio).
  • Volcado anual con DOI en Zenodo cada enero, con el informe de metodología y el código de ese año.

Cómo leerlos

Con DuckDB, en una línea: select * from read_parquet('https://hemeroscopio.org/datos/d/tramo_portada/dia=*/*.parquet') limit 10;. En el repositorio hay un cuaderno de ejemplo que reconstruye la matriz de cobertura de un día.

Reglas de lectura que te pedimos

  • Cada cifra comparativa lleva n, ventana, intervalo y versión del método: úsalos. Si el intervalo cruza cero, la lectura correcta es «sin diferencia detectable».
  • Las cifras de encuadre (encuadre_*, m_encuadre, m_tendencia) son estimaciones de un modelo local sobre titulares, en una escala de −1 (izquierda) a +1 (derecha) del debate político español; la de cabecera es relativa al conjunto de cabeceras medidas en las mismas noticias, no una etiqueta del medio. No las conviertas en categorías ni en una lista ordenada de cabeceras: el método no lo sostiene y así lo explica Método. Una cabecera con publicable = false no tiene cifra que citar.
  • Las cabeceras nuevas entran en la serie en la fecha que marca composicion_ventana; compara ventanas con la misma composición.
  • Los campos de modelo (m_* en los JSON; historia, articulo_historia, metrica_cabecera, afinidad, tema_iptc en Parquet) son salidas de un algoritmo con una tasa de error publicada en Método; los hechos ■ no.
  • Un cambio de versión de la lista de frases es una ruptura de serie: no sumes conteos de versiones distintas.

Cómo citar

Hemeroscopio (2027). Registro de portadas de la prensa digital española [conjunto de datos]. hemeroscopio.org. DOI: [pendiente del primer volcado].