Este es un sitio oficial de la ODERSA. Así es como puede saberlo

El dominio oficial

La dirección de este sitio termina en odersa.org. Cada servicio de la asociación está en un subdominio de odersa.org y en ningún otro lugar. Si la dirección que aparece en la barra de su navegador no termina en odersa.org, este sitio no es nuestro.

Gratuito, y sin cuenta

Todo está abierto desde el primer momento. Sin registro, sin cuenta, sin contraseña, sin suscripción, sin publicidad. Nada se reserva a quien paga, porque aquí no se paga nada.

Ningún dato recopilado

Este sitio no le sigue la pista: ni rastreadores, ni cookies de seguimiento, ninguna herramienta de medición incorporada en estas páginas, y nada medido en su dispositivo. Nuestro alojamiento cuenta los accesos de forma agregada, como hace cualquier servidor que responde: un total, nunca un perfil. No hace falta que nos crea: abra las herramientas de desarrollo de su navegador, pestaña Red, y recargue la página. Verá la lista completa de lo que el sitio pide. Todo viene de odersa.org, nada sale a otra parte.

Contenidos libres

Los contenidos se publican bajo licencia CC BY 4.0. Puede copiarlos, traducirlos, imprimirlos y redistribuirlos, tanto para sus clases como para su gente, con una única condición: citar a la ODERSA.

Lecturas y límites

Resultados y mediciones

Esta página pertenece a la carpeta del proyecto Generación de lenguaje natural verificable. Expone las lecturas del 28 de agosto de 2026 sobre el estado actual del sistema estudiado: fondo de hechos, cobertura lingüística, equivalencia factual y determinismo. Cada figura va acompañada de la tabla de los mismos datos, y la última sección nombra lo que estas cifras no dicen.

Mediciones del – regenerables.

Fecha de medición: 28 de agosto de 2026 Lecturas regenerables sobre el estado actual

1. Método de medición

Las cifras de esta página no son estimaciones, y tampoco son récords conservados. Las producen lecturas que se rehacen con un solo comando sobre el estado actual del sistema, y que borran las anteriores. La fecha que figura en la cabecera de la página es la de la lectura, no la de la redacción: cuando el sistema evoluciona, la medición se rehace y la página cambia.

El principio editorial que de ello se desprende cabe en una frase: la división solo publica lo que puede volver a medir. Un resultado que una lectura no supiera reproducir no tiene aquí su lugar, aunque sea cierto. Es también la razón por la que ninguna comparación numérica con otros sistemas aparece en este sitio: la división mide lo que controla, y nada más.

Tres familias de lecturas se reparten la página. La primera describe de qué dispone el sistema, es decir, su fondo de hechos estructurados. La segunda mide lo que produce efectivamente, lengua por lengua y tema por tema. La tercera somete las salidas a controles exteriores, entre ellos un control negativo destinado a establecer que esos controles saben fallar.

Caja tipográfica de madera inclinada, llena de tipos de imprenta de plomo ordenados por compartimentos, con un componedor apoyado en el centro.
Caja tipográfica, Gutenberg-Museum Mainz, photo dronepicr, CC BY 2.0.

Tres definiciones operativas fijan el vocabulario de las lecturas.

Definición 1 (documento completo). Para un tema y una lengua dados, una salida devuelta entera, sin sección vacía ni error de producción. El barrido cuenta una lengua como cubridora si y solo si ese documento existe.

Definición 2 (omisión honesta). La ausencia contada de un documento, o de un hecho dentro de un documento, cuando la materia disponible no permite enunciarlo correctamente. Cada omisión se publica junto a la medición a la que acompaña: cobertura y omisiones se complementan hasta 1 000 por construcción.

Definición 3 (equivalencia factual). Dos versiones de un mismo tema son equivalentes si todo valor de datos extraído de cualquiera de ellas, en el umbral publicado, se reencuentra sin conflicto en el referencial del tema. Decir menos está permitido, decir otra cosa no lo está.

2. El fondo de hechos

El sistema trabaja sobre 3 444 fichas de hechos estructurados, repartidas en 8 dominios. La repartición es muy desigual, y esa desigualdad explica una parte importante de las diferencias de cobertura observadas más adelante: un dominio con pocas fichas, o con fichas poco densas, produce mecánicamente menos documentos completos.

Fichas de hechos estructurados por dominio: figuras históricas 1 070; ciudades y lugares 1 003; especies vivas 504; acontecimientos 445; países 197; sustancias 156; invenciones 65; objetos celestes 4. figuras históricas 1 070 ciudades y lugares 1 003 especies vivas 504 acontecimientos 445 países 197 sustancias 156 invenciones 65 objetos celestes 4
Figura 1. Fichas de hechos estructurados por dominio, lectura del 28 de agosto de 2026. Los mismos datos figuran en la tabla 1.
Tabla 1. Fichas de hechos estructurados por dominio, 28 de agosto de 2026
Dominio Fichas
Figuras históricas1 070
Ciudades y lugares1 003
Especies vivas504
Acontecimientos445
Países197
Sustancias156
Invenciones65
Objetos celestes4
Total3 444

3. Cobertura lingüística, tema por tema

El barrido del 28 de agosto de 2026 cuenta, para un tema de ensayo dado, cuántas lenguas producen un documento completo sobre las 1 000 lenguas tratadas. Las lenguas restantes no producen un documento degradado: callan, y ese silencio se cuenta como una omisión honesta.

Lenguas que producen un documento completo, sobre 1 000 lenguas tratadas, barrido del 28 de agosto de 2026: país (Kenia) 935; especie (león) 932; sustancia 924; figura histórica 132. país (Kenia) 935 / 1 000 especie (león) 932 / 1 000 sustancia 924 / 1 000 figura histórica 132 / 1 000
Figura 2. Lenguas que producen un documento completo por tema de ensayo, barrido del 28 de agosto de 2026. Los mismos datos figuran en la tabla 2, con la columna de las omisiones honestas.
Tabla 2. Barrido del 28 de agosto de 2026: lenguas que producen un documento completo y omisiones honestas, sobre 1 000 lenguas
Tema de ensayo Documento producido Omisiones honestas
País (Kenia)93565
Especie viva (león)93268
Sustancia92476
Figura histórica132868

Las dos columnas de cifras se complementan hasta 1 000: cada lengua que no produce un documento se cuenta como una omisión honesta, y ninguna se pierde por el camino. La longitud de los documentos varía mucho según el tema: la mediana se sitúa en 77 palabras para el tema de los países, en 8 palabras para la especie y en 7 para la sustancia. Un ejemplo francés de ficha de país cuenta 274 palabras, para un nivel de lectura medido en grado 12.

Publicar la columna de las omisiones no es una precaución retórica, es una condición de lectura de las demás columnas. Una tasa de cobertura elevada solo tiene sentido si se sabe en qué ha quedado el resto: sin esa columna, nada distingue un sistema que calla de un sistema que aproxima. Contar los silencios es lo que vuelve legibles las afirmaciones, y por eso el dominio menos cubierto aparece en la misma figura y en la misma tabla que los mejor dotados.

4. Robustez multitema

Una lectura sobre un tema único por dominio se presta a la elección conveniente. La lectura multitema descarta ese riesgo por construcción: se retienen cinco temas por dominio, escogidos por orden lexicográfico, es decir, sin intervención discrecional. El valor consignado para cada dominio es la media de las lenguas que producen un documento sobre esos cinco temas.

Lenguas que producen un documento, media sobre 5 temas por dominio escogidos por orden lexicográfico, sobre 1 000 lenguas, 28 de agosto de 2026: sustancias 924; especies vivas 908; países 907; acontecimientos 900; ciudades y lugares 897; figuras históricas 273. sustancias 924 / 1 000 especies vivas 908 / 1 000 países 907 / 1 000 acontecimientos 900 / 1 000 ciudades y lugares 897 / 1 000 figuras históricas 273 / 1 000
Figura 3. Lenguas que producen un documento, media sobre 5 temas por dominio escogidos por orden lexicográfico, 28 de agosto de 2026. Los mismos datos figuran en la tabla 3.
Tabla 3. Robustez multitema, 28 de agosto de 2026: media de las lenguas que producen un documento sobre 5 temas por dominio, sobre 1 000 lenguas
Dominio Media sobre 5 temas
Sustancias924
Especies vivas908
Países907
Acontecimientos900
Ciudades y lugares897
Figuras históricas273

Cinco dominios de seis se mantienen en una banda estrecha, lo que indica que la cobertura no depende del tema escogido, sino de la materia disponible. El dominio de las figuras históricas confirma, en cambio, su dispersión: según la densidad de la ficha, el número de lenguas que producen un documento va de 109 a 902. El límite es, pues, el dato disponible, y no el procedimiento de producción, cosa que la división dice en lugar de apartar el dominio de la lectura.

La misma lectura multitema mide la longitud de los documentos producidos. La figura 4 lleva las treinta medianas, una por tema: la posición de un racimo dice la riqueza del dominio, su dispersión dice la varianza en el interior del dominio.

Longitud mediana de los documentos en palabras, cinco temas por dominio, campaña del 28 de agosto de 2026: países de 19 a 68; acontecimientos de 18 a 30; ciudades y lugares de 8 a 16; especies vivas de 11 a 14; figuras históricas de 11 a 13; sustancias 7 en cada uno de los cinco temas. países 19–68 acontecimientos 18–30 ciudades y lugares 8–16 especies vivas 11–14 figuras históricas 11–13 sustancias 7
Figura 4. Longitud mediana de los documentos, en palabras, para cada uno de los treinta temas de la campaña (cinco por dominio, orden lexicográfico), 28 de agosto de 2026. Cada punto es un tema; el eje corre de 0 a 70 palabras.

El racimo de las sustancias es un punto repetido: 7 palabras de mediana en cada uno de los cinco temas, la firma de un dominio cuya materia disponible es uniforme de un tema a otro. En el extremo opuesto, el dominio de los países se extiende de 19 a 68 palabras de mediana según el tema. Las figuras históricas combinan ambas lecturas: la cobertura varía allí de 109 a 902 lenguas según la ficha, pero la longitud mediana se mantiene apretada, de 11 a 13 palabras – lo que se dice varía poco, lo que varía es el número de lenguas capaces de decirlo.

5. Equivalencia factual y determinismo

Las dos lecturas que siguen atañen a las salidas mismas. La primera verifica la equivalencia factual entre las lenguas, en el sentido de la definición 3: decir menos está permitido, decir otra cosa no lo está. Los textos producidos han sido releídos por un verificador independiente del sistema, que extrae los valores numéricos de datos y comprueba que cada uno se reencuentra, sin conflicto, en el referencial del tema, sobre un umbral publicado: los valores superiores o iguales a 10 000, lo que excluye los años que llevan los nombres propios. Sobre 935 lenguas releídas, se han comparado 415 valores, y no se ha registrado ningún conflicto.

Un control que no encuentra nada solo tiene valor si es capaz de encontrar algo. Un control negativo acompaña, pues, a la lectura: un valor corrompido artificialmente e inyectado en una salida ha sido efectivamente detectado por el verificador. Es esa capacidad de fallar la que vuelve legible el resultado anterior como un resultado, y no como un silencio de instrumento.

La segunda lectura atañe al determinismo. Se han repetido 147 generaciones en dos procesos separados, y las 147 huellas SHA-256 obtenidas son idénticas: ninguna diferencia. La reproducibilidad anunciada no es, pues, una propiedad interna postulada, sino una igualdad constatada desde fuera, sobre huellas que cualquier tercero sabe calcular.

Proceso A Proceso B Huellas SHA-256 147 generaciones las mismas 147 generaciones calculables por un tercero 147 / 147 idénticas 0 diferencias

Esquema 1. Determinismo entre procesos, lectura del 28 de agosto de 2026: las mismas 147 generaciones, reejecutadas en dos procesos separados, devuelven huellas idénticas.

Tabla 4. Equivalencia factual y determinismo, 28 de agosto de 2026
Lectura Valor
Lenguas releídas por el verificador independiente935
Valores numéricos comparados415
Conflictos registrados0
Generaciones repetidas en dos procesos separados147
Huellas SHA-256 idénticas147
Diferencias registradas0

Propiedad P4

Equivalencia factual entre lenguas

Las versiones de un mismo tema en lenguas distintas llevan exactamente los mismos hechos: decir menos está permitido, decir otra cosa no lo está.

Estado: verificada desde fuera del sistema en la lectura del 28 de agosto de 2026, control negativo incluido.

6. La campaña ampliada

Las lecturas anteriores atañían a un tema de ensayo. La misma verificación se ha reejecutado después a escala: 30 temas, escogidos por orden lexicográfico a razón de los 5 primeros de cada uno de los 6 dominios medidos, releídos en las 1 000 lenguas. Se han comparado desde fuera 1 646 valores numéricos, y no se ha registrado ningún conflicto. Los controles negativos se han reejecutado tema por tema: sobre los 8 temas cuyo referencial lleva valores por encima del umbral, 8 corrupciones inyectadas, 8 detecciones.

30 temas Salidas producidas Valores extraídos Comparación 8 corrupciones orden lexicográfico 30 temas, 1 000 lenguas umbral: 10 000 y más entre lenguas inyectadas a propósito 1 646 valores · 0 conflictos 8 / 8 rechazadas

Esquema 2. El circuito de la campaña ampliada, 28 de agosto de 2026. El juez es externo: solo lee las salidas terminadas. La rama inferior es el control negativo, que establece que la comparación sabe fallar.

La calibración del verificador se ha medido por separado, en los dos sentidos. Se han inyectado 105 corrupciones artificiales en salidas reales, a razón de un valor alterado por texto, sobre 15 lenguas y 8 temas: 105 detecciones sobre 105. A la inversa, se han releído 113 textos intactos sin que se levantara ninguna falsa alarma. La sensibilidad y la especificidad del instrumento están, pues, medidas, no supuestas.

Veredicto del verificador alarma levantada silencio Realidad texto corrompido (105) texto intacto (113) 105 / 105 detecciones 0 corrupción no detectada 0 falsas alarmas 113 / 113 releídos sin alarma Un valor alterado por texto, 15 lenguas, 8 temas.

Esquema 3. Calibración del verificador, campaña del 28 de agosto de 2026. Las dos casillas de error están vacías, y se publican: un instrumento se juzga por sus dos columnas.

Dos lecturas de cobertura completan la campaña: los 197 temas del dominio de los países producen un documento en cada una de las 4 lenguas testigo (francés, inglés, suajili, árabe), y se han detectado 25 sistemas de escritura distintos en las salidas mismas.

Tabla 5. Campaña ampliada del 28 de agosto de 2026
Lectura Valor
Temas releídos (5 por dominio, orden lexicográfico)30
Valores numéricos comparados entre lenguas1 646
Conflictos registrados0
Corrupciones artificiales detectadas105 / 105
Falsas alarmas sobre textos intactos0 / 113
Temas del dominio de los países servidos en las 4 lenguas testigo197 / 197
Sistemas de escritura detectados en las salidas25

7. El detalle de los sistemas de escritura

La escritura dominante de cada documento producido durante la campaña se ha detectado desde fuera, por rangos Unicode, sin mirar el procedimiento que lo ha producido. De ahí salen 25 sistemas de escritura distintos. El alfabeto latino domina, y 21 de los 25 sistemas solo los llevan una o dos lenguas cada uno: es la larga cola tipográfica que el trato igual de las lenguas debe servir correctamente, hasta el tibetano o el oriya.

Tabla 6. Sistemas de escritura detectados en las salidas de la campaña, por número de lenguas, 28 de agosto de 2026
Sistema de escritura Lenguas
Latino895
Cirílico9
Árabe6
Devanagari3
Etíope2
Bengalí2
Hebreo2
Sinogramas2
Griego1
Armenio1
Georgiano1
Hiragana y katakana1
Hangul1
Tailandés1
Lao1
Birmano1
Tibetano1
Tamil1
Telugu1
Canarés1
Malayalam1
Oriya1
Gurmuji1
Guyaratí1
Cingalés1

8. Límites

El dominio de las figuras históricas es el menos cubierto de todos, y la diferencia no es marginal: 132 lenguas sobre 1 000 para el tema de ensayo, 273 de media sobre cinco temas, con una dispersión de 109 a 902 según la densidad de la ficha. Ese dominio es también el que cuenta con más fichas, lo que descarta la explicación por la rareza de los temas y remite a la densidad de la materia disponible en cada lengua.

La longitud de los documentos es escasa fuera del dominio de los países. Las medianas de 8 y 7 palabras registradas para la especie y la sustancia describen documentos breves, utilizables como fichas de hechos pero todavía no como contenidos pedagógicos completos. La división prefiere publicar esas medianas antes que callarlas: dicen dónde queda trabajo por hacer.

Por último, todas las cifras de esta página se miden sobre el estado actual del sistema y se regeneran en cada evolución. No describen un sistema congelado, y una lectura posterior podrá desplazarlas en un sentido o en el otro. La fecha que encabeza la página es, pues, un dato del resultado, no una mención de archivo.

9. Amenazas a la validez

El alcance de estas lecturas exige cinco reservas, que la división enuncia ella misma en lugar de dejar que se descubran.

El verificador de equivalencia solo compara los valores numéricos superiores o iguales a 10 000, umbral publicado que excluye los años que llevan los nombres propios. 22 de los 30 temas de la campaña ampliada no llevan ningún valor por encima de ese umbral: para esos temas, la equivalencia depende de los controles mecánicos internos, no de ese juez externo.

La equivalencia atañe a los valores de datos en el umbral publicado, no a la precisión de presentación. Una versión puede redondear un valor anunciándolo – escribir «alrededor de 1 208 000» donde otra versión escribe 1 208 333 –, y eso se ve en las demostraciones: el verificador compara cada valor extraído con el referencial del tema, que lleva ambas formas, y el redondeo anunciado depende del decir menos, nunca del decir otra cosa.

Los temas de ensayo siguen siendo pocos: uno por dominio para el barrido, cinco para la robustez. El orden lexicográfico descarta la elección conveniente; no establece, por sí solo, la representatividad de los temas retenidos.

El determinismo se constata entre dos procesos separados de una misma máquina; la reproducibilidad entre máquinas distintas todavía no ha sido objeto de una lectura publicada.

Por último, la cobertura cuenta documentos producidos, nunca su riqueza: las longitudes medianas publicadas con el barrido acotan esa lectura, y unas medianas de 7 y 8 palabras fuera del dominio de los países describen fichas de hechos, no lecciones.

Citar esta página

Las mediciones de esta página están fechadas y son regenerables: una cita lleva, pues, la fecha de medición, nunca una fecha de consulta sola.

ODERSA Research (división de investigación de la ODERSA). «Resultados y mediciones», mediciones del 28 de agosto de 2026. https://research.odersa.org/es/results

En formato BibTeX:

@misc{odersa_research_measurements_2026_es,
  author       = {{ODERSA Research}},
  title        = {Results and Measurements},
  organization = {ODERSA},
  year         = {2026},
  howpublished = {\url{https://research.odersa.org/es/results}},
  note         = {Measurements of 28 August 2026, regenerable}
}

Para leer a continuación

Atajos de teclado

TabNavegar de enlace en enlace
IntroAbrir el enlace, o plegar y desplegar una pregunta
?Abrir esta ayuda
EscCerrar el panel o esta ayuda