Lecturas y límites
Resultados y mediciones
Esta página pertenece a la carpeta del proyecto Generación de lenguaje natural verificable. Expone las lecturas del 28 de agosto de 2026 sobre el estado actual del sistema estudiado: fondo de hechos, cobertura lingüística, equivalencia factual y determinismo. Cada figura va acompañada de la tabla de los mismos datos, y la última sección nombra lo que estas cifras no dicen.
Mediciones del – regenerables.
1. Método de medición
Las cifras de esta página no son estimaciones, y tampoco son récords conservados. Las producen lecturas que se rehacen con un solo comando sobre el estado actual del sistema, y que borran las anteriores. La fecha que figura en la cabecera de la página es la de la lectura, no la de la redacción: cuando el sistema evoluciona, la medición se rehace y la página cambia.
El principio editorial que de ello se desprende cabe en una frase: la división solo publica lo que puede volver a medir. Un resultado que una lectura no supiera reproducir no tiene aquí su lugar, aunque sea cierto. Es también la razón por la que ninguna comparación numérica con otros sistemas aparece en este sitio: la división mide lo que controla, y nada más.
Tres familias de lecturas se reparten la página. La primera describe de qué dispone el sistema, es decir, su fondo de hechos estructurados. La segunda mide lo que produce efectivamente, lengua por lengua y tema por tema. La tercera somete las salidas a controles exteriores, entre ellos un control negativo destinado a establecer que esos controles saben fallar.
Tres definiciones operativas fijan el vocabulario de las lecturas.
Definición 1 (documento completo). Para un tema y una lengua dados, una salida devuelta entera, sin sección vacía ni error de producción. El barrido cuenta una lengua como cubridora si y solo si ese documento existe.
Definición 2 (omisión honesta). La ausencia contada de un documento, o de un hecho dentro de un documento, cuando la materia disponible no permite enunciarlo correctamente. Cada omisión se publica junto a la medición a la que acompaña: cobertura y omisiones se complementan hasta 1 000 por construcción.
Definición 3 (equivalencia factual). Dos versiones de un mismo tema son equivalentes si todo valor de datos extraído de cualquiera de ellas, en el umbral publicado, se reencuentra sin conflicto en el referencial del tema. Decir menos está permitido, decir otra cosa no lo está.
2. El fondo de hechos
El sistema trabaja sobre 3 444 fichas de hechos estructurados, repartidas en 8 dominios. La repartición es muy desigual, y esa desigualdad explica una parte importante de las diferencias de cobertura observadas más adelante: un dominio con pocas fichas, o con fichas poco densas, produce mecánicamente menos documentos completos.
| Dominio | Fichas |
|---|---|
| Figuras históricas | 1 070 |
| Ciudades y lugares | 1 003 |
| Especies vivas | 504 |
| Acontecimientos | 445 |
| Países | 197 |
| Sustancias | 156 |
| Invenciones | 65 |
| Objetos celestes | 4 |
| Total | 3 444 |
3. Cobertura lingüística, tema por tema
El barrido del 28 de agosto de 2026 cuenta, para un tema de ensayo dado, cuántas lenguas producen un documento completo sobre las 1 000 lenguas tratadas. Las lenguas restantes no producen un documento degradado: callan, y ese silencio se cuenta como una omisión honesta.
| Tema de ensayo | Documento producido | Omisiones honestas |
|---|---|---|
| País (Kenia) | 935 | 65 |
| Especie viva (león) | 932 | 68 |
| Sustancia | 924 | 76 |
| Figura histórica | 132 | 868 |
Las dos columnas de cifras se complementan hasta 1 000: cada lengua que no produce un documento se cuenta como una omisión honesta, y ninguna se pierde por el camino. La longitud de los documentos varía mucho según el tema: la mediana se sitúa en 77 palabras para el tema de los países, en 8 palabras para la especie y en 7 para la sustancia. Un ejemplo francés de ficha de país cuenta 274 palabras, para un nivel de lectura medido en grado 12.
Publicar la columna de las omisiones no es una precaución retórica, es una condición de lectura de las demás columnas. Una tasa de cobertura elevada solo tiene sentido si se sabe en qué ha quedado el resto: sin esa columna, nada distingue un sistema que calla de un sistema que aproxima. Contar los silencios es lo que vuelve legibles las afirmaciones, y por eso el dominio menos cubierto aparece en la misma figura y en la misma tabla que los mejor dotados.
4. Robustez multitema
Una lectura sobre un tema único por dominio se presta a la elección conveniente. La lectura multitema descarta ese riesgo por construcción: se retienen cinco temas por dominio, escogidos por orden lexicográfico, es decir, sin intervención discrecional. El valor consignado para cada dominio es la media de las lenguas que producen un documento sobre esos cinco temas.
| Dominio | Media sobre 5 temas |
|---|---|
| Sustancias | 924 |
| Especies vivas | 908 |
| Países | 907 |
| Acontecimientos | 900 |
| Ciudades y lugares | 897 |
| Figuras históricas | 273 |
Cinco dominios de seis se mantienen en una banda estrecha, lo que indica que la cobertura no depende del tema escogido, sino de la materia disponible. El dominio de las figuras históricas confirma, en cambio, su dispersión: según la densidad de la ficha, el número de lenguas que producen un documento va de 109 a 902. El límite es, pues, el dato disponible, y no el procedimiento de producción, cosa que la división dice en lugar de apartar el dominio de la lectura.
La misma lectura multitema mide la longitud de los documentos producidos. La figura 4 lleva las treinta medianas, una por tema: la posición de un racimo dice la riqueza del dominio, su dispersión dice la varianza en el interior del dominio.
El racimo de las sustancias es un punto repetido: 7 palabras de mediana en cada uno de los cinco temas, la firma de un dominio cuya materia disponible es uniforme de un tema a otro. En el extremo opuesto, el dominio de los países se extiende de 19 a 68 palabras de mediana según el tema. Las figuras históricas combinan ambas lecturas: la cobertura varía allí de 109 a 902 lenguas según la ficha, pero la longitud mediana se mantiene apretada, de 11 a 13 palabras – lo que se dice varía poco, lo que varía es el número de lenguas capaces de decirlo.
5. Equivalencia factual y determinismo
Las dos lecturas que siguen atañen a las salidas mismas. La primera verifica la equivalencia factual entre las lenguas, en el sentido de la definición 3: decir menos está permitido, decir otra cosa no lo está. Los textos producidos han sido releídos por un verificador independiente del sistema, que extrae los valores numéricos de datos y comprueba que cada uno se reencuentra, sin conflicto, en el referencial del tema, sobre un umbral publicado: los valores superiores o iguales a 10 000, lo que excluye los años que llevan los nombres propios. Sobre 935 lenguas releídas, se han comparado 415 valores, y no se ha registrado ningún conflicto.
Un control que no encuentra nada solo tiene valor si es capaz de encontrar algo. Un control negativo acompaña, pues, a la lectura: un valor corrompido artificialmente e inyectado en una salida ha sido efectivamente detectado por el verificador. Es esa capacidad de fallar la que vuelve legible el resultado anterior como un resultado, y no como un silencio de instrumento.
La segunda lectura atañe al determinismo. Se han repetido 147 generaciones en dos procesos separados, y las 147 huellas SHA-256 obtenidas son idénticas: ninguna diferencia. La reproducibilidad anunciada no es, pues, una propiedad interna postulada, sino una igualdad constatada desde fuera, sobre huellas que cualquier tercero sabe calcular.
Esquema 1. Determinismo entre procesos, lectura del 28 de agosto de 2026: las mismas 147 generaciones, reejecutadas en dos procesos separados, devuelven huellas idénticas.
| Lectura | Valor |
|---|---|
| Lenguas releídas por el verificador independiente | 935 |
| Valores numéricos comparados | 415 |
| Conflictos registrados | 0 |
| Generaciones repetidas en dos procesos separados | 147 |
| Huellas SHA-256 idénticas | 147 |
| Diferencias registradas | 0 |
Propiedad P4
Equivalencia factual entre lenguas
Las versiones de un mismo tema en lenguas distintas llevan exactamente los mismos hechos: decir menos está permitido, decir otra cosa no lo está.
Estado: verificada desde fuera del sistema en la lectura del 28 de agosto de 2026, control negativo incluido.
6. La campaña ampliada
Las lecturas anteriores atañían a un tema de ensayo. La misma verificación se ha reejecutado después a escala: 30 temas, escogidos por orden lexicográfico a razón de los 5 primeros de cada uno de los 6 dominios medidos, releídos en las 1 000 lenguas. Se han comparado desde fuera 1 646 valores numéricos, y no se ha registrado ningún conflicto. Los controles negativos se han reejecutado tema por tema: sobre los 8 temas cuyo referencial lleva valores por encima del umbral, 8 corrupciones inyectadas, 8 detecciones.
Esquema 2. El circuito de la campaña ampliada, 28 de agosto de 2026. El juez es externo: solo lee las salidas terminadas. La rama inferior es el control negativo, que establece que la comparación sabe fallar.
La calibración del verificador se ha medido por separado, en los dos sentidos. Se han inyectado 105 corrupciones artificiales en salidas reales, a razón de un valor alterado por texto, sobre 15 lenguas y 8 temas: 105 detecciones sobre 105. A la inversa, se han releído 113 textos intactos sin que se levantara ninguna falsa alarma. La sensibilidad y la especificidad del instrumento están, pues, medidas, no supuestas.
Esquema 3. Calibración del verificador, campaña del 28 de agosto de 2026. Las dos casillas de error están vacías, y se publican: un instrumento se juzga por sus dos columnas.
Dos lecturas de cobertura completan la campaña: los 197 temas del dominio de los países producen un documento en cada una de las 4 lenguas testigo (francés, inglés, suajili, árabe), y se han detectado 25 sistemas de escritura distintos en las salidas mismas.
| Lectura | Valor |
|---|---|
| Temas releídos (5 por dominio, orden lexicográfico) | 30 |
| Valores numéricos comparados entre lenguas | 1 646 |
| Conflictos registrados | 0 |
| Corrupciones artificiales detectadas | 105 / 105 |
| Falsas alarmas sobre textos intactos | 0 / 113 |
| Temas del dominio de los países servidos en las 4 lenguas testigo | 197 / 197 |
| Sistemas de escritura detectados en las salidas | 25 |
7. El detalle de los sistemas de escritura
La escritura dominante de cada documento producido durante la campaña se ha detectado desde fuera, por rangos Unicode, sin mirar el procedimiento que lo ha producido. De ahí salen 25 sistemas de escritura distintos. El alfabeto latino domina, y 21 de los 25 sistemas solo los llevan una o dos lenguas cada uno: es la larga cola tipográfica que el trato igual de las lenguas debe servir correctamente, hasta el tibetano o el oriya.
| Sistema de escritura | Lenguas |
|---|---|
| Latino | 895 |
| Cirílico | 9 |
| Árabe | 6 |
| Devanagari | 3 |
| Etíope | 2 |
| Bengalí | 2 |
| Hebreo | 2 |
| Sinogramas | 2 |
| Griego | 1 |
| Armenio | 1 |
| Georgiano | 1 |
| Hiragana y katakana | 1 |
| Hangul | 1 |
| Tailandés | 1 |
| Lao | 1 |
| Birmano | 1 |
| Tibetano | 1 |
| Tamil | 1 |
| Telugu | 1 |
| Canarés | 1 |
| Malayalam | 1 |
| Oriya | 1 |
| Gurmuji | 1 |
| Guyaratí | 1 |
| Cingalés | 1 |
8. Límites
El dominio de las figuras históricas es el menos cubierto de todos, y la diferencia no es marginal: 132 lenguas sobre 1 000 para el tema de ensayo, 273 de media sobre cinco temas, con una dispersión de 109 a 902 según la densidad de la ficha. Ese dominio es también el que cuenta con más fichas, lo que descarta la explicación por la rareza de los temas y remite a la densidad de la materia disponible en cada lengua.
La longitud de los documentos es escasa fuera del dominio de los países. Las medianas de 8 y 7 palabras registradas para la especie y la sustancia describen documentos breves, utilizables como fichas de hechos pero todavía no como contenidos pedagógicos completos. La división prefiere publicar esas medianas antes que callarlas: dicen dónde queda trabajo por hacer.
Por último, todas las cifras de esta página se miden sobre el estado actual del sistema y se regeneran en cada evolución. No describen un sistema congelado, y una lectura posterior podrá desplazarlas en un sentido o en el otro. La fecha que encabeza la página es, pues, un dato del resultado, no una mención de archivo.
9. Amenazas a la validez
El alcance de estas lecturas exige cinco reservas, que la división enuncia ella misma en lugar de dejar que se descubran.
El verificador de equivalencia solo compara los valores numéricos superiores o iguales a 10 000, umbral publicado que excluye los años que llevan los nombres propios. 22 de los 30 temas de la campaña ampliada no llevan ningún valor por encima de ese umbral: para esos temas, la equivalencia depende de los controles mecánicos internos, no de ese juez externo.
La equivalencia atañe a los valores de datos en el umbral publicado, no a la precisión de presentación. Una versión puede redondear un valor anunciándolo – escribir «alrededor de 1 208 000» donde otra versión escribe 1 208 333 –, y eso se ve en las demostraciones: el verificador compara cada valor extraído con el referencial del tema, que lleva ambas formas, y el redondeo anunciado depende del decir menos, nunca del decir otra cosa.
Los temas de ensayo siguen siendo pocos: uno por dominio para el barrido, cinco para la robustez. El orden lexicográfico descarta la elección conveniente; no establece, por sí solo, la representatividad de los temas retenidos.
El determinismo se constata entre dos procesos separados de una misma máquina; la reproducibilidad entre máquinas distintas todavía no ha sido objeto de una lectura publicada.
Por último, la cobertura cuenta documentos producidos, nunca su riqueza: las longitudes medianas publicadas con el barrido acotan esa lectura, y unas medianas de 7 y 8 palabras fuera del dominio de los países describen fichas de hechos, no lecciones.
Citar esta página
Las mediciones de esta página están fechadas y son regenerables: una cita lleva, pues, la fecha de medición, nunca una fecha de consulta sola.
ODERSA Research (división de investigación de la ODERSA). «Resultados y mediciones», mediciones del 28 de agosto de 2026. https://research.odersa.org/es/results
En formato BibTeX:
@misc{odersa_research_measurements_2026_es,
author = {{ODERSA Research}},
title = {Results and Measurements},
organization = {ODERSA},
year = {2026},
howpublished = {\url{https://research.odersa.org/es/results}},
note = {Measurements of 28 August 2026, regenerable}
}
Para leer a continuación
- Enfoque de validación – Cómo estas cifras saben fallar: controles negativos, registro de las propiedades, referencias independientes.
- Demostraciones – Las salidas que estas lecturas miden, tal cual, en doce lenguas.
- Datos – Los mismos indicadores, legibles por máquina: reléalos sin creernos.