Objeto de investigación
Generación de lenguaje natural verificable
La división dedica su programa de investigación a un solo sistema: un generador de textos factuales cuyas propiedades se verifican desde fuera en lugar de anunciarse, aplicado por igual a 1 000 lenguas. Esta página presenta lo que ese sistema garantiza, lo que mide, y los límites que la división reconoce.
Mediciones del – regenerables.
Lo que el sistema produce
El sistema estudiado produce documentos factuales breves, en cada una de las 1 000 lenguas que trata por igual: una lengua es una lengua, y ninguna se sirve mediante un tratamiento de segundo rango. Lo que varía de una lengua a otra es la materia disponible, una diferencia que la división mide y publica en lugar de alisarla.
Estos documentos se apoyan en 3 444 fichas de hechos estructurados, repartidas en ocho dominios: de las figuras históricas (1 070 fichas) a los objetos celestes (4 fichas), pasando por las ciudades y lugares (1 003), las especies vivas (504), los acontecimientos (445), los países (197), las sustancias (156) y las invenciones (65). Cada afirmación que lleva un documento sigue siendo vinculable a un identificador de fuente público – un identificador Wikidata – que el lector puede consultar por sí mismo.
En el momento de la generación, el sistema no recurre a ningún modelo de lenguaje ni a ningún acceso a la red: sus documentos se desprenden de hechos estructurados constituidos y congelados de antemano, al término de un procedimiento enteramente determinista. Con una entrada idéntica, devuelve salidas idénticas hasta el byte.
Tres garantías verificadas mecánicamente
Tres propiedades llevan la carga de la prueba en esta página. No se leen como una promesa, sino como una constatación fechada, obtenida mediante un control que habría podido fallar y que ha sido puesto ante esa posibilidad.
Propiedad P1
Generación determinista y reproducible
Con una entrada idéntica, el sistema produce salidas idénticas hasta el byte: dos ejecuciones devuelven los mismos textos.
Estado: constatada en la lectura del 28 de agosto de 2026 por comparación de huellas entre dos procesos separados: 147 generaciones repetidas, 147 huellas SHA-256 idénticas, 0 diferencias.
La conservación de los hechos se somete al mismo régimen: aquí nada se afirma sin que un control pueda contradecirlo.
Propiedad P3
Conservación de los hechos verificada mecánicamente
Cada documento producido se vuelve a verificar, por máquina, contra el conjunto de hechos que lo ha producido: nada inventado, nada perdido.
Estado: controlada mecánicamente sobre cada documento producido; una batería de más de 200 controles automáticos acompaña al desarrollo del sistema, controles negativos incluidos.
Lo que un control mecánico establece para un solo documento, un verificador independiente lo establece después entre las lenguas mismas.
Propiedad P4
Equivalencia factual entre lenguas
Las versiones de un mismo tema en lenguas distintas se verifican para comprobar que llevan exactamente los mismos hechos: decir menos está permitido, decir otra cosa no lo está.
Estado: constatada desde fuera en la lectura del 28 de agosto de 2026 por un verificador independiente del sistema: 935 lenguas releídas, 415 valores comparados, 0 conflictos; un valor corrompido artificialmente e inyectado en una salida fue efectivamente detectado.
Legibilidad, edad y tutor acotado
El sistema mide la dificultad de lectura de sus propias salidas y sabe producir, con hechos constantes, una variante adaptada a los lectores jóvenes: las cifras que lleva siguen siendo exactas, nunca redondeadas para la ocasión. En el ejemplo francés retenido para una ficha de país, el documento medido cuenta 274 palabras, para un nivel de lectura evaluado en grado 12.
El sistema comprende un tutor acotado: su componente de preguntas y respuestas solo responde desde la ficha del tema interrogado, y responde que todavía no lo sabe fuera de ese perímetro. La corrección de ejercicios que propone sigue la misma contención: devuelve un veredicto, acompañado de su justificación, antes que una calificación sin motivo.
Lo que mide el barrido del 28 de agosto de 2026
Un barrido del 28 de agosto de 2026 mide, para un tema de ensayo por dominio, cuántas lenguas sobre 1 000 producen un documento completo. Cuando una lengua o una ficha no permite enunciar correctamente un hecho, el sistema calla sobre ese hecho en lugar de aproximarlo: es lo que la división llama una omisión honesta. Esas omisiones se cuentan y se publican, nunca se enmascaran, porque una cifra de cobertura que las callara no mediría nada.
| Tema de ensayo | Lenguas que producen un documento |
|---|---|
| País (Kenia) | 935 / 1 000 |
| Especie (león) | 932 / 1 000 |
| Sustancia | 924 / 1 000 |
| Figura histórica | 132 / 1 000 |
Para el tema país (Kenia), 65 omisiones honestas acompañan a las 935 lenguas que producen un documento, cuya longitud mediana se sitúa en 77 palabras; para la especie (león), esa longitud mediana es de 8 palabras; para la sustancia, de 7 palabras. Para la figura histórica, tema menos cubierto, 868 omisiones honestas acompañan a las 132 lenguas que producen un documento.
Para comprobar que ese resultado no se debe a la elección de un tema favorable, se han retenido cinco temas por dominio por orden lexicográfico – una selección que nadie puede orientar – y el mismo barrido se ha repetido sobre cada uno de ellos. La media de las lenguas que producen un documento se sitúa en 924 para las sustancias, 908 para las especies vivas, 907 para los países, 900 para los acontecimientos y 897 para las ciudades y lugares; se sitúa en 273 para las figuras históricas, con una diferencia, según la densidad de cada ficha, de 109 a 902. El límite se debe al dato disponible, no al procedimiento, y la división lo dice en lugar de atenuarlo con una media.
Los límites
El dominio menos cubierto hasta la fecha es el de las figuras históricas: 132 lenguas sobre 1 000 producen allí un documento para el tema único del barrido, 273 de media sobre cinco temas. Una página que callara ese resultado contradiría el método mismo que describe.
Fuera del dominio de los países, los documentos producidos siguen siendo cortos: unas longitudes medianas de 8 y 7 palabras, para la especie y la sustancia retenidas, describen una frase, no una lección. El sistema dice lo que la materia le permite decir, y se detiene ahí antes que alargar el texto por aproximación.
Estas mediciones atañen al estado del sistema a 28 de agosto de 2026: regeneradas en cada evolución, no describen una propiedad permanente, sino lo que una lectura reproducible ha constatado en esa fecha. Los resultados formales de la división están, por su parte, en preparación para su publicación.
Posición científica
Una diferencia de naturaleza, no de grado
La división sostiene que un contenido pedagógico gratuito pero falso cuesta más que un contenido nunca leído: acertar a menudo no es garantizar, y entre los dos regímenes la diferencia es de naturaleza, no de grado. El programa explora sistemas que garantizan la conservación de los hechos por construcción, con verificación mecánica, sobre un dominio factual delimitado, antes que sistemas que solo la vuelven probable. El contexto científico de esta posición, y los resultados en preparación para su publicación, se leen en las páginas Programa de investigación y Validación.
Proseguir la lectura
El detalle de las mediciones, de los controles y de las salidas se lee en las páginas siguientes.
- Resultados y mediciones – Las lecturas fechadas que apoyan cada una de las propiedades presentadas en esta página.
- Enfoque de validación – Los controles automáticos, los controles negativos y las referencias independientes que las acompañan.
- Demostraciones – Salidas sin retocar, fechadas, en varias lenguas.
- Programa de investigación – Los ejes de investigación y la posición científica de la división.