Lo que se verifica
Enfoque de validación
Una propiedad anunciada sin medio de contradecirla no es una propiedad, es una promesa. Esta página describe lo que se verifica, mediante qué controles, y lo que la división no pretende haber establecido.
Mediciones del – regenerables.
1. Nada se declara, todo se exhibe
La regla que gobierna este sitio es sencilla: una afirmación que no venga acompañada del medio de refutarla no figura en él. Se aplica en primer lugar al desarrollo del propio sistema. Una batería de más de 200 controles automáticos acompaña ese desarrollo y verifica de forma continua las propiedades anunciadas sobre las salidas producidas. La imagen que acompaña a esta página muestra una versión antigua del gesto: un texto releído y glosado al margen por una mano distinta de la suya.
Esos controles carecerían de valor probatorio si solo supieran confirmar. Unos controles negativos los acompañan, pues: se somete deliberadamente al verificador un material que este debe rechazar, y se constata que lo rechaza. En la lectura del 28 de agosto de 2026, un valor corrompido artificialmente e inyectado en una salida fue efectivamente detectado. Un verificador que no sabe fallar no verifica nada; es esa capacidad de fallo la que vuelve legible la ausencia de error registrada por lo demás.
Dos propiedades se someten a ese régimen con prioridad. La conservación de los hechos, primero: cada documento producido se vuelve a verificar, por máquina, contra el conjunto de hechos que lo ha producido, sin añadido ni pérdida. La equivalencia factual entre lenguas, después: las versiones de un mismo tema en lenguas distintas se verifican para comprobar que llevan exactamente los mismos hechos, siendo lícito decir menos e ilícito decir otra cosa. Las lecturas correspondientes figuran en la página Resultados y mediciones.
Propiedad P1
Generación determinista y reproducible
Con una entrada idéntica, el sistema produce salidas idénticas hasta el byte: dos ejecuciones devuelven los mismos textos.
Estado: constatada desde fuera en la lectura del 28 de agosto de 2026, por comparación de huellas entre dos procesos separados: 147 generaciones repetidas, 147 huellas SHA-256 idénticas.
Esquema 1. El contrato de verificación, tal como lo enuncian las propiedades P1 a P3. El procedimiento de generación no se describe: solo se describe su contrato – entradas congeladas, salida determinista, reverificación mecánica, y un verificador que sabe fallar.
2. El registro de las propiedades
Las páginas de este sitio remiten a las propiedades del sistema mediante un identificador estable. El estado de cada una – buscada, constatada, verificada – lo lleva el recuadro que la cita, con su fecha de medición.
- P1. Generación determinista y reproducible: con una entrada idéntica, salidas idénticas hasta el byte.
- P2. Ningún modelo de lenguaje, ningún acceso a la red en el momento de la generación.
- P3. Conservación de los hechos: cada documento producido se vuelve a verificar por máquina contra sus hechos de entrada, sin añadido ni pérdida.
- P4. Equivalencia factual entre lenguas: las versiones de un mismo tema llevan exactamente los mismos hechos.
- P5. Omisión honesta: decir menos está permitido, decir otra cosa no lo está, y los silencios se cuentan.
- P6. Legibilidad medida: dificultad de lectura medida, variante para lectores jóvenes con hechos constantes.
- P7. Tutoría acotada: respuestas desde la ficha del tema únicamente, veredictos de corrección justificados.
- P8. Trazabilidad: cada afirmación de un documento es vinculable a un identificador de fuente público (identificadores Wikidata), consultable por el lector.
3. Referencias externas independientes
Un sistema que solo se controla con sus propios instrumentos no establece más que su coherencia interna. Las mediciones de la división se confrontan, pues, con referencias lingüísticas públicas independientes – bases léxicas y comparativas – de las que la división no es ni autora ni gestora, y que, por tanto, no puede ajustar a sus resultados.
Lo que esta página afirma se detiene donde empieza el funcionamiento interno del sistema: la confrontación tiene lugar, atañe a materiales que la división no controla, y es esa exterioridad la que le da su valor. El detalle del uso que de ellos se hace dentro del sistema no corresponde a una página pública.
4. Posición científica
La literatura reciente establece que unos generadores probabilistas calibrados no pueden garantizar la ausencia de alucinación sobre los hechos raros[1][2][3], aunque la alucinación pueda volverse estadísticamente insignificante en ciertos marcos[4]. El programa explora la otra rama de la alternativa así dibujada: sistemas que garantizan la conservación de los hechos por construcción, con verificación mecánica, sobre un dominio factual delimitado.
Esta posición se sostiene con prudencia. Los resultados formales de la división están en preparación para su publicación, y este sitio no publica ni teoremas, ni pruebas, ni reivindicación de prioridad: enuncia propiedades, mediciones fechadas y un programa. Lo que se sostiene cabe en una frase:
Acertar a menudo no es garantizar: entre los dos regímenes la diferencia es de naturaleza, no de grado.
5. Licencia y apertura
Los contenidos producidos por el sistema se publican bajo licencia CC BY 4.0: pueden copiarse, traducirse, imprimirse y redistribuirse con la sola condición de citar a la ODERSA. Esa licencia no es un añadido, es una condición del método: un contenido que no puede retomarse ni controlarse no se verifica.
Un corpus público de demostración está en preparación, y las publicaciones formales también lo están. No se anuncia ninguna fecha ni para el uno ni para las otras: la división prefiere anunciar menos y publicar lo que se verifica. Mientras tanto, las demostraciones dan a leer salidas sin retocar, y la página Resultados y mediciones da las lecturas que las acompañan.
Preguntas frecuentes
6. Preguntas directas
¿Por qué no emplear un gran modelo de lenguaje?
Porque el uso previsto es la educación, y la educación exige la garantía, no la verosimilitud. La literatura reciente establece que un generador probabilista calibrado no puede garantizar la ausencia de enunciados falsos sobre los hechos raros[1][2][3]; puede volverla estadísticamente rara[4], lo que no es lo mismo que una garantía. El programa estudia la otra rama: sistemas deterministas cuyos documentos se vuelven a verificar mecánicamente, uno por uno, contra sus hechos de entrada. «Acertar a menudo» no es «garantizar»; la diferencia es de naturaleza, no de grado.
¿Cómo verificar lo que este sitio afirma?
Cada cifra lleva su fecha de medición y su método; las mediciones las producen lecturas regenerables con un solo comando sobre el estado actual del sistema. Las demostraciones son salidas fechadas y sin retocar, imperfecciones incluidas. La adscripción institucional se verifica cruzando este sitio con la información oficial de la asociación. Los resultados formales serán objeto de publicaciones acompañadas de su material de verificación.
¿Qué significa «omisión honesta»?
Cuando una lengua o una ficha no permite enunciar correctamente un hecho, el sistema calla sobre ese hecho en lugar de aproximarlo. Decir menos está permitido; decir otra cosa no lo está. Las omisiones se cuentan y se publican con los resultados – la tabla de las mediciones tiene una columna para ellas.
¿Por qué algunas lenguas producen tan poco?
La igualdad entre las 1 000 lenguas es una igualdad de trato, no una igualdad de riqueza: la materia disponible varía según las lenguas y los dominios, y esa variación se mide en lugar de enmascararse. El dominio menos cubierto hasta la fecha es el de las figuras históricas (132 lenguas sobre 1 000 producen allí un documento); se publica igual que los mejores.
¿Los textos los revisan personas antes de publicarse?
Las salidas de demostración de este sitio se publican tal como el sistema las produce, sin retoque, incluidas sus torpezas. Es una decisión de transparencia: una antología corregida a mano no probaría nada. La validación del sistema mismo es mecánica: controles automáticos, controles negativos, confrontación con referencias lingüísticas públicas independientes.
¿Quién trabaja en este programa, y con qué medios?
ODERSA Research es la división de investigación de la ODERSA, asociación sin ánimo de lucro regida por la ley francesa de 1901, sin personal asalariado, que publica sus contenidos bajo licencia CC BY 4.0, sin publicidad ni recogida de datos. La dirección de la investigación corre a cargo de Mael Garbe. Contacto: research@odersa.org.
¿Dónde están las publicaciones?
En preparación. El sitio publica antes lo que se verifica sin creernos bajo palabra: las propiedades, las mediciones fechadas, las demostraciones. Los enunciados formales y sus pruebas seguirán por los canales de publicación científica.
7. Referencias
- A. T. Kalai, S. S. Vempala, «Calibrated Language Models Must Hallucinate», STOC 2024 (arXiv:2311.14648). volver
- A. T. Kalai, O. Nachum, S. S. Vempala, E. Zhang, «Why Language Models Hallucinate», 2025. volver
- Z. Xu, S. Jain, M. Kankanhalli, «Hallucination is Inevitable: An Innate Limitation of Large Language Models», 2024 (arXiv:2401.11817). volver
- Suzuki et al., 2025 (arXiv:2502.12187) – la alucinación puede volverse estadísticamente insignificante en ciertos marcos. volver
Para leer a continuación
- Resultados y mediciones – Las lecturas que este método enmarca, amenazas a la validez incluidas.
- Demostraciones – Salidas sin retocar, para releer y contradecir si la comparación falla.
- Notas de investigación – Las notas de la división, para las figuras que piden más espacio.