Este es un sitio oficial de la ODERSA. Así es como puede saberlo

El dominio oficial

La dirección de este sitio termina en odersa.org. Cada servicio de la asociación está en un subdominio de odersa.org y en ningún otro lugar. Si la dirección que aparece en la barra de su navegador no termina en odersa.org, este sitio no es nuestro.

Gratuito, y sin cuenta

Todo está abierto desde el primer momento. Sin registro, sin cuenta, sin contraseña, sin suscripción, sin publicidad. Nada se reserva a quien paga, porque aquí no se paga nada.

Ningún dato recopilado

Este sitio no le sigue la pista: ni rastreadores, ni cookies de seguimiento, ninguna herramienta de medición incorporada en estas páginas, y nada medido en su dispositivo. Nuestro alojamiento cuenta los accesos de forma agregada, como hace cualquier servidor que responde: un total, nunca un perfil. No hace falta que nos crea: abra las herramientas de desarrollo de su navegador, pestaña Red, y recargue la página. Verá la lista completa de lo que el sitio pide. Todo viene de odersa.org, nada sale a otra parte.

Contenidos libres

Los contenidos se publican bajo licencia CC BY 4.0. Puede copiarlos, traducirlos, imprimirlos y redistribuirlos, tanto para sus clases como para su gente, con una única condición: citar a la ODERSA.

Ejes de investigación

Programa de investigación

Esta página pertenece a la carpeta del proyecto activo de la división, la generación de lenguaje natural verificable. Su programa se sostiene en cuatro ejes: cada uno plantea una pregunta abierta y busca propiedades que el sistema estudiado debe volver verificables desde fuera. Los resultados formales están en preparación para su publicación: esta página enuncia el programa, no sus pruebas.

Mediciones del – regenerables.

A1. Generación verificable

La pregunta abierta de este eje se enuncia sin rodeos: ¿se puede garantizar, y no solo hacer probable, que un documento producido no diga nada que sus hechos de entrada no digan? La palabra que soporta todo el peso es «garantizar». Una garantía no se mide en frecuencia de aciertos: se demuestra, o no existe.

La literatura reciente aclara lo que está en juego. Establece que unos generadores probabilistas calibrados no pueden garantizar la ausencia de alucinación sobre los hechos raros[1][2][3], aunque la alucinación pueda volverse estadísticamente insignificante en ciertos marcos[4]. El programa no se opone a esos trabajos: explora la otra rama de la alternativa que dibujan.

Esa otra rama tiene una tradición: la generación llamada data-to-text[5][6], que produce un texto a partir de datos estructurados mediante procedimientos preferidos durante mucho tiempo en producción, precisamente por el control que dan sobre la salida. Las campañas de referencia del ámbito, como WebNLG[7], evalúan la fidelidad a los datos de entrada por juicio humano y por métricas, es decir, en frecuencia; el paso que estudia este eje consiste en hacer de esa fidelidad una propiedad verificada mecánicamente sobre cada documento producido, con controles negativos de apoyo.

Esa otra rama es la de los sistemas que garantizan la conservación de los hechos por construcción, con verificación mecánica, sobre un dominio factual delimitado. Allí se buscan tres propiedades a la vez. El determinismo, primero: con una entrada idéntica, salidas idénticas hasta el byte, dos ejecuciones que devuelven los mismos textos. La ausencia de modelo de lenguaje y de acceso a la red en el momento de la generación, después: los documentos se producen mediante un procedimiento enteramente determinista a partir de hechos estructurados constituidos y congelados de antemano. La conservación de los hechos, por último: cada documento se vuelve a verificar por máquina contra el conjunto de hechos que lo ha producido, y esa verificación sabe fallar, cosa que establecen unos controles negativos.

El eje asume la contrapartida de esa elección. El dominio factual está delimitado, los textos producidos son más cortos y más secos, y nada que salga del perímetro de los hechos de entrada puede decirse. Acertar a menudo no es garantizar: entre los dos regímenes, la diferencia es de naturaleza, no de grado.

Propiedades buscadas P1-P3

Determinismo, ausencia de modelo en la generación, conservación de los hechos

Con una entrada idéntica, el sistema devuelve salidas idénticas hasta el byte, sin modelo de lenguaje ni acceso a la red en el momento de la generación; cada documento producido se vuelve a verificar después por máquina contra el conjunto de hechos que lo ha producido.

Estado: propiedades buscadas por el eje.

Tablilla de arcilla cubierta de una escritura cuneiforme densa, carta privada de la colonia comercial asiria de Kültepe, hacia 1900 antes de nuestra era.
Tablilla cuneiforme, carta privada (Kültepe), The Metropolitan Museum of Art, CC0 1.0.

A2. Equidad lingüística a gran escala

La pregunta abierta de este eje atañe a la escala: ¿en qué se convierte una garantía de conservación de los hechos cuando debe sostenerse en 1 000 lenguas a la vez, y no en las pocas lenguas donde la materia abunda? El sistema estudiado trata 1 000 lenguas, y las trata por igual: una lengua es un tratamiento, nunca un rango. Sostener esa igualdad se verifica por el cálculo: las campañas de medición vuelven a ejecutar la generación y la verificación en cada una de las 1 000 lenguas, y se rehacen sobre el estado actual en cada evolución del sistema.

La igualdad de trato no es una igualdad de riqueza, y el programa se niega a hacer pasar la una por la otra. Dos propiedades enmarcan esa honestidad. La equivalencia factual, primero: las versiones de un mismo tema en lenguas distintas se verifican para comprobar que llevan exactamente los mismos hechos, siendo lícito decir menos e ilícito decir otra cosa. La omisión honesta, después: cuando una lengua o una ficha no permite enunciar correctamente un hecho, el sistema calla sobre ese hecho en lugar de aproximarlo, y las omisiones se cuentan y luego se publican.

El límite se nombra, pues, en lugar de callarse. En el barrido de medición, el dominio de las figuras históricas es el menos cubierto: 132 lenguas de 1 000 producen allí un documento, mientras que el tema de los países del mismo barrido reúne 935. Esta cifra se publica igual que las demás, porque un programa que solo publicara sus mejores dominios ya no mediría nada. El detalle del barrido está en la página Resultados y mediciones.

Propiedades buscadas P4-P5

Equivalencia factual entre lenguas y omisión honesta

Las versiones de un mismo tema en lenguas distintas se verifican para comprobar que llevan exactamente los mismos hechos; cuando una lengua o una ficha no permite enunciar correctamente un hecho, el sistema calla sobre ese hecho en lugar de aproximarlo.

Estado: propiedades buscadas por el eje.

A3. Legibilidad medida y adaptación a la edad

Un contenido exacto que un alumno no puede leer no sirve a la educación. Este eje plantea, pues, una cuestión de medida tanto como de redacción: ¿cómo adaptar un documento a un lector más joven sin tocar lo que afirma? La propiedad buscada es doble. El sistema mide la dificultad de lectura de sus salidas, y sabe producir una variante adaptada a los lectores jóvenes con hechos constantes.

«Con hechos constantes» es aquí una restricción fuerte, y no una intención. Las cifras de una versión para lectores jóvenes siguen siendo las de la versión de origen: no se redondean, no se simplifican, no se sustituyen por órdenes de magnitud. Lo que varía es la construcción de las frases y la elección de las palabras, nunca el valor enunciado. La legibilidad se convierte así en una medida más, sometida al mismo régimen de verificación que el resto.

Una ficha de país producida en francés sirve de ejemplo de referencia en las lecturas: 274 palabras, para un nivel de lectura medido en grado 12. El programa busca hacer variar ese nivel de manera controlada y medible, manteniendo intacta la verificación de conservación de los hechos.

Propiedad buscada P6

Niveles de lectura medidos

El sistema mide la dificultad de lectura de sus salidas y sabe producir una variante adaptada a los lectores jóvenes, con hechos constantes.

Estado: propiedad buscada por el eje.

A4. Tutoría acotada y verificable

El último eje traslada la cuestión del documento al intercambio. Un asistente pedagógico es útil si responde; es peligroso si responde a todo. La pregunta abierta es la del límite: ¿cómo construir un componente de preguntas y respuestas cuyo perímetro sea sabido, dicho y verificable, en lugar de adivinado por el alumno a fuerza de errores?

La propiedad buscada es la de un tutor acotado. El componente solo responde desde la ficha del tema; fuera de su perímetro, responde «todavía no lo sé» en lugar de producir una respuesta plausible. Esa confesión no es una carencia de cobertura tolerada: es el comportamiento esperado, y como tal se trata en los controles.

La corrección de ejercicios sigue el mismo régimen. El componente devuelve un veredicto acompañado de su justificación, de modo que un docente pueda controlar la corrección misma y no solo padecerla. También aquí, lo que se busca no es la fluidez del intercambio, sino la posibilidad de que un tercero verifique lo que se ha dicho.

Propiedad buscada P7

Un tutor acotado

El componente de preguntas y respuestas solo responde desde la ficha del tema y responde «todavía no lo sé» fuera de su perímetro; la corrección de ejercicios devuelve un veredicto acompañado de su justificación.

Estado: propiedad buscada por el eje.

Publicaciones

En preparación

Los resultados formales de estos cuatro ejes aparecerán acompañados de su material de verificación. La página Publicaciones los recogerá a medida que se publiquen; allí se describe la manera de citar este sitio.

Referencias

  1. A. T. Kalai, S. S. Vempala, «Calibrated Language Models Must Hallucinate», STOC 2024 (arXiv:2311.14648). volver
  2. A. T. Kalai, O. Nachum, S. S. Vempala, E. Zhang, «Why Language Models Hallucinate», 2025. volver
  3. Z. Xu, S. Jain, M. Kankanhalli, «Hallucination is Inevitable: An Innate Limitation of Large Language Models», 2024 (arXiv:2401.11817). volver
  4. Suzuki et al., 2025 (arXiv:2502.12187) – la alucinación puede volverse estadísticamente insignificante en ciertos marcos. volver
  5. E. Reiter, R. Dale, Building Natural Language Generation Systems, Cambridge University Press, 2000. volver
  6. A. Gatt, E. Krahmer, «Survey of the State of the Art in Natural Language Generation: Core tasks, applications and evaluation», Journal of Artificial Intelligence Research 61, 2018. volver
  7. C. Gardent, A. Shimorina, S. Narayan, L. Perez-Beltrachini, «The WebNLG Challenge: Generating Text from RDF Data», INLG 2017. volver

Para leer a continuación

Atajos de teclado

TabNavegar de enlace en enlace
IntroAbrir el enlace, o plegar y desplegar una pregunta
?Abrir esta ayuda
EscCerrar el panel o esta ayuda