Ce site est un site officiel de l’ODERSA. Voici comment le savoir

Le domaine officiel

L’adresse de ce site se termine par odersa.org. Chaque service de l’association vit sur un sous-domaine de odersa.org et nulle part ailleurs. Si l’adresse dans la barre de votre navigateur ne finit pas par odersa.org, ce site n’est pas le nôtre.

Gratuit, et sans compte

Tout est ouvert tout de suite. Aucune inscription, aucun compte, aucun mot de passe, aucun abonnement, aucune publicité. Rien n’est réservé à qui paie, puisque rien ne se paie.

Aucune donnée collectée

Ce site ne vous suit pas : ni mouchard, ni cookie de traçage, aucun outil de mesure embarqué dans ces pages, et rien de mesuré sur votre appareil. Notre hébergeur compte les passages de façon agrégée, comme tout serveur qui répond : un total, jamais un profil. Vous n’avez pas à nous croire : ouvrez les outils de développement de votre navigateur, onglet Réseau, et rechargez la page. Vous verrez la liste complète de ce que le site demande. Tout vient de odersa.org, rien ne part ailleurs.

Contenus libres

Les contenus sont publiés sous licence CC BY 4.0. Vous pouvez les copier, les traduire, les imprimer et les redistribuer, pour vos cours comme pour vos proches, à la seule condition de citer l’ODERSA.

Objet de recherche

Génération de langage naturel vérifiable

La division consacre son programme de recherche à un seul système : un générateur de textes factuels dont les propriétés se vérifient de l’extérieur plutôt qu’elles ne s’annoncent, appliqué de façon égale à 1 000 langues. Cette page présente ce que ce système garantit, ce qu’il mesure, et les limites que la division reconnaît.

Mesures du – régénérables.

Ce que le système produit

Le système étudié produit des documents factuels courts, dans chacune des 1 000 langues qu’il traite de façon égale : une langue est une langue, et aucune n’est servie par un traitement de second rang. Ce qui varie d’une langue à l’autre est la matière disponible, une différence que la division mesure et publie plutôt que de la lisser.

Ces documents s’appuient sur 3 444 fiches de faits structurés, réparties en huit domaines : des figures historiques (1 070 fiches) aux objets célestes (4 fiches), en passant par les villes et lieux (1 003), les espèces vivantes (504), les événements (445), les pays (197), les substances (156) et les inventions (65). Chaque affirmation qu’un document porte reste rattachable à un identifiant de source public – un identifiant Wikidata – que le lecteur peut consulter lui-même.

Au moment de la génération, le système n’a recours à aucun modèle de langage ni à aucun accès réseau : ses documents découlent de faits structurés préalablement constitués et figés, au terme d’un procédé entièrement déterministe. À entrée identique, il rend des sorties identiques à l’octet près.

Carte ancienne d’Europe (1850) coloriée par familles de langues indo-européennes : celtique, germanique, gréco-latine, thraco-illyrienne et slave.
Indo-European Languages, Map of Europe (1850), Samuel Bagster and Sons, domaine public.

Trois garanties vérifiées mécaniquement

Trois propriétés portent la charge de la preuve sur cette page. Elles ne se lisent pas comme une promesse, mais comme un constat daté, obtenu par un contrôle qui aurait pu échouer et qui a été mis face à cette possibilité.

Propriété P1

Génération déterministe et reproductible

À entrée identique, le système produit des sorties identiques à l’octet près : deux exécutions rendent les mêmes textes.

Statut : constatée sur le relevé du 28 août 2026 par comparaison d’empreintes entre deux processus séparés : 147 générations répétées, 147 empreintes SHA-256 identiques, 0 écart.

La conservation des faits est soumise au même régime : rien ne s’y affirme sans qu’un contrôle puisse le contredire.

Propriété P3

Conservation des faits vérifiée mécaniquement

Chaque document produit est re-vérifié, par machine, contre l’ensemble de faits qui l’a produit : rien d’inventé, rien perdu.

Statut : contrôlée mécaniquement sur chaque document produit ; une suite de plus de 200 contrôles automatiques accompagne le développement du système, contrôles négatifs compris.

Ce qu’un contrôle mécanique établit pour un seul document, un vérificateur indépendant l’établit ensuite entre les langues elles-mêmes.

Propriété P4

Équivalence factuelle entre langues

Les versions d’un même sujet dans des langues différentes sont vérifiées porter exactement les mêmes faits : dire moins est permis, dire autre chose ne l’est pas.

Statut : constatée de l’extérieur sur le relevé du 28 août 2026 par un vérificateur indépendant du système : 935 langues relues, 415 valeurs comparées, 0 conflit ; une valeur corrompue artificiellement injectée dans une sortie a bien été détectée.

Lisibilité, âge et tuteur borné

Le système mesure la difficulté de lecture de ses propres sorties et sait produire, à faits constants, une variante adaptée aux jeunes lecteurs : les chiffres qu’elle porte restent exacts, jamais arrondis pour l’occasion. Sur l’exemple français retenu pour une fiche pays, le document mesuré compte 274 mots, pour un niveau de lecture évalué à grade 12.

Le système comporte un tuteur borné : son composant de questions-réponses ne répond que depuis la fiche du sujet interrogé, et répond qu’il ne sait pas encore hors de ce périmètre. La correction d’exercices qu’il propose suit la même retenue : elle rend un verdict, accompagné de sa justification, plutôt qu’une note sans motif.

Ce que mesure le balayage du 28 août 2026

Un balayage du 28 août 2026 mesure, pour un sujet d’essai par domaine, combien de langues sur 1 000 produisent un document complet. Quand une langue ou une fiche ne permet pas d’énoncer un fait correctement, le système se tait sur ce fait plutôt que de l’approximer : c’est ce que la division appelle une omission honnête. Ces omissions sont comptées et publiées, jamais masquées, parce qu’un chiffre de couverture qui les tairait ne mesurerait rien.

Balayage du 28 août 2026 – langues produisant un document complet, par sujet d’essai
Sujet d’essai Langues produisant un document
Pays (Kenya)935 / 1 000
Espèce (lion)932 / 1 000
Substance924 / 1 000
Figure historique132 / 1 000

Pour le sujet pays (Kenya), 65 omissions honnêtes accompagnent les 935 langues qui produisent un document, dont la longueur médiane s’établit à 77 mots ; pour l’espèce (lion), cette longueur médiane est de 8 mots ; pour la substance, de 7 mots. Pour la figure historique, sujet le moins couvert, 868 omissions honnêtes accompagnent les 132 langues qui produisent un document.

Pour vérifier que ce résultat ne tient pas au choix d’un sujet favorable, cinq sujets par domaine ont été retenus par ordre lexicographique – une sélection que personne ne peut orienter – et le même balayage a été répété sur chacun d’eux. La moyenne des langues produisant un document s’établit à 924 pour les substances, 908 pour les espèces vivantes, 907 pour les pays, 900 pour les événements et 897 pour les villes et lieux ; elle s’établit à 273 pour les figures historiques, avec un écart, selon la densité de chaque fiche, de 109 à 902. La limite tient à la donnée disponible, non au procédé, et la division le dit plutôt que de l’atténuer par une moyenne.

Les limites

Le domaine le moins couvert à ce jour est celui des figures historiques : 132 langues sur 1 000 en produisent un document pour le sujet unique du balayage, 273 en moyenne sur cinq sujets. Une page qui tairait ce résultat contredirait la démarche même qu’elle décrit.

Hors du domaine des pays, les documents produits restent courts : des longueurs médianes de 8 et 7 mots, pour l’espèce et la substance retenues, décrivent une phrase, non une leçon. Le système dit ce que la matière lui permet de dire, et s’arrête là plutôt que d’allonger le texte par approximation.

Ces mesures portent sur l’état du système au 28 août 2026 : régénérées à chaque évolution, elles ne décrivent pas une propriété permanente, mais ce qu’un relevé reproductible a constaté à cette date. Les résultats formels de la division sont, quant à eux, en préparation de publication.

Position scientifique

Une différence de nature, pas de degré

La division tient qu’un contenu pédagogique gratuit mais faux coûte davantage qu’un contenu jamais lu : souvent juste n’est pas garanti, et entre les deux régimes la différence est de nature, pas de degré. Le programme explore des systèmes qui garantissent la conservation des faits par construction, avec vérification mécanique, sur un domaine factuel délimité, plutôt que des systèmes qui la rendent seulement probable. Le contexte scientifique de cette position, et les résultats en préparation de publication, se lisent sur les pages Programme de recherche et Validation.

Poursuivre la lecture

Le détail des mesures, des contrôles et des sorties se lit sur les pages suivantes.

  • Résultats et mesures – Les relevés datés qui appuient chacune des propriétés présentées sur cette page.
  • Démarche de validation – Les contrôles automatiques, les contrôles négatifs et les références indépendantes qui les accompagnent.
  • Démonstrations – Des sorties non retouchées, datées, dans plusieurs langues.
  • Programme de recherche – Les axes de recherche et la position scientifique de la division.

Retour à Projets

Raccourcis clavier

TabNaviguer de lien en lien
EntréeOuvrir le lien ou plier/déplier une question
?Ouvrir cette aide
ÉchapFermer le panneau ou cette aide