可核验的部分
验证方法
一项宣称出来、却没有办法加以反驳的属性,不是属性,而是承诺。本页说明哪些内容被核验、由哪些对照来核验,以及本部门并不声称已经确立的是什么。
的测量数据,可重新生成。
1. 不作声明,一切摊开
支配本站的规则很简单:一项论断如果不同时给出推翻它的手段,就不会出现在这里。这条规则首先适用于系统本身的开发。一套 200 多项自动对照伴随着这项开发,持续核验在所产出的输出上宣称的属性。本页所配的图像展示了这件事的一个古老形态:一份文本被另一只手重读,并在页边加上了注释。
如果这些对照只会确认,它们就没有证据价值。因此还有负对照与之相伴:故意把一份校验器应当拒绝的材料交给它,然后确认它确实拒绝了。在 2026年8月28日的读数上,一个人为损坏后注入某份输出的数值确实被检出了。一个不懂得失败的校验器什么也没有核验;正是这种失败的能力,使别处未发现错误这件事变得可读。
有两项属性被优先纳入这一制度。首先是事实的守恒:每一份产出的文档都由机器对照产生它的那组事实重新核验,不增不减。其次是语言之间的事实等价:同一主题在不同语言中的各个版本,经核验带有完全相同的事实,说得更少是允许的,说成别的则不允许。相应的读数见结果与测量页面。
属性 P1
确定性且可再现的生成
输入相同时,系统产出逐字节相同的输出:两次执行给出同样的文本。
状态:在 2026年8月28日的读数上从外部观察到,方法是比较两个独立进程之间的指纹:重复 147 次生成,147 个 SHA-256 指纹相同。
示意图 1 验证的契约,如属性 P1 至 P3 所陈述。生成过程本身不作描述:只描述它的契约,即冻结的输入、确定性的输出、机械的重新核验,以及一个懂得失败的校验器。
2. 属性登记表
本站各页通过一个稳定标识符来指称系统的属性。每一项属性的状态,即目标、已观察或已验证,由引用它的方框给出,并附上它的测量日期。
- P1. 确定性且可再现的生成:输入相同,输出逐字节相同。
- P2. 生成时不使用任何语言模型,也不进行任何网络访问。
- P3. 事实的守恒:每一份产出的文档都由机器对照其输入事实重新核验,不增不减。
- P4. 语言之间的事实等价:同一主题的各个版本带有完全相同的事实。
- P5. 诚实省略:说得更少是允许的,说成别的则不允许,而且沉默会被计数。
- P6. 可测量的可读性:阅读难度经过测量,并有事实不变的低龄读者变体。
- P7. 有界辅导:只依据主题的事实卡片作答,批改的判定附有理由。
- P8. 可追溯性:文档中的每一项论断都可以关联到一个公开的来源标识符(Wikidata 标识符),读者可以自行查阅。
3. 独立的外部参照
一个只用自己的仪器来检查自己的系统,只能确立它的内部一致性。因此本部门的测量要与独立的公共语言学参照相互对照,也就是词汇库与比较语言学数据库,本部门既不是它们的作者,也不是它们的管理者,因而无法把它们调整到符合自己的结果。
本页所断言的内容,到系统内部运作开始之处为止:对照确实发生,它所依据的材料不受本部门控制,而正是这种外在性赋予它价值。这些材料在系统内部如何使用,其细节不属于一个公开页面的事。
常见问题
6. 直接的问答
为什么不使用大语言模型?
因为目标用途是教育,而教育要求的是保证,不是似真。大语言模型是概率式的生成器;近期文献确立了:一个经过校准的概率式生成器无法保证在罕见事实上不出现虚假陈述[1][2][3];它可以让这种情况在统计上变得罕见[4],而这与一项保证并不是一回事。本计划研究的是另一条分支:确定性的系统,其每一份文档都由机器对照它的输入事实重新核验。“经常正确”不等于“有保证”;差别在于性质,而不在于程度。
如何核查本站所作的断言?
每个数字都带有它的测量日期与方法;这些测量由读数产生,只需一条命令即可在系统的当前状态上重新生成。演示是带日期且未经修饰的输出,缺陷也一并保留。机构隶属关系可以通过把本站与协会的官方信息相互对照来核实。正式结果将以出版物的形式发表,并附上它们的核验材料。
“诚实省略”是什么意思?
当一种语言或一份事实卡片无法正确地陈述某项事实时,系统就对这项事实保持沉默,而不去近似它。说得更少是允许的;说成别的则不允许。被省略之处会被计数,并与结果一同公布,测量表格为它们专设一栏。
为什么有些语言产出得这么少?
1,000 种语言之间的平等是处理上的平等,不是素材上的平等:可得的素材随语言与领域而变,这种变化被测量,而不是被遮盖。迄今覆盖最少的领域是历史人物(1,000 种语言中有 132 种在此产出文档);它与最充裕的领域同等公布。
这些文本在发布前有人工重读吗?
本站的演示输出,是系统怎么产出就怎么发布,未经修饰,包括其中笨拙的地方。这是一个透明的选择:一份手工修改过的精选集什么也证明不了。系统本身的验证是机械的:自动对照、负对照,以及与独立的公共语言学参照相互对照。
谁在做这个计划,用的是什么资源?
ODERSA Research 是 ODERSA 的研究部门,ODERSA 是依据法国1901年法律设立的非营利协会,没有雇员,其内容以 CC BY 4.0 许可协议发布,不含广告,也不收集数据。研究工作由 Mael Garbe 负责。联系方式:research@odersa.org。
出版物在哪里?
正在准备之中。本站首先公布那些不必相信我们的话就能核查的东西:属性、带日期的测量、演示。形式化的陈述及其证明将通过科学出版渠道随后给出。
7. 参考文献
- A. T. Kalai, S. S. Vempala, “Calibrated Language Models Must Hallucinate”, STOC 2024 (arXiv:2311.14648). 返回
- A. T. Kalai, O. Nachum, S. S. Vempala, E. Zhang, “Why Language Models Hallucinate”, 2025. 返回
- Z. Xu, S. Jain, M. Kankanhalli, “Hallucination is Inevitable: An Innate Limitation of Large Language Models”, 2024 (arXiv:2401.11817). 返回
- Suzuki et al., 2025 (arXiv:2502.12187),在某些设定下幻觉可以被压到统计上可以忽略。 返回