本站是 ODERSA 的官方网站。 如何确认这一点

官方域名

本站的网址以 odersa.org 结尾。协会的每一项服务都放在 odersa.org 的子域名下,别处一概没有。如果浏览器地址栏里的网址不是以 odersa.org 结尾,这个站点就不是我们的。

免费,也不用账号

所有内容一开始就全部开放:不用注册,不用账号,不用密码,不用订阅,也没有广告。没有什么是留给付费的人的,因为这里什么都不收费。

不收集任何数据

本站不跟踪您:没有跟踪代码,没有跟踪 cookie,这些页面里没有内嵌任何统计工具,也不在您的设备上测量任何东西。我们的主机会以汇总方式统计请求,就像任何会应答的服务器一样:只是一个总数,绝不是一份个人档案。您不必相信我们的话:打开浏览器的开发者工具,切到“网络”标签页,然后刷新页面。您会看到本站请求的完整清单。所有内容都来自 odersa.org,没有任何东西发往别处。

内容自由使用

内容以 CC BY 4.0 许可协议发布。您可以复制、翻译、打印并再分发,用于课堂或身边的人都可以,唯一的条件是署名 ODERSA。

可核验的部分

验证方法

一项宣称出来、却没有办法加以反驳的属性,不是属性,而是承诺。本页说明哪些内容被核验、由哪些对照来核验,以及本部门并不声称已经确立的是什么。

的测量数据,可重新生成。

1. 不作声明,一切摊开

支配本站的规则很简单:一项论断如果不同时给出推翻它的手段,就不会出现在这里。这条规则首先适用于系统本身的开发。一套 200 多项自动对照伴随着这项开发,持续核验在所产出的输出上宣称的属性。本页所配的图像展示了这件事的一个古老形态:一份文本被另一只手重读,并在页边加上了注释。

希罗多德《历史》的希腊文手稿页,四周是语文学家 Lorenzo Valla 手写添加的旁注。
希罗多德《历史》,附 Lorenzo Valla 的旁注(Vat. gr. 122),梵蒂冈宗座图书馆,公有领域。

如果这些对照只会确认,它们就没有证据价值。因此还有负对照与之相伴:故意把一份校验器应当拒绝的材料交给它,然后确认它确实拒绝了。在 2026年8月28日的读数上,一个人为损坏后注入某份输出的数值确实被检出了。一个不懂得失败的校验器什么也没有核验;正是这种失败的能力,使别处未发现错误这件事变得可读。

有两项属性被优先纳入这一制度。首先是事实的守恒:每一份产出的文档都由机器对照产生它的那组事实重新核验,不增不减。其次是语言之间的事实等价:同一主题在不同语言中的各个版本,经核验带有完全相同的事实,说得更少是允许的,说成别的则不允许。相应的读数见结果与测量页面。

属性 P1

确定性且可再现的生成

输入相同时,系统产出逐字节相同的输出:两次执行给出同样的文本。

状态:在 2026年8月28日的读数上从外部观察到,方法是比较两个独立进程之间的指纹:重复 147 次生成,147 个 SHA-256 指纹相同。

结构化事实,已冻结 确定性的生成 产出的文档 机械核验 对照其输入事实 相等 → 发布 有差异 → 拒绝 负对照:一份人为损坏的文档必须被拒绝——事实确实如此。

示意图 1 验证的契约,如属性 P1 至 P3 所陈述。生成过程本身不作描述:只描述它的契约,即冻结的输入、确定性的输出、机械的重新核验,以及一个懂得失败的校验器。

2. 属性登记表

本站各页通过一个稳定标识符来指称系统的属性。每一项属性的状态,即目标、已观察或已验证,由引用它的方框给出,并附上它的测量日期。

  • P1. 确定性且可再现的生成:输入相同,输出逐字节相同。
  • P2. 生成时不使用任何语言模型,也不进行任何网络访问。
  • P3. 事实的守恒:每一份产出的文档都由机器对照其输入事实重新核验,不增不减。
  • P4. 语言之间的事实等价:同一主题的各个版本带有完全相同的事实。
  • P5. 诚实省略:说得更少是允许的,说成别的则不允许,而且沉默会被计数。
  • P6. 可测量的可读性:阅读难度经过测量,并有事实不变的低龄读者变体。
  • P7. 有界辅导:只依据主题的事实卡片作答,批改的判定附有理由。
  • P8. 可追溯性:文档中的每一项论断都可以关联到一个公开的来源标识符(Wikidata 标识符),读者可以自行查阅。

3. 独立的外部参照

一个只用自己的仪器来检查自己的系统,只能确立它的内部一致性。因此本部门的测量要与独立的公共语言学参照相互对照,也就是词汇库与比较语言学数据库,本部门既不是它们的作者,也不是它们的管理者,因而无法把它们调整到符合自己的结果。

本页所断言的内容,到系统内部运作开始之处为止:对照确实发生,它所依据的材料不受本部门控制,而正是这种外在性赋予它价值。这些材料在系统内部如何使用,其细节不属于一个公开页面的事。

4. 科学立场

近期文献确立了这样一点:经过校准的概率式生成器无法保证在罕见事实上不出现幻觉[1][2][3],尽管在某些设定下这种情形可以变得在统计上可以忽略[4]。本计划探索由此勾勒出的另一条分支:在一个划定边界的事实领域上,通过构造方式保证事实守恒、并施以机械验证的系统。

这一立场持守审慎。本部门的正式结果正在准备发表,本站既不发表定理,也不发表证明,更不提出优先权主张:它陈述的是属性、带日期的测量与一份计划。所主张的内容可以归为一句话:

经常正确不等于有保证:在这两种体制之间,差别在于性质,而不在于程度。

5. 许可协议与开放

系统产出的内容以 CC BY 4.0 许可协议发布:可以复制、翻译、打印并再分发,唯一的条件是署名 ODERSA。这个许可协议不是附加项,而是整套做法的条件:一份既不能取用、也不能检查的内容,是无法核验的。

一份公开的演示语料正在准备之中,正式出版物同样如此。两者都不宣布日期:本部门宁可少宣布,只发布那些能够核验的东西。在此之前,演示给出可以阅读的、未经修饰的输出,而结果与测量页面给出与之相伴的读数。

常见问题

6. 直接的问答

为什么不使用大语言模型?

因为目标用途是教育,而教育要求的是保证,不是似真。大语言模型是概率式的生成器;近期文献确立了:一个经过校准的概率式生成器无法保证在罕见事实上不出现虚假陈述[1][2][3];它可以让这种情况在统计上变得罕见[4],而这与一项保证并不是一回事。本计划研究的是另一条分支:确定性的系统,其每一份文档都由机器对照它的输入事实重新核验。“经常正确”不等于“有保证”;差别在于性质,而不在于程度。

如何核查本站所作的断言?

每个数字都带有它的测量日期与方法;这些测量由读数产生,只需一条命令即可在系统的当前状态上重新生成。演示是带日期且未经修饰的输出,缺陷也一并保留。机构隶属关系可以通过把本站与协会的官方信息相互对照来核实。正式结果将以出版物的形式发表,并附上它们的核验材料。

“诚实省略”是什么意思?

当一种语言或一份事实卡片无法正确地陈述某项事实时,系统就对这项事实保持沉默,而不去近似它。说得更少是允许的;说成别的则不允许。被省略之处会被计数,并与结果一同公布,测量表格为它们专设一栏。

为什么有些语言产出得这么少?

1,000 种语言之间的平等是处理上的平等,不是素材上的平等:可得的素材随语言与领域而变,这种变化被测量,而不是被遮盖。迄今覆盖最少的领域是历史人物(1,000 种语言中有 132 种在此产出文档);它与最充裕的领域同等公布。

这些文本在发布前有人工重读吗?

本站的演示输出,是系统怎么产出就怎么发布,未经修饰,包括其中笨拙的地方。这是一个透明的选择:一份手工修改过的精选集什么也证明不了。系统本身的验证是机械的:自动对照、负对照,以及与独立的公共语言学参照相互对照。

谁在做这个计划,用的是什么资源?

ODERSA Research 是 ODERSA 的研究部门,ODERSA 是依据法国1901年法律设立的非营利协会,没有雇员,其内容以 CC BY 4.0 许可协议发布,不含广告,也不收集数据。研究工作由 Mael Garbe 负责。联系方式:research@odersa.org

出版物在哪里?

正在准备之中。本站首先公布那些不必相信我们的话就能核查的东西:属性、带日期的测量、演示。形式化的陈述及其证明将通过科学出版渠道随后给出。

7. 参考文献

  1. A. T. Kalai, S. S. Vempala, “Calibrated Language Models Must Hallucinate”, STOC 2024 (arXiv:2311.14648). 返回
  2. A. T. Kalai, O. Nachum, S. S. Vempala, E. Zhang, “Why Language Models Hallucinate”, 2025. 返回
  3. Z. Xu, S. Jain, M. Kankanhalli, “Hallucination is Inevitable: An Innate Limitation of Large Language Models”, 2024 (arXiv:2401.11817). 返回
  4. Suzuki et al., 2025 (arXiv:2502.12187),在某些设定下幻觉可以被压到统计上可以忽略。 返回

接下来读什么

  • 结果与测量,这套做法所框定的读数,含效度威胁。
  • 演示,未经修饰的输出,可以重读,也可以在比较失败时加以反驳。
  • 研究笔记,本部门的笔记,供那些需要更多篇幅的图表使用。

键盘快捷键

Tab 键在链接之间切换
回车键打开链接,或展开、收起一个问题
?打开这份帮助
Esc 键关闭面板或这份帮助