研究对象
可验证的自然语言生成
本部门把整个研究计划投向唯一一套系统:一个产出事实性文本的生成器,它的属性是从外部核验的,而不是自行宣布的,并且平等地施用于 1,000 种语言。本页说明这套系统保证什么、测量什么,以及本部门所承认的局限。
的测量数据,可重新生成。
系统产出什么
所研究的系统在它平等处理的 1,000 种语言中的每一种上,产出简短的事实性文档:一种语言就是一种语言,没有哪一种由次一等的处理来服务。从一种语言到另一种语言,变化的是可得的素材,本部门测量并公布这一差别,而不是把它抹平。
这些文档依托 3,444 份结构化事实卡片,分属八个领域:从历史人物(1,070 份卡片)到天体(4 份卡片),中间还有城市与地点(1,003 份)、生物物种(504 份)、事件(445 份)、国家(197 份)、物质(156 份)与发明(65 份)。文档所载的每一项论断,都仍然可以关联到一个公开的来源标识符,也就是一个 Wikidata 标识符,读者可以自行查阅。
在生成的时刻,系统既不借助任何语言模型,也不进行任何网络访问:它的文档由一个完全确定性的过程,从事先构建并冻结的结构化事实中得出。输入相同时,它给出逐字节相同的输出。
三项经机械验证的保证
本页上有三项属性承担举证的责任。它们不该被读作一个承诺,而应被读作一个带日期的观察结果,由一项本可能失败、并且确实被置于这种可能性之前的对照得出。
属性 P1
确定性且可再现的生成
输入相同时,系统产出逐字节相同的输出:两次执行给出同样的文本。
状态:在 2026年8月28日的读数上,通过比较两个独立进程之间的指纹观察到:重复 147 次生成,147 个 SHA-256 指纹相同,0 处差异。
事实的守恒接受同样的制度:这里没有什么会在一项对照无法反驳它的情况下被断言。
属性 P3
经机械验证的事实守恒
每一份产出的文档都由机器对照产生它的那组事实重新核验:没有编造,也没有遗失。
状态:在每一份产出的文档上受到机械检查;一套 200 多项自动对照伴随系统的开发,其中包括负对照。
机械对照就单份文档所确立的东西,一个独立的校验器随后在语言之间确立。
属性 P4
语言之间的事实等价
同一主题在不同语言中的各个版本,经核验带有完全相同的事实:说得更少是允许的,说成别的则不允许。
状态:在 2026年8月28日的读数上,由一个独立于系统的校验器从外部观察到:重读 935 种语言,比较 415 个数值,0 处冲突;一个人为损坏后注入某份输出的数值确实被检出了。
可读性、年龄与有界的辅导者
系统测量自己输出的阅读难度,并且能够在事实不变的前提下产出一个适合低龄读者的变体:它所带的数字仍然准确,绝不为此四舍五入。在为国家卡片选取的法语示例上,被测量的文档有 274 个词,评估出的阅读水平为 12 年级。
系统包含一个有界的辅导者:它的问答部件只依据所询问主题的事实卡片作答,在这个范围之外则回答它还不知道。它所提供的练习批改遵循同样的克制:它给出一个判定,并附上判定的理由,而不是一个没有缘由的分数。
2026年8月28日的扫描测量了什么
2026年8月28日的一次扫描测量:对每个领域的一个测试主题,1,000 种语言中有多少种产出了完整文档。当一种语言或一份卡片无法正确地陈述某项事实时,系统就对这项事实保持沉默,而不去近似它:这就是本部门所称的诚实省略。这些省略被计数并公布,绝不遮掩,因为一个把它们略去的覆盖数字,什么也没有测量。
| 测试主题 | 产出文档的语言 |
|---|---|
| 国家(肯尼亚) | 935 / 1,000 |
| 物种(狮) | 932 / 1,000 |
| 物质 | 924 / 1,000 |
| 历史人物 | 132 / 1,000 |
对国家主题(肯尼亚),产出文档的 935 种语言之外还有 65 处诚实省略,其文档长度中位数为 77 词;对物种(狮),这一中位长度为 8 词;对物质为 7 词。对覆盖最少的历史人物主题,产出文档的 132 种语言之外还有 868 处诚实省略。
为了核实这一结果并非取决于挑了一个有利的主题,每个领域按字典序选取了五个主题,这是一种谁也无法左右的选取方式,并在每一个主题上重复了同样的扫描。产出文档的语言数平均为:物质 924,生物物种 908,国家 907,事件 900,城市与地点 897;历史人物则为 273,并且视每份卡片的信息密度,差距从 109 到 902。限制来自可得的数据,而不是产出的过程,本部门把这一点说出来,而不是用一个平均数把它冲淡。
局限
迄今覆盖最少的领域是历史人物:在扫描的单一主题上,1,000 种语言中有 132 种产出文档,在五个主题上平均为 273 种。一个把这个结果略去的页面,会与它自己所描述的做法相矛盾。
在国家领域之外,产出的文档仍然简短:所选取的物种与物质上 8 词和 7 词的长度中位数,描述的是一个句子,而不是一堂课。系统只说素材允许它说的东西,然后就停下来,而不是用近似把文本拉长。
这些测量针对系统在 2026年8月28日的状态:它们在每次演进时重新生成,描述的不是一项永久的属性,而是一次可再现的读数在这个日期所观察到的东西。至于本部门的正式结果,正在准备发表之中。