读数与局限
结果与测量
本页属于“可验证的自然语言生成”项目的目录。它给出 2026年8月28日在所研究系统当前状态上的读数:事实存量、语言覆盖面、事实等价与确定性。每一幅图都附有同一批数据的表格,最后一节指出这些数字没有说出的东西。
的测量数据,可重新生成。
1. 测量方法
本页的数字不是估计,也不是保存下来的纪录。它们由读数产生,这些读数只需一条命令即可在系统的当前状态上重做,并覆盖此前的结果。页首显示的日期是读数的日期,不是撰写的日期:系统一有演进,测量就重做,页面也随之改变。
由此得出的编辑原则可以一句话概括:本部门只公布自己能够重新测量的东西。一项读数无法再现的结果在这里没有位置,哪怕它是真的。这也是本站不出现任何与其他系统的数值比较的原因:本部门测量自己所控制的东西,别的一概不测。
本页由三类读数分担。第一类描述系统所拥有的东西,也就是它的结构化事实存量。第二类测量它实际产出的东西,逐语言、逐主题。第三类把输出交给外部的对照,其中包括一项负对照,用以确立这些对照能够失败。
三条操作性定义确定了各次读数的用语。
定义 1(完整文档)。对于给定的主题与语言,指完整给出的一份输出,没有空白小节,也没有产出错误。当且仅当这样的文档存在时,扫描才把一种语言计为有覆盖。
定义 2(诚实省略)。指被计数的缺失:缺一份文档,或文档中缺一项事实,因为可得的素材不足以正确地陈述它。每一处省略都与它所伴随的测量一同公布:按构造,覆盖与省略相加为 1,000。
定义 3(事实等价)。同一主题的两个版本是等价的,条件是:从其中一个版本提取的、达到已公布阈值的任何数据值,都能在该主题的参照库中无冲突地找到。说得更少是允许的,说成别的则不允许。
2. 事实存量
系统在 3,444 份结构化事实卡片上工作,分属 8 个领域。分布很不均衡,这种不均衡在很大程度上解释了后文观察到的覆盖面差距:一个卡片少、或者卡片信息稀薄的领域,机械地就会产出更少的完整文档。
| 领域 | 卡片 |
|---|---|
| 历史人物 | 1,070 |
| 城市与地点 | 1,003 |
| 生物物种 | 504 |
| 事件 | 445 |
| 国家 | 197 |
| 物质 | 156 |
| 发明 | 65 |
| 天体 | 4 |
| 合计 | 3,444 |
3. 语言覆盖面,逐个主题
2026年8月28日的扫描统计:对于给定的一个测试主题,在所处理的 1,000 种语言中有多少种产出了完整文档。其余的语言不会产出降级的文档:它们保持沉默,而这份沉默被计为一处诚实省略。
| 测试主题 | 产出文档 | 诚实省略 |
|---|---|---|
| 国家(肯尼亚) | 935 | 65 |
| 生物物种(狮) | 932 | 68 |
| 物质 | 924 | 76 |
| 历史人物 | 132 | 868 |
两列数字相加为 1,000:每一种没有产出文档的语言都被计为一处诚实省略,没有一种在中途丢失。文档长度按主题差别很大:国家主题的中位数为 77 词,物种为 8 词,物质为 7 词。一份以法语产出的国家卡片示例有 274 个词,测得的阅读水平为 12 年级。
公布省略这一栏不是修辞上的谨慎,而是读懂其余各栏的条件。一个高覆盖率只有在人们知道其余部分变成了什么之后才有意义:没有这一栏,就无从分辨一个保持沉默的系统与一个作近似的系统。把沉默计数,才使那些断言变得可读,这也正是覆盖最少的领域与最充裕的领域出现在同一幅图、同一张表里的原因。
4. 多主题稳健性
每个领域只取一个主题的读数容易被挑拣。多主题读数按构造排除了这个风险:每个领域取五个主题,按字典序选取,因而没有酌情干预。每个领域所记的数值,是在这五个主题上产出文档的语言数的平均。
| 领域 | 5 个主题的平均 |
|---|---|
| 物质 | 924 |
| 生物物种 | 908 |
| 国家 | 907 |
| 事件 | 900 |
| 城市与地点 | 897 |
| 历史人物 | 273 |
六个领域中有五个处在一条狭窄的带内,这表明覆盖面并不取决于所选的主题,而取决于可得的素材。历史人物这一领域反而印证了它的离散:视卡片的信息密度而定,产出文档的语言数从 109 到 902 不等。因此限制来自可得的数据,而不是产出的过程,本部门把这一点说出来,而不是把这个领域排除在读数之外。
同一份多主题读数也测量了所产出文档的长度。图 4 给出三十个中位数,每个主题一个:一簇点的位置说明该领域的丰度,它的散开说明该领域内部的方差。
物质那一簇是同一个点的重复:五个主题上的中位数都是 7 词,这是可得素材在各主题之间均匀的领域的特征。相反,国家领域的中位数按主题从 19 词铺开到 68 词。历史人物兼有这两种读法:覆盖面按卡片从 109 种语言变到 902 种,但中位长度仍然收紧在 11 到 13 词之间,所说的内容变化不大,变化的是能够说出它的语言数量。
5. 事实等价与确定性
接下来的两项读数针对输出本身。第一项按定义 3 的意义核验语言之间的事实等价:说得更少是允许的,说成别的则不允许。产出的文本由一个独立于系统的校验器重读,它提取数据中的数值,并核验每一个数值都能在该主题的参照库中无冲突地找到,所依据的阈值是公布的:大于或等于 10,000 的数值,这排除了由专有名词带来的年份。在重读的 935 种语言上,比较了 415 个数值,没有发现任何冲突。
一项什么都没找到的对照,只有在它有能力找到什么的时候才有价值。因此读数附带一项负对照:一个人为损坏后注入某份输出的数值,确实被校验器检出了。正是这种失败的能力,使前一项结果可以被读作一个结果,而不是仪器的沉默。
第二项读数针对确定性。147 次生成在两个独立的进程中重复执行,所得到的 147 个 SHA-256 指纹完全相同:没有任何差异。因此所宣称的可再现性不是一项内部假定的属性,而是从外部观察到的相等,所依据的指纹任何第三方都会计算。
示意图 1 进程间的确定性,2026年8月28日的读数:同样的 147 次生成,在两个独立进程中重放,给出相同的指纹。
| 测量项 | 数值 |
|---|---|
| 由独立校验器重读的语言 | 935 |
| 比较过的数值 | 415 |
| 发现的冲突 | 0 |
| 在两个独立进程中重复的生成 | 147 |
| 相同的 SHA-256 指纹 | 147 |
| 发现的差异 | 0 |
属性 P4
语言之间的事实等价
同一主题在不同语言中的各个版本带有完全相同的事实:说得更少是允许的,说成别的则不允许。
状态:在 2026年8月28日的读数上从外部核验通过,含负对照。
6. 扩大的测量
前面的读数针对一个试验主题。同样的核验随后按规模重放:30 个主题,按字典序在所测量的 6 个领域中各取前 5 个,在 1,000 种语言中重读。从外部比较了 1,646 个数值,没有发现任何冲突。负对照按主题逐一重放:在参照库带有高于阈值数值的 8 个主题上,注入 8 处损坏,检出 8 处。
示意图 2 扩大测量的流程,2026年8月28日。裁判在外部:它只读取完成后的输出。下面那条分支是负对照,用以确立这项比较能够失败。
校验器的校准是单独测量的,而且是双向的。在真实的输出中注入了 105 处人为损坏,每篇文本改动一个数值,涉及 15 种语言和 8 个主题:105 处检出 105 处。反过来,重读了 113 篇未受损的文本,没有出现任何误报。因此这件仪器的灵敏度与特异度是被测量出来的,不是被假定的。
示意图 3 校验器的校准,2026年8月28日的测量。两个错误格都是空的,而且都已公布:一件仪器要看它的两栏来评判。
两项覆盖读数补齐了这轮测量:国家领域的 197 个主题在 4 种对照语言(法语、英语、斯瓦希里语、阿拉伯语)中各自都产出了文档,而且在输出本身中检出了 25 种不同的书写系统。
| 测量项 | 数值 |
|---|---|
| 重读的主题(每个领域 5 个,字典序) | 30 |
| 跨语言比较的数值 | 1,646 |
| 发现的冲突 | 0 |
| 检出的人为损坏 | 105 / 105 |
| 未受损文本上的误报 | 0 / 113 |
| 在 4 种对照语言中都得到服务的国家领域主题 | 197 / 197 |
| 在输出中检出的书写系统 | 25 |
7. 书写系统明细
本轮测量所产出的每一份文档,其主导书写系统都是从外部按 Unicode 区段检出的,不看产出它的过程。由此得出 25 种不同的书写系统。拉丁字母占主导,25 种系统中有 21 种各自只由一到两种语言承载:这正是语言的平等处理必须正确服务的排印长尾,一直到藏文或奥里亚文。
| 书写系统 | 语言 |
|---|---|
| 拉丁文 | 895 |
| 西里尔文 | 9 |
| 阿拉伯文 | 6 |
| 天城文 | 3 |
| 埃塞俄比亚文 | 2 |
| 孟加拉文 | 2 |
| 希伯来文 | 2 |
| 汉字 | 2 |
| 希腊文 | 1 |
| 亚美尼亚文 | 1 |
| 格鲁吉亚文 | 1 |
| 平假名与片假名 | 1 |
| 谚文 | 1 |
| 泰文 | 1 |
| 老挝文 | 1 |
| 缅甸文 | 1 |
| 藏文 | 1 |
| 泰米尔文 | 1 |
| 泰卢固文 | 1 |
| 卡纳达文 | 1 |
| 马拉雅拉姆文 | 1 |
| 奥里亚文 | 1 |
| 古木基文 | 1 |
| 古吉拉特文 | 1 |
| 僧伽罗文 | 1 |
8. 局限
历史人物领域是所有领域中覆盖最少的,而且差距不是边缘性的:试验主题上 1,000 种语言中有 132 种,五个主题上平均为 273 种,视卡片的信息密度从 109 到 902 不等。这个领域同时也是卡片最多的,这就排除了用主题稀少来解释的说法,把原因指回每种语言中可得素材的密度。
在国家领域之外,文档长度偏低。物种与物质上记录到的 8 词和 7 词的中位数,描述的是简短的文档,可以当作事实卡片使用,但还不能当作完整的教学内容。本部门宁可公布这些中位数,也不隐去它们:它们说明工作还有哪些地方要做。
最后,本页的所有数字都是在系统的当前状态上测得,并在每次演进时重新生成。它们描述的不是一个凝固的系统,后续的读数可能把它们朝任一方向移动。因此页首的日期是结果的一项数据,而不是一条存档说明。
9. 效度威胁
这些读数的适用范围要求五点保留,本部门自己把它们说出来,而不是留给别人去发现。
等价校验器只比较大于或等于 10,000 的数值,这是公布的阈值,用以排除由专有名词带来的年份。扩大测量的 30 个主题中有 22 个不带任何高于该阈值的数值:对这些主题而言,等价依靠内部的机械对照,而不是这位外部裁判。
等价针对的是达到已公布阈值的数据值,而不是显示精度。一个版本可以在声明的前提下把某个数值取整,在另一个版本写 1,208,333 的地方写“约 1,208,000”,这一点在演示中可以看到:校验器把提取出的每个数值与该主题的参照库比较,而参照库两种形式都带有,声明过的取整属于说得更少,绝不属于说成别的。
试验主题仍然不多:扫描每个领域一个,稳健性五个。字典序排除了挑拣;但它本身并不确立所选主题的代表性。
确定性是在同一台机器的两个独立进程之间观察到的;不同机器之间的可再现性尚未有公布的读数。
最后,覆盖面统计的是产出的文档,绝不是它们的丰富程度:随扫描一同公布的长度中位数为这一读法划定了边界,而国家领域之外 7 词和 8 词的中位数,描述的是事实卡片,不是课文。
引用本页
本页的测量带有日期且可重新生成:因此一条引用要带测量日期,绝不能只带访问日期。
ODERSA Research(ODERSA 的研究部门)。“结果与测量”,2026年8月28日的测量数据。https://research.odersa.org/zh/results
BibTeX 格式:
@misc{odersa_research_measurements_2026_zh,
author = {{ODERSA Research}},
title = {Results and Measurements},
organization = {ODERSA},
year = {2026},
howpublished = {\url{https://research.odersa.org/zh/results}},
note = {Measurements of 28 August 2026, regenerable}
}