本站是 ODERSA 的官方网站。 如何确认这一点

官方域名

本站的网址以 odersa.org 结尾。协会的每一项服务都放在 odersa.org 的子域名下,别处一概没有。如果浏览器地址栏里的网址不是以 odersa.org 结尾,这个站点就不是我们的。

免费,也不用账号

所有内容一开始就全部开放:不用注册,不用账号,不用密码,不用订阅,也没有广告。没有什么是留给付费的人的,因为这里什么都不收费。

不收集任何数据

本站不跟踪您:没有跟踪代码,没有跟踪 cookie,这些页面里没有内嵌任何统计工具,也不在您的设备上测量任何东西。我们的主机会以汇总方式统计请求,就像任何会应答的服务器一样:只是一个总数,绝不是一份个人档案。您不必相信我们的话:打开浏览器的开发者工具,切到“网络”标签页,然后刷新页面。您会看到本站请求的完整清单。所有内容都来自 odersa.org,没有任何东西发往别处。

内容自由使用

内容以 CC BY 4.0 许可协议发布。您可以复制、翻译、打印并再分发,用于课堂或身边的人都可以,唯一的条件是署名 ODERSA。

读数与局限

结果与测量

本页属于“可验证的自然语言生成”项目的目录。它给出 2026年8月28日在所研究系统当前状态上的读数:事实存量、语言覆盖面、事实等价与确定性。每一幅图都附有同一批数据的表格,最后一节指出这些数字没有说出的东西。

的测量数据,可重新生成。

测量日期:2026年8月28日 读数可在当前状态上重新生成

1. 测量方法

本页的数字不是估计,也不是保存下来的纪录。它们由读数产生,这些读数只需一条命令即可在系统的当前状态上重做,并覆盖此前的结果。页首显示的日期是读数的日期,不是撰写的日期:系统一有演进,测量就重做,页面也随之改变。

由此得出的编辑原则可以一句话概括:本部门只公布自己能够重新测量的东西。一项读数无法再现的结果在这里没有位置,哪怕它是真的。这也是本站不出现任何与其他系统的数值比较的原因:本部门测量自己所控制的东西,别的一概不测。

本页由三类读数分担。第一类描述系统所拥有的东西,也就是它的结构化事实存量。第二类测量它实际产出的东西,逐语言、逐主题。第三类把输出交给外部的对照,其中包括一项负对照,用以确立这些对照能够失败。

一只倾斜的木质活字盘,分格摆放着铅制活字,中央放着一把手动排字盘。
活字盘,Gutenberg-Museum Mainz,photo dronepicr, CC BY 2.0。

三条操作性定义确定了各次读数的用语。

定义 1(完整文档)。对于给定的主题与语言,指完整给出的一份输出,没有空白小节,也没有产出错误。当且仅当这样的文档存在时,扫描才把一种语言计为有覆盖。

定义 2(诚实省略)。指被计数的缺失:缺一份文档,或文档中缺一项事实,因为可得的素材不足以正确地陈述它。每一处省略都与它所伴随的测量一同公布:按构造,覆盖与省略相加为 1,000。

定义 3(事实等价)。同一主题的两个版本是等价的,条件是:从其中一个版本提取的、达到已公布阈值的任何数据值,都能在该主题的参照库中无冲突地找到。说得更少是允许的,说成别的则不允许。

2. 事实存量

系统在 3,444 份结构化事实卡片上工作,分属 8 个领域。分布很不均衡,这种不均衡在很大程度上解释了后文观察到的覆盖面差距:一个卡片少、或者卡片信息稀薄的领域,机械地就会产出更少的完整文档。

按领域划分的结构化事实卡片:历史人物 1,070;城市与地点 1,003;生物物种 504;事件 445;国家 197;物质 156;发明 65;天体 4。 历史人物 1,070 城市与地点 1,003 生物物种 504 事件 445 国家 197 物质 156 发明 65 天体 4
图 1 按领域划分的结构化事实卡片,2026年8月28日的读数。相同数据见表 1。
表 1。按领域划分的结构化事实卡片,2026年8月28日
领域 卡片
历史人物1,070
城市与地点1,003
生物物种504
事件445
国家197
物质156
发明65
天体4
合计3,444

3. 语言覆盖面,逐个主题

2026年8月28日的扫描统计:对于给定的一个测试主题,在所处理的 1,000 种语言中有多少种产出了完整文档。其余的语言不会产出降级的文档:它们保持沉默,而这份沉默被计为一处诚实省略。

在所处理的 1,000 种语言中产出完整文档的语言,2026年8月28日的扫描:国家(肯尼亚)935;生物物种(狮)932;物质 924;历史人物 132。 国家(肯尼亚) 935 / 1,000 生物物种(狮) 932 / 1,000 物质 924 / 1,000 历史人物 132 / 1,000
图 2 按测试主题统计的、产出完整文档的语言,2026年8月28日的扫描。相同数据见表 2,另附诚实省略一栏。
表 2。2026年8月28日的扫描:产出完整文档的语言与诚实省略,在 1,000 种语言中
测试主题 产出文档 诚实省略
国家(肯尼亚)93565
生物物种(狮)93268
物质92476
历史人物132868

两列数字相加为 1,000:每一种没有产出文档的语言都被计为一处诚实省略,没有一种在中途丢失。文档长度按主题差别很大:国家主题的中位数为 77 词,物种为 8 词,物质为 7 词。一份以法语产出的国家卡片示例有 274 个词,测得的阅读水平为 12 年级。

公布省略这一栏不是修辞上的谨慎,而是读懂其余各栏的条件。一个高覆盖率只有在人们知道其余部分变成了什么之后才有意义:没有这一栏,就无从分辨一个保持沉默的系统与一个作近似的系统。把沉默计数,才使那些断言变得可读,这也正是覆盖最少的领域与最充裕的领域出现在同一幅图、同一张表里的原因。

4. 多主题稳健性

每个领域只取一个主题的读数容易被挑拣。多主题读数按构造排除了这个风险:每个领域取五个主题,按字典序选取,因而没有酌情干预。每个领域所记的数值,是在这五个主题上产出文档的语言数的平均。

产出文档的语言,按每个领域以字典序选取的 5 个主题取平均,在 1,000 种语言中,2026年8月28日:物质 924;生物物种 908;国家 907;事件 900;城市与地点 897;历史人物 273。 物质 924 / 1,000 生物物种 908 / 1,000 国家 907 / 1,000 事件 900 / 1,000 城市与地点 897 / 1,000 历史人物 273 / 1,000
图 3 产出文档的语言,按每个领域以字典序选取的 5 个主题取平均,2026年8月28日。相同数据见表 3。
表 3。多主题稳健性,2026年8月28日:每个领域 5 个主题上产出文档的语言数平均,在 1,000 种语言中
领域 5 个主题的平均
物质924
生物物种908
国家907
事件900
城市与地点897
历史人物273

六个领域中有五个处在一条狭窄的带内,这表明覆盖面并不取决于所选的主题,而取决于可得的素材。历史人物这一领域反而印证了它的离散:视卡片的信息密度而定,产出文档的语言数从 109 到 902 不等。因此限制来自可得的数据,而不是产出的过程,本部门把这一点说出来,而不是把这个领域排除在读数之外。

同一份多主题读数也测量了所产出文档的长度。图 4 给出三十个中位数,每个主题一个:一簇点的位置说明该领域的丰度,它的散开说明该领域内部的方差。

文档长度中位数,以词计,每个领域五个主题,2026年8月28日的本轮测量:国家从 19 到 68;事件从 18 到 30;城市与地点从 8 到 16;生物物种从 11 到 14;历史人物从 11 到 13;物质在五个主题上都是 7。 国家 19–68 事件 18–30 城市与地点 8–16 生物物种 11–14 历史人物 11–13 物质 7
图 4 文档长度中位数,以词计,针对本轮测量三十个主题中的每一个(每个领域五个,字典序),2026年8月28日。每个点是一个主题;横轴从 0 到 70 词。

物质那一簇是同一个点的重复:五个主题上的中位数都是 7 词,这是可得素材在各主题之间均匀的领域的特征。相反,国家领域的中位数按主题从 19 词铺开到 68 词。历史人物兼有这两种读法:覆盖面按卡片从 109 种语言变到 902 种,但中位长度仍然收紧在 11 到 13 词之间,所说的内容变化不大,变化的是能够说出它的语言数量。

5. 事实等价与确定性

接下来的两项读数针对输出本身。第一项按定义 3 的意义核验语言之间的事实等价:说得更少是允许的,说成别的则不允许。产出的文本由一个独立于系统的校验器重读,它提取数据中的数值,并核验每一个数值都能在该主题的参照库中无冲突地找到,所依据的阈值是公布的:大于或等于 10,000 的数值,这排除了由专有名词带来的年份。在重读的 935 种语言上,比较了 415 个数值,没有发现任何冲突。

一项什么都没找到的对照,只有在它有能力找到什么的时候才有价值。因此读数附带一项负对照:一个人为损坏后注入某份输出的数值,确实被校验器检出了。正是这种失败的能力,使前一项结果可以被读作一个结果,而不是仪器的沉默。

第二项读数针对确定性。147 次生成在两个独立的进程中重复执行,所得到的 147 个 SHA-256 指纹完全相同:没有任何差异。因此所宣称的可再现性不是一项内部假定的属性,而是从外部观察到的相等,所依据的指纹任何第三方都会计算。

进程 A 进程 B SHA-256 指纹 147 次生成 同样的 147 次生成 任何第三方都可计算 147 / 147 完全相同 0 处差异

示意图 1 进程间的确定性,2026年8月28日的读数:同样的 147 次生成,在两个独立进程中重放,给出相同的指纹。

表 4。事实等价与确定性,2026年8月28日
测量项 数值
由独立校验器重读的语言935
比较过的数值415
发现的冲突0
在两个独立进程中重复的生成147
相同的 SHA-256 指纹147
发现的差异0

属性 P4

语言之间的事实等价

同一主题在不同语言中的各个版本带有完全相同的事实:说得更少是允许的,说成别的则不允许。

状态:在 2026年8月28日的读数上从外部核验通过,含负对照。

6. 扩大的测量

前面的读数针对一个试验主题。同样的核验随后按规模重放:30 个主题,按字典序在所测量的 6 个领域中各取前 5 个,在 1,000 种语言中重读。从外部比较了 1,646 个数值,没有发现任何冲突。负对照按主题逐一重放:在参照库带有高于阈值数值的 8 个主题上,注入 8 处损坏,检出 8 处。

30 个主题 产出的文本 提取的数值 比较 8 处损坏 字典序 30 个主题,1,000 种语言 阈值:10,000 及以上 跨语言 故意注入 1,646 个数值 · 0 处冲突 8 / 8 已拒绝

示意图 2 扩大测量的流程,2026年8月28日。裁判在外部:它只读取完成后的输出。下面那条分支是负对照,用以确立这项比较能够失败。

校验器的校准是单独测量的,而且是双向的。在真实的输出中注入了 105 处人为损坏,每篇文本改动一个数值,涉及 15 种语言和 8 个主题:105 处检出 105 处。反过来,重读了 113 篇未受损的文本,没有出现任何误报。因此这件仪器的灵敏度与特异度是被测量出来的,不是被假定的。

校验器的判定 发出报警 保持沉默 实际情况 受损文本(105) 未受损文本(113) 105 / 105 检出 0 漏检的损坏 0 误报 113 / 113 重读无报警 每篇文本改动一个数值,15 种语言,8 个主题。

示意图 3 校验器的校准,2026年8月28日的测量。两个错误格都是空的,而且都已公布:一件仪器要看它的两栏来评判。

两项覆盖读数补齐了这轮测量:国家领域的 197 个主题在 4 种对照语言(法语、英语、斯瓦希里语、阿拉伯语)中各自都产出了文档,而且在输出本身中检出了 25 种不同的书写系统。

表 5。2026年8月28日的扩大测量
测量项 数值
重读的主题(每个领域 5 个,字典序)30
跨语言比较的数值1,646
发现的冲突0
检出的人为损坏105 / 105
未受损文本上的误报0 / 113
在 4 种对照语言中都得到服务的国家领域主题197 / 197
在输出中检出的书写系统25

7. 书写系统明细

本轮测量所产出的每一份文档,其主导书写系统都是从外部按 Unicode 区段检出的,不看产出它的过程。由此得出 25 种不同的书写系统。拉丁字母占主导,25 种系统中有 21 种各自只由一到两种语言承载:这正是语言的平等处理必须正确服务的排印长尾,一直到藏文或奥里亚文。

表 6。本轮测量输出中检出的书写系统,按语言数,2026年8月28日
书写系统 语言
拉丁文895
西里尔文9
阿拉伯文6
天城文3
埃塞俄比亚文2
孟加拉文2
希伯来文2
汉字2
希腊文1
亚美尼亚文1
格鲁吉亚文1
平假名与片假名1
谚文1
泰文1
老挝文1
缅甸文1
藏文1
泰米尔文1
泰卢固文1
卡纳达文1
马拉雅拉姆文1
奥里亚文1
古木基文1
古吉拉特文1
僧伽罗文1

8. 局限

历史人物领域是所有领域中覆盖最少的,而且差距不是边缘性的:试验主题上 1,000 种语言中有 132 种,五个主题上平均为 273 种,视卡片的信息密度从 109 到 902 不等。这个领域同时也是卡片最多的,这就排除了用主题稀少来解释的说法,把原因指回每种语言中可得素材的密度。

在国家领域之外,文档长度偏低。物种与物质上记录到的 8 词和 7 词的中位数,描述的是简短的文档,可以当作事实卡片使用,但还不能当作完整的教学内容。本部门宁可公布这些中位数,也不隐去它们:它们说明工作还有哪些地方要做。

最后,本页的所有数字都是在系统的当前状态上测得,并在每次演进时重新生成。它们描述的不是一个凝固的系统,后续的读数可能把它们朝任一方向移动。因此页首的日期是结果的一项数据,而不是一条存档说明。

9. 效度威胁

这些读数的适用范围要求五点保留,本部门自己把它们说出来,而不是留给别人去发现。

等价校验器只比较大于或等于 10,000 的数值,这是公布的阈值,用以排除由专有名词带来的年份。扩大测量的 30 个主题中有 22 个不带任何高于该阈值的数值:对这些主题而言,等价依靠内部的机械对照,而不是这位外部裁判。

等价针对的是达到已公布阈值的数据值,而不是显示精度。一个版本可以在声明的前提下把某个数值取整,在另一个版本写 1,208,333 的地方写“约 1,208,000”,这一点在演示中可以看到:校验器把提取出的每个数值与该主题的参照库比较,而参照库两种形式都带有,声明过的取整属于说得更少,绝不属于说成别的。

试验主题仍然不多:扫描每个领域一个,稳健性五个。字典序排除了挑拣;但它本身并不确立所选主题的代表性。

确定性是在同一台机器的两个独立进程之间观察到的;不同机器之间的可再现性尚未有公布的读数。

最后,覆盖面统计的是产出的文档,绝不是它们的丰富程度:随扫描一同公布的长度中位数为这一读法划定了边界,而国家领域之外 7 词和 8 词的中位数,描述的是事实卡片,不是课文。

引用本页

本页的测量带有日期且可重新生成:因此一条引用要带测量日期,绝不能只带访问日期。

ODERSA Research(ODERSA 的研究部门)。“结果与测量”,2026年8月28日的测量数据。https://research.odersa.org/zh/results

BibTeX 格式:

@misc{odersa_research_measurements_2026_zh,
  author       = {{ODERSA Research}},
  title        = {Results and Measurements},
  organization = {ODERSA},
  year         = {2026},
  howpublished = {\url{https://research.odersa.org/zh/results}},
  note         = {Measurements of 28 August 2026, regenerable}
}

接下来读什么

键盘快捷键

Tab 键在链接之间切换
回车键打开链接,或展开、收起一个问题
?打开这份帮助
Esc 键关闭面板或这份帮助