开放数据
数据
本站以机器可读形式发布的东西:在研项目的指标、发布订阅源,以及即将推出的公开语料。每个字段都有说明;每个数值都带有它的读数日期。
指标文件
data/impact.json 文件发布在研项目的指标,每一轮测量都会重新生成。它的地址是稳定的,读取时既不需要密钥也不需要账号,并且带着允许第三方程序读取的响应头提供。一条命令就够了:
curl https://research.odersa.org/data/impact.json
它在 读数时的内容,按其提供的原样:
{
"date": "2026-08-28",
"langues_traitees": 1000,
"fiches_de_faits": 3444,
"domaines": 8,
"langues_document_pays": 935,
"langues_document_espece": 932,
"langues_document_substance": 924,
"langues_document_figure": 132,
"valeurs_comparees_equivalence": 415,
"conflits_equivalence": 0,
"generations_repetees": 147,
"empreintes_identiques": 147,
"controles_automatiques": 218
}
字段词典
一个离开我们就读不懂的字段不算开放。下表说明文件中的每个字段:这个数值测量什么,以及应当怎么读它。
| 字段 | 数值 | 读法 |
|---|---|---|
date | 2026-08-28 | 读数的日期:这是结果的一项数据,不是一条存档说明。 |
langues_traitees | 1000 | 系统所处理的语言,受同等处理。 |
fiches_de_faits | 3444 | 存量中的结构化事实卡片。 |
domaines | 8 | 存量所覆盖的事实领域。 |
langues_document_pays | 935 | 产出完整文档的语言,国家测试主题(肯尼亚)。 |
langues_document_espece | 932 | 产出完整文档的语言,物种测试主题(狮)。 |
langues_document_substance | 924 | 产出完整文档的语言,物质测试主题。 |
langues_document_figure | 132 | 产出完整文档的语言,历史人物测试主题,也就是覆盖最少的领域,与其余同等公布。 |
valeurs_comparees_equivalence | 415 | 由外部校验器在语言之间比较的数值,试验主题,按公布的阈值。 |
conflits_equivalence | 0 | 这项比较所发现的冲突。 |
generations_repetees | 147 | 在两个独立进程中重复的生成。 |
empreintes_identiques | 147 | 两个进程之间相同的 SHA-256 指纹。 |
controles_automatiques | 218 | 伴随系统开发的自动对照。 |
数据的契约
一个已发布的数值是有日期、可重新生成、有说明的
文件的地址是稳定的。已有的字段在各次读数之间保持它们的含义;词典可以扩充,绝不自相矛盾,任何变动都会在动态页面上宣布。本页没有说明的字段,不该出现在文件里。
本站的其他数据
- 发布订阅源,动态页面上带日期的事实,采用 Atom 格式:任何聚合器都能读取,不需要注册,也不需要账号。
- 公开语料,正在准备之中,系统未经修饰的输出,以 CC BY 4.0 许可协议发布。在它推出之前,演示页面给出带日期的输出。
任何被引用的数值都带有它的测量日期。本站的引用格式,包括 BibTeX 在内,见出版物页面。