研究主线
研究计划
本页属于本部门在研项目,即可验证的自然语言生成,的目录。它的计划分为四条主线:每一条提出一个开放问题,并指向所研究的系统必须能够从外部加以验证的属性。正式结果正在准备发表:本页陈述的是计划,不是它的证明。
的测量数据,可重新生成。
A1. 可验证生成
这条主线的开放问题可以简单地陈述:能否保证,而不只是使之成为大概率,一份产出的文档不会说出其输入事实所没有说过的东西?承担全部分量的词是“保证”。保证不以成功的频率来衡量:它要么被证明,要么并不存在。
近期文献说明了其中的利害。它确立了这样一点:经过校准的概率式生成器无法保证在罕见事实上不出现幻觉[1][2][3],尽管在某些设定下这种情形可以变得在统计上可以忽略[4]。本计划并不与这些工作对立:它探索的是它们所勾勒的那个二选一之中的另一条分支。
这另一条分支有它的传统:即所谓的数据到文本生成[5][6],它从结构化数据出发产生文本,所用的方法长期以来在生产环境中受到偏爱,正是因为它们对输出给予的控制。该领域的基准评测活动,例如 WebNLG[7],以人工判断和各项指标来评估对输入数据的忠实度,也就是以频率来评估;这条主线所研究的那一步,是把这种忠实度变成一项在每一份产出文档上经机械验证的属性,并辅以负对照。
这另一条分支属于这样一类系统:它们在一个划定边界的事实领域上,通过构造方式保证事实的守恒,并施以机械验证。这里同时追求三项属性。首先是确定性:输入相同,输出逐字节相同,两次执行给出同样的文本。其次是生成时不使用语言模型、也不访问网络:文档由一个完全确定性的过程,从事先构建并冻结的结构化事实产生。最后是事实的守恒:每一份文档都由机器对照产生它的那组事实重新核验,而且这一核验能够失败,这一点由负对照来确立。
这条主线承担这一选择的代价。事实领域是划定边界的,产出的文本更短也更干,凡是超出输入事实范围的内容都不能说。经常正确不等于有保证:在这两种体制之间,差别在于性质,而不在于程度。
目标属性 P1-P3
确定性、生成时不使用模型、事实的守恒
输入相同时,系统给出逐字节相同的输出,生成时既不使用语言模型也不访问网络;随后每一份产出的文档都由机器对照产生它的那组事实重新核验。
状态:本主线的目标属性。
A2. 大规模的语言公平
这条主线的开放问题关乎规模:当一项事实守恒的保证必须同时在 1,000 种语言中成立,而不只是在素材充裕的少数几种语言中成立时,它会变成什么?所研究的系统处理 1,000 种语言,而且平等地处理它们:一种语言就是一份处理,绝不是一个等级。要守住这份平等,需要用计算来核验:各轮测量在这 1,000 种语言的每一种上重新执行生成与验证,并在系统每次演进时于当前状态上重做。
处理上的平等不是素材上的平等,本计划拒绝把后者说成前者。有两项属性框住了这份诚实。首先是事实等价:同一主题在不同语言中的各个版本,经核验带有完全相同的事实,说得更少是允许的,说成别的则不允许。其次是诚实省略:当一种语言或一份事实卡片无法正确地陈述某项事实时,系统就对这项事实保持沉默,而不去近似它,被省略之处会被计数并公布。
于是局限被指名,而不是被略过。在测量扫描中,历史人物这一领域覆盖最少:1,000 种语言中有 132 种在此产出了文档,而同一次扫描中的国家主题则汇集了 935 种。这个数字与其他数字同等公布,因为一份只公布自己最好领域的计划,也就不再测量任何东西了。扫描的细节见结果与测量页面。
目标属性 P4-P5
语言之间的事实等价与诚实省略
同一主题在不同语言中的各个版本,经核验带有完全相同的事实;当一种语言或一份事实卡片无法正确地陈述某项事实时,系统就对这项事实保持沉默,而不去近似它。
状态:本主线的目标属性。
A3. 可测量的可读性与按年龄调整
一份学生读不懂的准确内容,无助于教育。因此这条主线提出的既是写作问题,也是测量问题:如何把一份文档调整给更年幼的读者,而不触动它所陈述的内容?目标属性是双重的。系统测量其输出的阅读难度,并且能够在事实不变的前提下产出一个面向低龄读者的变体。
“事实不变”在这里是一项强约束,而不是一种意愿。面向低龄读者的版本中的数字仍然是原版本的数字:不作四舍五入,不作简化,也不用数量级来替代。变化的是句子的构造与词语的选择,绝不是所陈述的数值。可读性由此成为又一项测量,与其余部分接受同样的核验制度。
一份以法语产出的国家事实卡片在各次读数中用作参照例子:274 个词,测得的阅读水平为 12 年级。本计划力求以受控且可测量的方式让这一水平发生变化,同时保持事实守恒的核验完好无损。
目标属性 P6
经测量的阅读水平
系统测量其输出的阅读难度,并能在事实不变的前提下产出一个面向低龄读者的变体。
状态:本主线的目标属性。
A4. 有界且可验证的辅导
最后一条主线把问题从文档移到交流。一个教学助手若能作答,是有用的;若什么都答,则是危险的。开放问题正是边界的问题:如何构造一个问答部件,使它的范围是已知的、说明过的、可核验的,而不是让学生在一次次出错中去猜?
目标属性是一个有界的辅导者。该部件只依据当前主题的事实卡片作答;在其范围之外,它回答“我还不知道”,而不是产出一个看似合理的答案。这种承认不是一处被容忍的覆盖缺陷:它就是预期的行为,并在各项对照中被如此对待。
练习批改遵循同样的制度。该部件给出一个判定,并附上判定的理由,以便教师能够检查这次批改本身,而不只是承受它。同样,这里所追求的不是交流的流畅,而是第三方能够核验已说内容的可能。
目标属性 P7
一个有界的辅导者
问答部件只依据当前主题的事实卡片作答,在其范围之外回答“我还不知道”;练习批改给出一个判定并附上其理由。
状态:本主线的目标属性。
参考文献
- A. T. Kalai, S. S. Vempala, “Calibrated Language Models Must Hallucinate”, STOC 2024 (arXiv:2311.14648). 返回
- A. T. Kalai, O. Nachum, S. S. Vempala, E. Zhang, “Why Language Models Hallucinate”, 2025. 返回
- Z. Xu, S. Jain, M. Kankanhalli, “Hallucination is Inevitable: An Innate Limitation of Large Language Models”, 2024 (arXiv:2401.11817). 返回
- Suzuki et al., 2025 (arXiv:2502.12187),在某些设定下幻觉可以被压到统计上可以忽略。 返回
- E. Reiter, R. Dale, Building Natural Language Generation Systems, Cambridge University Press, 2000. 返回
- A. Gatt, E. Krahmer, “Survey of the State of the Art in Natural Language Generation: Core tasks, applications and evaluation”, Journal of Artificial Intelligence Research 61, 2018. 返回
- C. Gardent, A. Shimorina, S. Narayan, L. Perez-Beltrachini, “The WebNLG Challenge: Generating Text from RDF Data”, INLG 2017. 返回