重算、重执行、重跑是三件不同的事,要求的东西不一样, 能承诺的也不一样。下面每一条命令都是做这一页的时候真跑的,贴的就是当场的输出。
第一件事最省事:拿账本自己核一遍,逐条对指纹,把整个过程从头重建到尾。谁都能做,不用模型,也不用授权数据,账本本身就在仓库里。
主展这一次运行的 47 步,逐条核过,一步不差。
不想装东西的话,同一件事在校验那一页上:账本原样放在页里,你一打开,它就在你自己的浏览器里核了一遍。
第二件事难一点:把当初算过的那几个数重新算一遍,看是不是一个字节都不差。这要求手上的数据跟当初是同一份。
在我们自己造的那批数据上,做得到,但不是每次都做得到。
但这一条不承诺每次都成。同一条命令、同一次运行,在同一台机器上连着跑十二遍,通过六遍;剩下六遍差在最后一位小数上。机器忙的时候通过的次数还会更少。这是浮点计算在不同机器状态下的正常抖动,我们没把它藏起来,也没假装它不存在。
主展那一次跑的是有授权的真实数据,眼下做不到。这台机器上那份数据的来历标记,已经跟账本里记的那条对不上了。重算走到这一步会当场停住,把两边的标记都打出来。
要紧的是它停的位置:账本本身照样核得过,停的是「重新算一遍」那一步。工具没有将就着算完再报个数——这正是它该有的样子。要把那一次真正重算出来,得有同一份授权数据和同一版读取程序。
第三件事是让它从头再做一次这道题。结果不会一样,本页也不承诺一样。研究员是大模型,同一道题两次做下来,想到的思路、要的数据、定的算法都可能不同。
仓库里有一条一键入口,但它跑的是照剧本走的那种——按事先写好的步骤演一遍,用来验机制通不通,不是自己做研究。
要让它真的自己做一次,得自备模型的钥匙;要做真实数据那道题,还得自己有那份授权数据。跑出来的会是一次新的运行,有它自己的编号和自己的账本。
初赛一共要求 7 项。每一项的证据放在仓库里,指到具体哪一次运行、哪一个文件。下面这张表是从那份清单现读的。
上面三件事,做这一页的时候都真跑了一遍,跑不通的那一件也跑了。跑不通就写跑不通,没有一句是照着设想写的。
核账本、重算数、重做研究,要求的东西不一样,能承诺的也不一样。把三件并成一句「跑出来跟我们的一样」,三句里有两句是假的。
命令、参数、每一步的输出,都写在仓库的说明文件里。这一页只交代能承诺什么、不能承诺什么。
政府工作报告为公开公文,可展示原文;上市公司数据只以汇总统计呈现。