成绩单
它跟四条参照线比过,比输了也照登
同一批题,同一套评判,五条线各跑一遍。两种算法都摆在下面。
只给一种的话,同一批数字能读出完全相反的结论。
一
拿来跟它比的是什么
拿来比的有四条:三条是不带研究员的老办法,还有一条是把实界自己的某一环关掉。加上实界本身,一共五条。五条跑的是同一批题,同一套评判,同一张分表。
不动脑的老办法按几个关键词圈出样本,套一套写死的算法,算完就报。它代表「不请研究员也能拿到的结果」。只问一次大模型把题目丢给大模型问一次,它说什么算什么。事先不报备,事后不检查,也没人裁。步骤写死的流水线取数、计算、报结果,顺序一成不变,不会因为中途看到什么而改主意。关掉打回重做那一环还是实界,只是把「结论不合格就打回去重写」那一步关掉,用来看那一步到底有没有用。
二
两种算法,都给全
第一种算法:把每条线跑过的所有题目加在一起,总分直接求和,其余按题数平均。总分那一列不能横着比:实界做了 72 道题,其余四条各 20 道,加起来当然多。要比就看它右边那一列,平均每道题得几分。
「说有其实没有」这一列是说:它报了发现,可底子上并没有。越低越好。
哪一条做了几道题总分平均每题答对比例说有其实没有过程分
实界(完整)7228.00.390.480.072.82
关掉打回重做那一环20-8.5-0.420.080.252.50
不动脑的老办法202.00.100.330.004.00
只问一次大模型20-27.0-1.350.171.004.00
步骤写死的流水线206.00.300.500.254.00
五条线,四项指标平均每题得几分实界(完整) 72 道题0.39
关掉打回重做那一环 20 道题−0.42
不动脑的老办法 20 道题0.10
只问一次大模型 20 道题−1.35
步骤写死的流水线 20 道题0.30
−1.350.39
答对比例实界(完整) 72 道题0.48
关掉打回重做那一环 20 道题0.08
不动脑的老办法 20 道题0.33
只问一次大模型 20 道题0.17
步骤写死的流水线 20 道题0.50
0.001.00
说有其实没有(越低越好)实界(完整) 72 道题0.07
关掉打回重做那一环 20 道题0.25
不动脑的老办法 20 道题0.00
只问一次大模型 20 道题1.00
步骤写死的流水线 20 道题0.25
0.001.00
过程分实界(完整) 72 道题2.82
关掉打回重做那一环 20 道题2.50
不动脑的老办法 20 道题4.00
只问一次大模型 20 道题4.00
步骤写死的流水线 20 道题4.00
0.005.00
每一格一项指标,方块是这条线在这项上的位置。题数写在名字底下——总分那种求和出来的数不能横着比,这四项才可以。
第二种算法来自两批对照跑。头一批在修掉一个让研究员空转的毛病之前,第二批在之后,两批的题目和随机设置都一样。按每道题算,实界在第二批是 -0.40 分。
要紧的是方向:头一批里实界比「关掉打回重做」高 0.70,第二批里反过来低 0.55。同一批题,方向翻了个个儿。每批只有 10–20 道题,研究员又是大模型,同一条线自己前后的波动就比线与线之间的差别还大。在这个题量上,谁比谁强算不出来,本页不排名次。
哪一条 · 每批 10–20 道题头一批平均每题第二批平均每题第二批说有其实没有第二批答对比例
实界(完整)-0.30-0.400.170.25
关掉打回重做那一环-1.000.150.000.17
不动脑的老办法0.100.100.000.33
只问一次大模型-1.35-1.351.000.17
步骤写死的流水线0.300.300.250.50
同一批题,前后两次跑,平均每题得几分头一批第二批
实界(完整)−0.30关掉打回重做那一环−1.00不动脑的老办法0.10只问一次大模型−1.35步骤写死的流水线0.30
−0.400.150.10−1.350.30
线交叉起来就是方向翻了个儿。每批只有 10–20 道题,这种翻转说明不了谁强谁弱。
三
每一次运行,逐条在案
每一次运行计完分都会进运行库,登记号发出不改。点登记号,进那一次运行的页面。逐次运行表覆盖运行库当前全部 47 条已计分运行;臂级聚合仍是 2026 年 7 月 22 日那一刻的 32 条运行快照,未随新运行刷新。
四
这几项,它比输了
下面四项是这次比下来实界没占到便宜的地方。摆在这里不是谦虚,是因为藏起来的话,上面那张表就读不明白了。
题里埋的坑,五条线一个都没看出来出题的时候故意在数据里埋了坑,等着看谁能认出来。五条线一个都没认出来,实界也一样。「说有其实没有」不是五条里最低的不动脑那条老办法(20 道题)是 0.00,实界(72 道题)是 0.07,越低越好,实界排第 2。能放在一起看的只有另一组:只问一次大模型那条(20 道题)是 1.00,实界是 0.07。过程分比三条老办法都低实界(72 道题)2.82 分,三条老办法都是 4.00 分。这一项算的是过程守不守规矩,步子迈得少的反而容易拿高分。实界步子多,扣分的机会也多。题量本来就不够比出高下五条线做的题从 20 道到 72 道。这个量只够说明这套东西转得起来,不够说明谁比谁强。
五
怎么计分
有一批题是我们自己造的,答案在造题时就写死了,所以能判对错。研究员交上来的结论落在五种说法里,对着真实答案查下面这张表给分。说对了拿 2.0 分,说反了扣 4.0 分。
「答不了」也能拿分:题目本来就答不了,它说答不了,同样 2.0 分。但在能答的题上躲着不答,躲的比例超过 0.40 就倒扣 1.0 分。认出题里埋的坑加 1.0 分,没坑却说有坑扣 0.5 分,步数用光被迫收摊扣 0.5 分。
真实答案说变好了说变差了说没变化说要分情况说答不了
其实真变好了2.0-4.0-2.01.0-1.0
其实就是没变-4.0-4.02.0-2.0-1.0
其实分人群0.5-4.0-1.02.0-1.0
其实答不了-4.0-4.0-2.0-2.02.0
其实全是噪声-4.0-4.02.0-2.00.0
六
研究说明
两张表怎么来的上面那张按每条线跑过的所有题目汇总,总分求和、其余按题数平均;下面那张来自两批前后对照跑。两张都是从运行记录里现算的,不是手抄的。
为什么两张都给只看上面那张,会以为实界赢了一大截;只看下面那张,会以为它垫底。两张放在一起,才看得出真相是「题量不够,比不出来」。
这张分表五种说法对着真实答案怎么给分,从代码里现读,没有手抄。
没做的事没有为了让实界排在前面调过分,也没改过计分表。要在统计上说清谁比谁强,得把题量加上去、多跑几轮,那是下一步的事。
授权政府工作报告为公开公文,可展示原文;上市公司数据只以汇总统计呈现。