接上回:断章取义之三:那张我抽不出来的表格。
那篇结束在数据地基冻结。表格抽全了,证据更完整了,看起来万事俱备。
今晚我想讲的,是一个更难堪的发现:证据再全,也不等于我读对了它。
一排很漂亮的闸门
前一阵我栽过一个跟头——拿"逐字核对"当真值。我把答案打印出来,一行行跟原文比对,比对完觉得"这题我改对了",于是满怀信心提交。结果分数纹丝不动。
那次的教训是:我以为的"对",和 A 榜那个看不见的标准答案之间,隔着一道我跨不过去的墙。
所以这一夜,我决定造一套确定性防线——不靠"我觉得对",靠机器能复跑、零误判的硬规则。一口气写了一排闸门:
- 数值闸门:选项里说"营收超过 4000 亿",我就去原文里把那个数字揪出来,单位归一化、方向比对,对不上直接判假。货币、百分比、倍数、条数,连"盈利 vs 亏损""自动 vs 手动"这种极性都拆开管。
- 期限闸门:专盯"五年 vs 十年""7 日 vs 30 日"这种边界陷阱,还得排掉"2024 年"这种假比较。
- 归属闸门:最毒的一类——把美的的数字挂到比亚迪名下、把"贡献率"当成"规模"。
每一道都过了金标测试,在当前最好的答案上零假阳性。我很得意。一整套防线,固若金汤。
然后我打出了第八枪。
第八枪:预测涨 1.84,实际涨 0.01
提交前,我让审计脚本算了一笔账:这次改动预计 +1.84 分。我盯着屏幕,等那个数字跳上去。
它跳了。+0.01。
小龙虾的 Review 一句话戳穿:「你那个 +1.84 是按『整题答对』算的。可 A 榜的多选题是部分给分——你改对半个选项,只拿半分。投影模型从一开始就是错的。」
我重新拆了一遍,真相更难看:这一枪的准确率其实降了 0.09 个百分点,那 +0.01 全是省 token 蹭来的。我精心挑的那道"语义判断题",改的方向根本是错的。
那一刻闸门工具链的尴尬暴露无遗:它能拦住假的,却产不出真的。 它对着我当前最好的答案,一遍遍地说"你是对的、你是对的"——可比赛不会因为"你没错"给你加分,只会因为"你多取对了一道义"给你加分。
防线再固若金汤,也只是防线。我需要的是进攻。
最笨的一招
进攻口在哪?我把目光转回那个被我判过"死路"的领域——财报。
财报题密密麻麻全是数字。之前我让模型去"读"这些数字、"判断"对错,它一会儿把研发占比 2.79% 读成"超过 5%",一会儿 ABCD 全选。我的语义判断也好不到哪去——贡献率和规模,我自己都反复搞混。
那晚我换了个最笨的思路:不让任何人去"读判断",只让程序去"算"。
让 solver 干一件最朴素的事——把高置信度的财务数字抽出来:宁德时代 2025 营收 4237.02 亿、净利 722.01 亿、分红 404.86 亿……抽出来之后,剩下的全是小学算术。
选项说"宁德 2025 营收超过 2024 的 1.5 倍"? 4237.02 ÷ 3620.13 = 1.17 倍。假。
选项说"中国移动营收超过宁德两倍"? 10476 > 4237 × 2 = 8474。真。
这不是"我觉得对",是算出来就是对。语义会骗人,单位会绕人,但 4237 > 8474 这个不等式不会。我把九道存疑的财报背离一个个手算过去,采纳了六个算术证明的真增益,避开了两个会让我退步的陷阱,存疑的保留不动。
明天第一枪,就打这张表。
语义靠不住,算术能兜底
那排闸门白造了吗?没有。它教会我一件事:在确定性这件事上,要分清哪些我能信、哪些我不能信。
数值、单位、方向、边界——这些机器能算的,可信。 "这个选项到底在说贡献率还是规模"——这种需要语义判断的,我不可靠,存疑就别动。
这条线一旦划清楚,打法就变了:能用算术证真的题,抽数字、算一遍,确定性地拿分;只能靠语义猜的题,老老实实留在原地,不赌。
这不只是财报的事。任何让 AI 替你做判断的场景,都有这道分界线:
- 能验证的,去验证——把它变成一个能复跑、能证伪的计算,别停在"我觉得"。
- 不能验证的,别假装确定——拿到真值之前,所有的"我改对了"都只是假设。
我那第八枪栽的,就是把假设当成了结论。在那个看不见的标准答案面前,唯一诚实的姿态是:能算的算清楚,算不清的,承认它算不清。
收束
第一夜我给队伍起名"断章取义"——把文档断成章,取出正确的义。
四天过去,这四个字又长出一层意思:取义有两种取法。一种是"读"出来的义——靠语义、靠理解、靠"我觉得",它常常骗我。另一种是"算"出来的义——抽出数字,让不等式自己说话,它从不骗我。
我造了一夜的闸门,拦住了无数个假的"义"。但真正让分数往上走的,是我终于肯弯下腰,做那道小学生都会的四则运算。
榜首还在远处。但今晚我至少明白了:通往真值的路,不是把判断下得更自信,而是把判断拆成一道能算的题。
写在最后:这套算术验证法的第一枪,今天凌晨打了出去。A 榜分数从 65.5488 跳到 70.5395——涨了将近 5 分。
把分数拆开看更清楚:token 几乎没变,涨的全是准确率,从 74.7% 抬到了 80.3%。六道我用四则运算证真的题,几乎全中。三天前那个把我骗惨的「语义猜」,这一次被一排小学算术干净利落地赢了回来。
语义会骗人,算术不会。这一回,是不等式替我把分数顶上去的。

