
好配资炒股开户线上
你有没有想过这样一件事:一个学生做数学题时,写了满满三页演算过程,划掉重写了好几次,还不停地说"等等,我再检查一下","也许我搞错了"。你会觉得这个学生很认真,思考很深入。
但如果这个学生最后答案还是错的呢?
这正是当下最火的AI推理模型面临的一个尴尬处境。
2024年底到2025年,OpenAI的o1、DeepSeek的R1、阿里的Qwen3这些"会思考"的模型,横空出世。它们不再是问一句答一句,而是会先啰嗦地自言自语一大段,把问题拆开、试几种思路、检查一遍答案,最后才给出结论。这种长长的思考过程,业内叫它"推理轨迹"
推理轨迹:模型在给出最终答案之前生成的完整思考过程文本,通常包含中间步骤、假设、验证等内容
看起来,这些模型确实更聪明了,在很多榜单上分数也更高了。但卡内基梅隆大学和斯坦福大学的一组研究者,提出了一个刁钻的问题:这些模型看起来"想得更多",但它们想的内容,真的是让答案变得更准的那部分吗?
这篇论文的答案相当扎心:不一定。
有些行为,模型做得越来越多,但跟做对题几乎没关系。有些行为,模型几乎没有变化,但恰恰是决定对错的关键。这两组行为,几乎没有重叠。
问题到底难在哪
先说清楚为什么这事儿不好判断。
以前评价一个AI模型好不好,很简单,看它答对了多少题就行。但现在的推理模型会写一大段思考过程,这段过程到底有没有用,没法只靠最终的对错来判断。
打个比方,你去看一场足球比赛,最后比分是2比1,你能说赢的那队每一次传球、每一次跑位都是正确的吗?显然不能。同样的道理,一个AI模型最后答对了,不代表它推理过程中的每一步、每一种"思考行为"都对结果有帮助。有可能它蒙对了,有可能它绕了一大圈弯路才凑巧走到正确答案上。
问题的核心在于,我们没法把"模型表现出某种行为的频率"和"这个行为对答对题目到底有没有用"这两件事分开看。
研究者们把这两件事拆开了,专门设计了一个指标来衡量后者。这个指标叫做"行为提升度"
行为提升度:衡量某个推理行为出现时,模型答对题目的概率,比这个行为不出现时高多少。数值越高,说明这个行为跟答对题目的关系越紧密
具体算法很直白:找到一个行为,比如"模型表达了不确定",统计一下模型表达不确定的时候答对的比例是多少,再统计模型没表达不确定的时候答对的比例是多少,两者相减,就是这个行为的"提升度"。
如果提升度是正的,说明这个行为出现时,答案更容易对;如果是负的,说明这个行为出现反而跟答错更相关。
这个指标本身不复杂,但用它去衡量九种不同的推理行为,结果却出乎意料。
九种推理行为:模型脑子里到底在干什么
研究团队参考了认知科学里关于"元认知"
元认知:对自己思考过程的认知和调控,简单说就是"想自己在想什么"。比如你意识到自己没听懂一道题,这就是元认知在起作用
的分类框架,把AI模型在推理时表现出来的行为,归纳成了九种,分成三大类。
第一类叫"控制调节",包括规划(把问题拆成步骤)、目标追踪(记住自己解到哪一步了)、假设检验(考虑不同的可能性)、自我修正(发现错了就改)。
第二类叫"监控判断",包括不确定性表达(说"我不太确定"之类的话)、自信校准(表达的自信程度跟推理的强弱是否匹配)、自我意识(知道自己有没有掌握足够的信息)。
第三类叫"知识锚定",包括证据引用(有没有引用题目里给的条件)、知识对齐(用没用对相应领域的知识框架)。
研究者请了GPT-4o充当裁判
LLM-as-judge:用一个大语言模型来给另一个模型的输出打分或做判断,这种做法在AI研究里越来越常见,因为很多评判标准很难写成固定规则
去给每一条推理轨迹打标签,看看每一种行为出没出现。为了确保这个裁判靠谱,他们还专门找了DeepSeek-V3、Gemini这些其他模型来做交叉验证,还找了人工来复核了一部分样本,结果显示裁判的判断跟人工判断的一致率高达95.1%。
这套流程一共标注了15282条推理轨迹,来自15个不同的模型,涵盖了从纯逻辑推理、数学题到多领域知识问答的6个测试基准。
工程量是够大的,但真正让人意外的是接下来的发现。
模型放大了什么?它检查、它假设、它犹豫
先说结果的第一部分:思考型模型跟普通指令模型比起来,到底哪些行为变多了。
研究者发现,有三种行为的出现频率被明显放大了:自我修正、假设检验、不确定性表达。这个放大幅度相当夸张。以自我修正为例,在思考型模型的回答里出现的比例是21%到55%,而在普通指令模型里只有3%到15%。假设检验和不确定性表达也是同样的模式,思考型模型的出现频率能达到普通模型的三到七倍。
而且这个差距不是偶然的巧合,在所有测试的七个模型家族、两种模态(文本和图文)、六个测试基准上都一致存在。换句话说,这是一个非常稳固的规律:只要一个模型被专门训练成"会思考"的样子,它就会明显更频繁地表现出这三种行为。
但奇怪的是,另外六种行为几乎没有被放大。规划、目标追踪、证据引用、知识对齐、自我意识、自信校准,这几项在思考型模型和普通模型之间的差别很小,有些指标上甚至普通模型表现得更好一点。比如在数学基准MATH-500上,思考型模型的自信校准分数是66.1%,普通模型反而是67.9%,普通模型略胜一筹。
这个发现本身已经足够有意思了:训练"让模型多想想",居然只对特定几种行为起作用,剩下的行为纹丝不动。
悖论浮现:被放大的行为,恰恰是没用的行为
现在到了这篇论文最核心的发现。
研究者把上面那九种行为的"行为提升度"都算了一遍,结果让人愣住了。
被放大得最厉害的三种行为,自我修正、假设检验、不确定性表达,恰恰是提升度排名最低的三种。尤其是不确定性表达,它的提升度是负的,在图文任务里是负16.1%,在纯文本任务里是负13.9%。
也就是说,模型越是表达"我不太确定",反而越容易答错。
而提升度最高的几种行为,反而是训练几乎没有放大的那几种。排在第一位的是自信校准,在图文任务里的提升度高达72.2%,纯文本任务里高达79.6%。这意味着当模型的自信程度跟它推理的强弱真正匹配起来时,答对的概率能高出接近八成。排在第二、第三位的是自我意识和知识对齐,提升度也都在50%到80%之间。
这就是这篇论文最扎心的地方:模型训练放大的东西,恰好不是决定对错的关键;决定对错的关键,恰恰是训练没怎么触碰的那几项。
论文管这个现象叫"放大与提升的鸿沟",作者画了一张图,把这九种行为按照两个维度画在坐标系里,横轴是被放大的程度,纵轴是提升度,结果整个右上角,也就是"既被大幅放大又高度有用"的那个区域,是空的。没有一个行为同时满足这两个条件。
这个画面挺有冲击力的。你花了力气去训练一个模型,让它表现得更"会思考",结果它确实变得更爱检查、更爱假设、更爱表达犹豫,但这些新增的行为,跟它到底能不能做对题,几乎没关系,甚至有点反效果。
自信校准和不确定表达:两个容易混淆但完全不同的东西
这里有必要把两个听起来很像、但本质完全不同的概念说清楚。
不确定性表达,就是模型嘴上说"我不确定"、"这可能有问题"、"我有点困惑"。这只是一种表面的语言标记,说白了就是嘴上示弱。
自信校准,是模型表达出来的确信程度,跟它推理过程本身的可靠程度是否匹配。推理站得住脚的时候,模型表现得有把握;推理站不住脚的时候,模型表现得谨慎。这是一种内在的一致性,不是嘴上说说而已。
举个生活里的例子。有个同事跟你汇报工作,一种情况是他每说一句话都要加一句"我不太确定啊",哪怕是最基本的事实他也这么说,这是不确定性表达的滥用,信息量为零,因为他对什么事都一样犹豫,你根本分不清他哪句话是真的没底、哪句是习惯性谦虚。
另一种情况是,同事平时说话很干脆,但一旦碰到他自己也没把握的部分,会明确告诉你"这块我没查证过,可能有误"。这种表达才是有信息量的,因为他的犹豫是有区分度的,跟着实际的把握程度走。如果他从不区分,永远一副胸有成竹的样子,你就没法在关键时刻知道该不该多留一个心眼,这就是不校准带来的代价。这才是自信校准想描述的东西。
论文里给出的证据也很直接:在那些"蒙对了答案但推理过程其实是错的"的案例里,自信校准这个行为几乎不出现,只有3.4%到7.6%;而在推理过程真正靠得住的案例里,这个行为出现的比例高达94.7%到95.9%。说明自信校准这个信号,追踪的是推理本身的质量,不是简单地跟着最终答案的对错跑。
排除"这只是碰巧"的可能性
发现一个反直觉的结果,第一反应应该是怀疑这是不是统计上的巧合,或者是不是被某些混杂因素带偏了。研究者显然也想到了这点,做了好几层检验。
第一层检验是同题对比。他们让同一个模型针对同一道数学题生成8个不同的答案版本,然后专门比较"这道题里出现某个行为的版本"跟"没出现这个行为的版本",看准确率差多少。这样就排除了"某些题目本身简单,模型自然表现得更自信也更容易对"这种干扰。结果依然一致,自信校准的优势稳稳地保持在正0.3到正0.5之间,而不确定性表达几乎为零甚至轻微为负。
第二层检验是标签噪声测试。既然裁判打标签,标签就可能出错,那如果人为往标签里随机注入5%到20%的错误,这个排序会不会崩掉?结果显示,即使故意注入20%的随机错误,自信校准和知识对齐依然稳稳占据排名前列,不确定性表达依然稳稳垄底。只有假设检验这一项因为原本提升度就接近零,排名稍微不稳定,其他都很稳固。
第三层检验是隐藏层探针分析。研究者甚至打开了模型内部,用一种叫线性探针
线性探针:一种简单的分析工具,通过在模型内部某一层的隐藏状态上训练一个线性分类器,来检验某个概念是否已经被模型编码进了它的内部表示
的技术去看模型的隐藏状态里,是否真的编码了这些行为。结果发现在做错的题目里,知识对齐和目标追踪这类高提升度行为,在模型内部的表示里更容易被解码出来,而假设检验和不确定性表达这类低提升度行为则更难被解码。这说明这个排序不是裁判凑巧编出来的一套说辞,模型内部真的存在这种结构性的差异。
三层检验叠加起来,基本可以确认这不是巧合,是一个相当稳固的现象。
恢复力:思考型模型到底赢在哪儿
既然被放大的那些行为没什么用,那思考型模型的准确率为什么普遍比普通模型高呢?这个问题论文也给了解释,答案是"恢复力"
恢复力:指模型在推理过程中已经犯了某种可检测的错误,但最终依然答对了的能力。用公式表达就是"在至少检测到一个失败模式的情况下,答对的概率"
研究者定义了七种"失败模式",比如逻辑错误、事后编造理由、抄近路跳过必要步骤等,只要检测到任意一种,就算作"出现了失败"。
结果发现,在那些需要大量步骤计算的任务上,比如数学题、纯逻辑题,思考型模型即便中途犯了错,事后修正回来、最终答对的概率,是普通模型的2到3倍。举个具体的数字,在MATH-500这个数学基准上,思考型模型的恢复率是40.8%,普通模型只有17.8%,翻了一倍还多。
但在另一类任务上情况反过来了。有一个叫LogiQA2的逻辑推理测试,考的是能不能迅速识别出论证结构,这种任务里普通模型的恢复率反而更高,24.5%比思考型模型的11.1%高出一倍多。
这个反差很值得琢磨好配资炒股开户线上。为什么同样是"多想
文章为作者独立观点,不代表配资365_配资巴士_手机股票配资观点