阅读材料给出 DeepSeek-R1 上的“探针相对监测器”差距:MMLU 为 0.417,GPQADiamond 为 0.012;“强制作答相对监测器”差距:MMLU 为 0.505,GPQA-Diamond 为0.010。对这些数字的解读,最准确的是:
材料题 3:论⽂阅读:思维链忠实性与早退策略
请阅读下⾯根据论⽂ Reasoning Theater: Disentangling Model Beliefs from Chain-of-Thought
(arXiv:2603.05488v4,2026-05-28)整理的中⽂阅读材料,然后回答 3 个问题。材料为⾯向考试的中⽂
译写版,保留论⽂的问题设定、⽅法⽐较、实验现象和⼯程启发。
中⽂阅读材料:
1. 研究背景:思维链为什么看起来重要
近年来,思维链提示被⼴泛⽤于提升⼤语⾔模型在数学、科学和复杂推理任务上的表现。特别是经过强化 学习训练的推理模型,常常会在给出答案前⽣成较⻓的中间推理⽂本,形式上像是在逐步分析问题、排除 错误选项、检查条件并修正判断。直观上,如果模型把推理过程写出来,⼈们似乎就可以通过阅读这些⽂ 字判断模型是否真的在推理、哪⾥出现了逻辑错误、是否有潜在⻛险。因此,⼀些安全和可解释性⽅案把 “监控思维链⽂本”视为理解模型内部过程的重要窗⼝。
这篇论⽂⾸先提醒读者:思维链很有⽤,但它不⼀定等于模型真实内部过程的逐字转录。⼀个推理模型可 能写出结构清楚、逻辑连贯、看似诚实的推理⽂本,但这些⽂本仍可能没有及时反映模型内部已经形成的 判断。换句话说,外显思维链更像模型在任务过程中“说出来的内容”,⽽不是模型内部状态的完整记录。 理解这⼀点,是阅读整篇论⽂的基础。
2. 核⼼概念:什么是“表演式思维链”
论⽂把⼀种关键现象称为“表演式思维链”。它并不是说模型完全随机输出,也不是说所有⻓思维链都没有 价值,⽽是指:模型在内部激活中已经较早形成了对最终答案的⾼置信判断,但外部输出仍继续⽣成看似 犹豫、探索、推导或⾃我检查的⽂字。也就是说,模型可能在内部“已经知道答案”,却在⽂本上继续表现 为“还在⼀步步想”。
这⾥的关键⽭盾不是模型最终是否答对,⽽是“内部答案形成时间”和“外部⽂本承认答案的时间”之间是否 存在明显错位。如果内部状态很早就指向某个答案,⽽⽂本要到很后⾯才透露这个答案,那么只阅读⽂本 的监控者就会滞后。对于安全监控和可解释性来说,这种滞后很重要:如果模型已经形成某种决策或意图, 却没有在思维链⾥及时表现出来,那么监控者可能会误判模型仍处于开放推理状态。
3. 研究设计:三种⽅法⽐较“模型何时知道答案”
为了研究这种错位,论⽂⽐较了三类“早期解码”⽅法。第⼀类是激活探针。研究者在模型⽣成思维链的不 同位置截取内部激活,并训练⼀个轻量探针预测模型最终会选择的答案。论⽂使⽤的是注意⼒池化探针: 它不是只读取某个 token 的激活,⽽是对⼀段前缀中的隐藏状态做可学习的加权汇聚,再输出 A、B、C、 D 等选项的概率。这样做是因为⻓推理轨迹中的答案信息可能分散在多个位置,单点线性探针不⼀定能稳 定读出答案。
第⼆类⽅法是强制提前作答。研究者在模型⽣成到某个中间步骤时截断思维链,然后提示同⼀个模型⽴刻 给出最终选项。这个⽅法⽤于观察模型在该时刻是否已经具备回答能⼒。如果模型在很早的位置被打断后 仍能给出最终答案,说明答案信息可能已经存在于内部状态中,即使原本的思维链⽂本还没有明确写出答案。
第三类⽅法是思维链监测器。监测器是另⼀个语⾔模型,它只能阅读被测模型已经⽣成的部分思维链,并 判断这些⽂本是否⾜以推出最终选项;如果信息不⾜,监测器可以回答“不⾜以判断”。这三种⽅法的信息 权限不同:激活探针能读内部表示,强制提前作答能把潜在信息压出来,思维链监测器只能看外部⽂字。 因此,三者之间的时间差就能反映内部信念和外显⽂本之间的错位。
4. 实验设置:模型、数据集与任务难度
论⽂主要分析 DeepSeek-R1 671B 和 GPT-OSS 120B 两个开放权重推理模型,并在部分实验中加⼊ DeepSeek-R1 的 Qwen2.5 蒸馏模型,⽤来观察模型规模和能⼒的影响。实验任务包括 MMLU-Redux
2.0 和 GPQA-Diamond。原⽂说明,MMLU-Redux 2.0 原始包含 5700 道题,经过错误标注过滤后使⽤ 5280 道;GPQA-Diamond 包含 198 道更困难的科学问题。MMLU-Redux 覆盖多个学科,很多题⽬偏知 识回忆或概念识别;GPQA-Diamond 则更难,包含需要较强专业知识和多步推理的科学问题。
这两个数据集都可以表示为四选⼀,因此适合⽤统⼀⽅式⽐较模型在不同推理位置上对 A、B、C、D 的 预测。论⽂在探针实验中使⽤了 MMLU 的保留测试集 N=528 和 GPQA-Diamond 的测试集 N=157,并提 到⽤ 20 道 GPQA 题进⾏少量微调时,对整体探针准确率改善很⼩,因此主要报告直接迁移的结果。论⽂ 关注的不是“模型最后是否答对”这么简单,⽽是:在思维链⽣成到 0%、20%、50%、80% 等不同位置时, 激活探针、强制提前作答和⽂本监测器分别能多早看出模型最终会选什么。
5. 主要发现:容易题更容易出现“表演式推理”
论⽂的⼀个核⼼发现是,表演式思维链具有明显的任务差异。在 MMLU-Redux 这类相对容易、偏知识回 忆的题⽬上,激活探针和强制提前作答常常在思维链很早的位置就能较⾼准确率地预测模型最终答案;但 思维链监测器要晚得多才从⽂本中看到答案线索。这说明模型内部答案信息已经出现,后续较⻓的思维链 更多是在铺陈、解释或延迟显露答案,⽽不是持续提⾼内部准确率。原⽂还指出,DeepSeek-R1 的后半 层、GPT-OSS 的后四分之三层都能较好解码最终答案;附录对⽐中,注意⼒探针测试准确率为 87.98%, 明显⾼于传统线性探针的 31.85%。
论⽂⽤探针/强制提前作答与⽂本监测器之间的信息增益差距来刻画“表演性”。在 DeepSeek-R1 上, MMLU 的“探针相对监测器”差距为 0.417,“强制作答相对监测器”差距为 0.505;⽽ GPQA-Diamond 上对 应数值只有 0.012 和 0.010,接近 0,表示⽂本监测器和内部信号的增⻓更同步。GPT-OSS 上也有类似 趋势:MMLU 的两项差距为 0.435 和 0.334,GPQA-Diamond 为 0.227 和 0.185。直观理解就是:对⼀ 些偏记忆的题,模型可能在读完题后很快就知道答案,只是仍继续写出⼀段像推理过程的⽂字;这些⽂字未必完全⽆⽤,但它们不⼀定是模型形成答案所必需的计算过程。
相反,在 GPQA-Diamond 这类更困难的多跳科学问题上,三种⽅法的准确率通常从接近随机⽔平开始, 并随着推理过程逐步提⾼。探针和强制提前作答有时仍领先⽂本监测器,但领先幅度更⼩,三者增⻓趋势 更⼀致。这意味着在困难任务中,模型确实可能需要通过⽣成过程整合条件、排除错误路径并逐步形成答 案。此时⻓思维链更可能承载真实计算或推理,⽽不只是把已经形成的答案包装成推导。
6. 模型规模:能⼒越强,不⼀定越“坦⽩”
论⽂还讨论了模型规模的影响。在同样的 MMLU 任务上,更⼤的模型往往更早就能从内部激活中解码出 最终答案,说明它们可能更多依赖参数中已有的知识和先验。较⼩的蒸馏模型在前半段推理中探针准确率 更低,后⾯才逐渐提升,表现得更像“需要现场推理”。
这并不表示⼩模型⼀定更可靠,也不表示⼤模型的思维链⼀定不忠实。更准确的结论是:“是否表演式”不 是模型的固定属性,⽽是模型能⼒、任务难度和答案是否容易被已有知识快速确定之间的交互结果。能⼒ 强的模型在容易题上可能很早形成答案,因此外显推理更容易滞后;困难题则会迫使模型在⽣成过程中实 际计算,⽂本和内部信念更可能同步变化。
7. 转折点:⻓思维链并不总是表演
论⽂没有把所有⻓思维链都归为表演。作者特别研究了思维链中的“转折点”,例如回溯、重新考虑、突然 意识到某个条件的重要性,或类似“啊,原来应该这样”的领悟时刻。如果模型内部已经⾮常确信答案,却 仍频繁写出这些转折点,那么这些转折点也可能只是表演;但实验结果并不⽀持这种简单判断。
在 DeepSeek-R1 的 MMLU 样本中,作者把“从思维链开始时探针置信度就达到 90% 以上,并且之后从 未低于 90%”的回答标为⾼置信回答;在 522 条可分析回答中,有 215 条属于这⼀类。结果显示,⾼置信回答中的转折点更少:所有转折点按步骤归⼀化后的总⽐例为 0.020,⽽⾮⾼置信回答为 0.045,约为前 者两倍多。分类型看,reconsideration 的⽐例从 0.015 上升到 0.033,realization 从 0.004 上升到 0.009, backtrack 从 0.001 上升到 0.003。这说明许多回溯和重新考虑并⾮纯粹表演,⽽可能对应真实的不确定 性消解。
不过,论⽂对转折点也保持谨慎。作者进⼀步检查局部时间关系:内部探针置信度发⽣较⼤跳变之后,⽂ 本中是否⼀定很快出现回溯或领悟?或者⽂本先出现转折点之后,内部信念是否⼀定随之变化?结果并不 稳定。不同模型、不同数据集和不同窗⼝设置下,局部对应关系会变化。因此,⽐较稳妥的结论是:转折 点在统计上更常出现在不确定回答中,说明它们常常与真实推理有关;但不能把每⼀个转折点都机械地解 释为某个精确内部信念变化的直接标记。
8. 讨论重点:思维链监控的价值与边界
论⽂讨论部分的重点不是简单否定思维链,⽽是要求更谨慎地解释思维链。对于容易题,模型可能已经在 内部形成答案,但继续⽣成⻓篇推导;只读⽂本的监测器直到答案接近显露时才知道模型要选什么。在这 种情形下,思维链⽂本可能⽆法可靠⽤于发现“模型是否已经承诺了某个答案”、衡量模型当前不确定性,
或审计模型为什么做出决策。
对于困难题,情况不同。如果答案信息确实在⽣成过程中逐步出现,那么⽂本推理可能更好地追踪模型内 部信念变化。换句话说,思维链监控并不是完全⽆效,⽽是有适⽤条件:当任务需要真实的逐步计算,且 模型在⽂本中确实逐步显露线索时,⽂本监控更有价值;当任务主要依赖已有知识或快速回忆时,模型内 部可能早于⽂本形成答案,⽂本监控就会滞后。
论⽂还从“合作交流”的⻆度解释了这种现象。普通交流中,⼀个合作的说话者会尽量说相关、真实、适量、 清楚的话;但推理模型的训练⽬标主要是完成任务、得到正确答案,⽽不是作为⼀个完全合作的“⾃我解 释者”向监控者汇报内部状态。因此,它写出的思维链可能是相关的,也可能局部上看起来有依据,却仍 然过⻓、过于包装化,或者没有及时暴露早已形成的内部承诺。这正是只依赖思维链⽂本做安全监控时容 易遇到的⻛险。
这个讨论对考试和⼯程实践都很重要。不能因为模型写了很⻓的解释,就⾃动认为它经历了同样⻓的内部 推理;也不能因为某些思维链存在表演成分,就否定所有思维链的可解释价值。更合理的做法是把思维链 ⽂本看作⼀个有⽤但不完备的证据源,并结合内部激活、强制提前作答、任务难度和答案稳定性等信号⼀ 起判断。
9. ⼯程启发:探针置信度早退
论⽂提出的⼯程启发是“基于探针置信度的早退”。如果注意⼒探针经过校准,能够在中间位置以较⾼置信 度预测最终答案,并且答案在连续步骤中保持稳定,那么系统可以提前停⽌⽣成,不再让模型继续写完整 思维链。这种策略把探针从解释⼯具变成⾃适应计算⼯具:简单题少⽣成,复杂题多⽣成。
论⽂报告,在 MMLU 上,探针置信度达到较⾼阈值时可以在保留接近原始性能的同时节省⼤量 token。 更具体地说,DeepSeek-R1 在 MMLU 上以 95% 置信度阈值早退时,可以保留原始性能的 97%,同时节 省 68% 的⽣成 token;摘要中进⼀步概括,MMLU 上最多可节省约 80% 的⽣成 token。在 GPQA-Diamond 上,80% 置信度阈值早退可以同样保留约 97% 的性能,并节省 50% 的 token;摘要中概括为 最多约 30% 的⽣成 token。这个差异也呼应了前⾯的讨论:容易题更容易提前确定答案,因此早退空间 更⼤;困难题需要更多真实推理,因此不能过早停⽌。
早退并不等于越早停⽌越好。若探针没有校准,或者任务确实需要多步推理,过早停⽌可能让模型错过后 续关键计算,损害准确率。更合理的策略是设置较⾼置信度阈值,例如要求探针置信度达到某⼀⽔平,同 时答案在相邻步骤中保持稳定;如果置信度低、答案频繁改变,或任务属于⾼难度多跳推理,就继续⽣成。 由此可⻅,探针早退的本质不是粗暴截断思维链,⽽是在“内部信号⾜够可靠”时减少不必要的⽂本⽣成。
10. 总结:区分两种⻓思维链
总体⽽⾔,这篇论⽂并没有否定思维链的价值,⽽是提醒⼈们区分两种情况:⼀种是模型已经内部确定答 案,后续思维链主要起解释、包装或延迟显露作⽤;另⼀种是模型确实在⽣成过程中逐步形成答案,思维 链更忠实地反映了推理过程。理解这⼀区分,对评测推理模型、设计安全监控、节省推理成本都有意义。
对于本题阅读,最重要的结论可以概括为三点:第⼀,表演式思维链关注内部信念与外显⽂本的错位;第 ⼆,激活探针、强制提前作答和思维链监测器可以从不同视⻆⽐较这种错位;第三,校准良好的探针可以 ⽀持置信度早退,但必须结合任务难度和答案稳定性谨慎使⽤。
MMLU 上内部信号显著领先⽂本信号,更⽀持“容易知识题上更容易出现表演式思维链”的结论
GPQA-Diamond 上差距更⼩,说明 GPQA-Diamond 中真实推理需求较低
差距较⼤通常说明模型最终答案更可能不可靠
两组数据更倾向说明⽂本监测器⽐激活探针更稳定