探针 11|o1 为什么「想」得久,能答得更对

有的 AI,回答前会先「想」很久
你可能注意到了:同样是问 AI 一道数学题,有的秒答,有的会先「想」很久。
你把问题丢进去,它不急着给答案,而是先在内部跑一遍推理——「先把这道题拆成两步……」「这里有个陷阱,得换个方法……」「再验算一遍……」——嘀嘀咕咕半天,最后才亮出答案。OpenAI 的 o1、DeepSeek 的 R1,就是这种风格。(o1 只给你看一段推理摘要,原始过程藏在后台;R1 更直接,整段思路都摊给你看。但不管看不看得见,那段推理它确实在跑。)
更怪的是:它在那段过程里花的时间越长、字写得越多,最后答得往往越对。
普通模型是「快答但容易错」,这种模型是「慢答但答得准」。为什么想得久,就能答得更对?这篇就拆它。
先分清:普通模型 vs 推理模型
要把这事讲清楚,得先分清两类模型。
我们前 10 篇讲的,大多是普通模型:你问它一句,它一个字一个字往外蹦,蹦完就完事,蹦的过程就是它的全部「思考」。它快,但碰到数学、逻辑、代码这种得绕几道弯的硬题,容易出错——因为下一步该往哪拐,它是一边蹦一边临时决定的,没有「先想清楚再开口」的余地。
而 o1、R1 这类,行话叫推理模型(reasoning model)。它的关键差别不在「更聪明」,而在它会把推理过程一步步写出来——先写思路、再列步骤、写完验算,最后才给出答案。这串先于答案、不计入最终输出的推理过程,有个名字,叫思维链(Chain of Thought,缩写 CoT)。

所以「想得久」,本质是想的内容多——那一大段推理过程,是一长串思维链。
关键:每一步推理,仍是「猜下一个字」
这里有个最容易想错的点。
看到推理模型吐出那么长一段思路,很多人会以为:它是不是先在脑子里想好了整段推理,再一口气写出来?
不是。它写那段推理,跟我们前几篇讲的没有任何区别——还是一个字一个字往外蹦,每蹦一个字,都是一次探针 1 讲过的「猜下一个字」(也就是 next-token,探针 3 讲过)。
打分、变成概率表、采样抽签——这套机制一个没换。区别只在于:普通模型拿到问题就直接蹦最终答案,推理模型先蹦一长串推理步骤,蹦完才蹦答案。
换句话说,思维链里的每一步「先看条件、再列方程、再求解」,每个字都是模型照概率表抽签抽出来的,并不是事先想好。但只要这一步一步往下推的过程足够长,错的地方它能在后面的步骤里自我修正、回头重来——这就是为什么写得越长,越容易绕到正确答案。

到这一步,因果链就清楚了。
因果链:想得久 = 多生成 token = 多烧算力 → 答得更对
把这条链子串起来:
想得久,意味着模型生成的推理 token 多(探针 2 讲过,token 是模型处理的最小单位,一个字约等于一个或几个 token);token 生成得多,意味着这次推理烧的算力多;算力烧得多,模型就有更多「回合」去拆解、试错、验算,最后答得更对。
这套「推理时多烧算力来换更高准确率」的做法,有个正式名字,叫 test-time scaling(推理时缩放,也叫 scaling test-time compute)。它和探针 3 讲过的 Scaling Law 是两码事——Scaling Law 说的是训练时多花算力(多喂数据、多堆参数),模型更强;test-time scaling 说的是推理时多花算力(多生成推理步骤),同一次回答能答得更对。

这就是 o1、R1 这类推理模型的全部秘密:它没有换脑子,只是把推理过程从「藏在肚子里」搬到了「写在纸上」,让原本一次性的快答,变成可以反复试错的长考。
顺带呼应一下探针 5:思维链要一步一步写、占着上下文窗口,写得太长还可能把前面的内容挤出去——所以推理模型更费 token、更贵、也更慢。这钱花在哪了?就花在它「想」的那一大段上。
至于它怎么学会推理的,留给探针 3
讲到这里,因果链已经答完了:「想得久 → 多生成推理 token → 多烧推理算力 → 答得更对」。
你大概还会好奇另一件事:模型又不是天生就会一步步推理,它是怎么学会写思维链的?这部分(强化学习怎么把推理能力练出来)属于训练侧,是探针 3「大模型是怎么炼出来的」的领地,这里就不抢了。你只要知道:推理模型的训练方式和普通模型有差别,但它回答时用的那套机制——猜下一个字、采样抽签——和普通模型一模一样,没有换底层。
这根探针挖到了什么
一个「o1 为什么想得久能答得更对」的疑问,底下连着这条因果链:推理模型把推理一步步写成思维链,而每一步仍是探针 1 的「猜下一个字」;想得久 = 多生成推理 token = 多花推理算力,这就是 test-time scaling;算力花得多,模型就有更多回合试错、验算,答得更对。
这一趟,推理模型、思维链(CoT)、test-time scaling 这些词,你都摸过了。以后再看到「o1 想了 5 分钟才答」,你大概就知道:它不是在「卡」,是在用更多的推理算力,换更高的正确率。
到此,11 根探针全部扎完了。
从「答案为什么每次都不一样」起手,一路挖到了采样、token、训练、循环、长上下文、多模态、Agent/RAG/MCP、Context 工程、MoE,直到今天的推理模型——11 个你最常撞见的现象,底下连着的是同一套底层机制。
但还有两个最底层的概念,前面每篇都绕不开、却一直没正面拆过:Attention(注意力)和 Transformer。模型凭什么「看懂」一句话里哪个词跟哪个词有关系?Transformer 那一整套结构到底在算什么?接下来两篇总成,就把地基打牢。下回聊。