番外02 - 小硅学会了多想一会儿
大话 AI · 番外02 | 小硅学会了"多想一会儿"
上一篇聊了"越大越强"的Scaling Law。可2024年底出了件更炸裂的事:OpenAI的o1和DeepSeek的R1证明——不用把模型做得更大,只要让它"多想一会儿",就能强一大截。 相当于同一个学生,卷子一样,只是多给了他10分钟草稿时间
,成绩就从80飙到95。
🏫 以前那条路:训练时砸钱
咱们回忆一下上一篇讲的 Scaling Law——想让模型更强?三板斧:更多数据、更多参数、更多算力。这三样全是训练时花的钱。模型训完,能力就定死了;之后不管你怎么问,它的"脑子"不会临时变大。
打个比方:这就像高考前你拼命刷题、请家教、上冲刺班。钱和精力全砸在"考前",进了考场只能靠已有水平——考试时你想多坐半小时?对不起,铃一响必须交卷。
这就是"训练时 Scaling":训练阶段不惜代价,推理阶段(考试时)却没得商量。
可问题是,训练时砸钱这条路快走到头了——数据没那么多了,芯片贵到天际,电费账单能让 CFO 心脏骤停。大家开始想:有没有不用再堆训练成本、就能让模型更强的办法?
✏️ 新发现:考试时多给张草稿纸
2024年,研究者发现了一条新路——推理时 Scaling:训练阶段不动,在模型回答问题的那一刻,让它"多想一会儿",效果就能大幅提升。
类比考试就很清楚:
- 普通模型 = 看到题直接写答案。反应快,但数学大题经常漏步骤、算错数。
- 推理模型 = 先在草稿纸上列步骤、验算一遍、发现哪步不对、划掉重来、最后再把答案誊到答题卡。慢,但准。
这张"草稿纸",就是模型内部生成的一长串思维链(Chain of Thought)——它在正式给你答案之前,自己跟自己对话:先拆问题、列思路、试算、自查、修正,最后才输出结论。
举个例子,你问"17×24等于几",普通模型眨眨眼直接蹦个数字(还经常蹦错)。推理模型会在内部先"嘀咕"一段:"嗯,17×24……我可以拆成17×20+17×4……17×20=340,17×4=68……340+68=408。验算一下,400+8=408,没问题。"这段嘀咕你看不到(或者看到一个折叠的"思考过程"),但正是它保证了最终答案的靠谱。
还记得正文第 5 篇讲的吗?当时我们手动在 prompt 里写"请一步步思考"来引导小硅。那是你在帮它列草稿。而现在的推理模型,是它自己学会了打草稿——不用你提醒,碰到难题它会自动展开内心独白。
🤖 它怎么学会"慢思考"的?
关键问题来了:谁教它打草稿的?答案出人意料——没人教,它自己悟出来的。
OpenAI 的 o1 和 DeepSeek 的 R1,核心训练方法都是强化学习(RL)。大白话就是:
不告诉你怎么做,只告诉你做对了有奖、做错了扣分。你自己摸索。
DeepSeek 做了个很极端的实验叫 R1-Zero:拿一个普通模型,什么思维链范本都不喂,纯靠 RL 奖惩——答对加分、答错扣分。结果这家伙自己就"涌现"出了慢思考的行为:碰到难题时,它会自发地多输出一大段推理过程,来回验算,然后才给出最终答案。
没有人手把手教它"第一步做什么、第二步做什么"。就像一只鹦鹉,你只是每次它答对了给颗瓜子、答错了不给,它自己就琢磨出"先在脑子里多转几圈再开口"这条路——因为这样拿瓜子的概率更高。
"慢思考"居然可以自动涌现,这是2024年最让人兴奋的发现。
🔧 DeepSeek-R1 四步走
R1-Zero 虽然惊人,但毕竟是"野蛮生长"——思考过程有时啰嗦、有时绕弯、表达也不够规范。所以 DeepSeek 又走了四步把它精修成最终的 R1:
- R1-Zero(纯 RL):让模型野蛮碰撞,自己摸索出"想清楚再答"。
- 收集好答案当范本(SFT):从 R1-Zero 的输出里,挑出又准又清晰的回答,拿去做监督微调。
- 人类偏好再训一轮(RL + RLHF):让人类评判哪些回答更好,模型再学着对齐人的口味。
- 最终版 R1:既会深度思考,表达又干净利落。
一句话总结:先让它野蛮探索学会思考,再用标准答案矫正它的表达。 先放养再精修,野性和规矩都要。
💰 代价:时间和钱
天下没有免费的午餐。推理模型"多想一会儿"那段草稿,也是要吐 token 的——而且一吐就是几百上千个。这意味着:
- 响应更慢:简单问题普通模型1秒搞定,推理模型可能转圈20秒。你肉眼能看到它在"思考中……"。
- 费用更贵:token 就是钱,草稿 token 虽然单价会打折,但量大管饱照样烧钱。一道数学题的思考链可能比最终答案长十倍。
所以不是所有场景都该上推理模型。你问"帮我把这封邮件翻译成英文",它要是也展开三页草稿来"深度思考",那就是杀鸡用牛刀、浪费你的时间和钱。简单问题秒答反而更好,难题才值得让它慢慢想。
实际使用建议:数学推导、代码 debug、逻辑推理、复杂决策——开推理模型;日常聊天、翻译、摘要、格式转换——用普通快模型就够了。这也是为什么现在各家 AI 产品都在做"智能路由"——自动判断这题简单还是复杂,简单的走快模型,复杂的走推理模型,帮你省钱又省时间。

🎁 这一篇带走的
同一个模型,推理时让它多想一会儿,就能强一大截——这是"推理时 Scaling",2024-2025年最热的认知革命。 本质就是给模型一张草稿纸,让它先验算再交卷。代价是更慢更贵,所以要按题目难度"分配思考时间"。
下次你在 ChatGPT 里切到 o1 模式,看到它说"正在思考……"然后转了好一会儿圈圈——别急,它不是卡了,是在打草稿呢。
下一篇预告:DeepSeek 为什么"又强又便宜"?秘密在三招:混合专家(MoE)让大模型只激活一小部分、量化让模型"瘦身"、蒸馏让大模型教小模型——用一半的钱拿到八成的效果。