大语言模型是怎么学会“思考”的?

2026-08-27 08:25:30 · chineseheadlinenews.com · 来源: AURORA视界

大模型的“思考”是工程上的简写,泛指指模型生成、比较、检查和修正解题步骤的能力。它不等于模型拥有人的意识,也不代表模型公开写出的每一步都是可靠的内部推理。

同一道题,普通聊天模型可能张口就答;换成推理模型,它会先停一会儿,再给出拆解、计算和检查后的结果。

这很容易让人产生一个印象:模型以前只会接话,现在突然学会思考了。

真实过程没那么神秘。大模型的能力像一名学生逐步长出来:预训练让它读了大量材料,指令微调教它怎么答题,偏好对齐让它知道什么回答更合适,强化学习再用奖励反复调整解题策略。到了实际使用时,系统还可以多给它一些计算时间,并接上搜索、代码和验证器。

它没有被塞进一颗“逻辑芯片”,而是在训练和反馈中,学会了更容易拿到高分的解题路线。

01|先看全程:能力不是一次训练出来的

今天常见的推理模型,大致会经过几类训练和运行阶段。

预训练 → 指令微调 → 偏好对齐 → 推理强化 → 推理时计算

这条线不是所有厂商都照抄的统一配方。有的阶段会合并,有的模型会加入蒸馏、合成数据、工具训练或多轮筛选。理解它最省事的方法,是把各阶段看成不同课程。

预训练负责“见多识广”;

指令微调教答题格式;

偏好对齐纠正行为;

推理强化训练解题策略;

推理时计算则发生在考试现场,让模型多尝试几条路。

模型的推理能力是多阶段训练与运行机制共同作用的结果。

02|预训练:先学会“接下去最可能是什么”

大语言模型最基础的训练任务,是根据前面的Token预测下一个Token。

听起来很朴素,规模放大后却不简单。为了把下一个词猜准,模型要逐渐捕捉语法、概念关系、常见事实、写作结构和代码模式。读到“水在标准大气压下达到100摄氏度会……”,只背词频不够,它还得把温度、物态和语境关联起来。

可以把预训练想成让一个学生长期泡在巨型图书馆里。它看过教材、小说、论文和程序,脑中形成一张压缩后的关系网。但没人专门告诉它:收到用户问题时,应该先列条件、再计算、最后核对。

所以基础模型往往“知道很多”,却不一定按要求交作业。它可能续写问题、模仿网页语气,也可能给出看似流畅的错误答案。预训练铺好了知识和表示能力的底盘,离稳定的解题助手还有一段距离。

03|指令微调:先照着好答案练习

接下来是监督式微调,也常简称SFT。训练者准备一批“指令—回答”样本,让模型模仿高质量答案。

样本里如果包含分步解法,模型也会学习常见的拆题方式:先识别已知条件,再建立关系,算出结果后做检查。这像老师先示范几道例题,学生照着练,慢慢形成答题习惯。

2022年的Chain-of-Thought研究还说明了一件重要的事:对足够大的模型,只在提示词中放入少量带中间步骤的示例,也能把部分多步推理能力“引出来”。这里要分清,提示词是在使用阶段引导模型;SFT则会真正更新参数。二者都能改变回答方式,作用位置不同。

模仿也有上限。示范答案写错了,模型会学错;训练题覆盖不够,换个问法就可能失灵。更麻烦的是,文字很像推理,不代表逻辑真的成立。模型完全可能写出一串像模像样的步骤,最后只是把错误包装得更完整。

04|RLHF:让模型知道“哪种回答更合适”

只靠标准答案,很难覆盖开放式对话。两个回答可能都没有明显事实错误,但一个更清楚、更安全,也更符合用户意图。于是训练进入偏好对齐。

InstructGPT展示过一条经典RLHF流程:先用人工示范做SFT;再让标注者给多个回答排序,训练奖励模型;最后用强化学习提高模型获得高奖励的概率。Anthropic提出的RLAIF则把部分比较工作交给另一个模型,并用一组原则约束评价。

InstructGPT论文中的三阶段训练示意。它说明偏好数据如何变成奖励信号,再用于更新模型策略。

强化学习可以简单理解成“不给整套标准动作,只告诉你这次得了多少分”。模型不断尝试,逐步增加高分回答出现的概率。

但RLHF的高分通常混合了有用性、清晰度、安全性和人的偏好。人更喜欢一段自信、完整的回答,不代表其中每个推导都正确。RLHF擅长把模型训练得更像一个合格助手,却不会自动补齐所有逻辑能力。

05|为什么数学和代码成了推理训练场

推理强化真正容易发力,是因为数学和代码提供了更硬的尺子。

一道数学题的最终答案可以精确比对;一段代码可以跑单元测试。模型生成多条解题轨迹,答对或通过测试就得分,失败就扣分。训练不必为每一道题人工写出唯一的标准过程,这类方法常被称为可验证奖励强化学习。

DeepSeek-R1-Zero是一个典型公开案例。按论文和官方仓库的描述,它在没有先做SFT的情况下,直接从基础模型开始大规模强化学习,逐渐出现更长的推理、反思和自我验证行为。随后发布的DeepSeek-R1又加入冷启动数据和多阶段训练,改善可读性、语言混杂与通用表现。

DeepSeek-R1论文Figure 1。左图是作者报告的AIME准确率变化,右图是训练期间平均回答长度变化。

这像教学生解题时,不先规定必须写哪套公式,而是把大量可判分的题交给他。做对有奖励,做错再换路。训练久了,模型可能找到人类示范中没有明确写出的策略。

问题也随之出现:只看终点,模型可能走一条碰巧答对的歪路,或者利用评分器漏洞。奖励设计不严,模型学会的就不是推理,而是“怎么讨好裁判”。

06|过程监督:不能只看最后一格答案

结果监督只检查答案,过程监督会给中间步骤打分。

比如一道计算题最后得到42。结果监督只问42对不对;过程监督还会检查单位有没有统一、公式是否适用、第二步有没有把加法写成乘法。OpenAI在MATH数据集上的研究报告称,逐步奖励正确推理的过程监督,在该实验中优于只看最终答案的结果监督。

过程监督更细,却更贵。人工逐步标注耗时,自动过程奖励模型也可能判断错。工程上常把几种办法混在一起:最终答案或测试用例负责硬验收,过程奖励帮助选择路线,规则和工具再检查关键节点。

换句话说,终点要验票,沿途也要设检查站。

07|推理时计算:考试时多给几张草稿纸

模型训练完,并不代表一次请求只能走一条路。系统可以让它多生成几个候选方案、延长推理、调用计算器或代码,再用验证器挑选结果。这就是推理时计算,也叫测试时计算的一部分。

OpenAI在o1技术说明中称,模型表现会随训练阶段的强化学习计算量和使用阶段的“思考时间”增加而改善。这里的关键不是让回答写得更长,而是给模型更多机会分解问题、发现冲突和改换策略。

2026年Google Research的一项研究又补了一层解释。研究者发现,推理Token有时像计算缓冲区,让模型获得更多前向计算;中间生成的相关事实也可能起到“热身”作用,帮助召回目标事实。不过,推理中只要混入错误事实,最终答案就更容易被带偏。

Google Research用“尼泊尔第十位国王”的例子说明事实预激活。

因此,“多想一会儿”不是免费升级。它会增加延迟和Token成本,也不保证单调变好。简单分类题没必要跑长推理;高风险计算则不该只靠模型自检。

08|一个实战:让模型负责拆题,让程序负责验算

假设业务问题是:

“仓库有360件货,6名员工每人每小时处理8件。设备中途停机15分钟,8小时内能否完成?”

这类题对人不难,却很适合展示可靠推理的工程做法。

第一步,模型提取条件,并明确假设:停机期间所有人都无法处理货物。第二步,模型写出计算关系。第三步,不让模型自己相信自己,而是把数字交给Python或计算器复算。

有效工时7.75小时 → 可处理6 × 8 × 7.75 = 372件 → 余量12件

可处理372件,大于360件,所以能完成,余量是12件。如果模型文字结论与程序结果不一致,系统把差异送回模型重试;涉及排班或合同承诺时,再交给人确认。

模型擅长理解语义和拆解步骤,确定性程序负责算术验收;两者不一致时回到拆解阶段。

这套做法比要求模型“请认真思考三遍”可靠。提示词能提醒,工具能核验,流程能拦住错误。生产系统也不必公开模型完整的内部思维,只需保留关键假设、可核验步骤、工具结果和审计记录。

09|真正的推理能力,来自一套组合拳

回头看,大模型学会“思考”并没有一个单独开关。

预训练提供知识与模式,SFT给出示范,偏好对齐修正行为,可验证奖励强化解题策略,过程监督检查路线,推理时计算增加尝试空间。到了应用里,搜索、代码、验证器和人工审批又把模型能力变成可交付结果。

也因此,选推理模型不能只看“思考了多少Token”。更该看任务正确率、验证方式、失败成本、延迟和预算。客服分类可以快速直答;财务计算、代码修改和研究分析,应把证据、工具校验和人工接管一起设计进去。

模型能生成更长的推理轨迹,只说明它多铺了几块踏脚石。每一块是否结实,还得靠奖励、评测和外部验证来确认。

结语

大模型最初学会的是预测语言,后来才在示范、偏好和奖励中,逐步形成更有效的解题习惯。

所谓“思考”,与其说是机器突然醒了,不如说是训练者把答题、判分、复盘和验算做成了一套可重复的课程。也可以把大模型学会“思考”比作培养一名学生:预训练是让他泡在图书馆里大量阅读,指令微调是老师带着做例题,强化学习是通过考试分数不断纠正解题方法,而推理时计算则是在考场上多给他几张草稿纸和一次验算机会。所谓“思考”,就是他从“见过很多题”,逐渐学会“怎么拆题、怎么找路、怎么检查答案”。

真正可靠的AI推理,不是让模型独自想得更久,而是让它在该停顿时停顿,在该调用工具时调用工具,在该被检查时接受检查。


    24小时新闻排行榜更多>>
  1. 刘翔怼体育局:10年才想起安置我 分广告费咋不依规
  2. 营收翻倍、数据中心暴涨117%,英伟达还能狂奔多久?
  3. 那些显示你正在变老的“奇怪”迹象 你理解对了吗?
  4. 美国新增录取安全审查,8月15日生效
  5. 新加坡,为什么突然鼓励“讲华语”?
  6. 中国糖都,正在面临历史级大洪水
  7. 35年来从未见过:经济学家警告
  8. 尼泊尔山洪暴发前后卫星图对比,差异惊人!
  9. 外卖投毒者是蜜雪冰城员工?传百草枯中毒死亡逾4千人
  10. 毁灭性泥石流突袭中尼口岸
  11. 买折叠手机前,先算三笔账
  12. 中国年轻女性群体与“腋毛自由”潮流的背后
  13. 播客鼓吹战时拘禁所有华裔 3名华裔议员联合谴责
  14. 特勤局高官被FBI押出办公室 疑涉泄漏机密信息
  15. 泽连斯基感谢习近平发来独立日贺电 官媒集体沉默
  16. 癌症疫苗,真的要来了吗?
  17. 美财长出手 长债暂回稳 交易员不敢轻易与之作对
  18. 川普称伊最高领袖左半身重伤 美伊战争“很快”结束
  19. 吉隆泥石流现场救出2人,3人遇难558人失联
  20. 生一个孩子补37万:新加坡真急了
  21. 一个女生教170万直男谈恋爱:先学卫生 从洗头开始
  22. 8到10米,尼泊尔乡政府大楼被卷走
  23. 西藏泥石流致3死265失联 家属:妻子和项目部约60人失联
  24. 川普再次宣称:没有我,就没有以色列
  25. 政协副主席陈武本命年早夭 蓝天立还是许家印的杰作?
  26. 加州134年房价暴涨真相曝光
  27. 狗仔再曝包贝尔和惹火美女开房细节
  28. 刘翔在线二选一!体坛巨星退役后都在解锁哪些职业?
  29. 韩国济州岛3年失踪3000人?
  30. 专家分析:西藏吉隆泥石流灾害属特大型
  31. 65岁华女再闯川普海湖庄园 推着一车家当被捕
  32. 被曝“羞辱式劝退应届生”,星宇股份发致歉信
  33. “幸运又沉重的一天”,吉隆带客导游称换行程救了命
  34. 币圈大佬孙宇晨小作文全文《我的女友景甜》
  35. “牛来”跑在10万国产卡上
  36. 胰腺癌治疗重大突破!FDA批准新药 生存期近翻倍
  37. 原来华为真的可以光速捂嘴、为所欲为
  38. 哈里斯县警员涉违规与ICE“协作”被调职
  39. 卫星照太震撼 山洪为何如此恐怖 喜马拉雅正在发生什么?
  40. 尼泊尔山洪“100m高水墙直扑”,市场瞬间消失
  41. 中国女留学生在韩国遇害,嫌犯:分散抛尸250公里外
  42. 她亲手杀死3个儿女 却获大量民众支持 网友吵翻天...
  43. 苹果9.10发布首款折叠iPhone,开启特努斯时代
  44. 旅美“辱毛”雕塑家高兟被判监禁 妻儿被禁离开中国
  45. 中尼边境土石流“活埋人车”!增至95人罹难
  46. “你也是女人吧?”,农村还有多少“房主任”
  47. 油烟机油垢难清?这种方法一抹就亮!
  48. 江西省省长叶建春落马 传涉魏小东案 两任省长都出事
  49. 地铁迎来涨价潮
  50. “硬汉特工”上位:别让我11岁和9岁的儿子上战场
  51. 贝森特“救美债”,下一招是什么?
  52. 川普关税行动令共和党中期选举承压
  53. 2亿60后“谢幕”,中国再无此代人
  54. 加州新规见效:50万人成功删除网上个资
  55. 草原上的“Token工厂”:乌兰察布成中国AI算力心脏
  56. 纽约时报:中国人为何热情拥抱人工智能?
  57. CIA局长访俄目的曝,传警告"勿攻北约,少支持伊朗"
  58. 两大减肥药巨头竞逐中国市场
  59. 演技护体的蒋奇明,竟没躲过颜值“审判”
  60. 中印边界问题特别代表第25次会晤举行 公布8点成果