大模型靠海量文本练出了”下一句怎么接”的本事,但别把它当成懂世界的专家。弄清参数、训练、推理这三件事,你才不会神话它,也不会小看它。
它到底在做什么
剥离光环,大模型核心任务极朴素:给定前文,预测下一个最可能出现的词,再把这个词接上,继续预测。整段回答就是这么一词一词接出来的。它学的是语言的概率规律。所以大模型”懂”的只是语言模式,离世界真相差得远。它说的很多事听起来有理,是因为训练文本里这类表达多,不代表它真验证过。理解这一点,才不会把它的话当权威结论。
参数是什么
参数(权重)是训练过程中模型内部调整出的海量数字,是它”记忆”语言规律的地方。参数越多,模型能装下的模式越细,对复杂语义的把握越细腻。规模是能力的底座之一。但参数多不等于一定聪明,还要看数据质量和训练方法。别盲目追参数量,同样的参数下,干净数据加好方法能拉开一截;参数只是骨架,喂什么料、怎么练才决定长成什么样。
训练的两阶段
预训练用海量无标注文本,让模型学通语言规律和广博知识,这一步算力最重、周期最长,是”打底子”。此后的模型像个博览群书但没专项训练的通才。微调用特定任务或数据继续训练,让模型适配具体场景,比如按指令作答、按格式输出。前者管知识面的广度,后者管任务的贴合度,投入前先想清楚缺哪一块。
推理是怎么发生的
你提问后,模型进入推理:基于前文逐词预测,每步从候选词里按概率挑一个接上,直到结束。推理消耗算力,也决定响应速度与单次成本,是模型”干活”的时刻。推理有可调参数,比如温度:低温度更确定保守,高温度更发散创意。不同任务选不同温度,写代码时压低,跑 brainstorm 时放开,输出的性格跟着这个设置走。
它不会真懂的边界
大模型没有真实感官和经验,不”经历”世界,只处理文本符号。它答”太阳从哪边升起”,靠的是语料共识,并没有真的观测过。遇到训练里少见的真实因果,它会自信地编。所以面对需要真实验证、实时事实、专业判断的事,要当它”博学但不可靠”,用工具和人类把关补足。清楚边界,才不会在关键处被它的笃定带偏。
幻觉从哪来
幻觉根子在”预测下一个词”这件事本身:模型优先选概率高的续写,哪怕那是编的。当问题超出它的可靠知识,它仍会接着编出通顺但假的答案,因为它没有”我不知道”的硬开关。缓解靠外部约束:接检索让它基于真实资料答、在提示词里画红线、对关键结论要求溯源。理解幻觉的机理,才知道为什么 RAG 和约束能压住它,而不是指望模型自觉。
大模型和小模型
同一架构,参数少的叫小模型,参数多的叫大模型。大模型容量大、能力强但贵且慢;小模型便宜快、能本地跑,但复杂任务易露怯。选型看任务要多少”脑力”。蒸馏能把大模型能力迁移到小模型,让简单任务不必砸大资源。理解这层,你就不会凡事都上最大模型,而是按任务复杂度分层用模型,成本和体验才平衡。
和 Agent 的关系
大模型是 Agent 的”大脑”,负责理解与决策;Agent 在此基础上接工具、管记忆、跑流程。没有大模型,Agent 不会思考;没有 Agent,大模型只是会聊天的模型。理解这层,你就明白为什么 Agent 的能力上限受模型制约,也为什么光有大模型不够,还得有工程把它的”想法”落成”动作”,一个负责动脑,一个负责动手。
常见三个误解
误解一:模型懂世界,其实它只懂语言模式。误解二:参数越大越聪明,其实数据和训练同样关键。误解三:它说的都可信,其实它会自信地编。这三条其实说的是同一件事:把大模型当”概率续写器”,别当”全知专家”供着,边界清楚了,用起来自然有分寸。
怎么初步判断一个模型
看三件事:在你任务上的实测表现、单次推理成本、响应延迟。榜单排名只是参考,真落到你的场景跑一遍,才知道合不合用。模型好不好,用你的数据说话。还要看可控性:能否私有部署、能否调温度、是否有安全护栏。把这些纳入选型,而不是只看参数规模。理解模型本质,选型才不盲从。
图:大模型三件事核心要点
| 概念 | 是什么 | 注意 |
|---|---|---|
| 参数 | 训练所得权重 | 多≠一定聪明 |
| 预训练 | 学语言广博 | 算力最重 |
| 微调 | 学任务适配 | 两阶段分清 |
| 推理 | 逐词生成 | 温度控性格 |


