大模型

读了海量文字、学会不断猜下一个字的 AI;ChatGPT、Claude、DeepSeek 背后都是它

大语言模型(Large Language Model,LLM)是当下所有对话式 AI 的底座。它做的事情说穿了只有一件:给定前面的文字,预测下一个 Token 最可能是什么,然后把预测出来的接上去,再预测下一个,如此往复。所谓"和 AI 聊天",本质是这个循环跑了几百上千轮。

为什么"猜下一个字"能显得聪明

关键在于要把这件事做准,模型被迫学会了远超"文字接龙"的东西。要准确续写一段法律分析,它得掌握法条的结构;要续写一段代码,它得理解语法和变量作用域;要续写一句反问,它得读出上文的情绪。这些能力没有人显式教过,是在海量文本上压缩规律的副产品。

这也解释了它的能力边界:模型学到的是文本中呈现的规律,不是世界本身。语料里错的东西它会照学,语料里没有的东西它会用最像的模式补上——这就是[幻觉]的来源。

它是怎么造出来的

大致三步:

  • 预训练:在几万亿 Token 的公开文本上做下一个词预测。这一步吃掉绝大部分算力和成本,产出一个"什么都懂一点、但不会好好说话"的基座模型。
  • 后训练:用人工写的示范对话做监督微调(SFT),让它学会以助手的口吻回答;再用人类偏好数据做 RLHF / DPO,让它更有用、更少说危险的话。
  • 对齐与评测:反复红队测试、跑基准、调安全策略,然后才上线。

一句话:预训练决定它知道多少,后训练决定它好不好用

用的时候要知道的几件事

  • 它没有记忆。每次请求都是把完整对话重新塞进[上下文窗口]算一遍,模型本身不会因为你聊过而改变。所谓"记住我的偏好",是产品层把内容存下来每次重新拼进去。
  • 它按 Token 计费,输入和输出分开计价,输出通常贵好几倍。成本结构直接由此决定。
  • 它是概率性的。同样的问题两次问可能答得不一样,温度参数只是调节这个随机性的强弱,调到 0 也不保证完全一致。
  • 参数量不等于好用。同尺寸下,数据质量和后训练的差距往往比参数量的差距更能决定体验。

常见误解

"大模型在数据库里查答案"——不是。除非你显式接了检索(见 RAG)或联网,它给的每一个字都是当场生成的,包括那些看起来像引用的部分。

"训练一次就能一直更新"——不是。模型有训练截止日期,之后发生的事它不知道,需要靠检索或联网补。

什么时候会用到

讨论 AI 产品的能力上限、成本结构和失败模式时,几乎一切都要回到「它只是在预测下一个 Token」这个事实。

例句

  • 这个需求不用微调,大模型本身的能力够了,把 Prompt 写好就行。
  • 大模型不是查数据库,它是现编的,所以你得给它接检索。
  • 同样一句话它两次答得不一样很正常,大模型本来就是概率性的。

别混淆

别把「大模型」和「AI」划等号。图像生成、语音识别、推荐系统都是 AI,但它们不是大语言模型。

相关词