大模型基础

大模型如何生成回答

大模型并不是从数据库里取出一句现成答案,而是在上下文中逐步预测下一个 token。

大模型如何生成回答

大模型的核心工作可以浓缩成一句话:根据已经看到的上下文,预测接下来最合适的 token。理解这件事,很多“模型为什么这样回答”的问题就有了入口。

从文字到 token

模型不会直接理解汉字、单词或段落,而是先把输入切成一串 token。一个 token 可能是一个汉字、一个英文单词,也可能只是词的一部分。模型处理的是 token 序列,回答也会以 token 序列逐步生成。

上下文决定下一步

模型会综合提示词、历史对话和已经生成的内容,为下一个 token 计算概率。比如输入“太阳从___”时,“东边”通常比“数据库”更符合上下文。生成一个 token 后,它会把这个 token 放回上下文,再预测下一个。

输入上下文 → 计算候选 token 概率 → 选择一个 token → 更新上下文 → 重复

为什么同一个问题会有不同答案

模型并不总是选择概率最高的 token。温度、top-p 等采样参数会影响选择范围;上下文中的措辞、示例和顺序也会改变概率分布。因此,同一个问题出现不同表达是正常现象。

小结

把大模型看成“上下文条件下的生成器”,就能更准确地设计应用:控制输入上下文、限制输出格式,并对事实性结果增加校验。