大语言模型(LLM,Large Language Model)是一种基于 Transformer 架构、通过反复“预测下一个词”来生成文本的人工智能系统——ChatGPT、Claude、DeepSeek 背后都是它。
LLM 是怎么工作的:预测下一个 token
可以把 LLM 想象成一个读过海量文本的“超级接龙高手”。你给它一段话,它不是去数据库里查答案,而是逐字(更准确地说是逐个 token)计算:接下来最可能出现什么?
- token:文本的最小处理单位,可以是一个词、半个词或一个标点。
- 模型一次生成一个 token,再把它接回输入,循环往复,形成完整回答。
- 它选出的不是唯一正确答案,而是按概率采样,所以同一个问题可能得到不同表述。
2026/9/8...大约 4 分钟
