什么是大语言模型(LLM)?一文看懂它如何工作
大语言模型(LLM,Large Language Model)是一种基于 Transformer 架构、通过反复“预测下一个词”来生成文本的人工智能系统——ChatGPT、Claude、DeepSeek 背后都是它。
LLM 是怎么工作的:预测下一个 token
可以把 LLM 想象成一个读过海量文本的“超级接龙高手”。你给它一段话,它不是去数据库里查答案,而是逐字(更准确地说是逐个 token)计算:接下来最可能出现什么?
- token:文本的最小处理单位,可以是一个词、半个词或一个标点。
- 模型一次生成一个 token,再把它接回输入,循环往复,形成完整回答。
- 它选出的不是唯一正确答案,而是按概率采样,所以同一个问题可能得到不同表述。
Transformer:让模型“看懂”上下文
2017 年 Google 提出的 Transformer 架构,是现代 LLM 的地基。其核心是自注意力机制(Self-Attention):模型处理每个词时,会同时衡量它与句子中所有词的关联强弱。
简单类比:读“狗追猫,因为它很害怕”这句话时,注意力机制帮助模型判断“它”指的是猫而不是狗。上下文越长,这种关联能力越重要。
LLM 的三个训练阶段
| 阶段 | 做什么 | 类比 |
|---|---|---|
| 预训练 | 在海量文本上学习预测下一个 token,掌握语言与常识 | 学生博览群书 |
| 微调 | 用高质量问答数据,教模型按人类期望的方式回答 | 上岗培训 |
| 对齐 | 通过人类反馈强化学习(RLHF)等,让回答更安全、有用 | 师傅带教 |
参数量(如 70 亿、700 亿)和训练数据量越大,模型通常越聪明,但成本也越高。
LLM 能做什么、不能做什么
擅长:写作与总结、翻译、写代码、头脑风暴、信息抽取、按指定格式整理内容。
局限:
- 会产生“幻觉”,编造看似合理但错误的信息;
- 知识截止于训练数据,不知道之后发生的事(除非联网或接入 RAG);
- 不擅长精确计算与实时控制,复杂推理也可能出错。
常见问题
LLM 真的理解它说的话吗?
LLM 并不像人一样真正“理解”语言,它通过统计规律预测下一个 token,但在足够大的数据和模型规模下,能表现出很强的语言与推理能力。
ChatGPT 和 LLM 是什么关系?
ChatGPT 是基于 LLM 的对话产品,GPT 系列模型是其背后的大语言模型;同类产品还有 Claude、Gemini、通义千问、DeepSeek 等。
为什么 LLM 会一本正经地胡说?
因为模型的目标是生成“看起来合理”的下文,而不是核实事实,这种现象叫幻觉,可通过 RAG、提示词约束和人工校验来降低。
总结
LLM 是基于 Transformer、以“预测下一个 token”为目标训练出来的文本生成模型;它能力强大但并非全知,会幻觉、有知识截止日期。理解这条底层逻辑,就能更清醒地使用它,也更容易读懂后面要讲的提示词工程、RAG 和 AI Agent。
