第一阶段:建立直觉 —— 详解
当然,如果你愿意花一点时间来了解下大模型的工作原理并尝试驯服它,这里便能作为一切的起点。
读完这篇,你会知道 LLM 到底是什么、核心概念怎么理解、以及如何上手使用。 预计阅读时间:30-40 分钟。
目录
从一个故事说起
假设你面前有一台神奇的机器。你往里面塞一张纸条,上面写着"从前有座山,山里有",机器嗡嗡响了几秒,吐出一张新纸条:"座庙,庙里有个老和尚在讲故事。"
你把纸条拿回来,又在末尾加上"老和尚说:",再塞进去。机器接着输出:"从前有座山,山里有座庙……"
这就是大语言模型(LLM, Large Language Model)最核心、最底层的运作逻辑:给定一段文本,预测接下来最可能出现的文字。
听起来很简单?简单到像是键盘上的自动补全功能。但被放大了几亿倍之后,这个"补全下一个词"的能力,演化出了翻译、编程、推理、创意写作等等令人惊叹的表现。
什么是 LLM
形式化定义
LLM(Large Language Model,大语言模型) 是一种基于深度学习的 AI 模型,使用海量文本数据训练而成。它的核心能力只有一件:根据已输入的文本,计算下一个词元(token)的概率分布,并从中采样生成输出。
拆解这个名字:
| 词 | 含义 |
|---|---|
| Large / 大 | 参数量巨大(亿级起步,千亿级也有),训练数据量巨大(万亿级 token) |
| Language / 语言 | 处理的是人类自然语言(英文、中文、代码也算"语言") |
| Model / 模型 | 本质是一个巨大的数学函数,输入数字序列,输出数字序列 |
它的本质是什么?
从程序员的角度看,LLM 就是一个函数:
输出文本 = LLM(输入文本, 参数1, 参数2, ...)函数的内部是几千亿个可调参数(weights),这些参数是"学"出来的,后面第三阶段会详细讲。函数每次运行都做同一件事:接收一串 token,预测下一个 token。
你可能会想:就这?预测下一个词就能写出诗、写出代码?
答案是:能。关键在于规模。
当模型读过几万亿 token 的文本(差不多是互联网上所有公开文字的总和),它从"预测下一个词"这个简单任务中,被迫学会了语法、事实知识、逻辑推理、甚至一些世界运作的规律。因为要准确地预测"北京是中国的___",你必须"知道"首都是北京;要预测 for i in range(10): 的下一个 token,你必须"理解" Python 循环的缩进规则。
这是一种间接学习——模型并没有人教它"北京是中国的首都",但在大量文本中反复看到这个搭配后,它学会了把"北京"、"中国"、"首都"这几个概念关联在一起。
一张图看懂 LLM 在做什么
先看一张整体架构图,有一个大局观(细节会在第二阶段拆解):

上图:Transformer 的完整架构。左半边是编码器(Encoder),右半边是解码器(Decoder)。现代 LLM(GPT 系)只用了右边的解码器部分。图片来源:dvgodoy / CC BY
简化版的流程是这样的:

下面这张图更具体地展示了自回归生成(autoregressive generation)的循环过程——每次生成一个新 token,拼回输入,再生成下一个:

上图:自回归采样(autoregressive sampling)的完整流程。注意虚线箭头——生成的 token 又被追加回上下文,形成循环。这是 LLM 逐字输出的根本原因。图片来源:PLOS One (CC BY 4.0)
强烈推荐: 打开 bbycroft.net/llm —— 这是一个 3D 交互式 LLM 可视化网站,你可以用鼠标旋转缩放,看到模型推理时数据如何从输入流到输出。绿色方块是权重参数,蓝色方块是中间计算结果。花 10 分钟玩一下,比读任何文字都管用。
LLM 发展简史(2017 — 2026.07)
了解 LLM 是怎么一步步走到今天的,有助于你理解为什么某些技术反复被提到,以及不同模型之间到底是什么关系。这篇简史会尽量用通俗语言——遇到不懂的名词先跳过,有个印象就行。
2017 之前:石器时代
在 Transformer 出现之前,处理文本的主流是 RNN(循环神经网络) 和 LSTM(长短期记忆网络)。它们像一个逐字阅读的人——每读完一个字,记住要点,再读下一个字。
问题是:读到第 500 个字时,第 1 个字的内容基本忘光了。而且必须一个字一个字串行处理,没法并行加速,训练极慢。
2017:Transformer 诞生
Google 团队发表了一篇论文,标题很嚣张——"Attention Is All You Need"(注意力就是你需要的全部)。他们把"逐字阅读"的机制整个扔掉,换成了所有字同时互相看的新架构。
核心想法很朴素:与其让信息一个字一个字往后传(传到后面早忘了),不如让每个字都能直接"看到"句子里的任意其他字。这样不仅解决了遗忘问题,还能并行计算——因为所有位置同时处理,不用排队。
这篇论文是所有现代 LLM 的基石。第二阶段会详细拆解它的每个组件。
2018–2019:GPT 与 BERT 分道
Transformer 原始设计包含"阅读理解"和"写作生成"两部分。业界很快分成了两条路:
- BERT 派(Google):只保留阅读理解那半,擅长分类、信息抽取——像一台精准的扫描仪
- GPT 派(OpenAI):只保留写作生成那半,擅长续写文本——像一支自动写作的笔
后来 GPT 路线胜出了,因为逻辑很简单:如果一个模型能流畅地续写任何文本,那么当它续写"答案是:"的时候,它就是在回答;续写"翻译是:"的时候,它就是在翻译。生成能力是一切的上游。
这个阶段有几个里程碑:
- GPT-1(2018):证明了"先读海量文本,再针对具体任务微调"这个范式行得通,1.17 亿参数
- BERT(2018):在 11 项语言理解任务上全面刷榜,3.4 亿参数
- GPT-2(2019):参数涨到 15 亿,生成的文本流畅到 OpenAI 一度不敢开源——怕被用来批量造谣
2020:GPT-3 —— 大力出奇迹
OpenAI 把 GPT-2 放大了一百多倍,推出了 GPT-3(1750 亿参数)。架构几乎没变,就是更大。但这一放大,验证了一个关键假设——Scaling Law(规模法则):
模型越大、训练数据越多,能力就越强。而且这个趋势在可预见的未来没有天花板。
GPT-3 还展现出一种"举一反三"的能力:在 prompt 里给两个翻译的例子,它就能自动把第三段也翻译了——不需要专门训练翻译任务。这让整个行业达成共识:继续放大,就是最可靠的路线。
2022.11:ChatGPT 引爆
GPT-3 虽然强大,但它本质是个"文字接龙机"——你问"什么是 Python",它可能给你续写一整篇博客,而不是直接回答你的问题。
OpenAI 在 GPT-3.5 上增加了一个关键环节:RLHF(基于人类反馈的强化学习)。简单说,就是让人类标注员教模型"怎么好好说话"——什么答案算有用、什么算敷衍、什么算冒犯。经过"家教"的模型,从只会续写的机器变成了能陪你聊天的助手。
ChatGPT 上线两个月用户破亿,成为史上增长最快的产品。这一刻,AI 从实验室走进了普通人的生活。
2023:开源追赶、能看图、记更多
- LLaMA(Meta):证明"小而精"也行——70 亿参数的模型在很多任务上不输 1750 亿的 GPT-3。关键不是堆参数,而是在更多数据上训练更久。模型权重泄露后,引爆了全球开源社区
- GPT-4(OpenAI):不仅能读文字,还能看图片——给它一张冰箱内部的照片问"我能做什么菜",它能回答
- 上下文窗口膨胀:Claude 2 率先支持一次性读完一整本小说(10 万 token),GPT-4 Turbo 跟进到 12.8 万。模型开始从"金鱼记忆"变成"大象记忆"
2024:MoE 架构与中国力量
这一年最具颠覆性的技术变革叫 MoE(混合专家)。
传统的模型是"全员上阵"——每个问题都要经过全部参数。MoE 的思路是把模型拆成很多个"专家"子模块,每次只叫醒少数几个相关的专家干活。效果:知识总量可以非常大(像一座图书馆),但每次回答只需要动用一小部分(像从书架上抽两本书)。
- Mixtral(法国 Mistral):第一个高质量开源 MoE 模型
- DeepSeek-V2/V3(中国深度求索):V3 有 6710 亿参数(比 GPT-3 还大近 4 倍),但训练只花了 557 万美元,性能对标 GPT-4o。全行业震惊——原来做出顶级模型不需要顶级预算
2025:让模型"多想一会儿"
以前的 LLM 是你问它答,不管简单还是复杂,都是同样速度出结果。2025 年的新思路:难的问题,让模型多思考一会。
- OpenAI o1/o3:模型在内部"自言自语"——推敲、验证、修正——然后再给出最终答案。数学和编程能力大幅提升
- DeepSeek-R1:第一个开源的高质量推理模型,而且公开了整个技术方案。更令人惊讶的是,它纯粹靠强化学习就在数学题上自发学会了"做完再检查一遍"
- Claude Opus 4 系列:模型不只是聊天,开始能操控电脑——打开文件、写代码、运行测试、根据报错修改——像一个真正的程序员助手
年底时,上下文窗口已经是 100 万 token 起步,相当于一次性能读进三本《三体》。
2026 上半年(截止 7 月):Agent 时代与超大规模开源
2026 年的更新节奏快到令人窒息——几乎每周都有重磅发布:
| 时间 | 事件 | 为什么重要 |
|---|---|---|
| 2026.02 | Claude Opus 4.6 | 大幅强化自主编程和工具调用能力 |
| 2026.03 | GPT-5.4 | 内置操控电脑的能力——不止是聊天,还能帮你操作软件 |
| 2026.04 | DeepSeek V4 Pro | 1.6 万亿参数,但每次只激活 3%,API 价格只有 GPT 的 1/15 |
| 2026.04 | GPT-5.5 | 首个同时原生理解文字、图片、音频、视频的模型 |
| 2026.06 | Claude Fable 5 | "思考模式"不再需要开关——模型始终在深度思考,回答质量飞跃 |
| 2026.06 | GLM-5.2(智谱) | 中国模型在代码能力上逼近美国最前沿水平 |
| 2026.07 | GPT-5.6 | 分三档——旗舰(Sol)、中端(Terra)、平价(Luna),按需选用 |
| 2026.07 | Kimi K3(月之暗面) | 2.8 万亿参数,目前全球最大的开源模型,编程竞技场排名第一 |
| 2026.07 | Qwen 3.8-Max(阿里) | 2.4 万亿参数,紧追全球最前沿 |
几条值得记住的趋势:
- 中国模型从"追赶"到"并跑":DeepSeek、Kimi、GLM、Qwen 等中国团队的开源模型,在不到两年内从望尘莫及追到几乎同一水平线
- 模型从"能聊天"变成"能干活":写代码、操控电脑、自主规划多步任务——AI 开始从嘴替变成手替
- 推理成本断崖式下跌:调用顶级模型的 API,从"一个项目几千美元"变成"一杯咖啡的钱"
- AI 开始深度卷入政治:美国政府曾以安全为由短暂限制 GPT-5.6 和 Fable 5 的访问,AI 成为大国竞争的新赛道
技术进化速览(一句话版)

读完这篇简史,如果对某个时期或概念感到好奇(比如 RLHF 是什么、MoE 怎么拆专家的),后续阶段都会展开讲。
核心术语深入讲解
Prompt(提示词)
一句话定义:你输入给 LLM 的任何文字,就是 prompt。
但 prompt 远不止"提问"这么简单。它更像你给模型设定的舞台和剧本。一个完整的 prompt 可以包含:

为什么 prompt 值得认真设计?因为 LLM 没有"长期记忆",你和它的每一次对话,它对世界的全部认知,就只局限在 context window(上下文窗口)里的那些文字。prompt 写得好不好,直接决定了它对你的任务"理解"到什么程度。
Token / 词元
一句话定义:LLM 读和写的最小文本单元。
注意,词元 ≠ 单词,也 ≠ 汉字。现代 LLM 使用的是子词(subword)级别的分词。
直观示例
用 OpenAI 的分词器处理一段中英混合文本:
原始文本: "我喜欢学习 machine learning"
分词结果: ["我", "喜欢", "学习", "machine", "learning"]
→ 5 个 token看几个典型情况:
| 原文 | 分词结果 | 说明 |
|---|---|---|
apple | ["apple"] | 常见单词是一个 token |
unhappiness | ["un", "happi", "ness"] | 罕见词被拆成子词 |
ChatGPT | ["Chat", "G", "PT"] | 专有名词按模式切分 |
你好世界 | ["你好", "世界"] | 中文常见词是一个 token |
20240721 | ["2024", "07", "21"] | 数字常被拆开 |
BPE 分词算法简介
现代 LLM 普遍采用 BPE(Byte Pair Encoding,字节对编码) 算法来训练分词器。大致的思路是这样:
- 把训练语料里每个词拆成单个字符
- 统计所有相邻字符对的出现频率
- 把频率最高的那一对合并成一个新 token 加入词表
- 重复步骤 2-3,直到词表达到预定大小(比如 50,000 个 token)
这个过程很像把"经常一起出现的东西粘在一起"。比如英文里 t + h → th,th + e → the,最终 the 成为一个独立 token。中文也是类似,"机器"经常一起出现,就成为一个 token,而"机"和"器"单独出现时还是独立的 token。
推荐看图: context-lab.com 的交互式分词器 —— 可以实时输入任意文本,对比 GPT-2、BERT、T5 三种分词器的结果,还有 BPE merge tree(合并树)的动画演示。
为什么词元这个概念如此重要
- 计费单位: API 按 token 收费(输入和输出价格不同),理解 token 就能预估成本
- 长度限制: 模型的 context window 以 token 为单位计,超了就截断
- 解释了模型的很多"怪癖":
- 为什么 LLM 做算术容易出错?因为数字被拆成子词 token,模型看不到完整的数字
- 为什么问 "strawberry 里几个 r" 经常答错?因为 "strawberry" 被切成
["straw", "berry"],单个字母被吞掉了 - 为什么中文 prompt 比英文"贵"?同等信息量,中文的 token 数通常更多
经验换算
| 文本量 | 约等于 |
|---|---|
| 1 个 token | 约 4 个英文字符,或 0.5-1 个汉字 |
| 1,000 token | 约 750 个英文单词,或 500-700 个汉字 |
| 128K token | 约一部中篇小说 |
Context Window(上下文窗口)
一句话定义:LLM 一次性能"看到"的最大 token 数量。
先理解"没有记忆"这件事
LLM 本身是没有长期记忆的。每次你向它发送消息时,服务端做的事情其实是:
- 把你整个对话历史(从第一条消息到现在)全部打包
- 加上系统提示词
- 一起喂给模型
- 模型输出新内容
这就意味着,如果对话历史太长,超过了 context window 的上限,最早的内容就会被截断或压缩。这也是为什么和 AI 聊久了,它会"忘记"最初聊过什么。
Context Window 不是"越大越好"
一个常见的误解是:window 越大,回答越准确。实际情况更微妙:
- 注意力分布不均: 模型对 prompt 开头和结尾的内容关注度更高,中间部分容易被"忽视"。这被称为**"迷失在中间"(Lost in the Middle)** 现象
- 信息密度问题: 把一整本书塞进 context window,模型可能抓不住重点
- 成本翻倍: 更大的 context = 更多 token 要处理 = 更高的 API 费用和更慢的响应
各模型 Context Window 一览
先看 2025 年的情况(感受一下增长速度):
| 模型 (2025) | Context Window | 能装下的内容 |
|---|---|---|
| GPT-3.5 | 4K token | 约 3 页 A4 纸 |
| GPT-4 | 8K-128K token | 约一篇中篇小说 |
| Claude 3.5 Sonnet | 200K token | 约一部《三体》第一部 |
| Gemini 1.5 Pro | 1M+ token | 约 1 小时视频 + 11 小时音频 |
| DeepSeek-V3 | 128K token | 约一篇长篇小说 |
再看 2026 年 7 月的最新情况——1M token 已是旗舰标配:
| 模型 (2026.07) | Context Window | 亮点 |
|---|---|---|
| GPT-5.5 (OpenAI) | 1M token | 128K 最大输出 |
| Claude Opus 4.8 (Anthropic) | 1M token | 长上下文不加价(业界唯一) |
| Gemini 3.1 Pro (Google) | 1M token | 分档计费(≤200K 更便宜) |
| DeepSeek V4 Pro | 1M token | 开源 + 极低价 ($0.14/M 输入) |
| Kimi K3 (月之暗面) | 1M token | 全球最大开源模型 (2.8T 参数) |
| Qwen 3.8-Max (阿里) | 128K token | 2.4T 参数,中文写作断层领先 |
| Llama 4 Scout (Meta) | 10M token | 当前最长上下文窗口 |
| Grok 4.20 (xAI) | 2M token | — |
仅仅一年半,GPT-3.5 的 4K 变成了旗舰标配 1M,翻了 250 倍。Llama 4 Scout 甚至到了 1000 万 token(可以塞进整部《三体》三部曲)。
一个重要的"但是":广告数字 ≠ 实际能力
多家独立评测机构(RULER、LongBench v2、Chroma)的测试一致表明:模型在长上下文场景下的有效准确率远低于广告中的窗口大小:
- Claude Opus 4.6 在 1M token 时的多跳检索准确率约 76%,算衰减最慢的
- Gemini 3 Pro 广告 2M,但在 1M 时的复杂任务准确率仅 26.3%
- Llama 4 Scout 广告 10M,但有效可用区间约 500K
- 大部分模型在超过 32K-64K token 后,"迷失在中间"(Lost in the Middle) 就开始显现——埋在文档中间的答案很容易被忽视
所以 context window 的数字更像"汽车仪表盘上的最高时速"——实验室条件下能跑到,但不代表日常能用满。
直观感受: 你可以去 OpenAI Tokenizer 贴一段文字,它会实时告诉你这段文字占了多少 token。
Inference(推理)
一句话定义:模型根据输入产生输出的计算过程。
注意,这里的"推理"和人类逻辑推理的含义不同。在 AI 领域,inference 特指模型完成训练后,在实际使用中接收输入、生成输出的前向计算过程。
训练(training)和推理(inference)是一对概念:
| 训练(Training) | 推理(Inference) | |
|---|---|---|
| 干什么 | 学习参数,调整权重 | 使用已学好的参数,做预测 |
| 计算量 | 巨大(数千 GPU,数周-数月) | 相对小(每次只算一遍) |
| 谁来做 | 模型厂商(OpenAI、Google 等) | 你调用 API 或本地运行 |
| 类比 | 学生花十年上学 | 毕业考试,拿到卷子就答 |
| 参数变化 | 参数不断更新 | 参数冻结不变 |
推理过程中的自回归循环是速度瓶颈:每次只能生成一个 token,而且要串行处理,所以生成 1,000 个 token 就意味着模型要跑 1,000 次完整的计算。这也是为什么推理速度是一个关键竞争维度。
在聊速度之前,先区分两个容易混淆的概念——"谁造的模型"和"谁跑的模型"是两个层面的事:
层面 1: 模型(谁训练的)
OpenAI (GPT), Anthropic (Claude), Google (Gemini), DeepSeek, 阿里 (Qwen), 月之暗面 (Kimi) …
→ 这些公司负责训练模型,决定了模型的"智商"
层面 2: 硬件 / 推理服务(谁跑的)
GPU 云 (H100/B200), Cerebras (晶圆级芯片), Groq (LPU 架构芯片) …
→ 这些是跑模型的"引擎",同样的模型可以在不同的引擎上跑打个比方:模型是"游戏",硬件是"游戏机"。同一个游戏(比如 DeepSeek V4),既可以在普通电脑(标准 GPU 云)上跑,也可以在顶级游戏主机(Cerebras)上跑——游戏没变,但流畅度差很多。
所以下面的速度数据,前面三个(Cerebras、Groq、标准 GPU 云)是比较不同的"引擎"跑同一个模型的快慢;DeepSeek 我单独标注,因为它是在标准 GPU 上跑的,速度和其他模型一样受限于 GPU:
| 推理引擎 | 吞吐量 (tok/s) | 是什么 |
|---|---|---|
| Cerebras (晶圆级芯片) | 2,500-3,000 | 一整片晶圆当一颗芯片用,内存带宽是 H100 GPU 的 6000 倍 |
| Groq (LPU 架构) | 400-750 | 用 SRAM 取代 GPU 的 HBM 显存,编译器提前排好所有计算步骤 |
| 标准 GPU 云 (H100/B200) | 100-150 | 目前大多数 API 服务都跑在这类硬件上,包括 DeepSeek |
Cerebras 和 Groq 选择了不同于 NVIDIA GPU 的硬件路线。但超过 300 tok/s 之后,瓶颈就转移到你的终端渲染速度和人类阅读速度了——再快你也看不完。
下面是 Transformer 解码器逐 token 生成的动态过程——注意每一步如何只关注已生成的上文(causal attention / 因果注意力):

上图:解码器逐 token 生成的过程动画。每一步,新生成的 token(彩色块)只能"看到"它之前的 token,不能偷看后面的。这就是 causal mask(因果遮罩)的作用。图片来源:Jay Alammar, The Illustrated GPT-2
国产算力:另一条赛道
前面聊的是全球范围内的推理引擎。对中国 AI 行业来说,还有一个独特的维度——芯片禁运倒逼出的国产算力生态。这是理解国内 AI 产业链的关键背景。
先看大格局的变化(2026 年):
- 英伟达在中国 AI 芯片市场的份额从三年前的 95% 暴跌至接近零,国产 AI 加速卡市占突破 60%
- 华为昇腾一家独占国产阵营约 50-60%,预计 2026 年 AI 芯片收入 120 亿美元
- 美国科技巨头 AI 资本支出 7250 亿美元,中国 5970 亿人民币——中美算力差距约 2 倍以上
如果你是对比着学,可以这样理解:全球市场是 NVIDIA CUDA 生态一统天下,中国市场则在快速形成以 华为昇腾 CANN 生态为核心的平行体系。
主要国产芯片玩家一览:
| 厂商 | 代表产品 | FP16 算力 | 定位 | 一句话总结 |
|---|---|---|---|---|
| 华为昇腾 | 910B → 950PR | 376 TFLOPS → 1.56P (FP4) | 全栈自研,训练+推理 | 绝对主力,唯一能对标 NVIDIA 全产品线的 |
| 寒武纪 | 思元 590 | 345 TFLOPS | 推理优先 | 字节跳动搜索/推荐系统大规模部署 |
| 壁仞科技 | BR100 系列 | 突破 1000 TFLOPS | 通用 GPU | 阿里下了万卡级订单,二线中最积极 |
| 摩尔线程 | MTT S5000 | 1000 TFLOPS (稠密) | 全功能 GPU | DeepSeek V4 Day-0 适配,但高端版仍未量产 |
| 沐曦 | 曦云 C600 | — | 全国产供应链 | 金融/政务等高安全场景,预订单超 40 亿 |
| 海光 | 深算二号 DCU | 达 A100 的 80% | 类 CUDA 兼容 | CUDA 迁移门槛最低,52% 企业在评估 |
一个关键区分:训练 vs 推理:
国产芯片在**推理(inference)**侧已经相当能打——昇腾 950PR 和寒武纪思元系列在推理吞吐(tokens/秒)上能超过英伟达 H20 50%-150%。2026 年推理算力需求已占全部 AI 计算的三分之二以上,这意味着国产替代在"量最大"的战场上站稳了。
但**训练(training)**侧差距仍然明显——高端训练芯片落后 NVIDIA 约 30%,万卡集群的稳定性和高带宽互联(对标 NVLink)是主要瓶颈。目前国产芯片在训练中更多扮演"辅助"角色。
还有一个紧箍咒:产能:
中芯国际 N+2(等效 7nm)产线是国产 AI 芯片唯一可规模量产的先进制程。2026 年全年产能约 260 万颗,市场需求约 420 万颗,缺口 40%。产能分配大致是:华为 43%、寒武纪 9-11%、其余厂商争抢剩余份额。"在断粮前能不能拿到下一批产能"是二线厂商的核心考验。
软件生态:CUDA 之外的"第二极":
这是容易被忽视但最关键的一环。NVIDIA 的真正护城河不只是硬件,更是 CUDA 生态——全球 400 万+ 开发者、95% 以上 AI 模型基于 CUDA 开发。华为用 CANN(昇腾算子库)+ MindSpore(深度学习框架) 在构建对等的软件栈。DeepSeek 花了数月将核心代码从 CUDA 迁移到 CANN——这个过程很痛苦,但一旦完成,就等于为后来的国产模型趟平了路。
一句话记住:全球正在形成两个平行的 AI 算力生态——美国以 NVIDIA CUDA 为核心,中国以华为昇腾 CANN 为核心。对 AI 开发者来说,未来可能需要在两套工具链上都具备一定的熟悉度。
Hallucination(幻觉)
一句话定义:模型一本正经地编造不存在的事实,而且说得跟真的一样。
为什么会幻觉?
根源在于 LLM 的工作方式是预测下一个词元,它并不真正"知道"什么是真什么是假。它只是在概率层面判断"接下来的词元组合起来像不像一段可信的文本"。
如果把 LLM 比作一个读过世间所有书的人,但他读书的方式很特别——他只记住了"什么词喜欢挨着出现",而从不验证事实。你问他"2024 年诺贝尔物理学奖获得者是谁?",他可能给你一个听起来很合理、很自信、但完全错误的答案,因为在训练数据里,"诺贝尔物理学奖"、"2024"、"授予"、"XXX"这些词的组合模式是存在的,他顺着模式编了一个。
幻觉常见的表现形态
- 虚构事实: 编造不存在的论文、人物、事件
- 虚构引用: 给你一段看起来格式完美但 DOI 不存在的参考文献
- 数字错误: 计算一个看似合理但精确错误的数字
- 过度自信: 用极其肯定的语气说完全错误的话
减少幻觉的实用方法
| 方法 | 说明 |
|---|---|
| RAG(检索增强生成) | 先查资料再回答,后面第四阶段会详细讲 |
| 让模型"展示推理过程" | 加上"请一步步思考",模型在铺陈推理时更不容易出错 |
| 要求引用来源 | "请在你的回答中标明信息来源" |
| 降低 temperature | 让输出更保守,减少"创造性编造"的空间 |
| 人工核实 | 重要事实永远交叉验证 |
如何开始使用 LLM
选一个开始用
下面的产品都有免费额度,随便注册一个就能开始:
| 产品 | 特点 |
|---|---|
| ChatGPT (chatgpt.com) | 用户最多,生态最丰富(插件、GPTs 商店)。当前旗舰 GPT-5.5 |
| Claude (claude.ai) | 写作和编程能力突出,上下文窗口大。当前旗舰 Claude Opus 4.8 |
| DeepSeek (chat.deepseek.com) | 国产模型,中文能力强,免费,推理速度快。当前旗舰 DeepSeek V4 |
| Kimi (kimi.moonshot.cn) | 超长上下文(100 万 token),K3 模型全球最大开源参数 (2.8T) |
| 通义千问 (tongyi.aliyun.com) | 阿里出品,当前旗舰 Qwen 3.8-Max,中文写作公认最佳 |
| 文心一言 (yiyan.baidu.com) | 百度出品,ERNIE 5.0 全模态(文本+图片+音频+视频),已全面免费 |
2026 年的一个重要变化: 开源模型(Kimi K3、DeepSeek V4、GLM-5.2、Qwen 3.8)的性能已经追上甚至部分超越闭源旗舰。以前是"闭源领先开源半年",现在差距基本消失。对于学习者来说,意味着你甚至可以在自己的电脑上跑一个接近 GPT-4 水平的模型。
推荐的第一周"实验清单"
刻意测试模型的边界,比随便聊天收获大得多:
□ 翻译: "把下面的英文翻译成中文:[一段你熟悉的英文技术文档]"
□ 总结: "用 200 字总结以下文章的核心观点:[贴一篇文章]"
□ 编程: "用 Python 写一个函数,读取 CSV 文件并计算每列的平均值"
□ 解释: "用简单的语言解释什么是 RESTful API"
□ 反问: "以下代码有什么 bug?[贴一段有问题的代码]"
□ 创意: "帮我想 5 个 AI 学习项目的点子"
□ 对比: 把同一个问题分别问 ChatGPT、Claude、DeepSeek,感受风格差异
□ 追问: 模型回答了之后,追一句"能再详细解释一下吗?"或"有没有更好的方案?"做完这些实验后,你应该会对 LLM 能干什么、不能干什么有个大致的直觉。
直观理解 LLM 的能力边界
一个有用的思维模型:System 1 vs System 2
借用认知心理学里的术语:
- System 1(快思考): 直觉、自动的、不假思索。你看到
2+2立刻知道是4。 - System 2(慢思考): 需要集中注意力、逐步推理。你做
37×58要在脑子里列竖式。
LLM 在输出每一个 token 时,花费的计算量是一模一样的,不管是回答"法国的首都是什么"还是"证明费马大定理"。从这个角度看,它随时都处于一种"快思考"的模式——本能地说出下一个词。
这就解释了:
为什么 LLM 有时会犯低级错误?
→ 它在做 System 1 的自动反应,但问题需要 System 2 的深度推理。
为什么加上"请一步步思考"能提高准确率?
→ 强制模型把推理链写出来,等于把"慢思考"的过程外化成了文本,后续的 token 生成有了
更扎实的"上文"。
为什么它写充满套路的代码很快,设计新算法却不行?
→ 写常规代码是"模式匹配",是强项;真正的创新需要超出已有模式,刚好是弱点。能力的三个阶段
可以这样粗略地理解当前 LLM 的能力水位:

本阶段小结
学完这五个概念,你已经拿到了读懂 AI 领域大部分讨论的"入场券":
Prompt(提示词) → 你和 LLM 的沟通方式
Token(词元) → LLM 的"原子"
Context Window → LLM 的"工作记忆"上限
Inference(推理) → LLM 的"运行"过程
Hallucination → LLM 的"说谎"天性下一篇进入第二阶段,会具体拆解 Tokenization 怎么把文字变数字、Embedding 怎么给词元赋予意义、Transformer 的 Self-Attention 怎么一次看懂整个句子。不过在这之前,先花一两天玩玩各种 LLM 产品,积累些手感,再看原理会顺畅很多。
延伸阅读与可视化资源
在线交互工具
| 资源 | 类型 | 说明 |
|---|---|---|
| bbycroft.net/llm | 3D 交互 | 在浏览器里看 LLM 推理的完整计算过程 |
| The Illustrated GPT-2 | 图解博客 | 手绘风格拆解 GPT-2 架构,新手必读 |
| Tokenization 交互演示 | 在线工具 | 实时看不同分词器怎么切你的输入 |
| OpenAI Tokenizer | 在线工具 | 数 token 数,看分词结果 |
| Andrej Karpathy - Intro to LLMs | 视频 (1h) | OpenAI 联合创始人的 LLM 全景通览 |
| 3Blue1Brown - 神经网络 | 视频系列 | 神经网络的数学可视化,零公式焦虑 |
| LLM Stats 2026 | 排行榜 | 300+ 模型的实时对比:价格、速度、上下文窗口 |
| LLM Cost Calculator | 在线工具 | 对比各 API 的实际费用,避免"天价账单" |
图片附录:先睹为快
以下是第二阶段会深入讲解的核心概念图解,先放在这里让你有个视觉印象:
Self-Attention(自注意力):Q、K、V 向量

每个词元被投影成三个向量:Query(查询,想找什么)、Key(键,我有什么)、Value(值,我能提供什么信息)。图片来源:Jay Alammar, The Illustrated Transformer
Self-Attention 矩阵计算

实际计算时所有词元打包成矩阵,通过矩阵乘法一次完成。Q × K 的点积决定"谁关注谁"。图片来源:Jay Alammar, The Illustrated Transformer
Multi-Head Attention(多头注意力)

一个头只能学一种模式,多个头并行就能同时关注语法、语义、指代等不同层面的关系。图片来源:Jay Alammar, The Illustrated Transformer
Encoder-Decoder 堆叠结构

实际的 Transformer 不是单层的——Encoder 和 Decoder 各自堆叠 N 层(GPT-3 有 96 层),层层提炼语义。图片来源:dvgodoy / CC BY
Positional Encoding(位置编码)

Transformer 本身感受不到词序("我爱你"和"你爱我"对它来说是同一堆词)。位置编码给每个位置赋予独特的"指纹",让模型知道谁先谁后。图片来源:dvgodoy / CC BY
参考文献与图片来源
核心参考
| 标题 | 作者/来源 | 类型 | 链接 |
|---|---|---|---|
| Intro to Large Language Models | Andrej Karpathy | 视频 (1h) | YouTube — LLM 全景通览 |
| Neural Networks (3Blue1Brown) | Grant Sanderson | 视频系列 | YouTube — 神经网络数学可视化 |
| The Illustrated GPT-2 | Jay Alammar | 博客 | jalammar.github.io — GPT-2 架构手绘图解 |
| LLM Visualization | Brendan Bycroft | 交互工具 | bbycroft.net/llm — 3D 推理全过程可视化 |
| LLM Stats 2026 | — | 数据平台 | llm-stats.com — 300+ 模型实时对比 |
| LLM Cost Calculator | Morph | 在线工具 | morphllm.com — API 费用对比 |
| Tokenization 交互演示 | Context Lab | 在线工具 | context-lab.com — 多分词器对比 |
| OpenAI Tokenizer | OpenAI | 在线工具 | platform.openai.com — token 计数 |
图片来源
| 图片 | 来源 | 许可 |
|---|---|---|
| Transformer 架构图、Self-Attention QKV 向量、矩阵计算、多头注意力、残差连接等 | Jay Alammar, The Illustrated Transformer / GPT-2 | 版权保留,教学引用 |
| 完整 Transformer 架构、Encoder/Decoder 堆叠、位置编码等 | dvgodoy / dl-visuals | CC BY 4.0 |
| 自回归采样流程图 | PLOS One | CC BY 4.0 |
| 词嵌入 3D/2D 可视化 | Embedding Plot (Wikipedia) | CC BY-SA |