Skip to content

第一阶段:建立直觉 —— 详解

当然,如果你愿意花一点时间来了解下大模型的工作原理并尝试驯服它,这里便能作为一切的起点。

读完这篇,你会知道 LLM 到底是什么、核心概念怎么理解、以及如何上手使用。 预计阅读时间:30-40 分钟。


目录

  1. 从一个故事说起
  2. 什么是 LLM
  3. LLM 发展简史(2017 — 2026.07)
  4. 核心术语深入讲解
  5. 如何开始使用 LLM
  6. 直观理解 LLM 的能力边界
  7. 本阶段小结

从一个故事说起

假设你面前有一台神奇的机器。你往里面塞一张纸条,上面写着"从前有座山,山里有",机器嗡嗡响了几秒,吐出一张新纸条:"座庙,庙里有个老和尚在讲故事。"

你把纸条拿回来,又在末尾加上"老和尚说:",再塞进去。机器接着输出:"从前有座山,山里有座庙……"

这就是大语言模型(LLM, Large Language Model)最核心、最底层的运作逻辑:给定一段文本,预测接下来最可能出现的文字。

听起来很简单?简单到像是键盘上的自动补全功能。但被放大了几亿倍之后,这个"补全下一个词"的能力,演化出了翻译、编程、推理、创意写作等等令人惊叹的表现。


什么是 LLM

形式化定义

LLM(Large Language Model,大语言模型) 是一种基于深度学习的 AI 模型,使用海量文本数据训练而成。它的核心能力只有一件:根据已输入的文本,计算下一个词元(token)的概率分布,并从中采样生成输出。

拆解这个名字:

含义
Large / 大参数量巨大(亿级起步,千亿级也有),训练数据量巨大(万亿级 token)
Language / 语言处理的是人类自然语言(英文、中文、代码也算"语言")
Model / 模型本质是一个巨大的数学函数,输入数字序列,输出数字序列

它的本质是什么?

从程序员的角度看,LLM 就是一个函数:

输出文本 = LLM(输入文本, 参数1, 参数2, ...)

函数的内部是几千亿个可调参数(weights),这些参数是"学"出来的,后面第三阶段会详细讲。函数每次运行都做同一件事:接收一串 token,预测下一个 token。

你可能会想:就这?预测下一个词就能写出诗、写出代码?

答案是:能。关键在于规模

当模型读过几万亿 token 的文本(差不多是互联网上所有公开文字的总和),它从"预测下一个词"这个简单任务中,被迫学会了语法、事实知识、逻辑推理、甚至一些世界运作的规律。因为要准确地预测"北京是中国的___",你必须"知道"首都是北京;要预测 for i in range(10): 的下一个 token,你必须"理解" Python 循环的缩进规则。

这是一种间接学习——模型并没有人教它"北京是中国的首都",但在大量文本中反复看到这个搭配后,它学会了把"北京"、"中国"、"首都"这几个概念关联在一起。

一张图看懂 LLM 在做什么

先看一张整体架构图,有一个大局观(细节会在第二阶段拆解):

Transformer 完整架构

上图:Transformer 的完整架构。左半边是编码器(Encoder),右半边是解码器(Decoder)。现代 LLM(GPT 系)只用了右边的解码器部分。图片来源:dvgodoy / CC BY

简化版的流程是这样的:

LLM 处理流程

下面这张图更具体地展示了自回归生成(autoregressive generation)的循环过程——每次生成一个新 token,拼回输入,再生成下一个:

自回归采样流程

上图:自回归采样(autoregressive sampling)的完整流程。注意虚线箭头——生成的 token 又被追加回上下文,形成循环。这是 LLM 逐字输出的根本原因。图片来源:PLOS One (CC BY 4.0)

强烈推荐: 打开 bbycroft.net/llm —— 这是一个 3D 交互式 LLM 可视化网站,你可以用鼠标旋转缩放,看到模型推理时数据如何从输入流到输出。绿色方块是权重参数,蓝色方块是中间计算结果。花 10 分钟玩一下,比读任何文字都管用。


LLM 发展简史(2017 — 2026.07)

了解 LLM 是怎么一步步走到今天的,有助于你理解为什么某些技术反复被提到,以及不同模型之间到底是什么关系。这篇简史会尽量用通俗语言——遇到不懂的名词先跳过,有个印象就行。

2017 之前:石器时代

在 Transformer 出现之前,处理文本的主流是 RNN(循环神经网络)LSTM(长短期记忆网络)。它们像一个逐字阅读的人——每读完一个字,记住要点,再读下一个字。

问题是:读到第 500 个字时,第 1 个字的内容基本忘光了。而且必须一个字一个字串行处理,没法并行加速,训练极慢。

2017:Transformer 诞生

Google 团队发表了一篇论文,标题很嚣张——"Attention Is All You Need"(注意力就是你需要的全部)。他们把"逐字阅读"的机制整个扔掉,换成了所有字同时互相看的新架构。

核心想法很朴素:与其让信息一个字一个字往后传(传到后面早忘了),不如让每个字都能直接"看到"句子里的任意其他字。这样不仅解决了遗忘问题,还能并行计算——因为所有位置同时处理,不用排队。

这篇论文是所有现代 LLM 的基石。第二阶段会详细拆解它的每个组件。

2018–2019:GPT 与 BERT 分道

Transformer 原始设计包含"阅读理解"和"写作生成"两部分。业界很快分成了两条路:

  • BERT 派(Google):只保留阅读理解那半,擅长分类、信息抽取——像一台精准的扫描仪
  • GPT 派(OpenAI):只保留写作生成那半,擅长续写文本——像一支自动写作的笔

后来 GPT 路线胜出了,因为逻辑很简单:如果一个模型能流畅地续写任何文本,那么当它续写"答案是:"的时候,它就是在回答;续写"翻译是:"的时候,它就是在翻译。生成能力是一切的上游

这个阶段有几个里程碑:

  • GPT-1(2018):证明了"先读海量文本,再针对具体任务微调"这个范式行得通,1.17 亿参数
  • BERT(2018):在 11 项语言理解任务上全面刷榜,3.4 亿参数
  • GPT-2(2019):参数涨到 15 亿,生成的文本流畅到 OpenAI 一度不敢开源——怕被用来批量造谣

2020:GPT-3 —— 大力出奇迹

OpenAI 把 GPT-2 放大了一百多倍,推出了 GPT-3(1750 亿参数)。架构几乎没变,就是更大。但这一放大,验证了一个关键假设——Scaling Law(规模法则)

模型越大、训练数据越多,能力就越强。而且这个趋势在可预见的未来没有天花板。

GPT-3 还展现出一种"举一反三"的能力:在 prompt 里给两个翻译的例子,它就能自动把第三段也翻译了——不需要专门训练翻译任务。这让整个行业达成共识:继续放大,就是最可靠的路线

2022.11:ChatGPT 引爆

GPT-3 虽然强大,但它本质是个"文字接龙机"——你问"什么是 Python",它可能给你续写一整篇博客,而不是直接回答你的问题。

OpenAI 在 GPT-3.5 上增加了一个关键环节:RLHF(基于人类反馈的强化学习)。简单说,就是让人类标注员教模型"怎么好好说话"——什么答案算有用、什么算敷衍、什么算冒犯。经过"家教"的模型,从只会续写的机器变成了能陪你聊天的助手。

ChatGPT 上线两个月用户破亿,成为史上增长最快的产品。这一刻,AI 从实验室走进了普通人的生活。

2023:开源追赶、能看图、记更多

  • LLaMA(Meta):证明"小而精"也行——70 亿参数的模型在很多任务上不输 1750 亿的 GPT-3。关键不是堆参数,而是在更多数据上训练更久。模型权重泄露后,引爆了全球开源社区
  • GPT-4(OpenAI):不仅能读文字,还能看图片——给它一张冰箱内部的照片问"我能做什么菜",它能回答
  • 上下文窗口膨胀:Claude 2 率先支持一次性读完一整本小说(10 万 token),GPT-4 Turbo 跟进到 12.8 万。模型开始从"金鱼记忆"变成"大象记忆"

2024:MoE 架构与中国力量

这一年最具颠覆性的技术变革叫 MoE(混合专家)

传统的模型是"全员上阵"——每个问题都要经过全部参数。MoE 的思路是把模型拆成很多个"专家"子模块,每次只叫醒少数几个相关的专家干活。效果:知识总量可以非常大(像一座图书馆),但每次回答只需要动用一小部分(像从书架上抽两本书)

  • Mixtral(法国 Mistral):第一个高质量开源 MoE 模型
  • DeepSeek-V2/V3(中国深度求索):V3 有 6710 亿参数(比 GPT-3 还大近 4 倍),但训练只花了 557 万美元,性能对标 GPT-4o。全行业震惊——原来做出顶级模型不需要顶级预算

2025:让模型"多想一会儿"

以前的 LLM 是你问它答,不管简单还是复杂,都是同样速度出结果。2025 年的新思路:难的问题,让模型多思考一会

  • OpenAI o1/o3:模型在内部"自言自语"——推敲、验证、修正——然后再给出最终答案。数学和编程能力大幅提升
  • DeepSeek-R1:第一个开源的高质量推理模型,而且公开了整个技术方案。更令人惊讶的是,它纯粹靠强化学习就在数学题上自发学会了"做完再检查一遍"
  • Claude Opus 4 系列:模型不只是聊天,开始能操控电脑——打开文件、写代码、运行测试、根据报错修改——像一个真正的程序员助手

年底时,上下文窗口已经是 100 万 token 起步,相当于一次性能读进三本《三体》。

2026 上半年(截止 7 月):Agent 时代与超大规模开源

2026 年的更新节奏快到令人窒息——几乎每周都有重磅发布:

时间事件为什么重要
2026.02Claude Opus 4.6大幅强化自主编程和工具调用能力
2026.03GPT-5.4内置操控电脑的能力——不止是聊天,还能帮你操作软件
2026.04DeepSeek V4 Pro1.6 万亿参数,但每次只激活 3%,API 价格只有 GPT 的 1/15
2026.04GPT-5.5首个同时原生理解文字、图片、音频、视频的模型
2026.06Claude Fable 5"思考模式"不再需要开关——模型始终在深度思考,回答质量飞跃
2026.06GLM-5.2(智谱)中国模型在代码能力上逼近美国最前沿水平
2026.07GPT-5.6分三档——旗舰(Sol)、中端(Terra)、平价(Luna),按需选用
2026.07Kimi K3(月之暗面)2.8 万亿参数,目前全球最大的开源模型,编程竞技场排名第一
2026.07Qwen 3.8-Max(阿里)2.4 万亿参数,紧追全球最前沿

几条值得记住的趋势:

  • 中国模型从"追赶"到"并跑":DeepSeek、Kimi、GLM、Qwen 等中国团队的开源模型,在不到两年内从望尘莫及追到几乎同一水平线
  • 模型从"能聊天"变成"能干活":写代码、操控电脑、自主规划多步任务——AI 开始从嘴替变成手替
  • 推理成本断崖式下跌:调用顶级模型的 API,从"一个项目几千美元"变成"一杯咖啡的钱"
  • AI 开始深度卷入政治:美国政府曾以安全为由短暂限制 GPT-5.6 和 Fable 5 的访问,AI 成为大国竞争的新赛道

技术进化速览(一句话版)

LLM 技术进化速览

读完这篇简史,如果对某个时期或概念感到好奇(比如 RLHF 是什么、MoE 怎么拆专家的),后续阶段都会展开讲。


核心术语深入讲解

Prompt(提示词)

一句话定义:你输入给 LLM 的任何文字,就是 prompt。

但 prompt 远不止"提问"这么简单。它更像你给模型设定的舞台和剧本。一个完整的 prompt 可以包含:

Prompt 的五层结构

为什么 prompt 值得认真设计?因为 LLM 没有"长期记忆",你和它的每一次对话,它对世界的全部认知,就只局限在 context window(上下文窗口)里的那些文字。prompt 写得好不好,直接决定了它对你的任务"理解"到什么程度。


Token / 词元

一句话定义:LLM 读和写的最小文本单元。

注意,词元 ≠ 单词,也 ≠ 汉字。现代 LLM 使用的是子词(subword)级别的分词。

直观示例

用 OpenAI 的分词器处理一段中英混合文本:

原始文本: "我喜欢学习 machine learning"
分词结果: ["我", "喜欢", "学习", "machine", "learning"]
          → 5 个 token

看几个典型情况:

原文分词结果说明
apple["apple"]常见单词是一个 token
unhappiness["un", "happi", "ness"]罕见词被拆成子词
ChatGPT["Chat", "G", "PT"]专有名词按模式切分
你好世界["你好", "世界"]中文常见词是一个 token
20240721["2024", "07", "21"]数字常被拆开

BPE 分词算法简介

现代 LLM 普遍采用 BPE(Byte Pair Encoding,字节对编码) 算法来训练分词器。大致的思路是这样:

  1. 把训练语料里每个词拆成单个字符
  2. 统计所有相邻字符对的出现频率
  3. 把频率最高的那一对合并成一个新 token 加入词表
  4. 重复步骤 2-3,直到词表达到预定大小(比如 50,000 个 token)

这个过程很像把"经常一起出现的东西粘在一起"。比如英文里 t + hthth + ethe,最终 the 成为一个独立 token。中文也是类似,"机器"经常一起出现,就成为一个 token,而"机"和"器"单独出现时还是独立的 token。

推荐看图: context-lab.com 的交互式分词器 —— 可以实时输入任意文本,对比 GPT-2、BERT、T5 三种分词器的结果,还有 BPE merge tree(合并树)的动画演示。

为什么词元这个概念如此重要

  1. 计费单位: API 按 token 收费(输入和输出价格不同),理解 token 就能预估成本
  2. 长度限制: 模型的 context window 以 token 为单位计,超了就截断
  3. 解释了模型的很多"怪癖":
    • 为什么 LLM 做算术容易出错?因为数字被拆成子词 token,模型看不到完整的数字
    • 为什么问 "strawberry 里几个 r" 经常答错?因为 "strawberry" 被切成 ["straw", "berry"],单个字母被吞掉了
    • 为什么中文 prompt 比英文"贵"?同等信息量,中文的 token 数通常更多

经验换算

文本量约等于
1 个 token约 4 个英文字符,或 0.5-1 个汉字
1,000 token约 750 个英文单词,或 500-700 个汉字
128K token约一部中篇小说

Context Window(上下文窗口)

一句话定义:LLM 一次性能"看到"的最大 token 数量。

先理解"没有记忆"这件事

LLM 本身是没有长期记忆的。每次你向它发送消息时,服务端做的事情其实是:

  1. 把你整个对话历史(从第一条消息到现在)全部打包
  2. 加上系统提示词
  3. 一起喂给模型
  4. 模型输出新内容

这就意味着,如果对话历史太长,超过了 context window 的上限,最早的内容就会被截断或压缩。这也是为什么和 AI 聊久了,它会"忘记"最初聊过什么。

Context Window 不是"越大越好"

一个常见的误解是:window 越大,回答越准确。实际情况更微妙:

  • 注意力分布不均: 模型对 prompt 开头和结尾的内容关注度更高,中间部分容易被"忽视"。这被称为**"迷失在中间"(Lost in the Middle)** 现象
  • 信息密度问题: 把一整本书塞进 context window,模型可能抓不住重点
  • 成本翻倍: 更大的 context = 更多 token 要处理 = 更高的 API 费用和更慢的响应

各模型 Context Window 一览

先看 2025 年的情况(感受一下增长速度):

模型 (2025)Context Window能装下的内容
GPT-3.54K token约 3 页 A4 纸
GPT-48K-128K token约一篇中篇小说
Claude 3.5 Sonnet200K token约一部《三体》第一部
Gemini 1.5 Pro1M+ token约 1 小时视频 + 11 小时音频
DeepSeek-V3128K token约一篇长篇小说

再看 2026 年 7 月的最新情况——1M token 已是旗舰标配

模型 (2026.07)Context Window亮点
GPT-5.5 (OpenAI)1M token128K 最大输出
Claude Opus 4.8 (Anthropic)1M token长上下文不加价(业界唯一)
Gemini 3.1 Pro (Google)1M token分档计费(≤200K 更便宜)
DeepSeek V4 Pro1M token开源 + 极低价 ($0.14/M 输入)
Kimi K3 (月之暗面)1M token全球最大开源模型 (2.8T 参数)
Qwen 3.8-Max (阿里)128K token2.4T 参数,中文写作断层领先
Llama 4 Scout (Meta)10M token当前最长上下文窗口
Grok 4.20 (xAI)2M token

仅仅一年半,GPT-3.5 的 4K 变成了旗舰标配 1M,翻了 250 倍。Llama 4 Scout 甚至到了 1000 万 token(可以塞进整部《三体》三部曲)。

一个重要的"但是":广告数字 ≠ 实际能力

多家独立评测机构(RULER、LongBench v2、Chroma)的测试一致表明:模型在长上下文场景下的有效准确率远低于广告中的窗口大小:

  • Claude Opus 4.6 在 1M token 时的多跳检索准确率约 76%,算衰减最慢的
  • Gemini 3 Pro 广告 2M,但在 1M 时的复杂任务准确率仅 26.3%
  • Llama 4 Scout 广告 10M,但有效可用区间约 500K
  • 大部分模型在超过 32K-64K token 后,"迷失在中间"(Lost in the Middle) 就开始显现——埋在文档中间的答案很容易被忽视

所以 context window 的数字更像"汽车仪表盘上的最高时速"——实验室条件下能跑到,但不代表日常能用满。

直观感受: 你可以去 OpenAI Tokenizer 贴一段文字,它会实时告诉你这段文字占了多少 token。


Inference(推理)

一句话定义:模型根据输入产生输出的计算过程。

注意,这里的"推理"和人类逻辑推理的含义不同。在 AI 领域,inference 特指模型完成训练后,在实际使用中接收输入、生成输出的前向计算过程

训练(training)和推理(inference)是一对概念:

训练(Training)推理(Inference)
干什么学习参数,调整权重使用已学好的参数,做预测
计算量巨大(数千 GPU,数周-数月)相对小(每次只算一遍)
谁来做模型厂商(OpenAI、Google 等)你调用 API 或本地运行
类比学生花十年上学毕业考试,拿到卷子就答
参数变化参数不断更新参数冻结不变

推理过程中的自回归循环是速度瓶颈:每次只能生成一个 token,而且要串行处理,所以生成 1,000 个 token 就意味着模型要跑 1,000 次完整的计算。这也是为什么推理速度是一个关键竞争维度。

在聊速度之前,先区分两个容易混淆的概念——"谁造的模型"和"谁跑的模型"是两个层面的事

层面 1: 模型(谁训练的)
  OpenAI (GPT), Anthropic (Claude), Google (Gemini), DeepSeek, 阿里 (Qwen), 月之暗面 (Kimi) …
  → 这些公司负责训练模型,决定了模型的"智商"

层面 2: 硬件 / 推理服务(谁跑的)
  GPU 云 (H100/B200), Cerebras (晶圆级芯片), Groq (LPU 架构芯片) …
  → 这些是跑模型的"引擎",同样的模型可以在不同的引擎上跑

打个比方:模型是"游戏",硬件是"游戏机"。同一个游戏(比如 DeepSeek V4),既可以在普通电脑(标准 GPU 云)上跑,也可以在顶级游戏主机(Cerebras)上跑——游戏没变,但流畅度差很多。

所以下面的速度数据,前面三个(Cerebras、Groq、标准 GPU 云)是比较不同的"引擎"跑同一个模型的快慢;DeepSeek 我单独标注,因为它是在标准 GPU 上跑的,速度和其他模型一样受限于 GPU:

推理引擎吞吐量 (tok/s)是什么
Cerebras (晶圆级芯片)2,500-3,000一整片晶圆当一颗芯片用,内存带宽是 H100 GPU 的 6000 倍
Groq (LPU 架构)400-750用 SRAM 取代 GPU 的 HBM 显存,编译器提前排好所有计算步骤
标准 GPU 云 (H100/B200)100-150目前大多数 API 服务都跑在这类硬件上,包括 DeepSeek

Cerebras 和 Groq 选择了不同于 NVIDIA GPU 的硬件路线。但超过 300 tok/s 之后,瓶颈就转移到你的终端渲染速度和人类阅读速度了——再快你也看不完。

下面是 Transformer 解码器逐 token 生成的动态过程——注意每一步如何只关注已生成的上文(causal attention / 因果注意力):

Transformer 解码过程

上图:解码器逐 token 生成的过程动画。每一步,新生成的 token(彩色块)只能"看到"它之前的 token,不能偷看后面的。这就是 causal mask(因果遮罩)的作用。图片来源:Jay Alammar, The Illustrated GPT-2

国产算力:另一条赛道

前面聊的是全球范围内的推理引擎。对中国 AI 行业来说,还有一个独特的维度——芯片禁运倒逼出的国产算力生态。这是理解国内 AI 产业链的关键背景。

先看大格局的变化(2026 年)

  • 英伟达在中国 AI 芯片市场的份额从三年前的 95% 暴跌至接近零,国产 AI 加速卡市占突破 60%
  • 华为昇腾一家独占国产阵营约 50-60%,预计 2026 年 AI 芯片收入 120 亿美元
  • 美国科技巨头 AI 资本支出 7250 亿美元,中国 5970 亿人民币——中美算力差距约 2 倍以上

如果你是对比着学,可以这样理解:全球市场是 NVIDIA CUDA 生态一统天下,中国市场则在快速形成以 华为昇腾 CANN 生态为核心的平行体系。

主要国产芯片玩家一览

厂商代表产品FP16 算力定位一句话总结
华为昇腾910B → 950PR376 TFLOPS → 1.56P (FP4)全栈自研,训练+推理绝对主力,唯一能对标 NVIDIA 全产品线的
寒武纪思元 590345 TFLOPS推理优先字节跳动搜索/推荐系统大规模部署
壁仞科技BR100 系列突破 1000 TFLOPS通用 GPU阿里下了万卡级订单,二线中最积极
摩尔线程MTT S50001000 TFLOPS (稠密)全功能 GPUDeepSeek V4 Day-0 适配,但高端版仍未量产
沐曦曦云 C600全国产供应链金融/政务等高安全场景,预订单超 40 亿
海光深算二号 DCU达 A100 的 80%类 CUDA 兼容CUDA 迁移门槛最低,52% 企业在评估

一个关键区分:训练 vs 推理

国产芯片在**推理(inference)**侧已经相当能打——昇腾 950PR 和寒武纪思元系列在推理吞吐(tokens/秒)上能超过英伟达 H20 50%-150%。2026 年推理算力需求已占全部 AI 计算的三分之二以上,这意味着国产替代在"量最大"的战场上站稳了。

但**训练(training)**侧差距仍然明显——高端训练芯片落后 NVIDIA 约 30%,万卡集群的稳定性和高带宽互联(对标 NVLink)是主要瓶颈。目前国产芯片在训练中更多扮演"辅助"角色。

还有一个紧箍咒:产能

中芯国际 N+2(等效 7nm)产线是国产 AI 芯片唯一可规模量产的先进制程。2026 年全年产能约 260 万颗,市场需求约 420 万颗,缺口 40%。产能分配大致是:华为 43%、寒武纪 9-11%、其余厂商争抢剩余份额。"在断粮前能不能拿到下一批产能"是二线厂商的核心考验。

软件生态:CUDA 之外的"第二极"

这是容易被忽视但最关键的一环。NVIDIA 的真正护城河不只是硬件,更是 CUDA 生态——全球 400 万+ 开发者、95% 以上 AI 模型基于 CUDA 开发。华为用 CANN(昇腾算子库)+ MindSpore(深度学习框架) 在构建对等的软件栈。DeepSeek 花了数月将核心代码从 CUDA 迁移到 CANN——这个过程很痛苦,但一旦完成,就等于为后来的国产模型趟平了路。

一句话记住:全球正在形成两个平行的 AI 算力生态——美国以 NVIDIA CUDA 为核心,中国以华为昇腾 CANN 为核心。对 AI 开发者来说,未来可能需要在两套工具链上都具备一定的熟悉度。


Hallucination(幻觉)

一句话定义:模型一本正经地编造不存在的事实,而且说得跟真的一样。

为什么会幻觉?

根源在于 LLM 的工作方式是预测下一个词元,它并不真正"知道"什么是真什么是假。它只是在概率层面判断"接下来的词元组合起来像不像一段可信的文本"。

如果把 LLM 比作一个读过世间所有书的人,但他读书的方式很特别——他只记住了"什么词喜欢挨着出现",而从不验证事实。你问他"2024 年诺贝尔物理学奖获得者是谁?",他可能给你一个听起来很合理、很自信、但完全错误的答案,因为在训练数据里,"诺贝尔物理学奖"、"2024"、"授予"、"XXX"这些词的组合模式是存在的,他顺着模式编了一个。

幻觉常见的表现形态

  • 虚构事实: 编造不存在的论文、人物、事件
  • 虚构引用: 给你一段看起来格式完美但 DOI 不存在的参考文献
  • 数字错误: 计算一个看似合理但精确错误的数字
  • 过度自信: 用极其肯定的语气说完全错误的话

减少幻觉的实用方法

方法说明
RAG(检索增强生成)先查资料再回答,后面第四阶段会详细讲
让模型"展示推理过程"加上"请一步步思考",模型在铺陈推理时更不容易出错
要求引用来源"请在你的回答中标明信息来源"
降低 temperature让输出更保守,减少"创造性编造"的空间
人工核实重要事实永远交叉验证

如何开始使用 LLM

选一个开始用

下面的产品都有免费额度,随便注册一个就能开始:

产品特点
ChatGPT (chatgpt.com)用户最多,生态最丰富(插件、GPTs 商店)。当前旗舰 GPT-5.5
Claude (claude.ai)写作和编程能力突出,上下文窗口大。当前旗舰 Claude Opus 4.8
DeepSeek (chat.deepseek.com)国产模型,中文能力强,免费,推理速度快。当前旗舰 DeepSeek V4
Kimi (kimi.moonshot.cn)超长上下文(100 万 token),K3 模型全球最大开源参数 (2.8T)
通义千问 (tongyi.aliyun.com)阿里出品,当前旗舰 Qwen 3.8-Max,中文写作公认最佳
文心一言 (yiyan.baidu.com)百度出品,ERNIE 5.0 全模态(文本+图片+音频+视频),已全面免费

2026 年的一个重要变化: 开源模型(Kimi K3、DeepSeek V4、GLM-5.2、Qwen 3.8)的性能已经追上甚至部分超越闭源旗舰。以前是"闭源领先开源半年",现在差距基本消失。对于学习者来说,意味着你甚至可以在自己的电脑上跑一个接近 GPT-4 水平的模型。

推荐的第一周"实验清单"

刻意测试模型的边界,比随便聊天收获大得多:

□ 翻译: "把下面的英文翻译成中文:[一段你熟悉的英文技术文档]"
□ 总结: "用 200 字总结以下文章的核心观点:[贴一篇文章]"
□ 编程: "用 Python 写一个函数,读取 CSV 文件并计算每列的平均值"
□ 解释: "用简单的语言解释什么是 RESTful API"
□ 反问: "以下代码有什么 bug?[贴一段有问题的代码]"
□ 创意: "帮我想 5 个 AI 学习项目的点子"
□ 对比: 把同一个问题分别问 ChatGPT、Claude、DeepSeek,感受风格差异
□ 追问: 模型回答了之后,追一句"能再详细解释一下吗?"或"有没有更好的方案?"

做完这些实验后,你应该会对 LLM 能干什么、不能干什么有个大致的直觉。


直观理解 LLM 的能力边界

一个有用的思维模型:System 1 vs System 2

借用认知心理学里的术语:

  • System 1(快思考): 直觉、自动的、不假思索。你看到 2+2 立刻知道是 4
  • System 2(慢思考): 需要集中注意力、逐步推理。你做 37×58 要在脑子里列竖式。

LLM 在输出每一个 token 时,花费的计算量是一模一样的,不管是回答"法国的首都是什么"还是"证明费马大定理"。从这个角度看,它随时都处于一种"快思考"的模式——本能地说出下一个词。

这就解释了:

为什么 LLM 有时会犯低级错误?
  → 它在做 System 1 的自动反应,但问题需要 System 2 的深度推理。

为什么加上"请一步步思考"能提高准确率?
  → 强制模型把推理链写出来,等于把"慢思考"的过程外化成了文本,后续的 token 生成有了
    更扎实的"上文"。

为什么它写充满套路的代码很快,设计新算法却不行?
  → 写常规代码是"模式匹配",是强项;真正的创新需要超出已有模式,刚好是弱点。

能力的三个阶段

可以这样粗略地理解当前 LLM 的能力水位:

LLM 能力三层次


本阶段小结

学完这五个概念,你已经拿到了读懂 AI 领域大部分讨论的"入场券":

Prompt(提示词)   → 你和 LLM 的沟通方式
Token(词元)     → LLM 的"原子"
Context Window    → LLM 的"工作记忆"上限
Inference(推理)  → LLM 的"运行"过程
Hallucination    → LLM 的"说谎"天性

下一篇进入第二阶段,会具体拆解 Tokenization 怎么把文字变数字、Embedding 怎么给词元赋予意义、Transformer 的 Self-Attention 怎么一次看懂整个句子。不过在这之前,先花一两天玩玩各种 LLM 产品,积累些手感,再看原理会顺畅很多。


延伸阅读与可视化资源

在线交互工具

资源类型说明
bbycroft.net/llm3D 交互在浏览器里看 LLM 推理的完整计算过程
The Illustrated GPT-2图解博客手绘风格拆解 GPT-2 架构,新手必读
Tokenization 交互演示在线工具实时看不同分词器怎么切你的输入
OpenAI Tokenizer在线工具数 token 数,看分词结果
Andrej Karpathy - Intro to LLMs视频 (1h)OpenAI 联合创始人的 LLM 全景通览
3Blue1Brown - 神经网络视频系列神经网络的数学可视化,零公式焦虑
LLM Stats 2026排行榜300+ 模型的实时对比:价格、速度、上下文窗口
LLM Cost Calculator在线工具对比各 API 的实际费用,避免"天价账单"

图片附录:先睹为快

以下是第二阶段会深入讲解的核心概念图解,先放在这里让你有个视觉印象:

Self-Attention(自注意力):Q、K、V 向量

Self-Attention QKV 向量

每个词元被投影成三个向量:Query(查询,想找什么)、Key(键,我有什么)、Value(值,我能提供什么信息)。图片来源:Jay Alammar, The Illustrated Transformer

Self-Attention 矩阵计算

Self-Attention 矩阵计算

实际计算时所有词元打包成矩阵,通过矩阵乘法一次完成。Q × K 的点积决定"谁关注谁"。图片来源:Jay Alammar, The Illustrated Transformer

Multi-Head Attention(多头注意力)

多头注意力回顾

一个头只能学一种模式,多个头并行就能同时关注语法、语义、指代等不同层面的关系。图片来源:Jay Alammar, The Illustrated Transformer

Encoder-Decoder 堆叠结构

堆叠的 Encoder-Decoder

实际的 Transformer 不是单层的——Encoder 和 Decoder 各自堆叠 N 层(GPT-3 有 96 层),层层提炼语义。图片来源:dvgodoy / CC BY

Positional Encoding(位置编码)

正弦余弦位置编码

Transformer 本身感受不到词序("我爱你"和"你爱我"对它来说是同一堆词)。位置编码给每个位置赋予独特的"指纹",让模型知道谁先谁后。图片来源:dvgodoy / CC BY


参考文献与图片来源

核心参考

标题作者/来源类型链接
Intro to Large Language ModelsAndrej Karpathy视频 (1h)YouTube — LLM 全景通览
Neural Networks (3Blue1Brown)Grant Sanderson视频系列YouTube — 神经网络数学可视化
The Illustrated GPT-2Jay Alammar博客jalammar.github.io — GPT-2 架构手绘图解
LLM VisualizationBrendan Bycroft交互工具bbycroft.net/llm — 3D 推理全过程可视化
LLM Stats 2026数据平台llm-stats.com — 300+ 模型实时对比
LLM Cost CalculatorMorph在线工具morphllm.com — API 费用对比
Tokenization 交互演示Context Lab在线工具context-lab.com — 多分词器对比
OpenAI TokenizerOpenAI在线工具platform.openai.com — token 计数

图片来源

图片来源许可
Transformer 架构图、Self-Attention QKV 向量、矩阵计算、多头注意力、残差连接等Jay Alammar, The Illustrated Transformer / GPT-2版权保留,教学引用
完整 Transformer 架构、Encoder/Decoder 堆叠、位置编码等dvgodoy / dl-visualsCC BY 4.0
自回归采样流程图PLOS OneCC BY 4.0
词嵌入 3D/2D 可视化Embedding Plot (Wikipedia)CC BY-SA

Released under the MIT License.