主题
第 6 章 · LLM 进化史:从 Transformer 到百花齐放
前五章的旅途中,我们把语言模型这台机器彻底拆开了。
我们见证了它如何从 1950 年代的规则引擎中蜕变;我们明白了 Transformer 是如何用 Attention 机制打破了记忆的壁垒;我们梳理了预训练与对齐的流水线;我们也直面了上下文窗口那个残酷的物理极限。
现在,你大可以把这些精密的齿轮与复杂的数学原理重新封装进黑盒里。我们要把视线从实验室的草纸,拉回到宏大的科技史时间线上。
2017 年 6 月,《Attention Is All You Need》发表。随后的九年,这篇仅有 11 页的论文,引发了一场堪比寒武纪生命大爆发的技术革命。今天你拉开模型列表,会看到几十个前沿模型:GPT-5.6、Claude Fable 5、Gemini 3.1 Pro、DeepSeek-V4、GLM-5.2、Llama 4、Qwen3.7……
它们底层都是 Transformer,但为什么会分化出如此庞大的家族?在这九年里,学术界和工业界在哪些岔路口做出了截然不同的选择?
了解这段进化史,并非为了背诵枯燥的发布日期或参数量。只有看清它们是从哪条技术路线走出来的、它们背后的创造者信仰怎样的哲学,你才能在未来的 AI 浪潮中,准确预判每一个新模型的定位与能力边界。
章节概要
- 三种架构的角逐:为什么最终统治世界的是“只会接话”的 Decoder-only 架构?
- 规模的暴力与数据的觉醒:Kaplan 缩放定律与 Chinchilla 的反叛,如何重塑了今天模型的训练方式。
- 巨头的分歧(闭源路线):OpenAI 的万能路线、Anthropic 的宪法安全路线与 Google 的原生多模态。
- 开源的野火与算力平权:从 LLaMA 的意外泄露,到以 DeepSeek 为代表的中国力量如何用极致的工程打破“算力霸权”。
- 范式转移:推理模型:o 系列与 R1 如何让模型从“直觉快思考”走向“内部慢思考”。
一、三种架构,一种胜出
2017 年的原版 Transformer,其实是一个 编码器-解码器(Encoder-Decoder) 架构——前半部分负责“读懂”原文,后半部分负责“写出”译文。 当这套架构被扔进开源社区后,研究者们立刻顺着三个不同的方向开始了实验。
1. Encoder-only:BERT 的双向理解
2018 年,Google 提出了 BERT。它大刀阔斧地砍掉了 Transformer 的后半部分(生成模块),只保留了用来“读”的 Encoder。 它的绝招是双向理解——在看一个词时,能同时看到它前面的词和后面的词。这让 BERT 在阅读理解、情感分类等任务上无往不胜。但它有一个致命弱点:它不会“接着往下写”。它是一个极佳的“阅读理解器”,却不是一个“内容生成器”。
2. Encoder-Decoder:T5 的大一统
Google 的另一个团队在 2019 年提出了 T5。它保留了完整的双边架构,提出了一种优雅的哲学:“把所有语言任务都变成‘文本进、文本出’”。无论是翻译、摘要还是分类,全部用相同的架构处理。但随着研究的深入,人们发现这种架构在处理纯粹的生成任务时,显得过于臃肿。
3. Decoder-only:GPT 的单向接龙
同样在 2018 年,OpenAI 提出了 GPT-1。他们做出了一个当时看来并不讨喜的选择:砍掉负责理解的 Encoder,只保留负责生成的 Decoder。 它采用严格的单向预测——在猜下一个词时,绝对不许偷看后面的词。这听起来似乎比 BERT 笨得多,但 OpenAI 押注了一个极其深远的直觉:只要把“预测下一个词”这个任务做到极致,模型自然就会涌现出对语言的深刻理解。
后来的历史证明,Decoder-only 赢得了整个时代。 因为它结构极其简单,训练目标极其纯粹。你不需要人工标注数据,直接把全互联网的文本倒进去,让它没日没夜地“猜下一个词”就可以了。这种极佳的可扩展性(Scalability),为下一阶段的暴力美学铺平了道路。今天所有的主流大模型,全部是 Decoder-only 的变体。
二、规模的暴力与 Chinchilla 的觉醒
暴力美学:GPT-3 与缩放定律
2020 年,OpenAI 发布了 1750 亿参数的 GPT-3。这是 AI 历史上的一座丰碑。 它向世界展示了“少样本学习(Few-shot Learning)”的奇迹:你不需要为了翻译或写诗去专门微调它,只需在提示词里给它几个例子,它就能自己照猫画虎。
这并非偶然。早在几个月前,OpenAI 就已发表了著名的 Kaplan 缩放定律(Scaling Laws),结论简单粗暴:只要你把算力花在增加模型的参数量上,模型的性能就会雷打不动地提升。GPT-3 正是这条定律指导下孕育出的巨兽。 在它的带动下,全行业陷入了盲目堆叠参数的狂热。
数据的反叛:Chinchilla 打破迷信
然而在 2022 年,DeepMind 团队发表了著名的 Chinchilla 论文。 他们做了一组极其严谨的实验,最后大声疾呼:大家全弄错了!我们在饿着我们的模型!
Chinchilla 证明,过去的模型(包括 GPT-3)参数太大,但喂进去的训练数据太少。在给定的算力预算下,最完美的解法是让参数量和训练数据量等比例增加。他们用远小于竞争对手的参数量(700 亿),喂了极高比例的数据(1.4 万亿 token),轻松碾压了当时所有的庞然大物。
这个发现让整个行业从“参数狂热”中清醒过来。从 2023 年的 LLaMA 开始,一直到 2026 年的前沿模型,各大厂商都不再盲目堆叠参数,而是开始丧心病狂地搜刮数据——训练数据量从万亿 token,一路狂飙到了 15 万亿甚至 30 万亿以上。
三、 ChatGPT 奇点与巨头的路线分化
2022 年 11 月 30 日,ChatGPT 的发布是一个分水岭。 在技术上,它只是在 GPT-3.5 的基础上叠加了我们第 4 章讲过的 RLHF(人类反馈强化学习)。但在历史上,它用 2 个月时间卷入了 1 亿活跃用户,正式拉开了通用人工智能(AGI)商业竞赛的序幕。
在此之后,昔日的学术极客们纷纷转型为庞大的商业帝国,并在底层的价值观和架构路线上分道扬镳:
OpenAI:万能助手与系统大一统
从 GPT-4 开始,OpenAI 彻底关上了开源的大门。他们的目标是打造最听话、最安全的“万能引擎”。2025 年的 GPT-5 把推理模型和普通模型整合成了一套自适应系统;到 2026 年 7 月最新的 GPT-5.6,更分化出 Sol、Terra、Luna 三种型号,分别主打旗舰能力、性价比与高吞吐场景,试图占领全球所有的知识工作场景。
Anthropic:绝对安全与宪法 AI
作为从 OpenAI 离职出走的团队,Anthropic 认为安全高于一切。在无害性对齐上,他们没有依赖庞大的人类标注团队逐条打分,而是为 Claude 系列写下了一部底层的“宪法”,让模型对照原则自我批评、自我修订——这套方法就叫 Constitutional AI。这造就了从 Opus 到 2026 年最新的 Fable 5 一脉相承的极佳文学品味,但也使其自带极其严苛的道德底线。
Google DeepMind:原生多模态
与前者最初的“文本拼装图像”不同,Google 从 Gemini 1.0 开始,就坚持原生多模态。图像、音频、文本从一开始就被打碎进同一个模型里联合训练。到了 Gemini 3.1 Pro,这种原生的感官融合让其在视觉理解和实时交互上独树一帜。
四、 开源的野火与算力平权
巨头的闭源模型越来越强大,但也越来越封闭、审查越来越严。如果大模型的算力被彻底垄断,那它将成为少数人定义人类知识体系的特权。
打破这面高墙的,是开源社区。
LLaMA 泄露:星星之火
2023 年 2 月,Meta 发布了 LLaMA 模型,原本只打算开放给通过审批的研究者,结果发布仅一周,模型权重就被人用种子链接泄露到了 4chan 论坛。 一夜之间,全世界的开发者拿到了大模型的“发动机图纸”。有人把它量化后塞进了 MacBook 里,有人用自己写的剧情数据对它进行无审查微调。这把意外的野火,直接催生了今天整个大语言模型的繁荣生态。后来,Meta 顺势而为,干脆将 Llama 2、Llama 3 作为开放权重(Open Weights)发布,确立了开源的基石。
架构创新与算力平权:MoE 的普及
2023 年底,法国公司 Mistral 发布 Mixtral 8x7B,把 MoE,即混合专家架构 Mixture of Experts,带入了主流开源界。 MoE 的核心思想是:把 FFN 拆成许多个“术业有专攻”的小模块。模型在生成每一个词时,不需要动用所有参数,只需要让路由器挑出一小部分“专家”来干活——以 Mixtral 8x7B 为例,总参数 470 亿,每个词只激活 130 亿。 要注意,MoE 省的是计算,不是内存:所有专家都得随时待命,总参数必须完整装进显存。它真正的威力在于,用远低于同等规模稠密模型的训练和推理算力,撑起巨大的知识容量。今天从 DeepSeek 到 Qwen 再到 Kimi,几乎所有前沿开源模型都采用了 MoE。
降维打击:中国力量的崛起
在 2024 到 2026 年的这场演进中,中国开源军团彻底改变了全球的竞争格局。 以杭州的 DeepSeek 为代表,他们开创了极其惊艳的底层优化,比如把 KV 缓存压掉九成以上的 MLA 注意力机制。DeepSeek-V3 只花了几百万美元级别的训练算力成本——不足硅谷同行的几十分之一——便训练出能力比肩闭源巨头的顶级模型;2026 年的 DeepSeek-V4 更是把 100 万 token 上下文变成了开源模型的默认配置。 与此同时,阿里的 Qwen、智谱的 GLM、MiniMax、月之暗面的 Kimi 等中国模型,不仅在全球基准测试中名列前茅,更是在开源界彻底普及了 100 万级甚至数百万级 Token 的超长上下文窗口。
开源生态的繁荣,彻底粉碎了“大模型只属于万亿财团”的神话。它让任何一个普通开发者和玩家,都能在本地部署或是以极低的成本,拥有属于自己的、不受审查约束的超级大脑。
五、 范式转移:System 2 推理模型的觉醒
就在我们以为模型的形态已经稳定在“扩大参数 + 增加数据”的轨道上时,2024 年 9 月 OpenAI 发布的 o1 系列,以及 2025 年 1 月 DeepSeek 发布的 R1,引发了自 ChatGPT 诞生以来最大的一次范式转移。
在此之前,所有的 LLM 都是在使用 系统 1(System 1) 的快思考:依靠直觉,一个词接着一个词往外接龙。
而推理模型(Reasoning Models)引入了大规模的强化学习,赋予了模型 系统 2(System 2) 的慢思考能力。当你给 o3 或者 R1 抛出一个复杂问题时,它不会立刻给你答案,而是先在后台写下几千甚至上万 token 的思维链草稿——英文叫 Chain-of-Thought,这份草稿通常不会完整展示给用户。 它会在内部自我博弈:提出假设、发现错误、推翻重来、验证事实,直到逻辑彻底闭环,才会把最终的结论输出给你。
这是 AI 历史上第一次,算法不再只是为了“纠正行为态度”,而是被用来内生性地发现推理规则。随着 GPT-5 系统、Claude 的混合推理以及开源推理模型的全面铺开,“先思考,再说话”已经成为了 2026 年前沿模型的标准配置。
什么是"系统 1"和"系统 2"?
这对概念出自诺贝尔经济学奖得主丹尼尔·卡尼曼(Daniel Kahneman)2011 年的著作《思考,快与慢》(Thinking, Fast and Slow)。
系统 1 是大脑的快思考模式——自动的、直觉的、瞬间的。当你看到"1+1=?"时,答案几乎不需要"想"就蹦出来了。它的优点是快,缺点是容易出错,尤其在需要多步推导的复杂问题面前。
系统 2 是大脑的慢思考模式——刻意的、有意识的、需要投入注意力的。当你面对"17×24=?"时,系统 1 给不了你答案,你必须调动系统 2,一步一步算。它的优点是精确,缺点是慢、累、消耗大量能量。
在 2024 年 o1 发布之前,所有 LLM 本质上都只有系统 1——模型接到输入后立刻开始逐词输出,没有"停下来想一想"的环节。推理模型的突破在于:它被允许在给出最终答案之前,先用大量 token 在内部"打草稿"——这就是系统 2 的引入。
六、 写给第二部
从 1950 年代的规则引擎,走到 2017 年那篇只有 11 页的论文;从最初被当作翻译工具的残阵,到通过极致的扩展(Scaling)统治了整个 AI 领域;从统一的文本接龙,分化出拥有“系统 2”慢思考能力的推理怪物。
到这里,第一部:大语言模型的来路,正式收官。
我们在这一部里花费了大量的笔墨,带你拆开架构的黑盒、走完预训练的管线、直面物理极限,最后梳理了各大阵营的谱系。这一切,都是因为我们坚信: 优秀的交互者,从不对着黑盒念咒。 当你理解了模型是怎么计算概率的、怎么被对齐的、以及它是从哪条技术路线上走下来的,你才拥有了驾驭它们的底层底气。
现在,这座庞大的引擎已经停在你的面前。 我们要把目光从冰冷的计算机科学和科技史,转向你手中的终极武器——语言本身。
为什么有时候你写得极其详尽,AI 却视而不见? 为什么只是换了一个标点符号,或者改变了信息的摆放位置,AI 的表现就判若两人?
在接下来的第二部:与 AI 对话的科学中,我们将正式推导出一套适用于所有大语言模型的提示词通用法则。 准备好,我们将走出历史的机房,开始学习如何真正地“雕刻概率”。
要点回顾
- 胜利的架构:相比于 Encoder,Decoder-only 因为极其纯粹的训练目标和无可匹敌的扩展性,最终统治了 LLM 领域。
- Scaling 与数据:Kaplan 缩放定律引发了参数竞赛,而 Chinchilla 则指出了“数据与参数必须等比增长”的真理。
- 巨头的博弈:OpenAI 致力于打造系统整合的万能助手;Anthropic 坚持用“宪法”确保绝对安全;Google 则深耕原生多模态的感官融合。
- 开源革命:由 LLaMA 泄露点燃,经由 MoE 架构优化,最终在中国力量(如 DeepSeek、Qwen 等)的推动下,实现了高质量模型和超长上下文的普及与平权。
- 推理模型的跨越:以 o 系列和 R1 为代表,模型从基于直觉的“文本接龙”跨越到了具有内部纠错能力的“深思熟虑”,这是近年来最深刻的架构革命。
参考文献
- Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., & Polosukhin, I. (2017). Attention Is All You Need. In Advances in Neural Information Processing Systems (NIPS), 5998–6008. arXiv:1706.03762.
- Radford, A., Narasimhan, K., Salimans, T., & Sutskever, I. (2018). Improving Language Understanding by Generative Pre-Training. OpenAI Technical Report.
- Devlin, J., Chang, M.-W., Lee, K., & Toutanova, K. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In Proceedings of NAACL-HLT 2019. arXiv:1810.04805.
- Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., Zhou, Y., Li, W., & Liu, P. J. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. Journal of Machine Learning Research, 21(140), 1–67. arXiv:1910.10683.
- Brown, T. B., Mann, B., Ryder, N., Subbiah, M., Kaplan, J., Dhariwal, P., ... & Amodei, D. (2020). Language Models are Few-Shot Learners. In Advances in Neural Information Processing Systems (NeurIPS). arXiv:2005.14165.
- Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., ... & Amodei, D. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Hoffmann, J., Borgeaud, S., Mensch, A., Buchatskaya, E., Cai, T., Rutherford, E., ... & Sifre, L. (2022). Training Compute-Optimal Large Language Models. In Advances in Neural Information Processing Systems (NeurIPS). arXiv:2203.15556.
- Ouyang, L., Wu, J., Jiang, X., Almeida, D., Wainwright, C. L., Mishkin, P., ... & Lowe, R. (2022). Training language models to follow instructions with human feedback. In Advances in Neural Information Processing Systems (NeurIPS). arXiv:2203.02155.
- OpenAI. (2023). GPT-4 Technical Report. arXiv:2303.08774.
- Bai, Y., Kadavath, S., Kundu, S., Askell, A., Kernion, J., Jones, A., ... & Kaplan, J. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M.-A., Lacroix, T., ... & Lample, G. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
- Jiang, A. Q., Sablayrolles, A., Roux, A., Mensch, A., Savary, B., Bamford, C., ... & Lample, G. (2024). Mixtral of Experts. arXiv:2401.04088.
- Liu, A., Xue, B., Wang, B., Wu, B., ... (DeepSeek-AI). (2024). DeepSeek-V3 Technical Report. arXiv:2412.19437.
- DeepSeek-AI. (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948.
- DeepSeek-AI. (2026). DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence. arXiv:2606.19348.