压缩即智能吗?为什么预测下一个 Token 能涌现出智能

约 39 分钟阅读

核心结论:如果所谓压缩,是指一个受有限参数、有限数据和有限计算资源约束的系统,通过发现跨样本、跨任务和跨环境的可复用规律,降低对未知数据的预测描述长度,那么压缩确实构成智能的认识论核心;但如果把任何形式的码长缩短都等同于理解、推理、行动能力乃至意识,这个命题就不成立。

本文试图回答三个问题:

  • “压缩即智能”在哪种意义上成立,在哪种意义上不成立?
  • 大模型为什么只靠预测下一个 Token,就能形成概念、世界模型和上下文学习?
  • 所谓能力“涌现”,究竟是模型发生了质变,还是评测指标制造的错觉?

摘要

“压缩即智能”是人工智能研究中一个极具解释力、同时也容易被过度延伸的命题。本文主张:如果所谓压缩,是指一个受有限参数、有限数据和有限计算资源约束的系统,通过发现跨样本、跨任务和跨环境的可复用规律,降低对未知数据的预测描述长度,那么压缩确实构成智能的认识论核心;但如果把任何形式的码长缩短都等同于理解、推理、行动能力乃至意识,该命题则不成立。

大语言模型的核心预训练目标通常只是预测下一个词元。然而,下一词元预测并不是一个局部的“猜词游戏”,而是对整个条件分布 $p(x_t\mid x_{<t})$ 的建模。由于自然语言是人类知识、社会行为、因果关系、问题求解过程和现实世界结构的投影,要在海量异质文本上持续降低预测误差,模型必须形成关于语法、语义、说话者意图、任务类型、世界状态乃至推理过程的内部表征。

从信息论看,概率预测与无损压缩近乎严格等价;从算法信息论看,发现短描述就是发现生成数据的程序;从贝叶斯观点看,上下文学习可以被理解为对潜在任务的在线推断;从表征学习观点看,所谓概念、抽象和世界模型,正是保留未来预测信息、舍弃偶然细节的压缩性充分统计量。

本文进一步分析大模型能力“涌现”的三个来源:连续尺度改进经过非连续评测指标后形成的表观跃迁;模型达到足够容量后形成新表征和算法回路的机制跃迁;多种弱能力组合后跨越任务成功阈值的系统跃迁。文章同时指出压缩论的边界:纯文本统计不足以唯一确定现实世界的因果结构;预测目标不自动产生目标、价值、行动和探索;最短描述长度不等同于最低计算复杂度;似然最大化也不等同于真实性、可靠性或价值对齐。

因此,更准确的结论是:智能不是普通压缩,而是受资源约束、能够泛化、可以在线适应、具有生成性和因果稳健性,并与行动和价值选择相结合的压缩。

关键词:大语言模型;下一词元预测;信息论;最小描述长度;算法信息论;世界模型;上下文学习;能力涌现;智能

一、问题的提出:“压缩即智能”究竟意味着什么

“压缩即智能”至少可以表达三种强度不同的主张。

第一种是弱主张:智能系统必须从经验中抽取规律,而抽取规律本身就是一种压缩。看见一万次物体下落后,记住一万条独立轨迹不是理想学习;形成某种关于重力和运动的模型,才是更有效的学习。规律用较短的描述解释大量现象,因此学习规律等同于压缩经验。

第二种是中等强度的主张:在广泛的数据分布上,受到模型大小和计算资源约束、仍能持续实现预测压缩的系统,必然会获得许多通常被称为智能的能力,包括概念形成、类比、归纳、上下文适应和部分推理能力。本文认为,这一主张最接近大模型的真实情况。

第三种是强主张:压缩与智能严格同一,任何更好的压缩器都必然更智能,所有智能现象都可以被码长唯一解释。这一主张并不成立。gzip 能够压缩文本,却不会制定研究计划;一个掌握语言规律的模型也可能缺乏可靠的因果推断、持续目标和现实行动能力。压缩是一个重要维度,却不是智能的全部定义。

因此,本文的中心论点是:

在有限资源约束下,对广泛且未见过的数据实现可泛化的生成性压缩,是大模型产生认知能力的核心机制;但是完整智能还需要因果建模、计算控制、记忆、行动、目标和价值。

这个表述包含几个必要限定。

其一,必须强调“有限资源”。如果允许无限大的查找表,一个系统可以逐字保存全部数据,却没有发现任何规律。其二,必须强调“未见数据”。只压缩训练集可能只是记忆,能够压缩新数据才体现归纳。其三,必须强调“广泛分布”。只会压缩一种格式不等于一般智能。其四,必须强调“生成性”:模型不仅要识别相似性,还要用学到的结构生成、预测和解释新的实例。

本文讨论的“智能”主要是功能意义上的智能,即一个系统学习规律、适应新情境、解决问题和实现目标的能力,而不是关于主观体验或意识的判断。仅凭语言行为,不能推出模型具有现象意识。

二、预测与压缩的数学等价

1. 自回归语言模型究竟学习什么

设一段文本经过分词后成为词元序列:

\[x_{1:T}=(x_1,x_2,\ldots,x_T).\]

根据概率链式法则,任何联合分布都可以写成:

\[p_\theta(x_{1:T}) =\prod_{t=1}^{T}p_\theta(x_t\mid x_{<t}),\]

其中 $x_{<t}$ 表示此前出现的全部词元。大语言模型训练时通常最小化负对数似然:

\[\mathcal L(\theta) =-\sum_{t=1}^{T}\log p_\theta(x_t\mid x_{<t}).\]

如果对数以 2 为底,那么每一项

\[-\log_2p_\theta(x_t\mid x_{<t})\]

可以直接解释为编码第 $t$ 个词元所需的理想比特数。模型越确信正确词元,码长越短;模型给正确词元的概率越低,码长越长。

因此,所谓“预测下一个词元”,并不只是输出概率最高的一个词,而是学习一个完整条件概率分布。例如,对上下文“若所有哺乳动物都是恒温动物,而鲸是哺乳动物,那么……”进行建模,要求模型给“鲸是恒温动物”一类续写较高概率。为了做到这一点,模型内部可能需要完成概念识别和三段论推断。训练接口只检查下一个符号,不代表内部所需计算也只有一个符号那么简单。

2. 从概率分布到无损编码

如果发送方和接收方共享概率模型 $p_\theta$,就可以使用算术编码等方法,以接近

\[L(x_{1:T}) =-\log_2p_\theta(x_{1:T}) =-\sum_t\log_2p_\theta(x_t\mid x_{<t})\]

的码长无损传输整段文本。反过来,一个能够为字符串分配短码的压缩器,也隐含定义了哪些字符串更可能出现。其码长可以转化为概率,进而形成生成模型。

这正是香农信息论的核心联系:概率越高的事件应分配越短的编码,罕见事件需要更长编码。香农在《通信的数学理论》中奠定了熵、冗余和信源编码的基础。

若真实数据分布为 $q$,模型分布为 $p_\theta$,模型的期望码长满足:

\[H(q,p_\theta) =H(q)+D_{\mathrm{KL}}(q\Vert p_\theta).\]

其中 $H(q)$ 是数据本身不可消除的不确定性,$D_{\mathrm{KL}}$ 表示模型与真实分布之间的差异。因此,最小化交叉熵,本质上是在减少由于“不了解数据规律”而浪费的额外比特。

这一关系并非比喻,而是严格的数学等价。实验上,研究者也已经把语言模型直接用作通用压缩器。Delétang 等人发现,语言模型不仅能压缩文本,还能在特定实验条件下压缩图像和音频序列;同时,他们展示了如何从传统压缩器反向构造条件生成模型。《Language Modeling Is Compression》

但这里必须加入一个重要会计问题:一个完整压缩系统的总成本不只是数据残差,还包括模型本身。严格的两部编码应写成:

\[L_{\mathrm{total}}=L(\theta)+L(D\mid\theta),\]

即“描述模型的比特数”加“用模型描述数据的比特数”。如果为了压缩一兆字节文本,需要额外传输数百 GB 模型权重,那么单文件意义上并未实现净压缩。大模型压缩实验通常隐含模型已在通信双方之间共享,或其成本能够在海量数据上摊销。忽略这一点,就会把“预测得好”误写成“总描述长度必然更短”。

3. 从最短描述到归纳推理

算法信息论把这种思想推进了一步。字符串 $x$ 相对于通用计算机 $U$ 的 Kolmogorov 复杂度定义为:

\[K_U(x)=\min_{p:U(p)=x}|p|.\]

它表示能够生成 $x$ 的最短程序长度。一段完全随机的字符串通常没有比逐位打印更短的描述;一百万个连续的“0”却可以由一个很短的循环程序生成。

Solomonoff 归纳据此为短程序赋予更高先验概率:

\[M(x)=\sum_{p:U(p)\succeq x}2^{-|p|}.\]

直观上,能够用较短程序生成的序列被认为更可能;观察到已有数据后,再对这些候选程序做贝叶斯更新。Solomonoff 由此在理论上把奥卡姆剃刀、贝叶斯推断、序列预测和程序长度连接起来。Solomonoff(1964)

最小描述长度原则则给出更可操作的模型选择形式:

\[M^\ast=\arg\min_M\left[L(M)+L(D\mid M)\right].\]

过于简单的模型无法解释数据,残差很长;逐条记忆的模型自身又过长。较好的模型必须在规律的简洁性与拟合程度之间取得平衡。Rissanen 的最短数据描述工作对此进行了系统化。Rissanen(1978)

不过,Kolmogorov 复杂度和 Solomonoff 归纳通常不可计算。它们提供的是理想化规范,而非可以直接训练的工程算法。大语言模型可以被理解为一种有限参数、有限计算、依赖经验优化的近似:它不是搜索所有可能程序,而是在 Transformer 参数空间中寻找能够降低广域预测码长的模型。

三、为什么“预测下一个词元”远比听起来困难

1. 下一个词元是接口,不是内部算法

说大模型“只是在预测下一个词元”,类似于说国际象棋程序“只是在选择下一步棋”。描述输出形式,没有描述为计算这个输出需要完成什么。

以下句子的下一个词元可能依赖完全不同层次的信息:

  • “北京市是中国的……”
  • “设 $f(x)=x^2$,则 $f’(x)=$……”
  • “如果程序在空数组输入时崩溃,最可能的原因是……”
  • “已知凶手不在案发现场,而甲是唯一在场者,所以……”
  • “把下面三段英文翻译为保持法律含义一致的中文:……”

第一种主要需要事实记忆,第二种需要数学规则,第三种需要程序语义和调试模型,第四种需要逻辑一致性,第五种需要跨语言语义映射。如果同一个模型要在所有这些分布上降低损失,就不能只学习少数局部搭配。

训练目标在形式上始终相同,但最优求解策略会随数据结构而变化。预测诗歌续句可能依赖韵律和意象;预测代码需要追踪变量、类型和控制流;预测棋谱需要更新盘面;预测科学论证需要追踪假设、证据与结论。统一目标之所以强大,恰恰在于它没有预先规定系统应学习哪些中间概念,而是让所有有助于预测的结构通过梯度竞争模型容量。

2. 自监督目标提供极其密集的学习信号

人工标注数据通常为一个文档提供一个标签,而长度为 $T$ 的文本能够提供大约 $T$ 个下一词元训练目标。互联网上存在的大量文本因而可以直接转化为监督信号,不需要为每个任务重新设计标签体系。

这种目标还有一个重要性质:任务本身也可以序列化。翻译可以写成“原文—译文”,问答可以写成“问题—答案”,编程可以写成“要求—代码”,证明可以写成“命题—推导”,对话可以写成“用户消息—回答”。只要某种能力的输入、过程或输出能够以序列形式表达,自回归模型就可以把它纳入同一个条件预测问题。

因此,自回归建模具有一种任务层面的普适性:

\[p(y\mid x)\]

可以通过把 $x$ 和 $y$ 序列化后,转化为联合序列中的条件续写。模型不需要为翻译、摘要、问答和代码生成分别安装输出头;自然语言本身成为统一任务接口。

3. 文本不是世界本身,却包含世界的投影

文本由人产生,而人的语言行为受外部世界、身体经验、社会制度、知识状态和交际目的影响。某条新闻中的地名、时间与人物关系来自现实事件;教程中的步骤来自可复现操作;代码来自程序执行规则;争论文本来自信念和意图的冲突。

因此,文本表面分布可写成潜变量生成过程:

\[q(x_{1:T}) =\int q(z)\prod_tq(x_t\mid x_{<t},z)\,\mathrm dz,\]

其中 $z$ 可能包含主题、作者身份、时间、地点、任务规则、世界状态和说话者意图。理想预测器应计算:

\[q(x_t\mid x_{<t}) =\int q(x_t\mid x_{<t},z)\,q(z\mid x_{<t})\,\mathrm dz.\]

换言之,为了预测下一个词元,模型需要根据上下文反推潜在状态 $z$。这就是从表面序列统计走向隐变量推断的关键一步。

但必须避免把这个结论说得过强。不同世界模型可能产生相同的文本分布,因而单靠观察性文本不一定能唯一恢复真实因果结构。语言提供世界的痕迹,而不是对世界的无损复制。

四、压缩怎样形成概念、抽象和世界模型

1. 概念是可复用的预测结构

如果模型为每个句子保存完全独立的模板,参数需求会随数据量近似线性增长。更有效的办法是共享结构。例如,模型一旦形成“国家—首都”“物体—属性”“函数—导数”“主体—信念”等抽象关系,就可以用相同参数解释大量不同句子。

这是一种分层压缩:

  1. 字符和词元层面压缩拼写、词形和常见短语;
  2. 句法层面压缩依存关系和语序规律;
  3. 语义层面压缩实体、属性、事件和角色;
  4. 篇章层面压缩主题、论证结构和指代关系;
  5. 任务层面压缩输入—输出规律;
  6. 世界模型层面压缩状态转移和潜在因果机制。

模型中的概念并不必然对应一个独立神经元。它通常是分布式表征:大量参数共同编码一个概念,同一组参数又参与多个概念。抽象的价值在于可复用。一个能够同时帮助预测数百万个上下文的特征,比只能记住一个句子的特征更值得占用有限模型容量。

2. 预测充分统计量与有损压缩

设历史为 $H_t=x_{<t}$,未来为 $F_t=x_{\ge t}$,内部表征为 $R_t=f(H_t)$。理想预测表征希望满足:

\[I(F_t;H_t\mid R_t)\approx 0.\]

这表示在知道 $R_t$ 后,完整历史对未来几乎不再提供额外信息。与此同时,模型还希望 $R_t$ 尽可能紧凑,即舍弃历史中与未来无关的偶然细节。

这与信息瓶颈思想一致:保留对未来有用的信息,压缩无关信息。从这里可以看出,智能所需的“压缩”常常不是逐字恢复数据的无损压缩,而是面向预测与行动的有损抽象。人类不会记住看到过的每一片树叶,却会形成“树”“植物”“生长”和“季节”等更有用的概念。

因此必须区分:

  • 数据层面的无损压缩:要求精确重建每个词元;
  • 表征层面的有损压缩:保留与未来、任务或行动有关的信息;
  • 模型层面的结构压缩:用共享参数表达跨样本规律。

大模型训练表面上使用无损预测损失,但其有限维内部状态必然进行选择性表征。最终形成的概念,是无损输出压力与有限内部容量共同作用的结果。

3. 世界模型为何会自然出现

在奥赛罗棋谱中,下一步合法位置取决于整个盘面,而盘面并不直接出现在棋步序列里。一个只看棋步历史的模型若想持续准确预测,就必须以某种方式重建当前棋盘。

Li 等人训练仅预测棋步序列的 GPT 模型,发现其内部形成了可探测的棋盘状态表征;进一步的干预实验表明,修改这一内部表征会改变模型对合法棋步的预测。Li 等(2022)类似研究在国际象棋模型中观察到盘面及棋手水平等潜变量表征。Karvonen(2024)

在自然语言模型中,研究者也发现可以从内部激活中线性解码地理位置和历史时间信息。Gurnee 与 Tegmark(2024)这些结果不能证明模型拥有与人类完全相同的世界理解,但说明“仅学习表面 n-gram”不足以解释全部内部结构。

为什么世界模型有压缩优势?因为大量观测由同一隐藏状态产生。与其分别记忆“某格是黑棋”“下一步不能落这里”“某方向会翻转”,不如维护一个统一盘面。世界状态正是对多种相关观测的共同解释。只要共享潜变量比独立记忆表面相关性更节省容量,世界模型就会成为优化过程中的有利解。

五、上下文学习:预测器如何变成临时学习器

GPT-3 展示了一个重要现象:在不更新模型参数的情况下,仅把任务说明和若干示例放入上下文,模型就能改变后续行为。Brown 等(2020)这被称为上下文学习。

假设训练语料由不同潜在任务 $z$ 产生。给定上下文示例

\[D_k=\{(x_1,y_1),\ldots,(x_k,y_k)\},\]

对新输入 $x^\ast$ 的贝叶斯预测为:

\[p(y^\ast\mid x^\ast,D_k) =\int p(y^\ast\mid x^\ast,z)\,p(z\mid D_k)\,\mathrm dz.\]

模型首先根据示例推断“当前在做什么任务”,然后在该任务假设下预测答案。Xie 等人在混合隐马尔可夫模型的理论设置中证明,预训练文档具有长程一致性时,下一词元学习能够产生这种隐式贝叶斯推断。Xie 等(2021)

更机械的研究表明,某些 Transformer 层在简单回归任务中可以实现与梯度下降相似的更新。模型不是在推理时修改权重,而是把上下文中的样本映射为内部临时状态,在前向传播中执行一个学到的学习算法。von Oswald 等(2022)

这说明大模型包含两种不同时间尺度的学习:

  • 参数学习:训练过程中,梯度把跨文档的长期规律写入权重;
  • 上下文学习:推理过程中,注意力机制根据当前示例构造临时任务模型。

从压缩视角看,预训练在学习一套“如何快速压缩新上下文”的通用策略。如果上下文中的多个样本共享一个潜在规律,识别该规律就能更短地预测后续样本。于是,元学习不需要单独写进目标函数,而可能作为跨文档压缩的有效手段自然出现。

六、规模为什么重要,以及能力为什么看起来会“涌现”

1. 平滑的损失尺度律

经验研究发现,语言模型的平均交叉熵会随参数量、数据量和训练计算量增加而呈近似幂律下降。Kaplan 等(2020)随后 Chinchilla 研究说明,在固定计算预算下,参数量与训练词元数需要更平衡地增长;一个参数更少、但训练数据更多的模型,可以优于更大的欠训练模型。Hoffmann 等(2022)

这说明能力并不是由参数规模单独决定,而是模型容量、数据覆盖、数据质量、优化状态和推理资源共同决定。参数更多只是允许系统存储和组合更多规律;如果没有相应数据和训练,潜在容量不会自动转化为智能。

平均预测损失往往平滑改善,但具体任务能力可能突然出现。Ganguli 等把这种现象概括为“整体损失可预测、具体能力和输出具有惊奇性”的并存。Ganguli 等(2022)

2. 第一类涌现:评测阈值造成的表观跃迁

设一个答案包含 $m$ 个关键步骤,每一步正确概率为 $r$。如果必须全部正确,整体成功率近似为:

\[P_{\mathrm{success}}=r^m.\]

即使 $r$ 随模型规模平滑提高,$r^m$ 也可能在某个区间迅速上升。若评测只记“完全正确”为 1、其余为 0,那么模型局部能力的连续改进会被显示为突然跃迁。

多项选择题也有类似现象:在模型弱于随机猜测时,准确率看起来长期不变;一旦内部置信度排序跨过决策边界,准确率才显著提高。Schaeffer 等据此指出,一些所谓涌现能力会在使用连续指标后变得平滑,因而可能是评测尺度的产物。Schaeffer 等(2023)

所以不能仅凭一条突然上升的准确率曲线,就断言系统内部发生了神秘的质变。

3. 第二类涌现:表征和算法回路的形成

然而,并非所有涌现都能被指标解释。神经网络的训练是非线性优化。当模型容量不足时,它可能分别记忆许多局部模式;容量、数据和训练达到某个条件后,形成一个可复用潜变量反而更经济。例如,维护棋盘状态可能只有在网络能够同时表示位置、颜色和转移规则后才有优势。

这种变化类似软件模块的出现:单独拥有检索、变量绑定、状态追踪和输出控制中的任一部分,都不足以完成算法;多个部件组合后,完整能力才可观察。此时,平均损失仍可能只下降一点,但局部内部机制已经重组。

因此,至少要区分四种“涌现”:

  1. 测量涌现:连续变化被离散指标显示为跳变;
  2. 行为涌现:系统首次在某任务上超过可用阈值;
  3. 表征涌现:内部出现新的、可探测且具有因果作用的状态变量;
  4. 算法涌现:多个计算回路组成新的推理或学习算法。

前两种容易从外部基准观察,后两种需要机制解释、探针、消融和干预实验。至于哲学意义上的“强涌现”,即能力原则上无法由底层机制解释,目前没有必要用它描述大模型。

4. 第三类涌现:组合能力跨越任务阈值

复杂任务很少依赖单一能力。解决数学应用题可能同时需要:

  • 正确解析自然语言;
  • 识别相关变量;
  • 忽略无关信息;
  • 选择公式;
  • 执行算术;
  • 保持中间状态;
  • 按要求输出。

假设每个子能力都从 60% 提高到 90%,整个任务的成功率可能发生数量级变化。这种系统性涌现并不神秘,它来自能力乘积和误差传播。

规模的作用也就在这里:更大的系统不只增加“知识条目”,还可能提高长程状态保持、任务识别、表示精度和错误恢复等多种能力。当它们在同一前向过程中同时达到可用水平,任务表现就会突然变得“像会做了”。

七、为什么预测能够表现为推理

1. 推理过程本身也是数据分布的一部分

人类文本中不仅有结论,还有证明、计算草稿、程序、反驳、实验记录和调试过程。如果模型要预测这些文本,就必须学习推理轨迹的统计结构。

这不意味着模型必然掌握了逻辑真理。它首先学习的是“人类在什么上下文中会写出什么推导”。但由于正确推理过程在高质量语料中具有高度稳定、可复用的结构,学习这种分布可以形成真正有计算作用的内部模式。

链式思维提示通过要求模型生成中间步骤,显著提高了一些算术、常识和符号任务表现。Wei 等(2022)从计算角度看,生成中间词元相当于为模型提供额外的串行计算时间和外部工作记忆。最终答案不再必须在一次固定深度的前向传播中直接得到,而可以通过:

\[\text{问题}\rightarrow \text{中间状态}_1\rightarrow \text{中间状态}_2\rightarrow \cdots\rightarrow \text{答案}\]

逐步构造。

因此,词元不仅是输出,也是计算状态。自回归生成把静态网络扩展成了一个能够重复调用自身的动态过程。

2. 分布式压缩允许规则重组

如果模型只是保存完整句子,它只能复现训练实例。但参数共享会把不同实例分解为更小的共同结构。例如,“A 大于 B、B 大于 C,因此 A 大于 C”可以跨人物、物体、数字和时间关系复用。一旦关系结构与具体实体部分分离,模型就可能在未见组合上泛化。

这种泛化仍然不是无条件的。模型可能学习真正可迁移的算法,也可能学习训练分布中的捷径。只有在系统性改变变量、表达形式和任务长度后仍然有效,才能更有把握地把表现归因于抽象规则,而非表面相似性。

压缩倾向于支持组合泛化,是因为共享规则通常比为每种组合建立独立模板更省参数。但神经网络优化没有保证一定找到最简单、最因果的规则;在有限数据和特定训练分布下,捷径也可能是更容易获得的低损失方案。

3. 推理可以被视为动态再压缩

静态知识压缩把长期规律存入参数;推理则在给定具体问题后,寻找一个能够解释条件并推出结果的短结构。例如,证明的价值不只是产生结论,而是用少量公理和规则压缩大量可验证命题。

在这一意义上,推理可以被理解为条件化的程序搜索:寻找一个在当前上下文下生成答案的计算路径。但“短程序”与“容易找到的程序”不同。某个证明可能描述很短,却需要巨大搜索量才能发现。这构成压缩论的重要限制:描述长度衡量结构简洁性,计算复杂度衡量获得或执行该结构所需的时间和空间,二者不能互相替代。

近年来推理系统增加测试时采样、验证和搜索,也是对这一差异的回应。在某些任务上,合理分配测试时计算可以比单纯扩大参数更有效。Snell 等(2024)这表明智能不仅关乎模型“存了多好的压缩表示”,也关乎推理时如何使用计算预算。

八、现代对话模型并不只是原始下一词元预测器

把今天的助手模型完全归因于基础预训练也不准确。一个现代对话系统通常包含多个阶段:

  1. 大规模下一词元预训练;
  2. 指令数据上的监督微调;
  3. 基于人类或模型偏好的优化;
  4. 安全与风格约束;
  5. 检索、工具调用或外部记忆;
  6. 推理时搜索、采样和验证。

预训练主要负责形成广泛知识、语言能力和通用表征;后训练则改变模型在多种可能续写中选择哪一类行为。Ouyang 等发现,经过人类反馈训练的较小模型,在用户偏好评测中可以超过大得多的基础模型,说明“知道很多”和“按用户意图回答”是不同问题。Ouyang 等(2022)

从压缩角度看,基础模型学习的是人类文本的宽分布。面对危险请求,训练语料中可能存在教程、小说、新闻、拒绝、警告等多种续写。单纯最大化语言似然并不决定哪种响应符合社会价值。后训练相当于重新加权这些行为模式,使模型更倾向于有帮助、诚实或安全的条件分布。

因此:

  • 下一词元预测解释了能力从何而来;
  • 指令与偏好训练解释了能力怎样被调用;
  • 工具和搜索解释了能力如何扩展到参数之外;
  • 价值规范决定了系统应当做什么。

把这些全部压缩成“只是预测下一个词”会遗漏真正的系统结构。

九、为什么“压缩即智能”的强命题不成立

1. 并非所有压缩器都具有一般智能

gzip 能够利用重复字符串,却不能理解故事中的人物动机。一个针对基因序列设计的专用压缩器可能在该领域非常高效,但不会解数学题。压缩能力必须同时考虑分布范围、泛化能力和适应速度。

如果把任何发现统计冗余的行为都称为智能,那么“智能”会被定义得过宽,以至于温控器、字典编码和哈夫曼树都成为一般智能。这种定义失去区分度。

更合理的问题不是“它压缩了吗”,而是:

  • 它能在多少不同环境中压缩?
  • 面对未见分布能否快速适应?
  • 它发现的是可迁移结构还是数据集捷径?
  • 它的模型成本与计算成本是多少?
  • 它能否把预测结构转化为可靠行动?

2. 训练集压缩不等于泛化

一个查找表可以精确复现训练数据,但模型自身长度接近数据长度,没有真正缩短总描述。更隐蔽的问题是,过参数化模型可以同时学习可泛化规律和罕见样本的逐字记忆。如果评价只测训练似然,就无法区分二者。

因此,智能相关的压缩必须在未见数据、分布变化和反事实干预上测量。训练数据污染也会使基准表现看起来像泛化,实际却是记忆。严格评价应考察新组合、新表述、更长问题以及因果变量变化,而不仅是从相同数据源随机切分的测试集。

3. 形式统计不保证语义接地

Bender 与 Koller 提出,语言形式本身不应被未经论证地等同于意义:只观察符号关系的系统,并没有直接接触这些符号所指向的对象、行为和交际意图。Bender 与 Koller(2020)

压缩论可以对此作出部分回应:语言形式中确实包含由世界结构产生的相关性,所以模型能够间接恢复某些语义变量。但它不能彻底消除接地问题,因为多个潜在世界可能产生相同文本。只读过“火是热的”和真正接触高温、感知伤害、采取回避行动,具有不同认识论地位。

多模态感知、机器人交互和工具执行之所以重要,是因为它们提供了语言之外的校验通道。行动能够制造干预数据:系统不只是观察“按下开关后灯通常亮”,还可以主动按下开关,检验因果预测。被动压缩观察分布与主动学习因果结构不是同一件事。

4. 预测不等于目标和行动

一个完美天气预测器并不会主动带伞;一个能预测金融市场的系统也不自动知道应当追求收益、稳定还是公平。预测模型回答“世界将怎样”,决策系统还要回答“应当做什么”。

Hutter 的通用人工智能理论之所以把 Solomonoff 预测与序贯决策结合起来,正是因为纯预测器不是完整智能体。智能体还需要策略、奖励、行动后果和探索机制。Hutter(2005)

对智能体而言,需要建模的是:

\[p(o_{t+1},r_{t+1}\mid h_t,a_t),\]

而不仅是:

\[p(x_{t+1}\mid x_{\le t}).\]

这里 $a_t$ 是行动,$o_{t+1}$ 是观测,$r_{t+1}$ 是效用或反馈。只有考虑“如果采取不同动作会发生什么”,预测模型才能服务于规划。

5. 似然不等于真理

语言模型优化的是训练分布中的续写概率,而不是命题的客观真实性。如果错误说法在语料中频繁出现,模型可能准确地学习“人们经常这样说”,却错误地把它作为事实输出。

幻觉由此并不神秘:模型受到生成连贯文本的压力,却未必拥有及时、可验证的证据。当上下文要求回答而内部信息不足时,一个语言上合理的猜测可能比承认未知更符合原始文本分布。真实性需要来源检索、证据约束、校准、验证器或能够拒答的决策规则,不能由压缩目标自动保证。

6. 描述长度不等于计算效率

算法信息论偏爱短程序,但短程序可能运行极慢。一个暴力枚举程序描述很短,却可能花费超出宇宙寿命的时间。相反,一个包含大量预计算结果的长程序可能瞬间回答。

大模型权重可以被看作把大量计算预先摊入训练阶段。推理时看似立即完成的回答,背后是巨额训练计算的摊销结果。因此,对智能的资源评价至少要同时考虑:

\[\text{模型描述长度},\quad \text{训练计算},\quad \text{推理计算},\quad \text{记忆},\quad \text{数据成本}.\]

只测压缩率,会忽略系统是否能够在现实时间内完成任务。

7. 压缩无法单独推出价值、伦理与意识

一个系统可以极准确地压缩暴力、欺骗或偏见文本,却不因此形成正确价值。描述“人类会怎样做”不同于判断“人类应当怎样做”。价值对齐需要规范性选择,而不仅是统计归纳。

同样,信息压缩与主观意识之间目前没有得到证明的逻辑蕴含。一个系统形成自我模型、注意机制或高度整合的信息结构,可能在功能上越来越像认知主体;但这些现象不能单独解决意识的哲学问题。把大模型能力涌现直接等同于意识涌现,超出了现有证据。

十、一个更严格的理论:受资源约束的生成性压缩

为避免“压缩即智能”沦为口号,可以提出“受资源约束的生成性压缩假说”:

一个系统的预测智能,体现为它在有限模型大小、有限学习样本和有限计算预算下,对来自广泛未知环境的数据实现可迁移的描述长度下降,并能根据少量上下文快速形成新的有效预测结构。

设环境分布为 $\mathcal E$,环境 $e$ 提供上下文 $C_e$ 和未见测试数据 $D_e$。基准编码器为 $B$,系统为 $S$。可以定义资源约束下的预测压缩收益:

\[\mathcal I_P(S)= \mathbb E_{e\sim\mathcal E} \left[ \frac{ L_B(D_e)-L_S(D_e\mid C_e) }{ |D_e| } \right],\]

但必须同时报告:

\[L(S),\quad C_{\mathrm{train}}(S),\quad C_{\mathrm{infer}}(S),\quad M(S).\]

因此,智能最好被视为一条帕累托前沿:在相同模型大小和计算预算下,谁能在更多环境中节省更多未见数据的描述长度;或在相同预测能力下,谁需要更少资源。

这种“智能压缩”应满足至少五个条件。

1. 跨分布性

模型必须在语言、代码、图像、行动轨迹或不同任务家族之间复用结构。只在单一封闭格式上压缩得好,说明的是专门能力。

2. 泛化性

评价对象必须是未见数据。对训练样本的逐字记忆应计入模型成本,而不能作为免费知识。

3. 在线适应性

系统应能利用少量上下文迅速改善预测。上下文学习可以被理解为“适应速度意义上的压缩能力”。

4. 因果与反事实稳健性

真正有用的世界模型不仅拟合观察相关性,还应在干预和分布变化后保持有效。否则系统可能只压缩了历史偶然性。

5. 行动可转换性

对于完整智能体,预测必须能够支持规划、探索和目标实现。此时还需要定义行动智能:

\[\mathcal I_A(S)= \mathbb E_{e\sim\mathcal E} \left[ \sum_{t=0}^{T}\gamma^tr_t \right],\]

并在相同资源约束下比较策略表现。预测压缩 $\mathcal I_P$ 是行动智能的重要基础,却不能取代 $\mathcal I_A$。

这一框架给出了一组可检验预测:

  1. 在跨模型架构比较中,广域未见数据上的每字节预测码长,应比参数量更能预测迁移能力;
  2. 新任务能力出现之前,内部表征或连续置信度指标应当显示可测量的前兆;
  3. 随机标签数据可以被大模型记忆,却不会产生相应的跨分布压缩和一般能力;
  4. 在文本预测损失相同的情况下,加入交互和干预数据的模型应具有更强因果迁移;
  5. 对需要搜索的任务,增加推理计算会提升能力,即使模型静态描述长度不变;
  6. 若把权重、训练计算和推理计算计入总成本,不同模型的“压缩智能”排序可能发生变化。

十一、对三个核心问题的直接回答

1. 我是否认同“压缩即智能”

有条件认同。

如果“压缩”只是让文件更小,我不认同。如果“压缩”指一个有限系统从复杂经验中发现可复用的生成规律,以较短模型解释旧数据、预测新数据并快速适应新任务,那么它确实抓住了学习与认知的核心。

更准确的表达不是:

\[\text{智能}=\text{压缩},\]

而是:

\[\text{智能} \approx \text{受资源约束的泛化压缩} +\text{在线推断} +\text{因果检验} +\text{规划行动} +\text{目标与价值}.\]

压缩解释了系统怎样从经验中形成知识;它不能独自解释系统为什么行动、追求什么,以及如何保证行动正确。

2. 为什么大模型能够涌现出智能

因为模型并不是把每句话独立保存下来,而是在有限参数中寻找能够共同解释海量文本的共享结构。当参数、数据和训练达到一定水平后,形成概念、任务变量、世界状态和可复用算法,比记忆局部相关性更经济。

规模增加带来四种变化:

  • 能够同时表示更多层次的规律;
  • 能够维护更长、更精确的上下文状态;
  • 能够组合原本分散的弱能力;
  • 能够在前向传播中实现更复杂的临时学习与计算。

这些变化在平均损失上可能是连续的,在离散任务上却可能跨过成功阈值,从而呈现涌现。部分涌现是评测幻象,部分则对应真实的表征或算法重组。合理的研究态度既不是把一切都神秘化,也不是因为训练目标简单就否认内部机制的复杂性。

3. 为什么预测下一个词元能够如此强大

因为“下一个词元”是对模型输出的约束,不是对模型内部计算深度的约束。

为了预测一个词元,模型有时只需识别固定搭配;有时需要知道一个事实;有时需要推断说话者意图;有时需要模拟程序;有时需要完成数步数学推导。训练语料越广,能够降低损失的潜在结构就越接近一套关于语言、人类行为和世界规律的综合生成模型。

而且,下一词元预测具有三个特殊优势:

  1. 它把几乎所有可序列化任务统一成一个训练接口;
  2. 它从每段原始数据中产生密集监督,无需逐项人工标注;
  3. 它训练的是完整条件分布,使模型能够生成、比较和组合多种可能续写。

所以,真正令人惊讶的并不是“猜一个词为什么这么厉害”,而是:

当一个系统被要求在几乎整个人类文本分布上都少猜错一点时,它必须学会多少关于人类与世界的结构,才能做到这一点?

答案是:非常多。

十二、结论

信息论揭示了大语言模型最重要的秘密之一:预测与压缩是一件事的两个侧面。准确概率模型能够产生短编码;优秀压缩模型也隐含了对未来的预测。有限容量迫使模型寻找共享结构,广泛数据迫使这些结构跨越语法、语义、知识和任务边界,长上下文又使模型能够在推理时对潜在任务进行在线推断。由此,概念、世界状态、类比和部分推理能力并不是与下一词元目标毫无关系的魔法副产品,而是广域预测压缩的有效内部解。

但压缩论必须保持克制。文本规律不等于现实本身,相关性不等于因果,预测不等于行动,似然不等于真理,最短描述不等于最低计算成本,行为能力也不等于意识。一个语言模型可以拥有极强的预测智能,却仍然缺乏持续目标、现实接地、可靠验证和价值判断。

因此,本文最终给出的判断是:

压缩不是智能的全部,但它可能是智能最深刻的认识论核心。大模型的“智能涌现”,不是简单压缩率神秘地变成了心智,而是受资源约束的广域预测,在规模、数据和计算达到一定条件后,形成了能够复用的潜变量、世界模型和内部算法。当这些预测结构进一步与记忆、搜索、工具、行动、反馈和价值相结合时,才逐渐接近完整意义上的智能系统。

参考文献

  1. Shannon, C. E. A Mathematical Theory of Communication, 1948
  2. Solomonoff, R. J. A Formal Theory of Inductive Inference, 1964
  3. Rissanen, J. Modeling by Shortest Data Description, 1978
  4. Hutter, M. Universal Artificial Intelligence, 2005
  5. Vaswani et al. Attention Is All You Need, 2017
  6. Kaplan et al. Scaling Laws for Neural Language Models, 2020
  7. Brown et al. Language Models Are Few-Shot Learners, 2020
  8. Bender & Koller. On Meaning, Form, and Understanding, 2020
  9. Xie et al. In-context Learning as Implicit Bayesian Inference, 2021
  10. Hoffmann et al. Training Compute-Optimal Large Language Models, 2022
  11. Ouyang et al. Training Language Models to Follow Instructions with Human Feedback, 2022
  12. Wei et al. Chain-of-Thought Prompting Elicits Reasoning, 2022
  13. Wei et al. Emergent Abilities of Large Language Models, 2022
  14. Li et al. Emergent World Representations, 2022
  15. von Oswald et al. Transformers Learn In-Context by Gradient Descent, 2022
  16. Ganguli et al. Predictability and Surprise in Large Generative Models, 2022
  17. Schaeffer et al. Are Emergent Abilities of Large Language Models a Mirage?, 2023
  18. Delétang et al. Language Modeling Is Compression, 2023
  19. Gurnee & Tegmark. Language Models Represent Space and Time, 2024
  20. Karvonen. Emergent World Models in Chess-Playing Language Models, 2024
  21. Snell et al. Scaling LLM Test-Time Compute Optimally, 2024

评论