← 返回内容列表

香农 1948 一句话定义“信息”,竟预言了今天的大模型

香农 1948 一句话定义“信息”,竟预言了今天的大模型

1948 年香农用“消除不确定性”重新定义信息、给出熵公式;76 年后大模型的训练目标就是最小化交叉熵——你每天都在用的 AI,跑的是他的数学。

一、1948 年,他给“信息”称了重

1948 年,克劳德·香农在论文《通信的数学理论》里干了一件颠覆的事:他没管信息“是什么意思”,只管信息“有多少”。他的定义朴素到反直觉——信息是用来消除不确定性的东西。一句话越能让你“猜不到”,信息量就越大。

“太阳从东边升起”几乎不携带信息(你早知道);“明天公司被收购”信息量爆表(完全意外)。衡量这个“意外程度”的工具,就是他提出的信息熵。

这个工具叫信息熵,写作 H = −Σ p(x)·log p(x)。熵越大,不确定性越高;熵越小,答案越“板上钉钉”。香农顺手还定义了“比特”(bit)——信息的最小单位,至今仍是整个数字世界的计量单位。

拖一拖:信息熵有多大二元熵 H(p):越不确定,熵越高
p(某事件发生概率)H(p) 比特

H(p) ≈ 1.000 bit

五五开 → 熵接近最大(最不确定)

香农的直觉

「太阳东升」p≈1,熵≈0,几乎不携带信息;「明天公司被收购」p 很小,反而信息量大。大模型训练目标最小化交叉熵,就是在不断把「下一个词」的不确定性压下去。

二、这个公式,悄悄铺好了数字世界的地基

沿着时间线看,香农的熵后来几乎长在每一个数字产品里:

从比特到交叉熵左右滑动 · 点击节点看详情

1948 · 定义比特与熵

《通信的数学理论》:信息=消除不确定性;H=−Σ p·log p;比特成为数字世界计量单位。

1949 年他证明“噪声信道编码定理”——只要传输速率低于信道容量,就能几乎无错地传数据,这是今天所有纠错码的理论源头。1977 年 Lempel-Ziv 压缩算法(你电脑里 zip、gzip 的基石)正是按熵的边界来挤水分:一段数据压到极限,体积就约等于它的熵,再压只会失真。MP3、JPEG 把“人耳/人眼不敏感”当成可丢的熵,才把音乐和照片塞进手机。

三、2026 年的大模型,本质是个“熵最小化机器”

这才是 D 型叙事最精彩的地方:今天你用的每一个大模型,底层跑的就是香农 1948 的数学。

大语言模型训练时优化的目标,叫交叉熵损失——说白了就是让模型对“下一个词”的预测,无限逼近真实文本的概率分布。而“下一个词的概率分布”,正是香农信息熵的直系后裔。LLM生成文字时做的,就是在给定上下文后,算出“哪个词最可能降不确定性”,然后采样输出。你问它一个问题,它答得准不准,取决于它把你的意图“解码”得有多好——而解码,本就是通信理论的本行。

也就是说:香农 1948 年把“通信”抽象成“在噪声中还原信号”,2026 年的 Transformer 把“对话”也变成了同一道题。76 年一个闭环,他赢麻了。

四、给你一个立刻用得上的视角

这跟你有什么关系?当你写提示词时,本质是在给模型补充上下文、帮它“压低熵”——背景越清楚、约束越明确,模型输出的不确定性越低,答案越可预期。所谓“会写提示词”,换个说法就是“你会给信息源降噪”。

这恰恰就是模块二提示词工程在练的本事:把模糊的意图,翻译成模型能稳定还原的信号。

关联推荐

[关联映射] 引流型:本篇呼应 M2 提示词工程课——信息论是提示词的数学底色,会降噪才会下指令。

评论 (0)

加载评论中…

香农 1948 一句话定义“信息”,竟预言了今天的大模型 | 必学必会