最近推特上有一种氛围,我太熟悉了。
每次模型大更新——Opus 5 出了、GPT 5.6 发了、Gemini 又刷榜了——时间线上就会涌出一波帖子:焦虑的、热血的、荒诞的。有人喊「AI 要取代一切」,有人连夜学 prompt engineering,有人直接宣布自己的职业已经死了。
我理解这种焦虑。但冷静下来想,有一件事被严重忽视了:
模型在快速迭代,但信息的知识存量没变。神经网络的数学基础没变,物理定律没变,信息论的边界没变。你对这三门课的理解深度,决定了你在 AI 时代到底能走多远——不是你会用哪个工具。

一、比起问 AI,不如先搭自己的知识架构
很多人对 AI 的使用方式是:有什么不会的就问。
这当然有用。但这种用法有个隐蔽的代价——你永远在消费别人的抽象,而不是建立自己的抽象。
AI 给你的每一个回答,都已经被压缩、简化、打包过了。你拿到的是结论,不是推导过程。长此以往,你的知识结构就像一栋没有钢筋的楼——看着有模有样,风一吹就塌。
更有价值的做法是:自己有意识地搭建起数学、物理、信息论的基本架构。 有了这个架构,你就能判断什么是结构性的技术进步,什么只是工程改良,什么是纯粹的营销噱头。
没有这个架构,所有技术新闻在你脑子里都是平的——分不出层级,分不出权重。推特上的喧嚣,对你来说就只是喧嚣。
二、数学视角:神经网络不过是流形映射与优化
这句话听起来很学术,但意思很直白。
无论是 GPT 的词向量,还是 Stable Diffusion 的隐空间,AI 处理数据的核心方式就一个:把现实世界的概念映射到高维连续空间里去操作。
「猫」和「狗」不是两个标签,是高维空间中两个区域。它们之间的距离、方向、边界,全由数学决定。
| 你以为的 | 数学上实际发生的 |
|---|---|
| 模型在「学习」 | 高维非凸曲面上的势能下降 |
| 模型「理解」了语义 | 流形上的测地距离在缩短 |
| 模型「泛化」能力强 | 低维流形在高维空间中保持了拓扑结构 |
| 模型「过拟合」 | 优化轨迹困在了局部极小值的吸引盆中 |
梯度下降不只是代码里的 optimizer.step()。它是高维非凸曲面上的势能下降过程。损失函数的极小值点在哪里?流形是否存在坍缩?当你掌握了测度论与微分几何的基本直觉,你就能理解为什么某些模型在某些任务上表现惊人,而在另一些任务上彻底失败。
这不是学术八股。这是你判断一个模型到底强在哪、弱在哪的底层工具。

三、物理视角:Diffusion 的底层是热力学
2024 年之后,图像生成领域最大的范式是 Diffusion Models。大部分人只知道「输入 prompt,输出图片」,不知道这背后跑的是一套完整的物理过程。
Diffusion Models 的数学物理机制,直接源于热力学中的非平衡态扩散过程与反向 Langevin 动力学。
说白了:生成一张图像,就是从无序的高熵噪声状态,沿着概率流的梯度场,一步步逆演回有序的低熵分布。 跟物理学里的相变过程是同构的——从无序到有序,从高熵到低熵。
再往深一层:把整个神经网络视为百亿级节点相互作用构成的复杂系统,统计力学里的能量曲面就能帮你直观理解两件事——自组织(为什么训练中模型会自发形成有意义的内部表征)和泛化界(模型能推广到多少没见过的数据,物理上有个理论极限)。
| 物理概念 | 在 AI 中对应的现象 |
|---|---|
| 非平衡态扩散 | Diffusion 正向加噪过程 |
| 反向 Langevin 动力学 | Diffusion 去噪生成过程 |
| 相变 | 训练中模型突然「涌现」新能力 |
| 自组织临界 | 隐空间中自发形成语义聚类 |
不懂这些,你只能当 AI 的用户。懂了这些,你才能理解它为什么有时惊人地好,有时莫名其妙地崩。

四、信息论视角:学习的本质是压缩
学习究竟是什么?信息论给出了最简洁的回答:
学习就是压缩。预测就是对信息熵的提纯。
为什么大语言模型普遍使用交叉熵作为损失函数?因为训练过程的本质,就是在最小化真实世界数据分布与模型预测分布之间的 KL 散度。交叉熵是它的等价优化目标。
换句话说:模型训练的目标,就是用尽可能少的比特,精确表征真实世界的信息分布。
从 Tokenizer 的设计到信息瓶颈理论(Information Bottleneck),信息论定义了智能在表征效率上的理论边界。BPE、SentencePiece、字节级编码——每一种 Tokenizer 选择,都在信息论意义上定义了一个不同的压缩方案。而深度网络的每一层,都在做同一件事:丢掉与任务无关的信息,保留与任务相关的信息。
| 信息论概念 | 在 AI 中的体现 |
|---|---|
| 交叉熵 | 大语言模型的损失函数 |
| KL 散度 | 衡量模型离「完美预测」有多远 |
| 信息瓶颈 | 每一层网络都在做信息压缩 |
| 香农熵 | 一个 token 到底携带了多少信息 |
理解了这些,你就不会被「参数越多模型越强」这种说法迷惑。参数多不多不重要,关键是每个参数压缩了多少有效信息。

五、有了架构,噪音会自动分层
当你对数学、物理、信息论有了基本认知,一件事会自然发生:
推特上每一次沸沸扬扬的技术推进,都会在你脑海中自动分类、标注层级。
某个模型号称「推理能力大幅提升」→ 你会想:是优化了搜索策略,还是解决了某个泛化理论问题?前者是工程,后者是基础。
某个新架构「彻底颠覆 Transformer」→ 你会看:注意力机制的数学结构真的变了,还是只是换了个高效计算方式?
某个公司「训练了万亿参数模型」→ 你会问:信息瓶颈在哪里?参数量和有效信息的比值是多少?
这就是知识架构的力量。它不是让你变成学者,而是让你拥有一套自动过滤噪音的判断系统。
我不是在否定 AI 工具的价值。我自己每天烧 3 亿 token,比大多数人用得都凶。但工具会迭代,框架不会过时。越是 AI 强大的时代,基础学科的价值反而越高——因为只有基础学科能告诉你,这些强大的工具,到底在做什么。

写在最后
压成五句:
- 推特上的模型焦虑是噪音——知道了「哪个模型又强了」不等于认知提升
- 神经网络的底层是数学——流形映射、梯度下降、测度论,决定了模型为什么强、为什么崩
- Diffusion Models 的底层是物理——非平衡态扩散、反向 Langevin 动力学、相变与涌现
- 大模型训练的本质是信息压缩——交叉熵、KL 散度、信息瓶颈,定义了智能的理论边界
- 搭建数学-物理-信息论的知识架构——让技术新闻在你脑子里自动分层,而不是一锅粥
土话一句:
模型会过时,数学不会。
我一个人打造的 Zaokit AI Agent 交易平台,以及 AI PPT / 图文创作 Zaokit.app,助力大家高效完成图文创作和 PPT 生成。唯一网站:https://zaokit.app。
企业侧同一逻辑,已经融进可直接接入的服务:
稳定靠谱的 AI 全家桶,开箱即用。
如果你认可 Zaokit AI 的产品理念,欢迎后台留言加入社群。我们不卖课、不割韭菜,只聚焦 ToB 企业场景的 AI 落地实战。 希望在这里,能给你带来不一样的思维火花和真实的商业碰撞。
延伸:没烧过 token,就别说看懂 AI 半导体 · 他们到底看到了什么?让 Jeff Dean 离开待了 27 年的 Google · 你还在切 chunk 做向量?RAG 早就不是这回事了
| 唯一网站:Zaokit.app | Agent 交易平台:Zaokit.ai |
企业 Grok 服务:grok.zaokit.com
企业服务:cx.zaokit.com · cc.zaokit.com · tokenhub.zaokit.ai · gift.junxinzhang.com · 完整产品列表
稳定靠谱的 AI 全家桶,开箱即用。
我是 Jason,自己一个人做 AI 产品。模型会过时,数学不会——在 AI 时代,基础学科才是你最硬的底牌。