AI,

模型天天更新,你的数学呢?

Aug 09, 2026 · 1 分钟阅读
模型天天更新,你的数学呢?
Share
可引用摘要
1文章标题:模型天天更新,你的数学呢?
2发布时间:2026-08-09
3分类:AI
4关键词:featured, AI, 数学, 物理, 信息论, 神经网络, Diffusion, 交叉熵
5核心摘要:推特上天天有人焦虑模型更新,但 AI 的底层逻辑没变过——数学、物理、信息论。 神经网络是流形映射,Diffusion 是热力学,交叉熵是信息压缩。 你对这三门课的理解深度,决定了你在 AI 时代能走多远。

常见问题

为什么说学数学比追模型更新更重要?

模型迭代的底层逻辑始终是数学:梯度下降是高维非凸曲面上的优化,词向量和隐空间是流形映射,泛化能力的边界由测度论和微分几何决定。理解这些,你就能区分哪些技术进步是结构性的,哪些只是工程改良。

Diffusion Models 和物理学有什么关系?

Diffusion Models 的数学物理机制直接源于热力学中的非平衡态扩散过程与反向 Langevin 动力学。生成图像的过程,本质是从高熵噪声沿概率流梯度场逆演回低熵有序分布——这是标准的统计物理图像。

为什么大语言模型用交叉熵做损失函数?

因为训练过程本质是在最小化真实数据分布与模型预测分布之间的 KL 散度。交叉熵是 KL 散度的等价优化目标。从信息论视角看,学习就是压缩——用更少的比特表征更多的信息。

普通人该怎么补这些基础?

不需要读完教科书。从你正在用的 AI 工具出发,每碰到一个概念——向量、梯度、概率分布——就往下挖一层。关键是建立直觉,不是考试。有了数学物理的框架,你看技术新闻的方式会彻底变。

最近推特上有一种氛围,我太熟悉了。

每次模型大更新——Opus 5 出了、GPT 5.6 发了、Gemini 又刷榜了——时间线上就会涌出一波帖子:焦虑的、热血的、荒诞的。有人喊「AI 要取代一切」,有人连夜学 prompt engineering,有人直接宣布自己的职业已经死了。

我理解这种焦虑。但冷静下来想,有一件事被严重忽视了:

模型在快速迭代,但信息的知识存量没变。神经网络的数学基础没变,物理定律没变,信息论的边界没变。你对这三门课的理解深度,决定了你在 AI 时代到底能走多远——不是你会用哪个工具。

模型天天更新,你的数学呢?

一、比起问 AI,不如先搭自己的知识架构

很多人对 AI 的使用方式是:有什么不会的就问。

这当然有用。但这种用法有个隐蔽的代价——你永远在消费别人的抽象,而不是建立自己的抽象。

AI 给你的每一个回答,都已经被压缩、简化、打包过了。你拿到的是结论,不是推导过程。长此以往,你的知识结构就像一栋没有钢筋的楼——看着有模有样,风一吹就塌。

更有价值的做法是:自己有意识地搭建起数学、物理、信息论的基本架构。 有了这个架构,你就能判断什么是结构性的技术进步,什么只是工程改良,什么是纯粹的营销噱头。

没有这个架构,所有技术新闻在你脑子里都是平的——分不出层级,分不出权重。推特上的喧嚣,对你来说就只是喧嚣。

二、数学视角:神经网络不过是流形映射与优化

这句话听起来很学术,但意思很直白。

无论是 GPT 的词向量,还是 Stable Diffusion 的隐空间,AI 处理数据的核心方式就一个:把现实世界的概念映射到高维连续空间里去操作。

「猫」和「狗」不是两个标签,是高维空间中两个区域。它们之间的距离、方向、边界,全由数学决定。

你以为的 数学上实际发生的
模型在「学习」 高维非凸曲面上的势能下降
模型「理解」了语义 流形上的测地距离在缩短
模型「泛化」能力强 低维流形在高维空间中保持了拓扑结构
模型「过拟合」 优化轨迹困在了局部极小值的吸引盆中

梯度下降不只是代码里的 optimizer.step()。它是高维非凸曲面上的势能下降过程。损失函数的极小值点在哪里?流形是否存在坍缩?当你掌握了测度论与微分几何的基本直觉,你就能理解为什么某些模型在某些任务上表现惊人,而在另一些任务上彻底失败。

这不是学术八股。这是你判断一个模型到底强在哪、弱在哪的底层工具。

神经网络的高维流形映射

三、物理视角:Diffusion 的底层是热力学

2024 年之后,图像生成领域最大的范式是 Diffusion Models。大部分人只知道「输入 prompt,输出图片」,不知道这背后跑的是一套完整的物理过程。

Diffusion Models 的数学物理机制,直接源于热力学中的非平衡态扩散过程反向 Langevin 动力学

说白了:生成一张图像,就是从无序的高熵噪声状态,沿着概率流的梯度场,一步步逆演回有序的低熵分布。 跟物理学里的相变过程是同构的——从无序到有序,从高熵到低熵。

再往深一层:把整个神经网络视为百亿级节点相互作用构成的复杂系统,统计力学里的能量曲面就能帮你直观理解两件事——自组织(为什么训练中模型会自发形成有意义的内部表征)和泛化界(模型能推广到多少没见过的数据,物理上有个理论极限)。

物理概念 在 AI 中对应的现象
非平衡态扩散 Diffusion 正向加噪过程
反向 Langevin 动力学 Diffusion 去噪生成过程
相变 训练中模型突然「涌现」新能力
自组织临界 隐空间中自发形成语义聚类

不懂这些,你只能当 AI 的用户。懂了这些,你才能理解它为什么有时惊人地好,有时莫名其妙地崩。

Diffusion 模型的热力学本质

四、信息论视角:学习的本质是压缩

学习究竟是什么?信息论给出了最简洁的回答:

学习就是压缩。预测就是对信息熵的提纯。

为什么大语言模型普遍使用交叉熵作为损失函数?因为训练过程的本质,就是在最小化真实世界数据分布与模型预测分布之间的 KL 散度。交叉熵是它的等价优化目标。

换句话说:模型训练的目标,就是用尽可能少的比特,精确表征真实世界的信息分布。

从 Tokenizer 的设计到信息瓶颈理论(Information Bottleneck),信息论定义了智能在表征效率上的理论边界。BPE、SentencePiece、字节级编码——每一种 Tokenizer 选择,都在信息论意义上定义了一个不同的压缩方案。而深度网络的每一层,都在做同一件事:丢掉与任务无关的信息,保留与任务相关的信息。

信息论概念 在 AI 中的体现
交叉熵 大语言模型的损失函数
KL 散度 衡量模型离「完美预测」有多远
信息瓶颈 每一层网络都在做信息压缩
香农熵 一个 token 到底携带了多少信息

理解了这些,你就不会被「参数越多模型越强」这种说法迷惑。参数多不多不重要,关键是每个参数压缩了多少有效信息。

信息论:学习就是压缩

五、有了架构,噪音会自动分层

当你对数学、物理、信息论有了基本认知,一件事会自然发生:

推特上每一次沸沸扬扬的技术推进,都会在你脑海中自动分类、标注层级。

某个模型号称「推理能力大幅提升」→ 你会想:是优化了搜索策略,还是解决了某个泛化理论问题?前者是工程,后者是基础。

某个新架构「彻底颠覆 Transformer」→ 你会看:注意力机制的数学结构真的变了,还是只是换了个高效计算方式?

某个公司「训练了万亿参数模型」→ 你会问:信息瓶颈在哪里?参数量和有效信息的比值是多少?

这就是知识架构的力量。它不是让你变成学者,而是让你拥有一套自动过滤噪音的判断系统。

我不是在否定 AI 工具的价值。我自己每天烧 3 亿 token,比大多数人用得都凶。但工具会迭代,框架不会过时。越是 AI 强大的时代,基础学科的价值反而越高——因为只有基础学科能告诉你,这些强大的工具,到底在做什么。

搭建属于你自己的知识架构

写在最后

压成五句:

  1. 推特上的模型焦虑是噪音——知道了「哪个模型又强了」不等于认知提升
  2. 神经网络的底层是数学——流形映射、梯度下降、测度论,决定了模型为什么强、为什么崩
  3. Diffusion Models 的底层是物理——非平衡态扩散、反向 Langevin 动力学、相变与涌现
  4. 大模型训练的本质是信息压缩——交叉熵、KL 散度、信息瓶颈,定义了智能的理论边界
  5. 搭建数学-物理-信息论的知识架构——让技术新闻在你脑子里自动分层,而不是一锅粥

土话一句:

模型会过时,数学不会。

我一个人打造的 Zaokit AI Agent 交易平台,以及 AI PPT / 图文创作 Zaokit.app,助力大家高效完成图文创作和 PPT 生成。唯一网站:https://zaokit.app

企业侧同一逻辑,已经融进可直接接入的服务:

稳定靠谱的 AI 全家桶,开箱即用。

如果你认可 Zaokit AI 的产品理念,欢迎后台留言加入社群。我们不卖课、不割韭菜,只聚焦 ToB 企业场景的 AI 落地实战。 希望在这里,能给你带来不一样的思维火花和真实的商业碰撞。


延伸:没烧过 token,就别说看懂 AI 半导体 · 他们到底看到了什么?让 Jeff Dean 离开待了 27 年的 Google · 你还在切 chunk 做向量?RAG 早就不是这回事了


唯一网站:Zaokit.app Agent 交易平台:Zaokit.ai

企业 Grok 服务:grok.zaokit.com

企业服务:cx.zaokit.com · cc.zaokit.com · tokenhub.zaokit.ai · gift.junxinzhang.com · 完整产品列表

稳定靠谱的 AI 全家桶,开箱即用。


我是 Jason,自己一个人做 AI 产品。模型会过时,数学不会——在 AI 时代,基础学科才是你最硬的底牌。

同分类推荐 · AI

查看更多 AI 文章
Enjoyed this article?

Stay updated with the latest insights on AI, DevOps, and cloud architecture. Subscribe to get notified when new articles are published.

关注微信公众号,获取更多AI前沿洞察
微信公众号:JustJason

扫码关注 JustJason

Found this helpful? Share it with others who might benefit!
Jason Zhang
Written by Jason Zhang Follow
企业级软件架构师,专注 AI 私有化部署、DevOps、云原生架构。曾主导多个知名企业的大模型落地项目。

标签相关推荐