AI,

模型天天更新,你的数学呢?

Aug 09, 2026 · 1 分钟阅读
模型天天更新,你的数学呢?
Share
可引用摘要
1文章标题:模型天天更新,你的数学呢?
2发布时间:2026-08-09
3分类:AI
4关键词:featured, AI, 数学, 物理, 信息论, 神经网络, Diffusion, 交叉熵
5核心摘要:推特上天天有人焦虑模型更新,但 AI 的底层逻辑没变过——数学、物理、信息论。 神经网络是流形映射,Diffusion 是热力学,交叉熵是信息压缩。 你对这三门课的理解深度,决定了你在 AI 时代能走多远。

常见问题

为什么说学数学比追模型更新更重要?

模型迭代的底层逻辑始终是数学:梯度下降是高维非凸曲面上的优化,词向量和隐空间是流形映射,泛化能力的边界由测度论和微分几何决定。理解这些,你就能区分哪些技术进步是结构性的,哪些只是工程改良。

Diffusion Models 和物理学有什么关系?

Diffusion Models 的数学物理机制直接源于热力学中的非平衡态扩散过程与反向 Langevin 动力学。生成图像的过程,本质是从高熵噪声沿概率流梯度场逆演回低熵有序分布——这是标准的统计物理图像。

为什么大语言模型用交叉熵做损失函数?

因为训练过程本质是在最小化真实数据分布与模型预测分布之间的 KL 散度。交叉熵是 KL 散度的等价优化目标。从信息论视角看,学习就是压缩——用更少的比特表征更多的信息。

普通人该怎么补这些基础?

不需要读完教科书。从你正在用的 AI 工具出发,每碰到一个概念——向量、梯度、概率分布——就往下挖一层。关键是建立直觉,不是考试。有了数学物理的框架,你看技术新闻的方式会彻底变。

最近推特上有一种氛围,我太熟悉了。

每次模型大更新——Opus 5 出了、GPT 5.6 发了、Gemini 又刷榜了——时间线上就会涌出一波帖子:焦虑的、热血的、荒诞的。有人喊「AI 要取代一切」,有人连夜学 prompt engineering,有人直接宣布自己的职业已经死了。

我理解这种焦虑。但冷静下来想,有一件事被严重忽视了:

模型在快速迭代,但信息的知识存量没变。神经网络的数学基础没变,物理定律没变,信息论的边界没变。你对这三门课的理解深度,决定了你在 AI 时代到底能走多远——不是你会用哪个工具。

模型天天更新,你的数学呢?

一、比起问 AI,不如先搭自己的知识架构

很多人对 AI 的使用方式是:有什么不会的就问。

这当然有用。但这种用法有个隐蔽的代价——你永远在消费别人的抽象,而不是建立自己的抽象。

AI 给你的每一个回答,都已经被压缩、简化、打包过了。你拿到的是结论,不是推导过程。长此以往,你的知识结构就像一栋没有钢筋的楼——看着有模有样,风一吹就塌。

更有价值的做法是:自己有意识地搭建起数学、物理、信息论的基本架构。 有了这个架构,你就能判断什么是结构性的技术进步,什么只是工程改良,什么是纯粹的营销噱头。

没有这个架构,所有技术新闻在你脑子里都是平的——分不出层级,分不出权重。推特上的喧嚣,对你来说就只是喧嚣。

二、数学视角:神经网络不过是流形映射与优化

这句话听起来很学术,但意思很直白。

无论是 GPT 的词向量,还是 Stable Diffusion 的隐空间,AI 处理数据的核心方式就一个:把现实世界的概念映射到高维连续空间里去操作。

「猫」和「狗」不是两个标签,是高维空间中两个区域。它们之间的距离、方向、边界,全由数学决定。

你以为的 数学上实际发生的
模型在「学习」 高维非凸曲面上的势能下降
模型「理解」了语义 流形上的测地距离在缩短
模型「泛化」能力强 低维流形在高维空间中保持了拓扑结构
模型「过拟合」 优化轨迹困在了局部极小值的吸引盆中

梯度下降不只是代码里的 optimizer.step()。它是高维非凸曲面上的势能下降过程。损失函数的极小值点在哪里?流形是否存在坍缩?当你掌握了测度论与微分几何的基本直觉,你就能理解为什么某些模型在某些任务上表现惊人,而在另一些任务上彻底失败。

这不是学术八股。这是你判断一个模型到底强在哪、弱在哪的底层工具。

神经网络的高维流形映射

三、物理视角:Diffusion 的底层是热力学

2024 年之后,图像生成领域最大的范式是 Diffusion Models。大部分人只知道「输入 prompt,输出图片」,不知道这背后跑的是一套完整的物理过程。

Diffusion Models 的数学物理机制,直接源于热力学中的非平衡态扩散过程反向 Langevin 动力学

说白了:生成一张图像,就是从无序的高熵噪声状态,沿着概率流的梯度场,一步步逆演回有序的低熵分布。 跟物理学里的相变过程是同构的——从无序到有序,从高熵到低熵。

再往深一层:把整个神经网络视为百亿级节点相互作用构成的复杂系统,统计力学里的能量曲面就能帮你直观理解两件事——自组织(为什么训练中模型会自发形成有意义的内部表征)和泛化界(模型能推广到多少没见过的数据,物理上有个理论极限)。

物理概念 在 AI 中对应的现象
非平衡态扩散 Diffusion 正向加噪过程
反向 Langevin 动力学 Diffusion 去噪生成过程
相变 训练中模型突然「涌现」新能力
自组织临界 隐空间中自发形成语义聚类

不懂这些,你只能当 AI 的用户。懂了这些,你才能理解它为什么有时惊人地好,有时莫名其妙地崩。

Diffusion 模型的热力学本质

四、信息论视角:学习的本质是压缩

学习究竟是什么?信息论给出了最简洁的回答:

学习就是压缩。预测就是对信息熵的提纯。

为什么大语言模型普遍使用交叉熵作为损失函数?因为训练过程的本质,就是在最小化真实世界数据分布与模型预测分布之间的 KL 散度。交叉熵是它的等价优化目标。

换句话说:模型训练的目标,就是用尽可能少的比特,精确表征真实世界的信息分布。

从 Tokenizer 的设计到信息瓶颈理论(Information Bottleneck),信息论定义了智能在表征效率上的理论边界。BPE、SentencePiece、字节级编码——每一种 Tokenizer 选择,都在信息论意义上定义了一个不同的压缩方案。而深度网络的每一层,都在做同一件事:丢掉与任务无关的信息,保留与任务相关的信息。

信息论概念 在 AI 中的体现
交叉熵 大语言模型的损失函数
KL 散度 衡量模型离「完美预测」有多远
信息瓶颈 每一层网络都在做信息压缩
香农熵 一个 token 到底携带了多少信息

理解了这些,你就不会被「参数越多模型越强」这种说法迷惑。参数多不多不重要,关键是每个参数压缩了多少有效信息。

信息论:学习就是压缩

五、有了架构,噪音会自动分层

当你对数学、物理、信息论有了基本认知,一件事会自然发生:

推特上每一次沸沸扬扬的技术推进,都会在你脑海中自动分类、标注层级。

某个模型号称「推理能力大幅提升」→ 你会想:是优化了搜索策略,还是解决了某个泛化理论问题?前者是工程,后者是基础。

某个新架构「彻底颠覆 Transformer」→ 你会看:注意力机制的数学结构真的变了,还是只是换了个高效计算方式?

某个公司「训练了万亿参数模型」→ 你会问:信息瓶颈在哪里?参数量和有效信息的比值是多少?

这就是知识架构的力量。它不是让你变成学者,而是让你拥有一套自动过滤噪音的判断系统。

我不是在否定 AI 工具的价值。我自己每天烧 3 亿 token,比大多数人用得都凶。但工具会迭代,框架不会过时。越是 AI 强大的时代,基础学科的价值反而越高——因为只有基础学科能告诉你,这些强大的工具,到底在做什么。

搭建属于你自己的知识架构

写在最后

压成五句:

  1. 推特上的模型焦虑是噪音——知道了「哪个模型又强了」不等于认知提升
  2. 神经网络的底层是数学——流形映射、梯度下降、测度论,决定了模型为什么强、为什么崩
  3. Diffusion Models 的底层是物理——非平衡态扩散、反向 Langevin 动力学、相变与涌现
  4. 大模型训练的本质是信息压缩——交叉熵、KL 散度、信息瓶颈,定义了智能的理论边界
  5. 搭建数学-物理-信息论的知识架构——让技术新闻在你脑子里自动分层,而不是一锅粥

土话一句:

模型会过时,数学不会。

我一个人打造的 Zaokit AI Agent 交易平台,以及 AI PPT / 图文创作 Zaokit.app,助力大家高效完成图文创作和 PPT 生成。唯一网站:https://zaokit.app

企业侧同一逻辑,已经融进可直接接入的服务:

稳定靠谱的 AI 全家桶,开箱即用。

如果你认可 Zaokit AI 的产品理念,欢迎后台留言加入社群。我们不卖课、不割韭菜,只聚焦 ToB 企业场景的 AI 落地实战。 希望在这里,能给你带来不一样的思维火花和真实的商业碰撞。


延伸:没烧过 token,就别说看懂 AI 半导体 · 他们到底看到了什么?让 Jeff Dean 离开待了 27 年的 Google · 你还在切 chunk 做向量?RAG 早就不是这回事了


唯一网站:Zaokit.app Agent 交易平台:Zaokit.ai

企业 Grok 服务:grok.zaokit.com

企业服务:cx.zaokit.com · cc.zaokit.com · tokenhub.zaokit.ai · gift.junxinzhang.com · 完整产品列表

稳定靠谱的 AI 全家桶,开箱即用。


我是 Jason,自己一个人做 AI 产品。模型会过时,数学不会——在 AI 时代,基础学科才是你最硬的底牌。

Enjoyed this article?

Stay updated with the latest insights on AI, DevOps, and cloud architecture. Subscribe to get notified when new articles are published.

关注微信公众号,获取更多AI前沿洞察
微信公众号:JustJason

扫码关注 JustJason

Found this helpful? Share it with others who might benefit!
Jason Zhang
Written by Jason Zhang Follow
企业级软件架构师,专注 AI 私有化部署、DevOps、云原生架构。曾主导多个知名企业的大模型落地项目。

标签相关推荐