<?xml version="1.0" encoding="utf-8"?><feed xmlns="http://www.w3.org/2005/Atom" ><generator uri="https://jekyllrb.com/" version="4.3.4">Jekyll</generator><link href="https://junxinzhang.com/feed.xml" rel="self" type="application/atom+xml" /><link href="https://junxinzhang.com/" rel="alternate" type="text/html" /><updated>2026-08-17T13:47:25+00:00</updated><id>https://junxinzhang.com/feed.xml</id><title type="html">Just Jason</title><subtitle>专注于 AI 技术、DevOps 实践、职业成长的技术博客。分享 LLM 私有化部署、云原生架构、个人成长等深度内容。</subtitle><entry><title type="html">Stripe $70 亿买 OpenRouter：公共电表被买走，这周自己多了 2 家</title><link href="https://junxinzhang.com/stripe-buys-openrouter-meter-not-router/" rel="alternate" type="text/html" title="Stripe $70 亿买 OpenRouter：公共电表被买走，这周自己多了 2 家" /><published>2026-08-17T00:00:00+00:00</published><updated>2026-08-17T00:00:00+00:00</updated><id>https://junxinzhang.com/stripe-buys-openrouter-meter-not-router</id><content type="html" xml:base="https://junxinzhang.com/stripe-buys-openrouter-meter-not-router/"><![CDATA[<p>彭博 8 月 16 日引述知情人士：Stripe 敲定收购 OpenRouter，报价超过 70 亿美元。5 月刚按 13 亿估值融完 B 轮，82 天，溢价五倍。Stripe 对 TechCrunch 说不评论传闻。价格还可能变。</p>

<p>同一周，ZaokitAI TokenHub 新增了 2 家企业。</p>

<blockquote>
  <p><strong>X 上吵的是贵不贵。被买走的是开发者和模型之间那块电表。公共电表被买走，这周自己多了 2 家。</strong></p>
</blockquote>

<p><img src="/assets/images/cover-20260817-stripe-openrouter-meter.webp" alt="Stripe 70 亿买 OpenRouter：被买走的是计量器" />
<!-- baoyu-skill prompt: 2.35:1清线漫画+清新扁平封面，奶油到天蓝渐变，干净描边，薄荷绿/蜜桃/天蓝平涂，留白充足。禁止品牌logo与深色赛博UI。左侧一座小收费站/电表亭，标中文「API 路由」，开发者小人把 token 硬币投进去；右侧一座更大的金色收费站，标中文「支付公司」，电表数字狂跳。中央粗体中文「买的不是中转站，是电表」。顶部「70亿美元 · 82天溢价五倍」。底部「被买走的是计量器」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="一先把事实摆桌上">一、先把事实摆桌上</h2>

<p>OpenRouter 是干什么的，用过的人都清楚：一个 API，四百多个模型。写一次接口就能换。CEO Alex Atallah 以前是 OpenSea 的联合创始人，今年早些时候把自己叫「AI 领域的 Stripe」。</p>

<table>
  <thead>
    <tr>
      <th>时间</th>
      <th>公开事实</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>2023</td>
      <td>Atallah 离开 OpenSea 后创办 OpenRouter</td>
    </tr>
    <tr>
      <td>2024 年 10 月</td>
      <td>和 Stripe 正式合作：发票、税务、风控都走 Stripe</td>
    </tr>
    <tr>
      <td>2026 年 5 月</td>
      <td>B 轮 1.13 亿美元，估值约 13 亿；自称 800 万用户、400+ 模型</td>
    </tr>
    <tr>
      <td>2026 年 7 月</td>
      <td>《华尔街日报》报道双方在谈，数字传到 100 亿附近</td>
    </tr>
    <tr>
      <td>2026 年 8 月 16 日</td>
      <td>彭博：敲定，超过 70 亿</td>
    </tr>
  </tbody>
</table>

<p>赚钱方式很土：模型价原价过手，充值时抽大约 5.5%。不训模型，做路由、切换、记账、结算。</p>

<p>市场对收入口径很乱。有人按年化 5000 万算，市销 140 倍；也有报道说到年化 1.4 亿。我两边都不当真——没看到他们自己的财报。只记住一句：Stripe 本来就给它收钱，后台曲线它自己看得见。</p>

<h2 id="二x-上其实在吵两件事">二、X 上其实在吵两件事</h2>

<p>我把时间线往后翻了几个小时。热闹，但核心就两派，外加开发者自己的一句脏话。</p>

<p><strong>空头说：中转站，没护城河。</strong></p>

<p>加密圈里那位「白发股神」Serenity 写得很直：编排和调度谁都能做，几乎没有护城河。Crémieux 更狠：独立路由层本身就给调用加复杂度，模型稳定了、每家云都自带 Router，中间商凭什么继续抽成？</p>

<p><strong>多头说：别把它当中转站，当收费站。</strong></p>

<p>硅谷增长顾问 Aakash Gupta 算的是费率：OpenRouter 抽 5.5%，Stripe 自己做支付才抽 2.9%。他收尾那句被转得最多——Stripe 当年给互联网商业修了收费站，现在花 70 亿买 AI 推理时代的收费站。</p>

<p>Lago 联合创始人 byAnhtho 补了一刀：当 API 代理看，这价荒谬；当推理流量的调度权看，账是另一本。分析师 @danizhu 把两家叠在一起：Stripe 当年把分散的金融基础设施变成可编程服务，OpenRouter 在对数百个模型做同一件事。</p>

<p><strong>开发者这边，多了一个词：ClosedRouter。</strong></p>

<p>Hacker News 几个小时几百条，中心不是估值，是中立还在不在。OpenRouter 被喜欢，是因为它不站队。Stripe 给 OpenAI、Anthropic 收过钱，也给 DeepSeek、Qwen 过手流量。路由算法还按成本走，还是会悄悄偏向自己的账单关系？没人能证明。但这个问题，从今天开始会一直被问。</p>

<p><img src="/assets/images/illust-20260817-x-two-camps.webp" alt="X 上两派：没护城河 vs. 收费站" />
<!-- baoyu-skill prompt: 2.35:1清新知识漫画对决图，奶油底、清线描边扁平色。左侧冷灰帐篷标中文「空头：没护城河」，小人举牌「谁都能做」「140倍市销」；右侧暖金帐篷标中文「多头：收费站」，小人举牌「5.5%过路费」「买的是电表」。中间一条马路，路上一个写着中文「ClosedRouter」的路障。顶部中文「X上其实在吵两件事」。薄荷绿/蜜桃/天蓝平涂，中文清晰可读。禁止深色赛博风。 --ar 2.35:1 --></p>

<h2 id="三我的读法贵不贵是假问题">三、我的读法：贵不贵是假问题</h2>

<p>空头说得对的那一半，我承认。转发请求的代码，值不了 70 亿。LiteLLM、各家云网关、开源 Router，都能做一层。</p>

<p>多头说得对的那一半，我也承认。难复制的不是代码，是已经聚在上面的用户、请求、支付关系和那本实时账本：谁在用哪个模型、什么价、什么时候切走。</p>

<p>所以我不加入「贵不贵」这场。贵，是相对于今天的收入；便宜，是相对于明天的推理流水。两边都在猜蛋糕有多大。</p>

<p>我比较确定的是另一句：</p>

<p><strong>Stripe 买的不是一个更好的 API。它买的是「每一次调用发生时，谁记账、谁路由、谁结算」。</strong></p>

<p><a href="/ai-token-hub-enterprise-first-step">6 月那篇</a>我写过：企业上 AI 的第一步不是给每个人买 Pro，是先建一个 Token Hub。当时不少人觉得小题大做。今天市场给这件事标了个价——70 亿。</p>

<p><a href="/apple-alibaba-siri-core-not-outsourced">昨天</a>写苹果：云可以租，Siri 核心层不长期外包。今天是同一张表的另一格。模型可以租。计量器最好自己留。</p>

<p><img src="/assets/images/illust-20260817-meter-not-router.webp" alt="买的不是中转站，是电表" />
<!-- baoyu-skill prompt: 2.35:1清线漫画，奶油到天蓝渐变。画面中央一块巨大的老式电表，表盘写中文「Token 用量」，指针狂转；电表后面是一排模型插座，分别淡标「Claude」「GPT」「Qwen」「DeepSeek」。电表上方一只手正在盖章，章上写中文「已售」。底部大字中文「每一次调用，谁记账」。薄荷绿/蜜桃/天蓝平涂，中文清晰可读。禁止深色赛博风。 --ar 2.35:1 --></p>

<h2 id="四中立这件事先看三条线">四、中立这件事，先看三条线</h2>

<p>有人已经说：赶紧迁走，别把生产流量押在一个被支付公司买下的入口上。</p>

<p>我理解这个本能。但今天就拔线，像应激。API 没变，价格没变，官方还没出声。迁不迁，看的是以后三件事有没有动：</p>

<ol>
  <li><strong>默认路由还敢不敢把便宜的开源模型放在前面</strong></li>
  <li><strong>账单和用量数据还让不让你完整导出</strong></li>
  <li><strong>企业合同里的零数据保留，还算不算数</strong></li>
</ol>

<p>动了，再迁。没动之前，先把自己的计量留一份。</p>

<p>我自己这边更实际的变化：OpenRouter 从「默认入口」降成「上游之一」。号池、官方 API、云网关，本来就该多条腿。公共路由被买走，只是把这件事从建议变成了必做。</p>

<p>有一件事我说不清，也不装懂：Stripe 会不会为了照顾和 OpenAI、Anthropic 的账单关系，慢慢把流量从便宜的中国开源模型上拨走。商业上说得通，政治上更说得通。开发者要的刚好相反。这个结，他们自己都还没解。</p>

<p><img src="/assets/images/illust-20260817-neutrality-three-lines.webp" alt="中立从今天开始要被追问" />
<!-- baoyu-skill prompt: 2.35:1清新知识漫画，奶油底、清线描边。画面中央一个路由器形状的小房子，顶上一面旗子写中文「中立」，旗子在风中摇摆。房子前面三条路分别写「路由公平」「数据可导出」「零数据保留」，路边放着审视的放大镜。顶部中文「中立从今天开始要被追问」。底部「三条线动了再迁」。薄荷绿/蜜桃/天蓝平涂，中文清晰可读。禁止深色赛博风。 --ar 2.35:1 --></p>

<h2 id="五对企业公共电表可以被买自己的电表别出租">五、对企业：公共电表可以被买，自己的电表别出租</h2>

<p>别读成 Stripe 新闻。这是一张所有权分类。</p>

<table>
  <thead>
    <tr>
      <th>可以过手别人</th>
      <th>最好自己留</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>某个模型的调用</td>
      <td>这个月公司烧了多少、烧在哪</td>
    </tr>
    <tr>
      <td>某次故障自动切换</td>
      <td>路由策略：贵的留给难活，便宜的留给批量</td>
    </tr>
    <tr>
      <td>充值、发票、汇率</td>
      <td>谁在用、用成了什么、失败在哪一步</td>
    </tr>
  </tbody>
</table>

<p><a href="/enterprise-agent-build-choose-token-hub">7 月那篇</a>钉过一句：工具可以分部门，心脏只能有一颗。今天补半句——<strong>心脏别长在别人身上。</strong></p>

<p>我做 <a href="https://tokenhub.zaokit.ai">Token Hub</a> 不是因为预见到 Stripe 会买 OpenRouter。是因为给企业看账单时，经常发现他们连「这个月到底烧了多少」都说不利索。公共入口越强，这个问题越容易被掩盖：用着很爽，账在别人那里。</p>

<p>同一周，<a href="https://tokenhub.zaokit.ai">ZaokitAI TokenHub</a> 新增了 2 家企业。客户名不方便写。能写的只有一句：他们要的不是又一个公共入口，是把自己的用量、权限和轨迹，装进自己的机房。</p>

<p>模型谁便宜接谁。能留下的是自己的计量器。</p>

<p><img src="/assets/images/illust-20260817-keep-your-own-meter.webp" alt="公共电表可以被买，自己的电表别出租" />
<!-- baoyu-skill prompt: 2.35:1清新知识漫画，奶油底。左侧一座被挂上中文「已售」牌子的公共电表站，标「公共入口」；右侧一间公司配电房，墙上自己的电表发光，标中文「自己的心脏」，几条整齐电缆通向「研发」「销售」「运营」三个部门。顶部中文「公共电表可以被买」。底部「自己的用量和轨迹，别写在别人账上」。薄荷绿/蜜桃/天蓝平涂，中文清晰可读。禁止深色赛博风。 --ar 2.35:1 --></p>

<h2 id="写在最后">写在最后</h2>

<ol>
  <li><strong>交易还没官宣</strong>——彭博说敲定，Stripe 说不评论</li>
  <li><strong>X 上两派都有道理</strong>——代码不值 70 亿，电表可能值</li>
  <li><strong>ClosedRouter 不是段子</strong>——中立从今天开始要被持续追问</li>
  <li><strong>贵不贵我猜不准</strong>——确定的是计量权被标了价</li>
  <li><strong>对企业</strong>——模型可以换，自己的电表别出租。ZaokitAI TokenHub 同一周新增了 2 家</li>
</ol>

<p>土话一句：</p>

<p><strong>别人的收费站可以过，自己的电表不能卖。</strong></p>

<p>我一个人打造的 <a href="https://zaokit.ai">Zaokit AI Agent 交易平台</a>，以及 AI PPT / 图文创作 <a href="https://zaokit.app">Zaokit.app</a>，助力大家高效完成图文创作和 PPT 生成。唯一网站：<a href="https://zaokit.app">https://zaokit.app</a>。</p>

<p>企业侧同一逻辑，已经融进可直接接入的服务：</p>

<ul>
  <li><a href="https://grok.zaokit.com">grok.zaokit.com</a></li>
  <li><a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a></li>
  <li><a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a></li>
  <li><a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a></li>
  <li><a href="https://junxinzhang.com/projects.html">完整产品列表</a></li>
</ul>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<p>如果你认可 Zaokit AI 的产品理念，欢迎后台留言加入社群。<strong>我们不卖课、不割韭菜，只聚焦 ToB 企业场景的 AI 落地实战。</strong> 希望在这里，能给你带来不一样的思维火花和真实的商业碰撞。</p>

<hr />

<p>延伸：<a href="/ai-token-hub-enterprise-first-step">企业上 AI 的第一步，是先建一个 Token Hub</a> · <a href="/enterprise-agent-build-choose-token-hub">工具可以分部门，心脏只能有一颗</a> · <a href="/apple-alibaba-siri-core-not-outsourced">苹果：Siri 核心层，最后时刻不外包</a></p>

<hr />

<table>
  <tbody>
    <tr>
      <td>唯一网站：<a href="https://zaokit.app">Zaokit.app</a></td>
      <td>Agent 交易平台：<a href="https://zaokit.ai">Zaokit.ai</a></td>
    </tr>
  </tbody>
</table>

<p>企业 Grok 服务：<a href="https://grok.zaokit.com">grok.zaokit.com</a></p>

<p>企业服务：<a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a> · <a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a> · <a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a> · <a href="https://junxinzhang.com/projects.html">完整产品列表</a></p>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p><em>我是 Jason，自己一个人做 AI 产品。公共入口可以被买走——自己烧了多少、烧在哪，别只写在别人的账上。ZaokitAI TokenHub 同一周新增了 2 家。</em></p>]]></content><author><name>Jason Zhang</name></author><category term="AI" /><category term="featured" /><category term="AI" /><category term="Stripe" /><category term="OpenRouter" /><category term="Token Hub" /><category term="模型路由" /><category term="计量器" /><category term="一人公司" /><category term="Zaokit" /><summary type="html"><![CDATA[彭博 8 月 16 日：Stripe 敲定收购 OpenRouter，报价超 70 亿美元。Stripe 没官宣。 同一周，ZaokitAI TokenHub 新增了 2 家企业。买的不是中转站，是开发者和模型之间那块电表。]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="https://junxinzhang.com/assets/images/cover-20260817-stripe-openrouter-meter.webp" /><media:content medium="image" url="https://junxinzhang.com/assets/images/cover-20260817-stripe-openrouter-meter.webp" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">苹果和阿里联合训练：Siri 核心层，最后时刻不外包</title><link href="https://junxinzhang.com/apple-alibaba-siri-core-not-outsourced/" rel="alternate" type="text/html" title="苹果和阿里联合训练：Siri 核心层，最后时刻不外包" /><published>2026-08-16T00:00:00+00:00</published><updated>2026-08-16T00:00:00+00:00</updated><id>https://junxinzhang.com/apple-alibaba-siri-core-not-outsourced</id><content type="html" xml:base="https://junxinzhang.com/apple-alibaba-siri-core-not-outsourced/"><![CDATA[<p>路透 8 月 14 日独家：苹果为中国区自己训了一层大模型，阿里提供技术支持。三位知情人士，两边都没评论。</p>

<p>很多人读成「通义进 iPhone」。那是 7 月的旧闻。</p>

<blockquote>
  <p><strong>联合训练是真的。我的读法：最后时刻，Siri 核心层不长期外包。云可以租，芯自己留。</strong></p>
</blockquote>

<p><img src="/assets/images/cover-20260816-apple-alibaba-siri.webp" alt="苹果和阿里联合训练：Siri 核心层，最后时刻不外包" /></p>

<h2 id="一路透爆的不是通义进苹果">一、路透爆的不是通义进苹果</h2>

<p>别把两件事焊成一件。</p>

<table>
  <thead>
    <tr>
      <th>时间</th>
      <th>公开事实</th>
      <th>说明</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>2025 年 2 月</td>
      <td>蔡崇信说苹果中国区选了阿里</td>
      <td>当时听起来像通义给 iPhone 供电</td>
    </tr>
    <tr>
      <td>2026 年 7 月</td>
      <td>网信办登记苹果上海；通义进 Apple Intelligence，百度补搜索</td>
      <td>监管过了，方案还是第三方</td>
    </tr>
    <tr>
      <td>2026 年 8 月 8–9 日</td>
      <td>支持页放出 Mac 接千问，第二天撤掉</td>
      <td>云端接法写进说明书，功能没开</td>
    </tr>
    <tr>
      <td>2026 年 8 月 14 日</td>
      <td>路透：苹果自己训，阿里提供支持</td>
      <td>靠第三方的策略，被改了一刀</td>
    </tr>
  </tbody>
</table>

<p>主语是苹果自己的模型，不是通义。参数、上线日、路由，都没公布，我不编。</p>

<h2 id="二为什么说最后时刻">二、为什么说最后时刻</h2>

<p>「最后时刻」不是新闻稿，是我读时间线的判断。</p>

<p>2 月定成外包，7 月还是通义进机。8 月 14 日多出一层苹果自己的。中间几周，说明书都写到登录千问了。</p>

<p>路透说这是对「靠第三方供电」的偏离。我读成一句：通义可以继续走云，Siri 核心层不写成长期外包。</p>

<p>租得越久，Siri 越像别人的助手套了个壳。中国区卖了快两年 Apple Intelligence，功能没落地。再把核心层也租出去，入口还在，脑子是租的。所以合作往外推一层：阿里帮训，通义进云，核心层自己留。</p>

<p><img src="/assets/images/illust-20260816-core-not-outsourced.webp" alt="核心层不长期外包" /></p>

<h2 id="三中国区是三层栈不是一张皮">三、中国区是三层栈，不是一张皮</h2>

<p>路由没公布。只写已经公开的。</p>

<table>
  <thead>
    <tr>
      <th>层</th>
      <th>谁</th>
      <th>已经公开的</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>自有模型</td>
      <td>苹果自己训的</td>
      <td>路透 8 月 14 日：阿里提供支持</td>
    </tr>
    <tr>
      <td>云端语言</td>
      <td>通义</td>
      <td>7 月：进中国区 iPhone / iPad / Mac / Vision Pro</td>
    </tr>
    <tr>
      <td>搜索 / 视觉</td>
      <td>百度</td>
      <td>7 月路透：同时接入</td>
    </tr>
  </tbody>
</table>

<p>被撤掉的支持页写过：macOS 26.6，千问账号或通过 Apple 登录；阿里不得用这些材料训自己的模型。说明书不是发版。</p>

<p><strong>通义进 iPhone，不等于通义成为 Siri。</strong></p>

<p><img src="/assets/images/illust-20260816-three-layer-stack.webp" alt="中国区是三层栈" /></p>

<h2 id="四端侧能跑才敢自己留">四、端侧能跑，才敢自己留</h2>

<p><a href="/qwen38-27b-m5pro-local">昨天那篇</a> 的数字不在这里重跑。27B 在 M5 Pro 上能跑，24G 是入场券。</p>

<p>今天只借一句：端侧真能跑，才敢把核心层留在自己手里。如果只能躺在云上，所谓自己的模型就是换了签名的云合同。</p>

<p>阿里是联合训练、提供支持，不是把模型卖断。苹果要收得回，阿里要云端入口。各拿一层，谁都没交底牌。</p>

<p><a href="/grok46-gemini37-flash-model-knockout">14 号</a> 说中间地带在消失。苹果这步是同一条规则：可以租云、租搜索，判断层不能租。</p>

<p><img src="/assets/images/illust-20260816-ondevice-sovereignty.webp" alt="端侧能跑，才敢自己留" /></p>

<h2 id="五对企业最核心那一层不能长期租">五、对企业：最核心那一层，不能长期租</h2>

<p>别读成苹果新闻。这是一张合同分类。</p>

<table>
  <thead>
    <tr>
      <th>可以租</th>
      <th>不能长期租</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>算力、通用模型、搜索</td>
      <td>判断层：产品拿什么做决定</td>
    </tr>
    <tr>
      <td>润色、闲聊、外挂问答</td>
      <td>身份、权限、私有数据</td>
    </tr>
    <tr>
      <td>地板价 token</td>
      <td>入口后面那一层「这是不是我的产品」</td>
    </tr>
  </tbody>
</table>

<p>我做 <a href="https://zaokit.ai">Zaokit</a> 也是这句：模型谁便宜接谁，价值不能沉淀在调用上。调用是原材料。能留下的是判断层。</p>

<p>过不了这张表，就是在给别人的模型打工。过得了，云越便宜对你越有利。</p>

<p><img src="/assets/images/illust-20260816-dont-rent-core.webp" alt="对企业也一样" /></p>

<h2 id="写在最后">写在最后</h2>

<ol>
  <li><strong>路透爆的是苹果自己训</strong>——不是通义进 iPhone 的旧闻</li>
  <li><strong>「最后时刻不外包」是我的读法</strong></li>
  <li><strong>中国区是三层栈</strong>——苹果自己的、云端通义、搜索百度</li>
  <li><strong>端侧能跑，才敢自己留</strong></li>
  <li><strong>对企业也一样</strong>——云可以租，判断层不能长期外包</li>
</ol>

<p>土话一句：</p>

<p><strong>厨房可以外包，配方不能租。</strong></p>

<p>我一个人打造的 <a href="https://zaokit.ai">Zaokit AI Agent 交易平台</a>，以及 AI PPT / 图文创作 <a href="https://zaokit.app">Zaokit.app</a>，助力大家高效完成图文创作和 PPT 生成。唯一网站：<a href="https://zaokit.app">https://zaokit.app</a>。</p>

<p>企业侧同一逻辑，已经融进可直接接入的服务：</p>

<ul>
  <li><a href="https://grok.zaokit.com">grok.zaokit.com</a></li>
  <li><a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a></li>
  <li><a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a></li>
  <li><a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a></li>
  <li><a href="https://junxinzhang.com/projects.html">完整产品列表</a></li>
</ul>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<p>如果你认可 Zaokit AI 的产品理念，欢迎后台留言加入社群。<strong>我们不卖课、不割韭菜，只聚焦 ToB 企业场景的 AI 落地实战。</strong> 希望在这里，能给你带来不一样的思维火花和真实的商业碰撞。</p>

<hr />

<p>延伸：<a href="/qwen38-27b-m5pro-local">Qwen3.8 27B 在 M5 Pro 64G 上：能跑不是新闻，MLX 快了四成才是</a> · <a href="/grok46-gemini37-flash-model-knockout">Grok 4.6 和 Gemini 3.7 Flash：模型竞争进入淘汰赛</a> · <a href="/grok-bot-cloud-pc-agent-war">Grok Bot 上线：这场战争才刚刚开始</a></p>

<hr />

<table>
  <tbody>
    <tr>
      <td>唯一网站：<a href="https://zaokit.app">Zaokit.app</a></td>
      <td>Agent 交易平台：<a href="https://zaokit.ai">Zaokit.ai</a></td>
    </tr>
  </tbody>
</table>

<p>企业 Grok 服务：<a href="https://grok.zaokit.com">grok.zaokit.com</a></p>

<p>企业服务：<a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a> · <a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a> · <a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a> · <a href="https://junxinzhang.com/projects.html">完整产品列表</a></p>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p><em>我是 Jason，自己一个人做 AI 产品。云可以租——最核心那一层，别写成长期合同。</em></p>]]></content><author><name>Jason Zhang</name></author><category term="AI" /><category term="featured" /><category term="AI" /><category term="Apple" /><category term="Alibaba" /><category term="Qwen" /><category term="Siri" /><category term="Apple Intelligence" /><category term="中国区" /><category term="Zaokit" /><summary type="html"><![CDATA[路透 8 月 14 日独家：苹果为中国区自己训了一层大模型，阿里提供技术支持。 我的读法：最后时刻，Siri 核心层不长期外包。云可以租，芯自己留。]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="https://junxinzhang.com/assets/images/cover-20260816-apple-alibaba-siri.webp" /><media:content medium="image" url="https://junxinzhang.com/assets/images/cover-20260816-apple-alibaba-siri.webp" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">Qwen3.8 27B 在 M5 Pro 64G 上：能跑不是新闻，MLX 快了四成才是</title><link href="https://junxinzhang.com/qwen38-27b-m5pro-local/" rel="alternate" type="text/html" title="Qwen3.8 27B 在 M5 Pro 64G 上：能跑不是新闻，MLX 快了四成才是" /><published>2026-08-15T00:00:00+00:00</published><updated>2026-08-15T00:00:00+00:00</updated><id>https://junxinzhang.com/qwen38-27b-m5pro-local</id><content type="html" xml:base="https://junxinzhang.com/qwen38-27b-m5pro-local/"><![CDATA[<p>Qwen3.8-27B 的权重是 8 月 13 到 15 号这窗口落地的。Apache 2.0，稠密 27B，自带视觉，原生 262K 上下文。外面立刻开始传：17GB 就能跑，家用显卡入场。</p>

<p>我没去抄这句。今天下午在自己这台 MacBook Pro 上拉了两个标签，数字如下。</p>

<blockquote>
  <p><strong>能跑不是新闻。这台 M5 Pro 64G 上，官方 Q4_K_M 热身解码 27–29 tok/s；换同机的 MLX 标签，解码到 39–40。64G 不是入场券，是用来比引擎的。</strong></p>
</blockquote>

<p><img src="/assets/images/cover-20260815-qwen38-m5pro.webp" alt="Qwen3.8 27B 在 M5 Pro 64G 上" />
<!-- baoyu-skill prompt: 2.35:1清线漫画+清新扁平封面，奶油到天蓝渐变底，干净描边，薄荷绿/蜜桃/天蓝平涂，留白充足。禁止品牌logo与深色赛博UI。画面中央一台银色笔记本，上面坐着标中文「27B」的小机器人，身后淡淡隐去一个巨大「2.4T」影子；桌上一根发光内存条标「64G」，只亮了三分之一。顶部粗体中文「能跑不是新闻」，底部小字「M5 Pro 64G 本地实测」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="一这台机器和17gb-能跑这句话">一、这台机器，和「17GB 能跑」这句话</h2>

<p>先把台子摆清楚，免得后文的 tok/s 像从别处抄来的。</p>

<table>
  <thead>
    <tr>
      <th>项目</th>
      <th>这台机器</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>型号</td>
      <td>MacBook Pro（Mac17,8）</td>
    </tr>
    <tr>
      <td>芯片</td>
      <td>Apple M5 Pro</td>
    </tr>
    <tr>
      <td>CPU</td>
      <td>18 核（6 Super + 12 Performance）</td>
    </tr>
    <tr>
      <td>GPU</td>
      <td>20 核，Metal 4</td>
    </tr>
    <tr>
      <td>统一内存</td>
      <td>64 GB</td>
    </tr>
    <tr>
      <td>系统</td>
      <td>macOS 26.6.1（25G76）</td>
    </tr>
    <tr>
      <td>运行时</td>
      <td>Ollama 0.32.13（Homebrew，Flash Attention 开，KV cache q8_0）</td>
    </tr>
    <tr>
      <td>测试日期</td>
      <td>2026-08-15，上海时区</td>
    </tr>
  </tbody>
</table>

<p>官方仓库是 <code class="language-plaintext highlighter-rouge">Qwen/Qwen3.8-27B</code>，Apache 2.0。旁边那个 2.4T Max 是另一张许可证，跟这篇无关。Unsloth 和 LM Studio 对外说的地板是 17GB——那是权重大小，不是你开 256K 上下文之后的工作集。</p>

<p>这台机器开测前，本地没有 Qwen3.8 权重。Ollama 也是现装的。拉下来的两个标签：</p>

<table>
  <thead>
    <tr>
      <th>标签</th>
      <th>量化</th>
      <th>盘上大小</th>
      <th>架构</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td><code class="language-plaintext highlighter-rouge">qwen3.8:27b</code></td>
      <td>Q4_K_M</td>
      <td><strong>17 GB</strong></td>
      <td>qwen35 + CLIP 视觉</td>
    </tr>
    <tr>
      <td><code class="language-plaintext highlighter-rouge">qwen3.8:27b-mlx</code></td>
      <td>nvfp4</td>
      <td><strong>18 GB</strong></td>
      <td>qwen3_5，<code class="language-plaintext highlighter-rouge">--mlx-engine</code></td>
    </tr>
  </tbody>
</table>

<p>这台机器上当时的真实命令输出：</p>

<p><img src="/assets/images/shot-20260815-ollama-list.webp" alt="Ollama 0.32.13 拉下的两个标签" /></p>

<p>下面所有速度，除特别注明外，都走 Ollama HTTP <code class="language-plaintext highlighter-rouge">/api/generate</code>，<code class="language-plaintext highlighter-rouge">num_ctx=8192</code>，温度 1 / top_p 0.95 / top_k 20。没有 128K，没有 256K，没有 BF16，也没有复现官方 SWE-bench。</p>

<h2 id="二官方-q4_k_m28-toks20g没掉交换">二、官方 Q4_K_M：28 tok/s，20G，没掉交换</h2>

<p>先跑官方标签。这是大多数人会 <code class="language-plaintext highlighter-rouge">ollama run qwen3.8:27b</code> 的那一条。</p>

<table>
  <thead>
    <tr>
      <th>任务</th>
      <th>思考</th>
      <th>加载</th>
      <th>预填充</th>
      <th>解码</th>
      <th>生成 token</th>
      <th>进程 RSS</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>首次加载</td>
      <td>关</td>
      <td>4.0 s</td>
      <td>30 t/s</td>
      <td>16.7 t/s</td>
      <td>25</td>
      <td>18.0 G</td>
    </tr>
    <tr>
      <td>热身短答</td>
      <td>关</td>
      <td>0.14 s</td>
      <td>105 t/s</td>
      <td><strong>26.1 t/s</strong></td>
      <td>19</td>
      <td>18.5 G</td>
    </tr>
    <tr>
      <td>线程安全 LRU</td>
      <td>开</td>
      <td>0.14 s</td>
      <td>54 t/s</td>
      <td><strong>28.9 t/s</strong></td>
      <td>1194</td>
      <td>18.9 G</td>
    </tr>
    <tr>
      <td>同一道 LRU</td>
      <td>关</td>
      <td>0.14 s</td>
      <td>134 t/s</td>
      <td><strong>26.7 t/s</strong></td>
      <td>1585</td>
      <td>19.4 G</td>
    </tr>
    <tr>
      <td>400 字中文</td>
      <td>开</td>
      <td>0.16 s</td>
      <td>104 t/s</td>
      <td>15.3 t/s</td>
      <td>1351</td>
      <td>19.5 G</td>
    </tr>
    <tr>
      <td><code class="language-plaintext highlighter-rouge">is_prime</code></td>
      <td>关</td>
      <td>0.16 s</td>
      <td>57 t/s</td>
      <td>28.1 t/s</td>
      <td>91</td>
      <td>19.7 G</td>
    </tr>
    <tr>
      <td>约 3.6K prefill</td>
      <td>关</td>
      <td>0.17 s</td>
      <td><strong>272 t/s</strong></td>
      <td>14.0 t/s</td>
      <td>159</td>
      <td>20.3 G</td>
    </tr>
  </tbody>
</table>

<p>命令行再打一条 <code class="language-plaintext highlighter-rouge">ollama run --verbose</code>（新进程，默认上下文 256K）：加载 7.4 s，解码 <strong>27.6 t/s</strong>。</p>

<p><img src="/assets/images/shot-20260815-verbose-27b.webp" alt="官方标签 verbose：解码 27.57 tok/s" /></p>

<p>看这张表，只抓三件事。</p>

<p>第一，<strong>热身之后，官方 GGUF 就在 27–29 tok/s 这条线上。</strong> 首次加载 4 秒，之后加载都在 0.14–0.17 秒。16.7 那种冷启动数字，不要拿去当日常体感。</p>

<p>第二，<strong>内存很老实。</strong> 进程 RSS 从 18.0G 爬到 20.3G，8K 上下文全程 Swapins=0、Swapouts=0，memory_pressure 没有 warn。压缩内存有，交换没有。官方 runner 报 66/66 层在 GPU，Metal 占用约 16.0 GiB，再加 888 MiB 的 CLIP mmproj。</p>

<p><img src="/assets/images/shot-20260815-rss-loaded.webp" alt="加载后进程 18.9G RSS，8K 没掉交换" /></p>

<p>第三，<strong>长一点的预填充，这台机器吃得动。</strong> 3662 个 prompt token，prefill 272 t/s，首 token 大约 13.4 秒。这不是 256K 长窗口，只是说明 8K 档的预填充不是瓶颈。</p>

<p><img src="/assets/images/illust-20260815-qwen-ollama-speed.webp" alt="官方 Q4 热身之后就在 28 tok/s" />
<!-- baoyu-skill prompt: 2.35:1清新知识漫画，奶油底、清线描边。银色笔记本吐出一条稳定的薄荷绿 token 缎带，旁边放着一块标中文「17G」的砝码和一只秒表。顶部中文「官方 Q4 热身之后就在 28 tok/s」，底部小字「进程 18 到 20G，8K 没掉交换」。薄荷绿/蜜桃/天蓝平涂，中文清晰可读，禁止深色赛博风。 --ar 2.35:1 --></p>

<h2 id="三同一台机器换-mlx40-toks">三、同一台机器换 MLX：40 tok/s</h2>

<p>64G 的好处现在才出现：不用换电脑，直接拉 <code class="language-plaintext highlighter-rouge">qwen3.8:27b-mlx</code>。</p>

<p>同一道 LRU，同一套采样：</p>

<table>
  <thead>
    <tr>
      <th>任务</th>
      <th>思考</th>
      <th>加载</th>
      <th>预填充</th>
      <th>解码</th>
      <th>生成 token</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>LRU</td>
      <td>开</td>
      <td>0.03 s</td>
      <td>82 t/s</td>
      <td><strong>38.9 t/s</strong></td>
      <td>2858</td>
    </tr>
    <tr>
      <td>同一道 LRU</td>
      <td>关</td>
      <td>0.03 s</td>
      <td>167 t/s</td>
      <td><strong>40.5 t/s</strong></td>
      <td>1166</td>
    </tr>
  </tbody>
</table>

<p>相对官方 Q4_K_M 的 26.7–28.9，这是大约四成的解码加速。</p>

<p>这两个数不是模型变聪明了，是推理引擎换了。<strong>28 是 GGUF 的解码速度，40 是 MLX 的解码速度。</strong> 说的都是生成时每秒吐多少 token——已经开始一个字一个字往外蹦的那种，不是预填充，也不是智商。GGUF 是 llama.cpp 那一套，跨平台，Ollama 默认就是它；MLX 是苹果统一内存加 Metal 那一套，这台 Mac 上通常更快。两边量化也不一样：官方标签是 Q4_K_M，MLX 标签是 <strong>nvfp4</strong>，走 <code class="language-plaintext highlighter-rouge">ollama runner --mlx-engine</code>。所以这不是纯引擎对比，是「社区最常见的那条默认路径」对「这台机器上更快的那条路径」。</p>

<p>MLX 进程 RSS 不能直接跟 GGUF 比。权重走 Metal/wired，进程本身只有几百 MB；我测的时候还叠过一次官方 runner 的残留，那个 26G 的脏数字不写进结论。卸掉官方标签之后，机器空闲内存回到 61%，没有新的压力。</p>

<p>所以结论很窄，也很硬：</p>

<p><strong>在这台 M5 Pro 64G 上，想要交互速度，走 MLX 标签；想要对齐社区最常见的 Q4 体感，走官方 GGUF。</strong> 同一份 27B，引擎差一档，手感就不一样。</p>

<p><img src="/assets/images/illust-20260815-qwen-mlx-faster.webp" alt="同机换 MLX，解码到 40" />
<!-- baoyu-skill prompt: 2.35:1清新知识漫画，奶油底、清线描边。同一台银色笔记本喷出两条 token 缎带：左侧较慢标中文「GGUF 28」，右侧更快更亮标「MLX 40」。顶部中文「同一台机器换 MLX」，底部小字「快了大约四成」。薄荷绿/蜜桃/天蓝平涂，中文清晰可读，禁止深色赛博风。 --ar 2.35:1 --></p>

<h2 id="四默认开思考本地更费的是-token">四、默认开思考，本地更费的是 token</h2>

<p>Qwen3.8 默认思考开着。本地没有 API 账单，很多人会以为「开着也无所谓」。</p>

<p>速度上，这件事几乎不成立。官方标签同一道 LRU：开思考 28.9 tok/s，关思考 26.7 tok/s，解码没有变慢。MLX 也一样，开 38.9、关 40.5。</p>

<p>贵的是生成量。</p>

<p>写 400 字中文产品体感、思考开着：一共 1351 个生成 token，思考正文 1671 字，真正给读者的只有 454 字。墙钟 89 秒。同一下午，关思考的短代码题 91 个 token、4 秒结束。</p>

<table>
  <thead>
    <tr>
      <th>任务</th>
      <th>思考</th>
      <th>生成 token</th>
      <th>思考字数</th>
      <th>正文字数</th>
      <th>墙钟</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>LRU</td>
      <td>开</td>
      <td>1194</td>
      <td>429</td>
      <td>3698</td>
      <td>42 s</td>
    </tr>
    <tr>
      <td>LRU</td>
      <td>关</td>
      <td>1585</td>
      <td>—</td>
      <td>6282</td>
      <td>60 s</td>
    </tr>
    <tr>
      <td>400 字中文</td>
      <td>开</td>
      <td>1351</td>
      <td>1671</td>
      <td>454</td>
      <td>89 s</td>
    </tr>
    <tr>
      <td><code class="language-plaintext highlighter-rouge">is_prime</code></td>
      <td>关</td>
      <td>91</td>
      <td>—</td>
      <td>247</td>
      <td>4 s</td>
    </tr>
  </tbody>
</table>

<p>本地模型的思考开关，不是「更聪明所以更慢」，是「同一速度下多写一堆你不一定要看的字」。日常写代码、改补丁，先关；真要推一道算法，再开。</p>

<p><img src="/assets/images/illust-20260815-qwen-think-tokens.webp" alt="思考开关烧掉的是字，不是显存" />
<!-- baoyu-skill prompt: 2.35:1清新知识漫画，奶油底、清线描边。深色书桌上一个拨杆开关，一侧是薄薄一张答案卡片，另一侧是烧着火星的长卷草稿纸。顶部中文「思考开关烧掉的是字」，底部小字「不是显存」。薄荷绿/蜜桃/天蓝平涂，中文清晰可读，禁止深色赛博风。 --ar 2.35:1 --></p>

<h2 id="五一张自检表16g--24g--64g-怎么选">五、一张自检表：16G / 24G / 64G 怎么选</h2>

<p>把官方那句「17GB 能跑」放回硬件账本里。</p>

<table>
  <thead>
    <tr>
      <th>内存</th>
      <th>能不能跑官方 Q4</th>
      <th>实际该怎么选</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>16 GB</td>
      <td>不能。Q4_K_M 文件就是 17G</td>
      <td>换 9B，或者等更狠的量化，别硬上 27B</td>
    </tr>
    <tr>
      <td>24 GB</td>
      <td>能进门，短上下文</td>
      <td>官方 Q4，关思考，别开 128K</td>
    </tr>
    <tr>
      <td>32–48 GB</td>
      <td>能比较舒服地跑 Q4 / Q5</td>
      <td>日常本地助手够了</td>
    </tr>
    <tr>
      <td><strong>64 GB（这台）</strong></td>
      <td>很宽裕</td>
      <td>同一台机器对比 GGUF 和 MLX，思考可以开，应用可以留</td>
    </tr>
  </tbody>
</table>

<p>64G 不是「终于能跑 27B」的门槛。24G 才是入场券。64G 买到的是余量：两个引擎并排、思考开着、浏览器不用关。</p>

<p>这篇没测 128K / 256K，也没测 BF16。BF16 官方权重约 55.6G，这台 64G 理论上塞得进短上下文，长窗口会顶满，我今天没拉。LM Studio 的 MLX 下载中途超时，所以速度只报 Ollama 两条线。</p>

<p><img src="/assets/images/illust-20260815-qwen-64g-ledger.webp" alt="16G 塞不进，64G 是用来比引擎的" />
<!-- baoyu-skill prompt: 2.35:1清新知识漫画，奶油底、清线描边。三根内存条并排：短的一根裂开标中文「16G」，中等一根勉强托住「17G」砝码标「24G」，最长一根大半空着标「64G」。顶部中文「16G 塞不进，64G 是用来比引擎的」，底部小字「24G 才是入场券」。薄荷绿/蜜桃/天蓝平涂，中文清晰可读，禁止深色赛博风。 --ar 2.35:1 --></p>

<h2 id="写在最后">写在最后</h2>

<p>压成五句：</p>

<ol>
  <li><strong>数字都来自这台 M5 Pro 64G</strong>——Ollama 0.32.13，2026-08-15 下午，不是官方榜</li>
  <li><strong>官方 Q4_K_M 热身解码 27–29 tok/s</strong>——进程 18–20G，8K 没掉交换，3.6K prefill 272 t/s</li>
  <li><strong>同机 MLX nvfp4 解码 39–40 tok/s</strong>——快大约四成，64G 的意义是能并排对比</li>
  <li><strong>思考开关不减速，只烧 token</strong>——400 字任务思考 1671 字、正文 454 字</li>
  <li><strong>16G 塞不进，24G 才是入场券</strong>——64G 买的是余量，不是入场资格</li>
</ol>

<p>土话一句：</p>

<p><strong>能跑只说明你买对了内存，快不快，要看你喂给它的是哪一个引擎。</strong></p>

<p>我一个人打造的 <a href="https://zaokit.ai">Zaokit AI Agent 交易平台</a>，以及 AI PPT / 图文创作 <a href="https://zaokit.app">Zaokit.app</a>，助力大家高效完成图文创作和 PPT 生成。唯一网站：<a href="https://zaokit.app">https://zaokit.app</a>。</p>

<p>企业侧同一逻辑，已经融进可直接接入的服务：</p>

<ul>
  <li><a href="https://grok.zaokit.com">grok.zaokit.com</a></li>
  <li><a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a></li>
  <li><a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a></li>
  <li><a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a></li>
  <li><a href="https://junxinzhang.com/projects.html">完整产品列表</a></li>
</ul>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<p>如果你认可 Zaokit AI 的产品理念，欢迎后台留言加入社群。<strong>我们不卖课、不割韭菜，只聚焦 ToB 企业场景的 AI 落地实战。</strong> 希望在这里，能给你带来不一样的思维火花和真实的商业碰撞。</p>

<hr />

<p>延伸：<a href="/grok46-gemini37-flash-model-knockout">Grok 4.6 和 Gemini 3.7 Flash 同周落地：模型竞争进入淘汰赛</a> · <a href="/grok-bot-cloud-pc-agent-war">Grok Bot 上线：这场战争才刚刚开始</a> · <a href="/private-llm-deployment-guide">私有化大模型部署指南</a></p>

<hr />

<table>
  <tbody>
    <tr>
      <td>唯一网站：<a href="https://zaokit.app">Zaokit.app</a></td>
      <td>Agent 交易平台：<a href="https://zaokit.ai">Zaokit.ai</a></td>
    </tr>
  </tbody>
</table>

<p>企业 Grok 服务：<a href="https://grok.zaokit.com">grok.zaokit.com</a></p>

<p>企业服务：<a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a> · <a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a> · <a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a> · <a href="https://junxinzhang.com/projects.html">完整产品列表</a></p>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p><em>我是 Jason，自己一个人做 AI 产品。本地评测最便宜的作弊是抄榜——数字只能从自己桌上的那台机器出。</em></p>]]></content><author><name>Jason Zhang</name></author><category term="AI" /><category term="featured" /><category term="AI" /><category term="Qwen" /><category term="Qwen3.8" /><category term="Ollama" /><category term="MLX" /><category term="Apple Silicon" /><category term="M5 Pro" /><category term="本地部署" /><category term="评测" /><category term="Zaokit" /><summary type="html"><![CDATA[Qwen3.8-27B 开源第二天，我在自己的 MacBook Pro M5 Pro 64G 上拉了两个 Ollama 标签。 官方 Q4_K_M 热身解码 27–29 tok/s，进程 18–20G，8K 上下文没掉交换。 同机换 MLX nvfp4，解码到 39–40 tok/s。64G 不是入场券，是用来比引擎的。]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="https://junxinzhang.com/assets/images/cover-20260815-qwen38-m5pro.webp" /><media:content medium="image" url="https://junxinzhang.com/assets/images/cover-20260815-qwen38-m5pro.webp" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">Grok 4.6 和 Gemini 3.7 Flash 同周落地：模型竞争进入淘汰赛</title><link href="https://junxinzhang.com/grok46-gemini37-flash-model-knockout/" rel="alternate" type="text/html" title="Grok 4.6 和 Gemini 3.7 Flash 同周落地：模型竞争进入淘汰赛" /><published>2026-08-14T00:00:00+00:00</published><updated>2026-08-14T00:00:00+00:00</updated><id>https://junxinzhang.com/grok46-gemini37-flash-model-knockout</id><content type="html" xml:base="https://junxinzhang.com/grok46-gemini37-flash-model-knockout/"><![CDATA[<p>把这周的日历摊开看一眼：</p>

<p>周三，Grok 4.6 发布，首日上线 Cursor。周四，Google 发布 Gemini 3.7 Flash，价格直接砍半。周五，SpaceX 对 Cursor 的 600 亿美元收购正式交割。</p>

<p>三天，三记重拳，没有一记是巧合。</p>

<blockquote>
  <p><strong>巨头开始发力了。模型竞争从积分赛进入淘汰赛——输一场，就下场。而第一个信号是：独立工具的黄金时代，结束了。</strong></p>
</blockquote>

<p><img src="/assets/images/cover-20260814-model-knockout.webp" alt="模型竞争进入淘汰赛" />
<!-- baoyu-skill prompt: 2.35:1清线漫画+清新扁平封面，奶油到天蓝渐变底，干净描边，薄荷绿/蜜桃/天蓝平涂，留白充足。禁止品牌logo与深色赛博UI。画面中央一张体育淘汰赛对阵图，左侧黑色闪电徽章机器人举牌中文「Grok 4.6」，右侧蓝色星光徽章机器人举牌中文「Gemini 3.7 Flash」，晋级线汇向中央发光奖杯；下方灰色被淘汰支线上，小工具小人抱箱离场。顶部粗体中文「模型竞争进入淘汰赛」，底部小字「巨头下场，中间地带正在消失」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="一cursor不是被收购是被收编">一、Cursor：不是被收购，是被收编</h2>

<p>说实话，”收购”这个词可能不够准确。</p>

<p>准确讲，Cursor 不是被收购，更像是被<strong>收编</strong>进了马斯克的 AI 军团。收购是资产换了主人，收编是进了别人的作战序列——这两件事的含金量完全不同。</p>

<p>我一开始觉得这就是笔大买卖：600 亿，挺吓人的。但转念一想，这事儿比交易本身狠得多。</p>

<p>所有人都以为 AI 编程是独立赛道——Cursor、Windsurf、Copilot，三足鼎立，各凭本事。但<strong>入口从来不是终点，只是平台的基础设施。</strong> 你以为你在赛道上领跑，其实你只是别人棋盘上最值钱的那颗子。</p>

<p>Cursor 的处境其实早就写在明面上：ARR 一路冲到 40 亿美元，号称史上增长最快的软件公司，但它自己在公告里都承认——<strong>been bottlenecked by compute，被算力卡着脖子。</strong> 收入涨得再快，后训练跟不上，模型能力就是别人的天花板。</p>

<p>现在，氧气管直接接上了。Colossus 那个全球最大的单站点 GPU 集群，从”租不起”变成了”自家的”。</p>

<p>交割那天的两句对话，值得逐字读。Cursor 说：<strong>我们将助力 Grok 成为全球最有用的 AI。</strong> 对面官方账号回了一个词：<strong>Welcome。</strong></p>

<p>这不是退出比赛。这是换了一套队服，直接进了决赛。</p>

<p><img src="/assets/images/illust-20260814-jersey-swap-oxygen.webp" alt="不是退出比赛，是换了队服进决赛" />
<!-- baoyu-skill prompt: 2.35:1清新知识漫画更衣室场景，奶油到淡蜜桃渐变底、清线描边。戴眼镜的程序员小机器人把写中文「独立工具」的旧队服挂进薄荷绿衣柜，身上换上胸前写「SpaceXAI」的新队服，手握氧气管连向远处发光服务器机柜标中文「Colossus 算力」，门口指示牌指向「决赛入口」。顶部中文「不是退出比赛，是换了队服进决赛」，底部小字「氧气管直接接上了」。薄荷绿/蜜桃/天蓝平涂，中文清晰可读，禁止深色赛博风。 --ar 2.35:1 --></p>

<h2 id="二马斯克手里的链条闭合了">二、马斯克手里的链条，闭合了</h2>

<p>把镜头拉远，看马斯克手里现在攥着什么：</p>

<table>
  <thead>
    <tr>
      <th>环节</th>
      <th>资产</th>
      <th>作用</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>智能</td>
      <td>Grok 4.6</td>
      <td>50 万 token 上下文，发布首日上线 Cursor</td>
    </tr>
    <tr>
      <td>算力</td>
      <td>Colossus</td>
      <td>孟菲斯园区约 55 万块 GPU，目标 2027 年逼近 10 GW</td>
    </tr>
    <tr>
      <td>入口</td>
      <td>Cursor</td>
      <td>40 亿美元 ARR，约 75% 来自企业客户</td>
    </tr>
    <tr>
      <td>载体</td>
      <td>Optimus</td>
      <td>Grok 做 System 2 大脑，负责高层推理决策</td>
    </tr>
  </tbody>
</table>

<p><strong>从写代码到造硬件，链条闭合了。</strong></p>

<p>单看每一环都不是最强：Grok 4.6 在 Artificial Analysis 上追平了 GPT-5.6 Sol，但前面还有 Claude Opus 5；Cursor 的入口再大，也大不过 GitHub。但淘汰赛比的从来不是单项，是<strong>整条链有没有断点</strong>。</p>

<p>模型不行，Colossus 堆算力补；入口不够，Cursor 的企业客户直接导流；智能落了地，还有 Optimus 这个物理载体等着装。反过来看那些单项冠军——只有模型的、只有工具的、只有算力的——每一家都在祈祷自己的上下游别翻脸。</p>

<p><a href="/grok-bot-cloud-pc-agent-war">写 Grok Bot 那篇</a>时我说巨头下场打的是基础设施价格战。现在看，价格战只是表象，<strong>真正的杀招是垂直整合：把赛道两头都焊死，中间的人想跑都没处跑。</strong></p>

<p><img src="/assets/images/illust-20260814-musk-closed-loop.webp" alt="从写代码到造硬件，链条闭合了" />
<!-- baoyu-skill prompt: 2.35:1清新知识漫画闭环图，奶油底、清线描边。四个圆形节点首尾相接成闭环：发光大脑标中文「Grok·模型」、服务器机柜标「Colossus·算力」、代码编辑器大门标「Cursor·开发者入口」、人形机器人标「Optimus·物理载体」，粗箭头连成环，环中央中文「链条闭合了」。顶部「从写代码到造硬件」，底部小字「入口不是终点，是平台的地基」。薄荷绿/蜜桃/天蓝平涂，中文清晰可读，禁止深色赛博风。 --ar 2.35:1 --></p>

<h2 id="三gemini-37-flash便宜的开始干重活了">三、Gemini 3.7 Flash：便宜的开始干重活了</h2>

<p>同一周，Google 出手了。Gemini 3.7 Flash 发布，促销价砍到上一代原价的一半：每百万 token 输入 0.75 美元、输出 3.75 美元。</p>

<p>降价不稀奇，稀奇的是这次升级基本都冲着干活去的：</p>

<table>
  <thead>
    <tr>
      <th>能力</th>
      <th>基准</th>
      <th>上一代</th>
      <th>3.7 Flash</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>生产级代码</td>
      <td>FrontierCode 1.1</td>
      <td>34.4%</td>
      <td><strong>43.6%</strong></td>
    </tr>
    <tr>
      <td>长期软件工程</td>
      <td>DeepSWE v1.1</td>
      <td>48.6%</td>
      <td><strong>65.3%</strong></td>
    </tr>
    <tr>
      <td>网页开发</td>
      <td>WebDev Arena</td>
      <td>1538</td>
      <td><strong>1588 Elo</strong></td>
    </tr>
    <tr>
      <td>终端 Agent</td>
      <td>Terminal-Bench 2.1</td>
      <td>78.0%</td>
      <td><strong>85.8%</strong></td>
    </tr>
    <tr>
      <td>企业工作流</td>
      <td>AutomationBench</td>
      <td>17.0%</td>
      <td><strong>30.4%</strong></td>
    </tr>
  </tbody>
</table>

<p>看这张表要抓两个点。第一，涨幅最大的两项是<strong>长期软件工程和企业工作流</strong>——前者接近 17 个点，后者直接翻倍还不止。这两项恰恰是 Agent 时代最值钱的能力：不是答一道题，是接一个活，自己跑完整条流水线。</p>

<p>第二，这是 Google 自报的数据，得打个折听——同一张官方对比表里，GPT-5.6 Terra 在长期软件工程和终端 Agent 上依然领先。但方向不会骗人：</p>

<p><strong>以前 Flash 给人的感觉是速度快、便宜、够用。3.7 Flash 开始变成：便宜归便宜，但真能拿来干重活了。</strong></p>

<p>这才是 Google 式的淘汰赛打法。马斯克焊链条，Google 砸地板——把”够用的智能”的单价打到对手的成本线以下。你的产品如果只是”比 Flash 强一点点”，那从今天起，你比它贵多少，就是你的死期倒计时。</p>

<p><img src="/assets/images/illust-20260814-flash-benchmark-jump.webp" alt="便宜归便宜，但真能干重活了" />
<!-- baoyu-skill prompt: 2.35:1清新知识漫画数据图，奶油底、清线描边。左侧戴安全帽的蓝色闪电徽章小机器人标「Gemini 3.7 Flash」；右侧五组成对柱状图，旧柱浅灰、新柱薄荷绿更高，柱下依次中文「生产级代码 34.4→43.6」「长期软件工程 48.6→65.3」「网页开发 1538→1588」「终端 Agent 78.0→85.8」「企业工作流 17.0→30.4」；上方价签被剪刀剪半标「价格砍半」。顶部中文「便宜归便宜，但真能干重活了」。薄荷绿/蜜桃/天蓝平涂，中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="四淘汰赛的规则中间地带正在消失">四、淘汰赛的规则：中间地带正在消失</h2>

<p>把三件事放在一张图上，规则就浮出来了。</p>

<p>积分赛时代，大家各刷各的榜，输一场明天再来。淘汰赛不一样：<strong>要么长成平台，要么成为平台的一部分。中间地带，正在消失。</strong></p>

<p>Cursor 选了后者，而且选得体面——40 亿 ARR 的身价换 600 亿的席位，是中间地带里能谈到的最好价钱。往后的独立工具，牌桌上的筹码只会越来越少：模型是别人的，算力是别人的，价格是别人定的，你唯一的资产是用户——而用户，恰恰是平台最想要的东西。</p>

<p>那没被收编的怎么办？我的看法反而没那么悲观，分两头说。</p>

<p><strong>对企业：</strong> 淘汰赛的副产品是史上最便宜的智能。正确姿势不是押注某一家，而是搭好自己的模型路由——重活给前沿模型，批量任务给砍半价的 Flash 这类工作马，<a href="/post-training-chaos-reward-clarity">之前说过的</a>那句话继续成立：企业用 AI 的第一步，一定要有自己的 MaaS 平台，好钢用在刀刃上。</p>

<p><strong>对小团队：</strong> 别在巨头的赛道上当选手，去当用户。巨头把智能的单价打到地板，你把地板价当原材料，去做贴着具体场景和工作流的产品。我自己做 <a href="https://zaokit.ai">Zaokit</a> 就是这个打法：模型谁便宜好用接谁，价值沉淀在把模型、执行环境和企业工作流缝起来的那层胶水上。<strong>巨头打淘汰赛，我们捡门票钱。</strong></p>

<p><img src="/assets/images/illust-20260814-middle-ground-vanish.webp" alt="独立工具的黄金时代结束了" />
<!-- baoyu-skill prompt: 2.35:1清新知识漫画海岛图，奶油到淡天蓝渐变底、清线描边。海面三块陆地：左侧平台城市大岛插旗标中文「长成平台」，右侧大工厂岛标「成为平台的一部分」，中间正在下沉碎裂的沙洲上站着抱工具箱的犹豫小机器人，牌子写「中间地带」。顶部中文「独立工具的黄金时代结束了」，底部小字「要么长成平台，要么成为平台的一部分」。薄荷绿/蜜桃/天蓝平涂，中文清晰可读，禁止深色赛博风。 --ar 2.35:1 --></p>

<h2 id="写在最后">写在最后</h2>

<p>压成五句：</p>

<ol>
  <li><strong>一周三记重拳不是巧合</strong>——Grok 4.6、Gemini 3.7 Flash、Cursor 交割，巨头开始发力，模型竞争进入淘汰赛</li>
  <li><strong>Cursor 不是被收购，是被收编</strong>——被算力卡脖子的 40 亿 ARR，换了队服直接进决赛</li>
  <li><strong>马斯克的链条闭合了</strong>——Grok 模型、Colossus 算力、Cursor 入口、Optimus 载体，从写代码到造硬件</li>
  <li><strong>Flash 便宜归便宜，真能干重活了</strong>——长期软件工程 48.6%→65.3%，价格砍半，地板价的智能来了</li>
  <li><strong>中间地带正在消失</strong>——企业搭好模型路由，小团队用地板价原材料做贴场景的产品</li>
</ol>

<p>土话一句：</p>

<p><strong>淘汰赛的哨声一响，赛道上就没有观众席了——你要么在场上，要么在别人的名单里。</strong></p>

<p>我一个人打造的 <a href="https://zaokit.ai">Zaokit AI Agent 交易平台</a>，以及 AI PPT / 图文创作 <a href="https://zaokit.app">Zaokit.app</a>，助力大家高效完成图文创作和 PPT 生成。唯一网站：<a href="https://zaokit.app">https://zaokit.app</a>。</p>

<p>企业侧同一逻辑，已经融进可直接接入的服务：</p>

<ul>
  <li><a href="https://grok.zaokit.com">grok.zaokit.com</a></li>
  <li><a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a></li>
  <li><a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a></li>
  <li><a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a></li>
  <li><a href="https://junxinzhang.com/projects.html">完整产品列表</a></li>
</ul>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<p>如果你认可 Zaokit AI 的产品理念，欢迎后台留言加入社群。<strong>我们不卖课、不割韭菜，只聚焦 ToB 企业场景的 AI 落地实战。</strong> 希望在这里，能给你带来不一样的思维火花和真实的商业碰撞。</p>

<hr />

<p>延伸：<a href="/grok-bot-cloud-pc-agent-war">Grok Bot 上线：这场战争才刚刚开始</a> · <a href="/codex-linux-billion-servers">Codex 登陆 Linux，一亿台服务器准备好了</a> · <a href="/post-training-chaos-reward-clarity">训得出模型，训不明白 Post-training</a></p>

<hr />

<table>
  <tbody>
    <tr>
      <td>唯一网站：<a href="https://zaokit.app">Zaokit.app</a></td>
      <td>Agent 交易平台：<a href="https://zaokit.ai">Zaokit.ai</a></td>
    </tr>
  </tbody>
</table>

<p>企业 Grok 服务：<a href="https://grok.zaokit.com">grok.zaokit.com</a></p>

<p>企业服务：<a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a> · <a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a> · <a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a> · <a href="https://junxinzhang.com/projects.html">完整产品列表</a></p>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p><em>我是 Jason，自己一个人做 AI 产品。淘汰赛已经开哨——别急着下注谁夺冠，先确认自己不在被淘汰的名单里。</em></p>]]></content><author><name>Jason Zhang</name></author><category term="AI" /><category term="featured" /><category term="AI" /><category term="Grok" /><category term="Gemini" /><category term="xAI" /><category term="SpaceX" /><category term="Cursor" /><category term="Google" /><category term="模型竞争" /><category term="淘汰赛" /><category term="Zaokit" /><summary type="html"><![CDATA[一周之内：周三 Grok 4.6 发布，周四 Gemini 3.7 Flash 价格砍半、五项指标跳涨， 周五 Cursor 的 600 亿收购正式交割。巨头开始发力了，模型竞争进入淘汰赛。 独立工具的黄金时代结束了——要么长成平台，要么成为平台的一部分，中间地带正在消失。]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="https://junxinzhang.com/assets/images/cover-20260814-model-knockout.webp" /><media:content medium="image" url="https://junxinzhang.com/assets/images/cover-20260814-model-knockout.webp" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">Grok Bot 上线：Manus 看到的真是终局，这场战争才刚刚开始</title><link href="https://junxinzhang.com/grok-bot-cloud-pc-agent-war/" rel="alternate" type="text/html" title="Grok Bot 上线：Manus 看到的真是终局，这场战争才刚刚开始" /><published>2026-08-13T00:00:00+00:00</published><updated>2026-08-13T00:00:00+00:00</updated><id>https://junxinzhang.com/grok-bot-cloud-pc-agent-war</id><content type="html" xml:base="https://junxinzhang.com/grok-bot-cloud-pc-agent-war/"><![CDATA[<p>两百刀一个月的会员费，送你一台 16GB 内存、128GB 存储、永远在线的云端个人电脑，外加大额 AI 用量。</p>

<p>这不是哪家云厂商搞促销，这是 xAI 刚上线的 Grok Bot。很多人根本没看懂这意味着什么，今天把话说透。</p>

<blockquote>
  <p><strong>Manus 当年看到的”给 Agent 配电脑”，真的就是终局形态。但看到终局是一回事，活到终局是另一回事——巨头亲自下场打价格战，战争才刚刚开始。</strong></p>
</blockquote>

<p><img src="/assets/images/cover-20260813-grok-bot-agent-war.webp" alt="Grok Bot 上线：Manus 看到的真是终局，这场战争才刚刚开始" /></p>

<h2 id="一grok-bot-到底是个什么东西">一、Grok Bot 到底是个什么东西</h2>

<p>我花了 300 刀开通 SuperGrok Heavy，对 xAI 新上线的 Grok Bot 做了深度测试。这次 Grok 想做的，不是一个更聪明的聊天机器人，而是一个真正能”上班”的云端 AI 员工。</p>

<p>每个 Bot 都拥有一台持续在线的云电脑：</p>

<ul>
  <li>登录邮箱、CRM 和网站后台</li>
  <li>像人一样点击、输入、整理资料</li>
  <li>你演示一次，它就保存为 Routine</li>
  <li>多个 Bot 分工协作、互相交接任务</li>
  <li>你的电脑关机后，任务仍在云端继续执行</li>
</ul>

<p>不是 PPT 上的参数。进到这台云电脑里跑一遍 <code class="language-plaintext highlighter-rouge">top</code> 和 <code class="language-plaintext highlighter-rouge">df -h</code>，内存大约 16GB，根分区一百多 GB——就是一台真实在线的 Linux 工位。</p>

<p><img src="/assets/images/shot-20260813-grok-bot-cloud-pc-top.webp" alt="Grok Bot 云电脑实机：16GB 内存，永远在线" /></p>

<p>它的本质是一个五层堆叠：<strong>大模型 + 云电脑 + 浏览器自动化 + 长期记忆 + 多智能体调度。</strong></p>

<p>最关键的一条是：<strong>即使一个软件没有 API、没有 MCP，Bot 也能直接操作网页界面。</strong></p>

<p>这一条把”数字员工”的适用范围，从少数有接口的系统，直接扩展到了一切能用浏览器打开的东西。真实世界的软件，绝大多数是没有接口的长尾——公司内部的 ERP、某个行业的老旧后台、只有网页版的 SaaS。浏览器自动化是唯一的通用接口，而云电脑给了这个接口一个 7×24 的工位。</p>

<p>实际用起来更直观：你在对话里下指令，它在那台云电脑上装环境、跑命令、回结果——不是聊天框里生成一段脚本让你自己执行，是员工真的在工位上干活。</p>

<p><img src="/assets/images/shot-20260813-grok-bot-chief-chat.webp" alt="给云端数字员工下指令：装环境、跑命令、回结果" /></p>

<p><img src="/assets/images/illust-20260813-grok-bot-anatomy.webp" alt="Grok Bot 的五层堆叠：演示一次，永远上班" /></p>

<h2 id="二原来-manus-看到的真的是终局">二、原来 Manus 看到的，真的是终局</h2>

<p><a href="/agent-next-phase-not-intelligence-race">之前写过</a>数字员工和 Manus 的终局。当时不少人觉得 Manus 是套壳、是概念。结合最近 Manus 重新独立运营再回头看——<strong>Manus 当年看到的方向，真的就是终局：Agent 不是聊天框里的助手，而是一个有自己电脑、有自己记忆、能独立完成工作流的员工。</strong></p>

<table>
  <thead>
    <tr>
      <th>Manus 当年做的</th>
      <th>Grok Bot 现在做的</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>完全运行在云上</td>
      <td>每个 Bot 一台持续在线的云电脑</td>
    </tr>
    <tr>
      <td>Agent 独立完成任务，人看结果</td>
      <td>电脑关机，任务继续</td>
    </tr>
    <tr>
      <td>替代人而非增强人</td>
      <td>数字员工直接接管工作流</td>
    </tr>
    <tr>
      <td>多 Agent 协作探索</td>
      <td>多 Bot 分工、交接、共享上下文</td>
    </tr>
  </tbody>
</table>

<p>但看到终局是一回事，能不能活到终局是另一回事。这场战争远远没有结束，它才刚刚进入大厂亲自下场的阶段。</p>

<p>马斯克这一年是在不惜血本地补课。今年 5 月，SpaceXAI（前身为 xAI）匆忙推出首个编程智能体追赶 Anthropic；6 月，直接以 600 亿美元天价收购 AI 编程公司 Cursor，随后基于 Cursor 的技术栈推出 Grok 4.5。如今 Grok Bot 登场——<strong>这是 Grok 的 Cursor 团队交出的第一份大作业，标志着这场补课全面升级。</strong></p>

<p>对手也没闲着。Sam Altman 近期在华盛顿与议员会面时，谈的同样是多智能体协作完成工作的未来图景。两大巨头在”智能体团战”上的正面交锋，已经不可避免。</p>

<p><img src="/assets/images/illust-20260813-catchup-timeline.webp" alt="一场不惜血本的补课：从编程智能体到 Grok Bot" /></p>

<h2 id="三算一笔账小作坊已经没法比了">三、算一笔账：小作坊已经没法比了</h2>

<p>把账摆在桌面上。面向用户，你要和 Grok Bot 竞争，对方一个月两百刀，给的是：</p>

<table>
  <thead>
    <tr>
      <th>项目</th>
      <th>Grok Bot 给的</th>
      <th>你自建的成本</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>云端个人电脑</td>
      <td>16GB + 128GB，7×24 在线</td>
      <td>光硬成本就打不平</td>
    </tr>
    <tr>
      <td>AI 模型用量</td>
      <td>大额配给</td>
      <td>按 API 价采购，毛利倒挂</td>
    </tr>
    <tr>
      <td>基础设施</td>
      <td>浏览器自动化 + Routine + 多 Bot 调度</td>
      <td>全套自研，人力黑洞</td>
    </tr>
  </tbody>
</table>

<p>你一个创业小团队，光是给每个用户配这台云电脑的成本，就已经收不回两百刀。这不是产品力的差距，是资产负债表的差距——巨头可以把云电脑按边际成本供给，你只能按市场价采购。</p>

<p>所以判断很直接：<strong>同类竞品的小作坊，趁早放弃换赛道。大公司已经亲自下场打价格战，这个位置上不会再有缝隙。</strong></p>

<p>顺便泼一盆冷水：这台云电脑是给 Bot 上班用的，不是让你拿去当自己的服务器创业的。那些琢磨着倒卖会员算力、把云电脑攒起来做”机房生意”的——这下好了，<strong>龙虾爱马仕都要歇菜了。</strong></p>

<p><img src="/assets/images/illust-20260813-price-war-scale.webp" alt="这笔账没法算：价格战的天平" /></p>

<h2 id="四为什么给-agent-一台电脑是分水岭">四、为什么”给 Agent 一台电脑”是分水岭</h2>

<p>这里值得多想一层。过去两年，Agent 赛道的主流叙事是接口化：给模型接 API、接 MCP、接工具。<a href="/codex-linux-billion-servers">上一篇</a>聊 Codex 登陆 Linux 时说过，Agent 的规模天花板在服务器上——而 Grok Bot 把同一个逻辑推到了每个普通用户面前。</p>

<p>云电脑给了 Agent 三样此前没有的东西：</p>

<ol>
  <li><strong>持久的身份</strong>——登录态、Cookie、账号密码都留在这台电脑里，不用每次重新授权</li>
  <li><strong>持久的文件</strong>——整理到一半的资料、下载的附件、生成的报表，都有地方放</li>
  <li><strong>持久的记忆</strong>——Routine 是新时代的 RPA，不用写脚本，你演示一遍，它记住流程</li>
</ol>

<p>再叠加多 Bot 之间的任务交接和上下文共享，一个部门级的数字员工团队就成型了：一个 Bot 盯邮箱，一个 Bot 整理资料，一个 Bot 出报表，一个 Bot 回邮件——互相交接，闭环运转。</p>

<p><strong>Manus 早就看到了这一层，所以它当年做的就是”给 Agent 配电脑”。区别在于，现在下场做这件事的，是能把成本打到地板价的巨头。</strong></p>

<p><img src="/assets/images/illust-20260813-bot-team-workflow.webp" alt="一支会交接的数字员工团队" /></p>

<h2 id="五个人开发者的活路在哪">五、个人开发者的活路在哪</h2>

<p>大厂打的是基础设施的价格战，个人和小团队的活路只剩一条：<strong>往上走，做贴着具体场景和工作流的东西。</strong></p>

<p>巨头的云电脑再便宜，它不会弯腰去解决某个行业的具体问题——报关流程怎么跑、财税单据怎么核、企业内部审批怎么串。这些脏活累活里的 know-how，才是小团队真正的护城河。基础设施的战争让巨头去打，把巨头打下来的地板价算力，变成自己产品的原材料。</p>

<p>我自己就是这么干的。做 <a href="https://zaokit.ai">Zaokit</a> 的过程中感受很直接：Agent 平台的价值不在于我自建了多少算力，而在于把模型、执行环境和企业工作流缝在一起的那层胶水。<strong>巨头卖水泥，我们盖房子。</strong></p>

<h2 id="写在最后">写在最后</h2>

<p>压成五句：</p>

<ol>
  <li><strong>Grok Bot 不是聊天机器人，是云端数字员工</strong>——大模型 + 云电脑 + 浏览器自动化 + 长期记忆 + 多智能体调度</li>
  <li><strong>没有 API 也能干活是真正的突破</strong>——浏览器自动化把适用范围扩展到一切网页软件</li>
  <li><strong>Manus 看到的真是终局</strong>——但巨头下场打价格战，战争才刚刚开始</li>
  <li><strong>两百刀一个月配 16GB+128GB 云电脑</strong>——小作坊的账没法算，趁早换赛道</li>
  <li><strong>小团队往上走</strong>——用巨头的地板价基础设施，做贴着场景的产品</li>
</ol>

<p>土话一句：</p>

<p><strong>巨头把水泥价格打到地板上，你还在自己烧水泥，那不是创业，是殉情。</strong></p>

<p>我一个人打造的 <a href="https://zaokit.ai">Zaokit AI Agent 交易平台</a>，以及 AI PPT / 图文创作 <a href="https://zaokit.app">Zaokit.app</a>，助力大家高效完成图文创作和 PPT 生成。唯一网站：<a href="https://zaokit.app">https://zaokit.app</a>。</p>

<p>企业侧同一逻辑，已经融进可直接接入的服务：</p>

<ul>
  <li><a href="https://grok.zaokit.com">grok.zaokit.com</a></li>
  <li><a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a></li>
  <li><a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a></li>
  <li><a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a></li>
  <li><a href="https://junxinzhang.com/projects.html">完整产品列表</a></li>
</ul>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<p>如果你认可 Zaokit AI 的产品理念，欢迎后台留言加入社群。<strong>我们不卖课、不割韭菜，只聚焦 ToB 企业场景的 AI 落地实战。</strong> 希望在这里，能给你带来不一样的思维火花和真实的商业碰撞。</p>

<hr />

<p>延伸：<a href="/agent-next-phase-not-intelligence-race">Agent 下一程，打在云上</a> · <a href="/codex-linux-billion-servers">Codex 登陆 Linux，一亿台服务器准备好了</a> · <a href="/agent-runtime-beyond-laptop-infrastructure">你的公司电脑，可能连 Agent 的门都进不了</a></p>

<hr />

<table>
  <tbody>
    <tr>
      <td>唯一网站：<a href="https://zaokit.app">Zaokit.app</a></td>
      <td>Agent 交易平台：<a href="https://zaokit.ai">Zaokit.ai</a></td>
    </tr>
  </tbody>
</table>

<p>企业 Grok 服务：<a href="https://grok.zaokit.com">grok.zaokit.com</a></p>

<p>企业服务：<a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a> · <a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a> · <a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a> · <a href="https://junxinzhang.com/projects.html">完整产品列表</a></p>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p><em>我是 Jason，自己一个人做 AI 产品。巨头在打基础设施的价格战——别跟他们抢水泥，去盖只有你会盖的房子。</em></p>]]></content><author><name>Jason Zhang</name></author><category term="AI" /><category term="featured" /><category term="AI" /><category term="Grok" /><category term="Manus" /><category term="xAI" /><category term="Cursor" /><category term="云电脑" /><category term="数字员工" /><category term="Agent" /><category term="价格战" /><category term="Zaokit" /><summary type="html"><![CDATA[xAI 的 Grok Bot 上线了：两百刀一个月的会员费，附带一台 16GB+128GB、永远在线的云端个人电脑， 外加大额 AI 用量。Manus 当年看到的"给 Agent 配电脑"真的是终局形态， 但巨头亲自下场打价格战，才是这场战争真正的开始。]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="https://junxinzhang.com/assets/images/cover-20260813-grok-bot-agent-war.webp" /><media:content medium="image" url="https://junxinzhang.com/assets/images/cover-20260813-grok-bot-agent-war.webp" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">Codex 登陆 Linux，一亿台服务器准备好了</title><link href="https://junxinzhang.com/codex-linux-billion-servers/" rel="alternate" type="text/html" title="Codex 登陆 Linux，一亿台服务器准备好了" /><published>2026-08-12T00:00:00+00:00</published><updated>2026-08-12T00:00:00+00:00</updated><id>https://junxinzhang.com/codex-linux-billion-servers</id><content type="html" xml:base="https://junxinzhang.com/codex-linux-billion-servers/"><![CDATA[<p>昨天推特上刷到一条消息，差点没刹住。</p>

<blockquote>
  <p><strong>Codex 和 ChatGPT 桌面版，正式登陆 Linux。</strong></p>

  <p>这不是”补全一个平台”那么简单。这是 OpenAI 收购 Ona 之后，第一次把 Agent 真正推向服务器世界的大门。</p>
</blockquote>

<p><img src="/assets/images/cover-20260812-codex-linux-billion-servers.webp" alt="Codex 登陆 Linux" /></p>

<h2 id="一一条推文背后的信号">一、一条推文背后的信号</h2>

<p>OpenAI 官方和 Codex 负责人 Tibo 几乎同时发声：ChatGPT Linux 桌面应用现已推出预览版，支持 ChatGPT、ChatGPT Work 和 Codex，可以在 Linux 系统上处理项目和浏览器工作流程。</p>

<p><img src="/assets/images/screenshot-20260812-chatgpt-linux-tweet.webp" alt="OpenAI 官方及 Codex 负责人 Tibo 宣布 Linux 支持" /></p>

<p>第一反应可能是：不就是出了个 Linux 版客户端吗？macOS、Windows 都有了，Linux 只是补齐了。</p>

<p><strong>如果你这么想，就低估了这件事。</strong></p>

<p>macOS 和 Windows 的用户是谁？个人。开发者、设计师、产品经理——坐在自己的笔记本前，打开 ChatGPT 问问题。</p>

<p>Linux 的用户是谁？<strong>服务器。</strong> 全球超过 90% 的服务器跑的是 Linux。AWS、Azure、GCP 上的每一个实例，每一个 Docker 容器，每一个 Kubernetes Pod——Linux。</p>

<table>
  <thead>
    <tr>
      <th>平台</th>
      <th>典型用户</th>
      <th>规模量级</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>macOS</td>
      <td>个人开发者</td>
      <td>约 1 亿台</td>
    </tr>
    <tr>
      <td>Windows</td>
      <td>企业员工</td>
      <td>约 14 亿台</td>
    </tr>
    <tr>
      <td>Linux</td>
      <td>服务器 + 云环境</td>
      <td><strong>数十亿实例</strong></td>
    </tr>
  </tbody>
</table>

<p><strong>当 Codex 原生支持 Linux，它不只是跑在了你的 Ubuntu 桌面上。它可以跑在全球任何一台服务器里。</strong></p>

<p><img src="/assets/images/illust-20260812-laptop-to-datacenter.webp" alt="从笔记本到数据中心：Linux 打开的不是一扇门，是一面墙" /></p>

<h2 id="二ona-收购的真正后手">二、Ona 收购的真正后手</h2>

<p><a href="/agent-next-phase-not-intelligence-race">上一篇文章</a>聊过 OpenAI 收购 Ona 的事。当时的判断是：Agent 的下一程打在云上。</p>

<p>现在这个判断有了更具体的落地形态——<strong>Linux 原生支持，就是 Ona 收购之后的第一记重手。</strong></p>

<p>Ona 做的事情很具体：让 Agent 在客户的云环境里持续运行。你合上笔记本，Agent 不停。但要让 Agent 真正”住”在云上，有一个前提——<strong>运行环境必须是 Linux。</strong></p>

<p>因为云上没有 macOS，没有 Windows。云上只有 Linux。</p>

<p>收购 Ona + 原生支持 Linux + 招 Cloud Agents 工程师——三件事串起来，OpenAI 在做的事情就很清楚了：</p>

<p><strong>把 Codex 从一个”你打开终端用的工具”，变成一个”可以部署在任何 Linux 环境里、7×24 小时自主运行的 Agent 基础设施”。</strong></p>

<p>这不是产品迭代，这是基座切换。</p>

<table>
  <thead>
    <tr>
      <th>之前的 Codex</th>
      <th>正在变成的 Codex</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>跑在你的笔记本上</td>
      <td>跑在云端 Linux 沙箱里</td>
    </tr>
    <tr>
      <td>你开电脑才能用</td>
      <td>7×24 小时自主运行</td>
    </tr>
    <tr>
      <td>一次处理一个任务</td>
      <td>并行处理成百上千个任务</td>
    </tr>
    <tr>
      <td>受限于本地算力</td>
      <td>弹性调度云端算力</td>
    </tr>
    <tr>
      <td>你操作它</td>
      <td>它自己执行，完事交结果</td>
    </tr>
  </tbody>
</table>

<p><img src="/assets/images/illust-20260812-ona-linux-cloud-infra.webp" alt="Ona 收购 + Linux 支持 = Agent 云基础设施" /></p>

<h2 id="三个人笔记本的规模太小了">三、个人笔记本的规模，太小了</h2>

<p>这是我最想说的一个判断。</p>

<p>全球有多少台个人电脑？大约 15 亿台。听起来不少，但每台电脑一天真正用来跑 AI Agent 的时间可能不到 2 小时。算下来，全球个人电脑能提供的 Agent 算力，折合成有效运行时间，可能就几亿小时/天。</p>

<p>全球有多少台服务器和云实例？保守估计数十亿。而且它们 7×24 小时不停。单就 AWS 一家，同时在线的实例数就以百万计。</p>

<p><strong>当 Codex 只跑在个人电脑上时，AI Agent 的总运行规模被锁死在”人打开电脑”这个动作里。</strong> 你合上盖子，Agent 就停了。你去吃饭，Agent 就停了。你睡觉，Agent 就停了。</p>

<p>但当 Codex 原生跑在 Linux 上——</p>

<p><strong>Agent 不需要等你开机。它自己跑。</strong> 在数据中心的某台服务器上，在某个 Kubernetes Pod 里，在某个 Docker 容器中。一个 Agent 完成了一个任务，结果自动推送到下一个 Agent。成百上千个 Agent 同时工作，组成流水线。</p>

<p>这就是”个人工具”和”基础设施”之间的根本差距。</p>

<p>想象一下：你今天用 Codex，是你告诉它”帮我写一个函数”。以后呢？可能是你部署了 50 个 Codex Agent 在云上，每个盯着代码库的不同模块，有 bug 自动修，有新需求自动实现，每天早上给你一份报告。</p>

<p><strong>你不是在”用” AI。你是在”运营” AI。</strong></p>

<table>
  <thead>
    <tr>
      <th> </th>
      <th>个人电脑时代</th>
      <th>服务器时代</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>Agent 何时工作</td>
      <td>你开机的时候</td>
      <td>7×24 小时</td>
    </tr>
    <tr>
      <td>并行度</td>
      <td>1 个 Agent</td>
      <td>成百上千个</td>
    </tr>
    <tr>
      <td>扩展方式</td>
      <td>买更好的电脑</td>
      <td>弹性扩容云实例</td>
    </tr>
    <tr>
      <td>人的角色</td>
      <td>操作者</td>
      <td>运营者</td>
    </tr>
  </tbody>
</table>

<p><img src="/assets/images/illust-20260812-operate-ai-at-scale.webp" alt="从&quot;用 AI&quot;到&quot;运营 AI&quot;：规模决定了角色" /></p>

<h2 id="四交互方式将被彻底改写">四、交互方式将被彻底改写</h2>

<p>这个规模切换带来的最深层变化，不是算力，是交互方式。</p>

<p>过去 40 年，人和电脑的交互方式本质上没变过：<strong>你坐在屏幕前，用键盘鼠标下达指令，看着屏幕等结果。</strong> 从命令行到图形界面到触摸屏，变的是输入方式，不变的是”人坐在那里操作”。</p>

<p>AI Agent 跑在个人电脑上的时候，这个模式还能维持——你打开终端，输入 prompt，等它干完。</p>

<p>但当 Agent 跑在云端服务器上、以亿为单位并行工作的时候，”坐在屏幕前操作”这个范式就不成立了。</p>

<p><strong>你不可能坐在那里同时操作 100 个 Agent。你需要的是一个管理界面——下达目标、分配资源、监控进度、审核结果。</strong></p>

<p>这跟今天管理一个团队更像，跟今天用电脑完全不像。</p>

<p>我在做 <a href="https://zaokit.ai">Zaokit</a> 的时候，越来越深刻地感受到这一点：Agent 产品的 UI 不应该是一个聊天框，而应该是一个<strong>指挥中心</strong>。你不是在跟一个 AI 对话，你是在调度一支 Agent 部队。</p>

<p><img src="/assets/images/illust-20260812-interaction-paradigm-shift.webp" alt="交互范式切换：从聊天框到指挥中心" /></p>

<h2 id="五谁先把-agent-种进-linux-生态谁就占住入口">五、谁先把 Agent 种进 Linux 生态，谁就占住入口</h2>

<p>最后说一个判断。</p>

<p>OpenAI 做这件事的时机很精准。Codex 已经在沙箱里跑了一年多，模型能力到了 GPT 5.6，Cloud Agents 团队在搭建，Ona 团队也已整合——<strong>所有组件在这个节点上拼完了。</strong></p>

<p>Linux 桌面版只是起手式。接下来大概率会看到：</p>

<ol>
  <li><strong>Codex Cloud</strong>——完全运行在云端沙箱里的 Agent 服务，企业按量付费</li>
  <li><strong>企业级 Agent 编排</strong>——在你的 VPC 里部署 Agent 集群，接入你的代码库、CI/CD、监控系统</li>
  <li><strong>Agent Marketplace</strong>——不同用途的 Agent 模板，一键部署到你的云环境</li>
</ol>

<p>Anthropic 在 Claude Code 上也在走类似的路。但 OpenAI 现在的优势是：<strong>它同时有模型（GPT 5.6）、有产品（ChatGPT + Codex）、有云基础设施（Ona）、有企业客户基础。</strong> 四个维度同时推进。</p>

<p>这场仗的终局不是谁的 Agent 更聪明——而是谁先把 Agent 种进全球 Linux 服务器的生态里。<strong>先到先得。</strong></p>

<h2 id="写在最后">写在最后</h2>

<p>压成五句：</p>

<ol>
  <li><strong>Linux 支持不是补平台，是打开服务器市场的大门</strong>——全球 90% 以上的服务器跑的是 Linux</li>
  <li><strong>Ona 收购 + Linux 原生 = Agent 云基础设施</strong>——Codex 正在从个人工具变成企业级 Agent 基座</li>
  <li><strong>个人笔记本的规模太小了</strong>——AI Agent 的未来在 7×24 小时运行的数十亿台服务器上</li>
  <li><strong>交互方式将被彻底改写</strong>——从坐在屏幕前操作，变成调度 Agent 部队</li>
  <li><strong>谁先种进 Linux 生态，谁就占住入口</strong>——OpenAI 四个维度同时推进，时机精准</li>
</ol>

<p>土话一句：</p>

<p><strong>你的笔记本装得下一个 Agent，但装不下一个时代。服务器可以。</strong></p>

<p>我一个人打造的 <a href="https://zaokit.ai">Zaokit AI Agent 交易平台</a>，以及 AI PPT / 图文创作 <a href="https://zaokit.app">Zaokit.app</a>，助力大家高效完成图文创作和 PPT 生成。唯一网站：<a href="https://zaokit.app">https://zaokit.app</a>。</p>

<p>企业侧同一逻辑，已经融进可直接接入的服务：</p>

<ul>
  <li><a href="https://grok.zaokit.com">grok.zaokit.com</a></li>
  <li><a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a></li>
  <li><a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a></li>
  <li><a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a></li>
  <li><a href="https://junxinzhang.com/projects.html">完整产品列表</a></li>
</ul>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<p>如果你认可 Zaokit AI 的产品理念，欢迎后台留言加入社群。<strong>我们不卖课、不割韭菜，只聚焦 ToB 企业场景的 AI 落地实战。</strong> 希望在这里，能给你带来不一样的思维火花和真实的商业碰撞。</p>

<hr />

<p>延伸：<a href="/agent-next-phase-not-intelligence-race">Agent 下一程，打在云上</a> · <a href="/post-training-chaos-reward-clarity">训得出模型，训不明白 Post-training</a> · <a href="/ai-needs-math-physics-information-theory">模型天天更新，你的数学呢？</a></p>

<hr />

<table>
  <tbody>
    <tr>
      <td>唯一网站：<a href="https://zaokit.app">Zaokit.app</a></td>
      <td>Agent 交易平台：<a href="https://zaokit.ai">Zaokit.ai</a></td>
    </tr>
  </tbody>
</table>

<p>企业 Grok 服务：<a href="https://grok.zaokit.com">grok.zaokit.com</a></p>

<p>企业服务：<a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a> · <a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a> · <a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a> · <a href="https://junxinzhang.com/projects.html">完整产品列表</a></p>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p><em>我是 Jason，自己一个人做 AI 产品。你的笔记本装不下一个时代——但 Linux 服务器可以。</em></p>]]></content><author><name>Jason Zhang</name></author><category term="AI" /><category term="featured" /><category term="AI" /><category term="OpenAI" /><category term="Codex" /><category term="ChatGPT" /><category term="Linux" /><category term="云端Agent" /><category term="沙箱" /><category term="服务器" /><category term="Ona" /><category term="Zaokit" /><summary type="html"><![CDATA[OpenAI 同时把 Codex 和 ChatGPT 桌面版推上 Linux——收购 Ona 之后的第一记重手。 表面是补平台，实际是打开服务器市场的大门。当数以亿计的 Linux 服务器 和云端沙箱开始原生运行 AI Agent，个人笔记本的规模就不值一提了。]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="https://junxinzhang.com/assets/images/cover-20260812-codex-linux-billion-servers.webp" /><media:content medium="image" url="https://junxinzhang.com/assets/images/cover-20260812-codex-linux-billion-servers.webp" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">训得出模型，训不明白 Post-training</title><link href="https://junxinzhang.com/post-training-chaos-reward-clarity/" rel="alternate" type="text/html" title="训得出模型，训不明白 Post-training" /><published>2026-08-11T00:00:00+00:00</published><updated>2026-08-11T00:00:00+00:00</updated><id>https://junxinzhang.com/post-training-chaos-reward-clarity</id><content type="html" xml:base="https://junxinzhang.com/post-training-chaos-reward-clarity/"><![CDATA[<p>今天和一位模型厂的 post-training researcher 聊了两个小时。</p>

<p>聊之前有一个模糊的判断：国内 Pre-training 已经追得很近，Post-training 明显落后。聊完之后判断没变，但理由变得更具体了——<strong>落后的原因不是技术差距，是两件事的 reward 清晰度完全不一样。</strong></p>

<blockquote>
  <p><strong>Pre-training 的反馈像射靶——靶心在哪清清楚楚。Post-training 的反馈像在雾里找路——你甚至不确定脚下有没有路。</strong></p>
</blockquote>

<p><img src="/assets/images/cover-20260811-post-training-chaos.webp" alt="训得出模型，训不明白 Post-training" /></p>

<h2 id="一reward-落差一个清晰一个混沌">一、Reward 落差：一个清晰，一个混沌</h2>

<p>Pre-training 的 reward 非常明确：在单位时间内，把 Next Token Loss 降得越低越好，同时尽可能降低训练成本。方向清楚、指标可量化、进步肉眼可见。</p>

<p>Post-training 要解决的则是另一类问题：怎么让模型在下游应用中表现得更好。但这个「更好」本身就是一团迷雾——</p>

<table>
  <thead>
    <tr>
      <th> </th>
      <th>Pre-training</th>
      <th>Post-training</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>Reward 定义</td>
      <td>Next Token Loss，越低越好</td>
      <td>「让模型更好」——好在哪？好多少？</td>
    </tr>
    <tr>
      <td>可量化程度</td>
      <td>极高，loss 曲线一目了然</td>
      <td>极低，指标容易被 hack</td>
    </tr>
    <tr>
      <td>反馈周期</td>
      <td>实时，每个 step 都有信号</td>
      <td>滞后，需要复杂的评估流程</td>
    </tr>
    <tr>
      <td>创新可见性</td>
      <td>架构开源、写 Paper、做 PR</td>
      <td>数据清洗和 Recipe 通常不外传</td>
    </tr>
  </tbody>
</table>

<p>怎么定义「更好」？怎么评估「更好」？怎么确认模型是真的变强了，还是在 hacking 某个指标？每一个都极其 tricky。</p>

<p>这里有一个被忽视的不对称：<strong>Pre-training 的创新更容易被外界看到。</strong> 模型架构没有那么强的机密性，一开源大家就能看到，也可以写成论文做 PR。但一家模型公司的数据清洗方案、具体的训练 Recipe——Post-training 真正的核心竞争力——没有人会拿出来讲。</p>

<p>Pre-training 既有清晰的 reward，又有清晰的声量。Post-training 两样都缺。</p>

<p>加上众所周知的缺卡问题，模型的绝对能力又是生死线，大家自然把更多资源投入反馈更明确、也更容易获得声量的 Pre-training。</p>

<p><strong>Post-training 因此陷入了一个尴尬的循环：因为混沌，所以拿不到足够多的资源；因为资源不够，这种混沌迟迟无法被解决。</strong></p>

<p><img src="/assets/images/illust-20260811-reward-clarity-gap.webp" alt="Pre-training 靶心清晰 vs Post-training 雾中找路" /></p>

<h2 id="二大厂一定赢是偷懒的推论">二、「大厂一定赢」是偷懒的推论</h2>

<p>聊到竞争格局，有一种声音很常见：大厂有钱有卡有人，最终一定会赢。</p>

<p>这位 researcher 不这么看。</p>

<p>模型竞争不是比身价。更多钱、更多卡、更多人，不等于一定能训出最好的模型。<strong>真正起决定性作用的，可能是组织里到底有多少人发自内心想把模型训好，以及组织摩擦会不会消耗掉这些人的热情。</strong></p>

<p>这个判断放在当下的市场里，正在被验证——大模型的机会看上去正在重新回到创业公司手里。半年多前这一切还难以想象。</p>

<p>窗口期来自编程。Coding 浪潮把按 token 计费的需求真正引爆，算账方式彻底改变了。智谱定价提高一倍，调用量反而涨了八倍，与海外前沿模型的价差在逐渐缩小。Kimi 比智谱更激进，K3 模型 API 输出价每百万 token 15 美元，与 Claude Sonnet 5 的标准定价一模一样。而 Anthropic 此前推出的 $2/MTok 输入、$10/MTok 输出的限时推广价已决定永久保留，不再按原计划在 9 月 1 日上调——前沿模型的价格战，已经从国内烧到了美国。</p>

<p>窗口期的另一面是大厂的缺位：<strong>在长达半年的时间里，BAT 拿不出一个第一梯队的 coding 模型。</strong> 2 月时人们津津乐道的叙事还是春节红包大战，而智谱 2025 年春天就已经把研究方向聚焦到编程上来。</p>

<p>但窗口期不会一直敞开。字节已宣布不做蒸馏，但在视频模型上已拿出 SOTA 成果，对 Coding 的投入肉眼可见地坚定。大厂只要赢一次，整个叙事就可能重新改写。</p>

<p>更不用说算力采购与人力的结构性优势：阿里今年 5 月表示对算力中心的投入将远超之前承诺的三年 3800 亿；腾讯 Q1 经营性资本支出同比增长 18%、环比增长 84%。而独立模型厂商至今还受困于算力瓶颈，有时甚至向潜在对手租卡。</p>

<p><img src="/assets/images/illust-20260811-coding-window-startups.webp" alt="Coding 窗口期：创业公司的短暂领跑" /></p>

<h2 id="三agent-正在模糊-ai-lab-的内部边界">三、Agent 正在模糊 AI Lab 的内部边界</h2>

<p>我们还聊到了一个正在发生的变化：<strong>Agent 已经开始替代 AI Lab 里的一部分工作。</strong></p>

<p>拿 Infra 举例。现在可以直接告诉 Agent：「每秒只能输出 50 个 Token，请优化到 60 个」，然后让它自己检查 Kernel 和整条链路。</p>

<p>结果就是，一些 Infra 工程师开始自己给自己找事干——跑去研究算法、理解训练需求。跟一些 researchers 交流下来，有些人确实已经有了失业焦虑。</p>

<p>从这里往外延伸一步：如果说 AI Coding 模糊了产品、研发和设计之间的边界，那么 <strong>AI for AI（RSI）也在逐渐模糊数据、算法和 Infra 之间的边界。</strong></p>

<p>还有一个更根本的观察：<strong>Model Research 本身，可能就是最 Science 的 AI for Science。</strong> 模型研究不是在解决某个特定领域的问题，而是在研究「通用智能」本身。</p>

<p><img src="/assets/images/illust-20260811-agent-replacing-lab-work.webp" alt="Agent 替代 AI Lab 工作：边界正在模糊" /></p>

<h2 id="四两个没有答案的问题">四、两个没有答案的问题</h2>

<p>最后聊了两个真正开放的问题，欢迎有想法的朋友分享你的见解。</p>

<p><strong>Q1：怎么让模型拥有时间概念？</strong></p>

<p>如果模型不交卷，它就可以一直保持「我没错」的状态。反正模型不老不死，从它自己的视角看，磨洋工可能并不是什么坏事。</p>

<p>就像《葬送的芙莉莲》里，对于一个能活几千年的精灵来说，花十年寻找一枚戒指完全合理。但我们这些凡胎肉体，根本等不起。</p>

<p>（GPT-5.6 一直写测试，是不是就是深刻践行了这一点 doge）</p>

<p><strong>Q2：OpenAI 是怎么持续相信 RL，并最终把 o1 做出来的？</strong></p>

<p>好奇的不是具体 Recipe，而是背后的组织问题。之前请清华叉院助理教授 @jxwuyi 录过一期<a href="https://xiaoyuzhoufm.com/episode/67efcaf5f9578163d601286a">播客</a>，他提到 OpenAI 很早就在做 RL，但之前做了很久都没有得到结果。</p>

<p>在一个方向连续失败很多年以后，团队为什么还能继续相信它，招到人、说服老板、拿到资源，然后真的把事情做出来？</p>

<p><strong>这个问题的答案，又绕回了组织文化。</strong></p>

<p><img src="/assets/images/illust-20260811-open-questions.webp" alt="两个没有答案的问题" /></p>

<h2 id="五组织文化才是真正的变量">五、组织文化才是真正的变量</h2>

<p>跟很多 researchers 交流，尤其是问他们觉得哪家模型更有希望时，大家最后都会强调同一件事：组织文化。</p>

<p>在一个快速变化、资源永远不够的行业里，<strong>怎么把人和算力分给那些还没有答案的创新，以及愿意等这些创新多久</strong>——可能和技术判断本身一样重要。</p>

<p>智谱和 DeepSeek 预计都将在 8 月发布新模型。据了解，智谱 MaaS 开放平台注册用户近 700 万，七月以来增长约 200 万，其中 2.3 万家企业客户；对标 Codex 的 ZCode 上线一个月用户破百万。今年以来智谱 ARR 增长 15 倍。</p>

<p>Coding 的商业模式本身也在快速变化。越来越多企业开始搭建「内部路由」，按任务复杂度把不同价位的模型组合使用。Palantir 则在教育客户只用 API、不用模型厂商的其他工具——它的逻辑是模型最终会大宗商品化，数据和工作流才是企业最珍贵的资产。</p>

<p><strong>企业用 AI 的第一步，一定要有自己的 MaaS 平台。</strong> 按需分配算力，好钢用在刀刃上。</p>

<p>假如 Scaling Law 的提升真没有尽头，那意味着超级人工智能的实现，届时讨论的就不再是谁的毛利率高几个点了。但在 ASI 到来之前，眼下可以确定的似乎只有一件事——以越来越快的速度不断刷新的顶尖模型排行榜。</p>

<p><strong>窗口还开着，算力依旧紧缺，人们依然渴望新的顶尖模型出现。而下一次发布，已经排上了日程。</strong></p>

<h2 id="写在最后">写在最后</h2>

<p>压成五句：</p>

<ol>
  <li><strong>Pre-training 的 reward 清晰，Post-training 还在混沌</strong>——不是技术差距，是反馈信号的清晰度差了一个量级</li>
  <li><strong>混沌导致恶性循环</strong>——拿不到资源因为说不清价值，说不清价值因为没资源去做</li>
  <li><strong>「大厂一定赢」是偷懒的推论</strong>——组织效率比组织规模重要，Coding 窗口期正在证明这一点</li>
  <li><strong>Agent 正在模糊 AI Lab 的内部边界</strong>——数据、算法、Infra 的分工正在被 RSI 重新定义</li>
  <li><strong>组织文化才是真正的变量</strong>——愿意为没有答案的创新等多久，决定了谁能走出混沌</li>
</ol>

<p>土话一句：</p>

<p><strong>模型训出来不算完。训不明白 Post-training，就是在雾里开车——油门踩得再猛，也不知道往哪开。</strong></p>

<p>我一个人打造的 <a href="https://zaokit.ai">Zaokit AI Agent 交易平台</a>，以及 AI PPT / 图文创作 <a href="https://zaokit.app">Zaokit.app</a>，助力大家高效完成图文创作和 PPT 生成。唯一网站：<a href="https://zaokit.app">https://zaokit.app</a>。</p>

<p>企业侧同一逻辑，已经融进可直接接入的服务：</p>

<ul>
  <li><a href="https://grok.zaokit.com">grok.zaokit.com</a></li>
  <li><a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a></li>
  <li><a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a></li>
  <li><a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a></li>
  <li><a href="https://junxinzhang.com/projects.html">完整产品列表</a></li>
</ul>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<p>如果你认可 Zaokit AI 的产品理念，欢迎后台留言加入社群。<strong>我们不卖课、不割韭菜，只聚焦 ToB 企业场景的 AI 落地实战。</strong> 希望在这里，能给你带来不一样的思维火花和真实的商业碰撞。</p>

<hr />

<p>延伸：<a href="/agent-next-phase-not-intelligence-race">Agent 下一程，打在云上</a> · <a href="/ai-needs-math-physics-information-theory">模型天天更新，你的数学呢？</a> · <a href="/token-burn-ai-semiconductor-investing">没烧过 token，就别说看懂 AI 半导体</a></p>

<hr />

<table>
  <tbody>
    <tr>
      <td>唯一网站：<a href="https://zaokit.app">Zaokit.app</a></td>
      <td>Agent 交易平台：<a href="https://zaokit.ai">Zaokit.ai</a></td>
    </tr>
  </tbody>
</table>

<p>企业 Grok 服务：<a href="https://grok.zaokit.com">grok.zaokit.com</a></p>

<p>企业服务：<a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a> · <a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a> · <a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a> · <a href="https://junxinzhang.com/projects.html">完整产品列表</a></p>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p><em>我是 Jason，自己一个人做 AI 产品。模型训出来不算完——Post-training 的混沌里，藏着这个行业真正的胜负手。</em></p>]]></content><author><name>Jason Zhang</name></author><category term="AI" /><category term="featured" /><category term="AI" /><category term="Post-training" /><category term="Pre-training" /><category term="模型训练" /><category term="RL" /><category term="组织文化" /><category term="Coding" /><category term="智谱" /><category term="Zaokit" /><summary type="html"><![CDATA[和一位模型厂 post-training researcher 深聊后的核心发现：国内 Pre-training 已经会做了， 但 Post-training 还在混沌期。根本原因是 reward 的清晰程度完全不同。 而决定谁能走出混沌的，可能不是技术，是组织文化。]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="https://junxinzhang.com/assets/images/cover-20260811-post-training-chaos.webp" /><media:content medium="image" url="https://junxinzhang.com/assets/images/cover-20260811-post-training-chaos.webp" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">Agent 下一程，打在云上</title><link href="https://junxinzhang.com/agent-next-phase-not-intelligence-race/" rel="alternate" type="text/html" title="Agent 下一程，打在云上" /><published>2026-08-10T00:00:00+00:00</published><updated>2026-08-10T00:00:00+00:00</updated><id>https://junxinzhang.com/agent-next-phase-not-intelligence-race</id><content type="html" xml:base="https://junxinzhang.com/agent-next-phase-not-intelligence-race/"><![CDATA[<p>最近盯着 OpenAI 的动作看了一周。三件事串在一起，一个判断就清楚了。</p>

<blockquote>
  <p><strong>Agent 的下一程，不是比谁的模型更聪明。是比谁先给 Agent 造出一个云端的身体——让它合上你的笔记本之后，还能继续干活。</strong></p>
</blockquote>

<p><img src="/assets/images/cover-20260810-agent-next-phase.webp" alt="Agent 下一程，比的不是智商" /></p>

<h2 id="一openai-的三条线索">一、OpenAI 的三条线索</h2>

<p>第一条：<strong>收购 Ona。</strong> 官方说法是「Codex 下一阶段」。Ona 做的事情很具体——让 Agent 在客户的云环境里持续运行。你的笔记本合上，Agent 不停。</p>

<p>第二条：<strong>在招 Cloud Agents 工程师。</strong> 岗位描述四个关键词：编排、沙箱、身份、成本。这不是在做一个 CLI 工具，是在造一套基础设施。</p>

<p>第三条：<strong>Codex 负责人 Tibo 那句话</strong>（<a href="/what-did-they-see-jeff-dean-new-paradigm">之前文章引用过</a>）——Codex 是个好 harness，但两三个月后会显得原始，下一代模型需要的不只是你的笔记本。</p>

<p>三条放在一起看，其实在讲同一件事：</p>

<p><strong>模型将拉起临时 workspace——机器、Agent、共享内存、权限——连续工作数天。</strong></p>

<p>这不是「Codex 变快一点」。是运行范式的切换。从「你打开终端给 Agent 下指令」变成「Agent 自己拉起一整套执行环境，干完了把结果交给你」。</p>

<p><img src="/assets/images/illust-20260810-three-signals.webp" alt="OpenAI 三条信号指向同一个方向" /></p>

<h2 id="二季逸超一年前就在造这个东西">二、季逸超一年前就在造这个东西</h2>

<p>回过头看 Manus，它从产品形态上，基本就是朝着这个「终局」去的。</p>

<table>
  <thead>
    <tr>
      <th>时间</th>
      <th>Manus 做了什么</th>
      <th>对应的终局能力</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>2025 年初</td>
      <td>完全运行在云上，本地无打扰</td>
      <td>云原生 Agent 执行环境</td>
    </tr>
    <tr>
      <td>2025 年中</td>
      <td>引入 wide research</td>
      <td>任务拓扑方向的智能调用密集度</td>
    </tr>
    <tr>
      <td>2025 年底</td>
      <td>开始做主动式 Agent</td>
      <td>时间维度的智能调用密集度</td>
    </tr>
    <tr>
      <td>很早</td>
      <td>建立 evaluation 团队</td>
      <td>Agent 产品的迭代地基</td>
    </tr>
  </tbody>
</table>

<p>2025 年初发布 Manus，意味着 2024 年季逸超团队对整体方向已经有比较强的判断和投入。<strong>OpenAI 今天在追的东西——云端持续运行、容器隔离、评估体系——Manus 一年前就在造了。</strong></p>

<p>季逸超牛逼。产品经理的眼界，在 25 年初发布这个产品，说明 24 年对方向已经有了清晰判断。连续创业者的市场洞察力就是强。他们很早就意识到三件事要分开做：容器、评估、架构。还有一个很多人没看到的区分——增强人和替代人的区别。Manus 走的是替代路线：Agent 独立完成任务，人只看结果。</p>

<p>这个判断在当时是超前的。大部分团队还在做「辅助写代码」，季逸超已经在做「Agent 独立干活」。</p>

<p><img src="/assets/images/illust-20260810-manus-endgame.webp" alt="Manus 的终局直觉" /></p>

<h2 id="三但模型上限才是留存manus-的困局">三、但模型上限才是留存——Manus 的困局</h2>

<p>说完 Manus 的强，也要说它的难。</p>

<p>Manus 订阅用户在下降。原因不复杂：ChatGPT 更新了 GPT 5.6 之后，模型上限太高了。</p>

<p>这里面有一个残酷的逻辑：</p>

<p><strong>产品形态可以领先，但模型能力是天花板。</strong></p>

<p>Manus 的 Agent 架构做得再好，底座模型如果和 GPT 5.6 有代差，用户体验的上限就被锁死了。模型能力一拉开，订阅留存差距立刻可见。</p>

<table>
  <thead>
    <tr>
      <th> </th>
      <th>Manus</th>
      <th>ChatGPT (GPT 5.6)</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>产品形态</td>
      <td>领先（云原生、主动式）</td>
      <td>在追（Codex 整合中）</td>
    </tr>
    <tr>
      <td>模型上限</td>
      <td>受限于接入的底座模型</td>
      <td>自家最强模型</td>
    </tr>
    <tr>
      <td>订阅留存</td>
      <td>下降</td>
      <td>稳定</td>
    </tr>
  </tbody>
</table>

<p>这也是所有 Agent 创业公司面对的核心矛盾：<strong>你能把编排做到极致，但推理能力的上限不在你手里。</strong> 模型是别人家的，天花板也是别人定的。</p>

<p>但这不影响季逸超的判断力。产品方向没看错——只是模型底座不是他能决定的变量。</p>

<h2 id="四下一程的竞争维度">四、下一程的竞争维度</h2>

<p>那下一阶段到底比什么？我的判断是三个维度同时比拼：</p>

<p><strong>智能 × 云端执行能力 × 计算资源配额。</strong></p>

<p>光有聪明的模型不够——没有云端身体，Agent 就困在你的笔记本里。光有好的产品形态也不够——底座模型有代差，体验上限直接打折。光有算力也不够——没有好的编排和评估体系，算力就是浪费。</p>

<p>国内能对标的玩家：月之暗面没有计算资源，字节跳动没有创新力。Manus 有眼光有执行，但缺模型底座。</p>

<p>这也引出一个关于连续创业者的思考。所谓「连续」，不是「在大厂杀死这个行业之前快速融资赚钱」——而是 <strong>pivot 的能力</strong>。比如 OpenAI 在 Sora 2 没盈利的时候砍掉它，在趋势明显的时候把 ChatGPT 和 Codex 合并。方向判断 + 执行果断，才是连续创业者真正的护城河。</p>

<p><img src="/assets/images/illust-20260810-competition-axis.webp" alt="竞争维度：智能 × 执行 × 算力" /></p>

<h2 id="五终局形态agent-成为独立-control-plane">五、终局形态：Agent 成为独立 Control Plane</h2>

<p>顺着这条线想下去，Agent 的终局形态正在变清晰：</p>

<p><strong>Agent 成为一个独立的 control plane——按任务动态调度本地和云端 execution environments，同时可以无限横向扩展 worker。</strong></p>

<p>容器、评估、架构分开。Agent 不再是跑在你电脑上的一个进程，而是一套独立系统。它自己决定用什么执行环境、自己拉起资源、自己释放。</p>

<p>但这里面有一个被严重低估的难题：<strong>怎么把你本地机器的身份、授权、文件和运行环境，打包交给云端沙箱？</strong></p>

<p>每个人的本地机器，本质上就是自己的分身和记忆。你的 SSH key、你的 git 凭证、你的 <code class="language-plaintext highlighter-rouge">.env</code> 文件、你跑了三天才配好的开发环境、你本地分支上昨晚改到一半的代码——这些不是数据，是上下文。把它们安全、完整地同步给一个云端容器，远比听起来要难。</p>

<table>
  <thead>
    <tr>
      <th>需要打包的</th>
      <th>难在哪</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>身份与授权</td>
      <td>SSH key、API token 不能明文上传，需要安全注入</td>
    </tr>
    <tr>
      <td>文件系统</td>
      <td>本地未提交的改动、.gitignore 里的配置文件</td>
    </tr>
    <tr>
      <td>运行环境</td>
      <td>依赖版本、系统级工具链、自定义脚本</td>
    </tr>
    <tr>
      <td>隐性上下文</td>
      <td>你脑子里知道但没写在文档里的东西</td>
    </tr>
  </tbody>
</table>

<p>这就是为什么 OpenAI 招的 Cloud Agents 工程师要懂身份和沙箱——不是造一个能跑代码的容器就完了，是要让这个容器<strong>变成你的分身</strong>。</p>

<p>我自己也在做 Agent Runtime（<a href="https://zaokit.ai">Zaokit</a>），感受很直接：本地和云上各有优劣。云上 24 小时随叫随到，本地还要开电脑；但本地访问文件和凭证更有优势。云上可以通过链接外部存储和安全凭证注入来平衡——所以我坚信云 Agent 有其发展空间，但谁先把「本地分身上云」这件事做顺，谁就占住了真正的入口。</p>

<p>Manus 团队的很多工作，都让我后知后觉。终局形态的演进路径值得持续追踪。</p>

<p><img src="/assets/images/illust-20260810-control-plane.webp" alt="Agent 作为独立 Control Plane" /></p>

<h2 id="写在最后">写在最后</h2>

<p>压成五句：</p>

<ol>
  <li><strong>OpenAI 三条线索指向同一件事</strong>——收购 Ona、招 Cloud Agents 工程师、Tibo 暗示 Codex 即将过时，都在说 Agent 要搬进云里</li>
  <li><strong>Manus 一年前就看到了这个方向</strong>——云原生、wide research、主动式 Agent、evaluation 团队，季逸超的产品判断力值得尊重</li>
  <li><strong>但模型上限才是留存的命门</strong>——GPT 5.6 一出，产品形态领先也扛不住模型代差</li>
  <li><strong>下一程三维比拼</strong>——智能 × 云端执行能力 × 计算资源配额，缺任何一个都打不赢</li>
  <li><strong>终局是 Agent 成为独立 control plane</strong>——动态调度本地和云端执行环境，无限横向扩展</li>
</ol>

<p>说直白点：</p>

<p><strong>下一代 Agent 不住在你电脑里，住在云上——带着你的身份、你的记忆、你的环境。谁先把这件事做顺，谁赢。</strong></p>

<p>我一个人打造的 <a href="https://zaokit.ai">Zaokit AI Agent 交易平台</a>，以及 AI PPT / 图文创作 <a href="https://zaokit.app">Zaokit.app</a>，助力大家高效完成图文创作和 PPT 生成。唯一网站：<a href="https://zaokit.app">https://zaokit.app</a>。</p>

<p>企业侧同一逻辑，已经融进可直接接入的服务：</p>

<ul>
  <li><a href="https://grok.zaokit.com">grok.zaokit.com</a></li>
  <li><a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a></li>
  <li><a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a></li>
  <li><a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a></li>
  <li><a href="https://junxinzhang.com/projects.html">完整产品列表</a></li>
</ul>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<p>如果你认可 Zaokit AI 的产品理念，欢迎后台留言加入社群。<strong>我们不卖课、不割韭菜，只聚焦 ToB 企业场景的 AI 落地实战。</strong> 希望在这里，能给你带来不一样的思维火花和真实的商业碰撞。</p>

<hr />

<p>延伸：<a href="/agent-runtime-beyond-laptop-infrastructure">你的公司电脑，可能连 Agent 的门都进不了</a> · <a href="/what-did-they-see-jeff-dean-new-paradigm">他们到底看到了什么？让 Jeff Dean 离开待了 27 年的 Google</a> · <a href="/token-burn-ai-semiconductor-investing">没烧过 token，就别说看懂 AI 半导体</a></p>

<hr />

<table>
  <tbody>
    <tr>
      <td>唯一网站：<a href="https://zaokit.app">Zaokit.app</a></td>
      <td>Agent 交易平台：<a href="https://zaokit.ai">Zaokit.ai</a></td>
    </tr>
  </tbody>
</table>

<p>企业 Grok 服务：<a href="https://grok.zaokit.com">grok.zaokit.com</a></p>

<p>企业服务：<a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a> · <a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a> · <a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a> · <a href="https://junxinzhang.com/projects.html">完整产品列表</a></p>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p><em>我是 Jason，自己一个人做 AI 产品。Agent 的下一程，打在云上——谁先让你的分身住进去，谁赢。</em></p>]]></content><author><name>Jason Zhang</name></author><category term="AI" /><category term="featured" /><category term="AI" /><category term="Agent" /><category term="OpenAI" /><category term="Codex" /><category term="Manus" /><category term="季逸超" /><category term="云端Agent" /><category term="Agent Runtime" /><category term="Zaokit" /><summary type="html"><![CDATA[OpenAI 收购 Ona、招 Cloud Agents 工程师、Tibo 暗示 Codex 即将过时——三条线索拼在一起， 指向同一个判断：Agent 的下一程不是比模型聪明，是比谁先给 Agent 造出云端的身体。 而 Manus 的季逸超，一年前就在造了。]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="https://junxinzhang.com/assets/images/cover-20260810-agent-next-phase.webp" /><media:content medium="image" url="https://junxinzhang.com/assets/images/cover-20260810-agent-next-phase.webp" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">模型天天更新，你的数学呢？</title><link href="https://junxinzhang.com/ai-needs-math-physics-information-theory/" rel="alternate" type="text/html" title="模型天天更新，你的数学呢？" /><published>2026-08-09T00:00:00+00:00</published><updated>2026-08-09T00:00:00+00:00</updated><id>https://junxinzhang.com/ai-needs-math-physics-information-theory</id><content type="html" xml:base="https://junxinzhang.com/ai-needs-math-physics-information-theory/"><![CDATA[<p>最近推特上有一种氛围，我太熟悉了。</p>

<p>每次模型大更新——Opus 5 出了、GPT 5.6 发了、Gemini 又刷榜了——时间线上就会涌出一波帖子：焦虑的、热血的、荒诞的。有人喊「AI 要取代一切」，有人连夜学 prompt engineering，有人直接宣布自己的职业已经死了。</p>

<p>我理解这种焦虑。但冷静下来想，有一件事被严重忽视了：</p>

<blockquote>
  <p><strong>模型在快速迭代，但信息的知识存量没变。神经网络的数学基础没变，物理定律没变，信息论的边界没变。你对这三门课的理解深度，决定了你在 AI 时代到底能走多远——不是你会用哪个工具。</strong></p>
</blockquote>

<p><img src="/assets/images/cover-20260809-math-physics-ai-foundation.webp" alt="模型天天更新，你的数学呢？" /></p>

<h2 id="一比起问-ai不如先搭自己的知识架构">一、比起问 AI，不如先搭自己的知识架构</h2>

<p>很多人对 AI 的使用方式是：有什么不会的就问。</p>

<p>这当然有用。但这种用法有个隐蔽的代价——<strong>你永远在消费别人的抽象，而不是建立自己的抽象。</strong></p>

<p>AI 给你的每一个回答，都已经被压缩、简化、打包过了。你拿到的是结论，不是推导过程。长此以往，你的知识结构就像一栋没有钢筋的楼——看着有模有样，风一吹就塌。</p>

<p><strong>更有价值的做法是：自己有意识地搭建起数学、物理、信息论的基本架构。</strong> 有了这个架构，你就能判断什么是结构性的技术进步，什么只是工程改良，什么是纯粹的营销噱头。</p>

<p>没有这个架构，所有技术新闻在你脑子里都是平的——分不出层级，分不出权重。推特上的喧嚣，对你来说就只是喧嚣。</p>

<h2 id="二数学视角神经网络不过是流形映射与优化">二、数学视角：神经网络不过是流形映射与优化</h2>

<p>这句话听起来很学术，但意思很直白。</p>

<p>无论是 GPT 的词向量，还是 Stable Diffusion 的隐空间，AI 处理数据的核心方式就一个：<strong>把现实世界的概念映射到高维连续空间里去操作。</strong></p>

<p>「猫」和「狗」不是两个标签，是高维空间中两个区域。它们之间的距离、方向、边界，全由数学决定。</p>

<table>
  <thead>
    <tr>
      <th>你以为的</th>
      <th>数学上实际发生的</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>模型在「学习」</td>
      <td>高维非凸曲面上的势能下降</td>
    </tr>
    <tr>
      <td>模型「理解」了语义</td>
      <td>流形上的测地距离在缩短</td>
    </tr>
    <tr>
      <td>模型「泛化」能力强</td>
      <td>低维流形在高维空间中保持了拓扑结构</td>
    </tr>
    <tr>
      <td>模型「过拟合」</td>
      <td>优化轨迹困在了局部极小值的吸引盆中</td>
    </tr>
  </tbody>
</table>

<p>梯度下降不只是代码里的 <code class="language-plaintext highlighter-rouge">optimizer.step()</code>。它是高维非凸曲面上的势能下降过程。损失函数的极小值点在哪里？流形是否存在坍缩？当你掌握了测度论与微分几何的基本直觉，你就能理解为什么某些模型在某些任务上表现惊人，而在另一些任务上彻底失败。</p>

<p><strong>这不是学术八股。这是你判断一个模型到底强在哪、弱在哪的底层工具。</strong></p>

<p><img src="/assets/images/illust-20260809-manifold-mapping.webp" alt="神经网络的高维流形映射" /></p>

<h2 id="三物理视角diffusion-的底层是热力学">三、物理视角：Diffusion 的底层是热力学</h2>

<p>2024 年之后，图像生成领域最大的范式是 Diffusion Models。大部分人只知道「输入 prompt，输出图片」，不知道这背后跑的是一套完整的物理过程。</p>

<p>Diffusion Models 的数学物理机制，直接源于热力学中的<strong>非平衡态扩散过程</strong>与<strong>反向 Langevin 动力学</strong>。</p>

<p>说白了：<strong>生成一张图像，就是从无序的高熵噪声状态，沿着概率流的梯度场，一步步逆演回有序的低熵分布。</strong> 跟物理学里的相变过程是同构的——从无序到有序，从高熵到低熵。</p>

<p>再往深一层：把整个神经网络视为百亿级节点相互作用构成的复杂系统，统计力学里的能量曲面就能帮你直观理解两件事——<strong>自组织</strong>（为什么训练中模型会自发形成有意义的内部表征）和<strong>泛化界</strong>（模型能推广到多少没见过的数据，物理上有个理论极限）。</p>

<table>
  <thead>
    <tr>
      <th>物理概念</th>
      <th>在 AI 中对应的现象</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>非平衡态扩散</td>
      <td>Diffusion 正向加噪过程</td>
    </tr>
    <tr>
      <td>反向 Langevin 动力学</td>
      <td>Diffusion 去噪生成过程</td>
    </tr>
    <tr>
      <td>相变</td>
      <td>训练中模型突然「涌现」新能力</td>
    </tr>
    <tr>
      <td>自组织临界</td>
      <td>隐空间中自发形成语义聚类</td>
    </tr>
  </tbody>
</table>

<p><strong>不懂这些，你只能当 AI 的用户。懂了这些，你才能理解它为什么有时惊人地好，有时莫名其妙地崩。</strong></p>

<p><img src="/assets/images/illust-20260809-diffusion-thermodynamics.webp" alt="Diffusion 模型的热力学本质" /></p>

<h2 id="四信息论视角学习的本质是压缩">四、信息论视角：学习的本质是压缩</h2>

<p>学习究竟是什么？信息论给出了最简洁的回答：</p>

<p><strong>学习就是压缩。预测就是对信息熵的提纯。</strong></p>

<p>为什么大语言模型普遍使用交叉熵作为损失函数？因为训练过程的本质，就是在最小化真实世界数据分布与模型预测分布之间的 KL 散度。交叉熵是它的等价优化目标。</p>

<p>换句话说：<strong>模型训练的目标，就是用尽可能少的比特，精确表征真实世界的信息分布。</strong></p>

<p>从 Tokenizer 的设计到信息瓶颈理论（Information Bottleneck），信息论定义了智能在表征效率上的理论边界。BPE、SentencePiece、字节级编码——每一种 Tokenizer 选择，都在信息论意义上定义了一个不同的压缩方案。而深度网络的每一层，都在做同一件事：<strong>丢掉与任务无关的信息，保留与任务相关的信息。</strong></p>

<table>
  <thead>
    <tr>
      <th>信息论概念</th>
      <th>在 AI 中的体现</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>交叉熵</td>
      <td>大语言模型的损失函数</td>
    </tr>
    <tr>
      <td>KL 散度</td>
      <td>衡量模型离「完美预测」有多远</td>
    </tr>
    <tr>
      <td>信息瓶颈</td>
      <td>每一层网络都在做信息压缩</td>
    </tr>
    <tr>
      <td>香农熵</td>
      <td>一个 token 到底携带了多少信息</td>
    </tr>
  </tbody>
</table>

<p><strong>理解了这些，你就不会被「参数越多模型越强」这种说法迷惑。参数多不多不重要，关键是每个参数压缩了多少有效信息。</strong></p>

<p><img src="/assets/images/illust-20260809-information-compression.webp" alt="信息论：学习就是压缩" /></p>

<h2 id="五有了架构噪音会自动分层">五、有了架构，噪音会自动分层</h2>

<p>当你对数学、物理、信息论有了基本认知，一件事会自然发生：</p>

<p><strong>推特上每一次沸沸扬扬的技术推进，都会在你脑海中自动分类、标注层级。</strong></p>

<p>某个模型号称「推理能力大幅提升」→ 你会想：是优化了搜索策略，还是解决了某个泛化理论问题？前者是工程，后者是基础。</p>

<p>某个新架构「彻底颠覆 Transformer」→ 你会看：注意力机制的数学结构真的变了，还是只是换了个高效计算方式？</p>

<p>某个公司「训练了万亿参数模型」→ 你会问：信息瓶颈在哪里？参数量和有效信息的比值是多少？</p>

<p><strong>这就是知识架构的力量。它不是让你变成学者，而是让你拥有一套自动过滤噪音的判断系统。</strong></p>

<p>我不是在否定 AI 工具的价值。我自己每天烧 3 亿 token，比大多数人用得都凶。但工具会迭代，框架不会过时。<strong>越是 AI 强大的时代，基础学科的价值反而越高</strong>——因为只有基础学科能告诉你，这些强大的工具，到底在做什么。</p>

<p><img src="/assets/images/illust-20260809-knowledge-architecture.webp" alt="搭建属于你自己的知识架构" /></p>

<h2 id="写在最后">写在最后</h2>

<p>压成五句：</p>

<ol>
  <li><strong>推特上的模型焦虑是噪音</strong>——知道了「哪个模型又强了」不等于认知提升</li>
  <li><strong>神经网络的底层是数学</strong>——流形映射、梯度下降、测度论，决定了模型为什么强、为什么崩</li>
  <li><strong>Diffusion Models 的底层是物理</strong>——非平衡态扩散、反向 Langevin 动力学、相变与涌现</li>
  <li><strong>大模型训练的本质是信息压缩</strong>——交叉熵、KL 散度、信息瓶颈，定义了智能的理论边界</li>
  <li><strong>搭建数学-物理-信息论的知识架构</strong>——让技术新闻在你脑子里自动分层，而不是一锅粥</li>
</ol>

<p>土话一句：</p>

<p><strong>模型会过时，数学不会。</strong></p>

<p>我一个人打造的 <a href="https://zaokit.ai">Zaokit AI Agent 交易平台</a>，以及 AI PPT / 图文创作 <a href="https://zaokit.app">Zaokit.app</a>，助力大家高效完成图文创作和 PPT 生成。唯一网站：<a href="https://zaokit.app">https://zaokit.app</a>。</p>

<p>企业侧同一逻辑，已经融进可直接接入的服务：</p>

<ul>
  <li><a href="https://grok.zaokit.com">grok.zaokit.com</a></li>
  <li><a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a></li>
  <li><a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a></li>
  <li><a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a></li>
  <li><a href="https://junxinzhang.com/projects.html">完整产品列表</a></li>
</ul>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<p>如果你认可 Zaokit AI 的产品理念，欢迎后台留言加入社群。<strong>我们不卖课、不割韭菜，只聚焦 ToB 企业场景的 AI 落地实战。</strong> 希望在这里，能给你带来不一样的思维火花和真实的商业碰撞。</p>

<hr />

<p>延伸：<a href="/token-burn-ai-semiconductor-investing">没烧过 token，就别说看懂 AI 半导体</a> · <a href="/what-did-they-see-jeff-dean-new-paradigm">他们到底看到了什么？让 Jeff Dean 离开待了 27 年的 Google</a> · <a href="/rag-to-agentic-rag-evolution">你还在切 chunk 做向量？RAG 早就不是这回事了</a></p>

<hr />

<table>
  <tbody>
    <tr>
      <td>唯一网站：<a href="https://zaokit.app">Zaokit.app</a></td>
      <td>Agent 交易平台：<a href="https://zaokit.ai">Zaokit.ai</a></td>
    </tr>
  </tbody>
</table>

<p>企业 Grok 服务：<a href="https://grok.zaokit.com">grok.zaokit.com</a></p>

<p>企业服务：<a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a> · <a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a> · <a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a> · <a href="https://junxinzhang.com/projects.html">完整产品列表</a></p>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p><em>我是 Jason，自己一个人做 AI 产品。模型会过时，数学不会——在 AI 时代，基础学科才是你最硬的底牌。</em></p>]]></content><author><name>Jason Zhang</name></author><category term="AI" /><category term="featured" /><category term="AI" /><category term="数学" /><category term="物理" /><category term="信息论" /><category term="神经网络" /><category term="Diffusion" /><category term="交叉熵" /><category term="流形映射" /><category term="Zaokit" /><summary type="html"><![CDATA[推特上天天有人焦虑模型更新，但 AI 的底层逻辑没变过——数学、物理、信息论。 神经网络是流形映射，Diffusion 是热力学，交叉熵是信息压缩。 你对这三门课的理解深度，决定了你在 AI 时代能走多远。]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="https://junxinzhang.com/assets/images/cover-20260809-math-physics-ai-foundation.webp" /><media:content medium="image" url="https://junxinzhang.com/assets/images/cover-20260809-math-physics-ai-foundation.webp" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">没烧过 token，就别说看懂 AI 半导体</title><link href="https://junxinzhang.com/token-burn-ai-semiconductor-investing/" rel="alternate" type="text/html" title="没烧过 token，就别说看懂 AI 半导体" /><published>2026-08-08T00:00:00+00:00</published><updated>2026-08-08T00:00:00+00:00</updated><id>https://junxinzhang.com/token-burn-ai-semiconductor-investing</id><content type="html" xml:base="https://junxinzhang.com/token-burn-ai-semiconductor-investing/"><![CDATA[<p>关注芒格君有一阵子了。</p>

<p>中文圈能把 LLM 的 training/inference infra 讲透，能从软硬件 system co-design 一路讲到底层硬件原理，最后还能接回投资逻辑的人，凤毛麟角。芒格君算一个。这种跨层穿透的分享，在中文内容里非常稀缺。</p>

<blockquote>
  <p><strong>但作为同样在做 AI、每天泡在 post-training 一线的人，我想补一个芒格君没有展开的角度：一线信息有时候是把双刃剑。好处是能更早嗅到机会；坏处是信息茧房非常重——把「内部需求炽热」直接外推成「这种需求会很快扩展到其他产业」，太自然了。</strong></p>
</blockquote>

<p><img src="/assets/images/cover-20260808-token-burn-ai-investing.webp" alt="没烧过 token，就别说看懂 AI 半导体" /></p>

<h2 id="一一线信息的双刃剑">一、一线信息的双刃剑</h2>

<p>好处明摆着：离前沿越近，越早知道产业链上的真实 bottleneck，知道大家在 push 的技术方向是什么。</p>

<p>坏处也是真的：<strong>信息茧房非常重。</strong></p>

<p>做 AI 的人每天接触的圈子都在往同一个方向跑。GPU 不够用、推理成本居高不下、内存是最大瓶颈——这些是真实的。但「圈内需求炽热」和「这种需求会很快扩散到其他产业」之间，隔着一道巨大的鸿沟。</p>

<p>一线的人太容易把自己的体感直接外推成整个市场的状态。<strong>这是做投资最危险的事情之一。</strong></p>

<p>所以我一直纠结一个问题——</p>

<p><img src="/assets/images/illust-20260808-double-edged-sword.webp" alt="一线信息的双刃剑" /></p>

<h2 id="二ai-到底在吃存量还是做增量">二、AI 到底在吃存量，还是做增量？</h2>

<p>需要说清楚：我知道这两者不是非此即彼。历史上几乎所有通用技术——电力、互联网、智能手机——都是先再分配、后做大蛋糕。这不是争论。</p>

<p><strong>我真正想追问的，不是最终「有没有新蛋糕」，而是：扩散到了哪一步？进度是否符合当前的 capex 定价？</strong></p>

<p>从目前来看，大部分还是在吃存量。替代白领工作、替代人工的数据标注、优化现有流程——这些确实在发生。但全新的、不靠替代而是靠创造的增量市场？目前还没看到有说服力的规模化案例。</p>

<p>这不是悲观。这是一个阶段性的事实判断。而这个判断直接影响你怎么给 AI 半导体公司定价。</p>

<p><strong>这也是我和纯技术视角最大的分歧：技术人看到的是「这东西太强了，一定会改变一切」；做投资要追问的是「改变的速度，是否匹配了当前花出去的钱」。</strong></p>

<h2 id="三没烧过-token-的人看不懂供应链">三、没烧过 token 的人，看不懂供应链</h2>

<p>之前的文章分享过如何借助 AI 做基本面分析和投研。那只是我投资布局中的一环。每天大概会花掉 3 亿 token，日复一日。</p>

<p>2026 年的今天，如果团队里的人每天烧不掉 1 亿 token，我会怀疑他对 AI 的认知深度和抽象能力。</p>

<p><strong>一个人对 AI 的理解，基本等于他被 token 账单教育过的次数。</strong> 无论是跟着技术走，还是做投资，只有把 AI 用透——或者至少知道一线的人到底怎么用 AI——才谈得上做 AI 半导体的布局。</p>

<p>这是看任何小作文和 K 线都给不了你的东西。</p>

<p>具体讲几个例子：</p>

<table>
  <thead>
    <tr>
      <th>你没做过的事</th>
      <th>你就算不清的账</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>没在「一卡难求」时排过队</td>
      <td>不会真正理解 $NVDA 的定价权从哪来</td>
    </tr>
    <tr>
      <td>没自己 host 过模型、没为 token 账单付过钱</td>
      <td>算不清云厂商从「卖机器小时」变成「卖 token」后，$MSFT $AMZN $GOOGL 部署 Kimi、Qwen 这类开源权重，利润率能抬多少个点</td>
    </tr>
    <tr>
      <td>没用 vLLM 真跑过推理</td>
      <td>不知道 KV Cache 调度有多讲究、HBM 每一 GB 有多贵——关于内存供应链的所有判断，都从这里来</td>
    </tr>
    <tr>
      <td>没研究过 MoE 的 all-to-all 通信</td>
      <td>不明白 $MRVL $COHR 这些光互联玩家解决的根本不是「把机器连起来」，而是让上万张卡表现得像一台机器</td>
    </tr>
  </tbody>
</table>

<p><strong>一线的手感，最后都会变成仓位。看懂才能心中有数。</strong></p>

<p><img src="/assets/images/illust-20260808-token-bill-depth.webp" alt="token 账单即认知深度" /></p>

<h2 id="四怎么把一家公司的投资价值研究透">四、怎么把一家公司的投资价值研究透</h2>

<p>手感要变成仓位，中间需要一套系统。光靠体感和朋友圈信息做判断，迟早翻车。</p>

<p>下面是我自己跑了大半年的投研流程。</p>

<p><strong>第一步：收集资料。</strong></p>

<p>找到研究标的最近的新闻、各大投行能找到的所有研报（高盛、大摩、小摩、UBS 等）、财报、公司公告、10-K，一网打尽。</p>

<p><strong>第二步：派发 Agent Team。</strong></p>

<p>我的 Agent 会化身成各个投行的分析师，分别持有一方观点。我仿照华尔街投行搭建了一套自己的 Agent Team：</p>

<ul>
  <li>有的 Agent 蒸馏了我的思想</li>
  <li>有的 Agent 蒸馏了我的专业知识</li>
</ul>

<p>它们分别去评估公司的收入、财务、风险、基本面和估值，最后再汇总给 Agent Team Leader 进行对抗评审。如此反复。</p>

<p>这一步我只用 Fable 5 或 GPT 5.6 Sol Ultra。</p>

<p><strong>第三步：人工校验。</strong></p>

<p>每一个 Sub Agent 和最后的 Agent Leader 都会给我一个 report。我会逐行根据实际经验人工校验，给整个团队新的输入，由 Agent Team 评估是否需要重做第二步。如此往复，直到我认为通过。</p>

<p>经过这三步，任何人都可以在几天之内把一家标的研究透彻。<strong>而我每天 Agent Team 都会自动化运行一遍，确保每天的新变量被纳入我的 agent 大脑。</strong></p>

<p><img src="/assets/images/illust-20260808-agent-team-workflow.webp" alt="Agent Team 投研三步" /></p>

<h2 id="五这套东西能不能复制">五、这套东西能不能复制？</h2>

<p>坦率说，有门槛。</p>

<ol>
  <li><strong>数据源。</strong> 你得知道去哪找研报、财报、10-K，怎么把非结构化的信息喂给 Agent。垃圾进垃圾出，数据源的质量就是分析的天花板。</li>
  <li><strong>基本功。</strong> 没有经济学和技术的底子，你连问题都提不对——Agent 再强，也需要人告诉它该从哪些维度拆解一家公司。</li>
  <li><strong>自己的判断框架。</strong> 照搬别人的 thesis 没用。你得有自己的投资逻辑，并且能坚持纪律性执行。</li>
</ol>

<p>这三条加在一起，门槛确实不低。</p>

<p><strong>所以我在考虑另一条路：把整套流程封装成一个开放接口或者 skill，让任何人的豆包、ChatGPT 都能直接调用我的 Agent Team Leader——24 小时在线，随时拆解任意一家公司的基本面。</strong></p>

<p>不用自己搭系统，不用自己找数据，直接问就行。我敢说这套东西跑出来的结论，比网上绝大多数财经博主的分析都要扎实——因为它背后不是一个人拍脑袋，是一群 Agent 反复对抗校验的结果。</p>

<h2 id="写在最后">写在最后</h2>

<p>压成五句：</p>

<ol>
  <li><strong>一线信息是双刃剑</strong>——好处是更早嗅到 bottleneck，坏处是把圈内需求直接外推成全市场</li>
  <li><strong>AI 目前大部分在吃存量</strong>——全新增量市场还没看到规模化案例，这个判断直接影响 capex 定价</li>
  <li><strong>你对 AI 的理解 ≈ 你被 token 账单教育过的次数</strong>——没烧过 token，看不懂供应链的每一环</li>
  <li><strong>我的投研用 Agent Team</strong>——每天 3 亿 token，仿照华尔街投行搭的对抗评审系统</li>
  <li><strong>计划开源这套系统</strong>——让所有人都能接入 Agent Team Leader，做到任何公司的基本面全解</li>
</ol>

<p>土话一句：</p>

<p><strong>别看 K 线了。先看看你的 token 账单。</strong></p>

<p>我一个人打造的 <a href="https://zaokit.ai">Zaokit AI Agent 交易平台</a>，以及 AI PPT / 图文创作 <a href="https://zaokit.app">Zaokit.app</a>，助力大家高效完成图文创作和 PPT 生成。唯一网站：<a href="https://zaokit.app">https://zaokit.app</a>。</p>

<p>企业侧同一逻辑，已经融进可直接接入的服务：</p>

<ul>
  <li><a href="https://grok.zaokit.com">grok.zaokit.com</a></li>
  <li><a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a></li>
  <li><a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a></li>
  <li><a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a></li>
  <li><a href="https://junxinzhang.com/projects.html">完整产品列表</a></li>
</ul>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<p>如果你认可 Zaokit AI 的产品理念，欢迎后台留言加入社群。<strong>我们不卖课、不割韭菜，只聚焦 ToB 企业场景的 AI 落地实战。</strong> 希望在这里，能给你带来不一样的思维火花和真实的商业碰撞。</p>

<hr />

<p>延伸：<a href="/what-did-they-see-jeff-dean-new-paradigm">他们到底看到了什么？让 Jeff Dean 离开待了 27 年的 Google</a> · <a href="/rag-to-agentic-rag-evolution">你还在切 chunk 做向量？RAG 早就不是这回事了</a> · <a href="/workbuddy-codex-positioning-threshold">WorkBuddy 和 Codex 谁更强？你问错了</a></p>

<hr />

<table>
  <tbody>
    <tr>
      <td>唯一网站：<a href="https://zaokit.app">Zaokit.app</a></td>
      <td>Agent 交易平台：<a href="https://zaokit.ai">Zaokit.ai</a></td>
    </tr>
  </tbody>
</table>

<p>企业 Grok 服务：<a href="https://grok.zaokit.com">grok.zaokit.com</a></p>

<p>企业服务：<a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a> · <a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a> · <a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a> · <a href="https://junxinzhang.com/projects.html">完整产品列表</a></p>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p><em>我是 Jason，自己一个人做 AI 产品。一线手感变成仓位——你的 token 账单，就是你对 AI 最诚实的理解。</em></p>]]></content><author><name>Jason Zhang</name></author><category term="AI" /><category term="featured" /><category term="AI" /><category term="投资" /><category term="token" /><category term="Agent Team" /><category term="AI半导体" /><category term="post-training" /><category term="NVDA" /><category term="HBM" /><category term="MoE" /><category term="Zaokit" /><summary type="html"><![CDATA[从 LLM infra 到硬件原理再接回投资，能把这些讲透的人在中文圈凤毛麟角。 作为每天泡在 post-training 一线的人，补一个体会：一线信息是双刃剑。 没烧过 token 就看不懂供应链——这篇讲我怎么每天烧 3 亿 token 做 AI 投研。]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="https://junxinzhang.com/assets/images/cover-20260808-token-burn-ai-investing.webp" /><media:content medium="image" url="https://junxinzhang.com/assets/images/cover-20260808-token-burn-ai-investing.webp" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">他们到底看到了什么？让 Jeff Dean 离开待了 27 年的 Google</title><link href="https://junxinzhang.com/what-did-they-see-jeff-dean-new-paradigm/" rel="alternate" type="text/html" title="他们到底看到了什么？让 Jeff Dean 离开待了 27 年的 Google" /><published>2026-08-07T00:00:00+00:00</published><updated>2026-08-07T00:00:00+00:00</updated><id>https://junxinzhang.com/what-did-they-see-jeff-dean-new-paradigm</id><content type="html" xml:base="https://junxinzhang.com/what-did-they-see-jeff-dean-new-paradigm/"><![CDATA[<p>这周 X 上有一种奇怪的氛围。</p>

<p>不是吵架，不是发新品。是一群在前沿实验室工作的人，密集地发了很多意味深长的推文。大意都差不多：</p>

<p><strong>「我最近看到的一些东西，让我觉得现在的工具很快就会显得原始。」</strong></p>

<p>然后什么都不说了。</p>

<blockquote>
  <p><strong>当 Google 第 30 号员工决定离开待了 27 年的公司去创业，当 Anthropic 据报道签下约 100 亿美金的算力合同并开始招芯片团队，当 Google Maps 开始跑 Agent——他们到底看到了什么？最合理的解释，可能指向 AI 智能体的下一个范式。</strong></p>
</blockquote>

<p><img src="/assets/images/cover-20260809-what-did-they-see.webp" alt="他们到底看到了什么？让 Jeff Dean 离开待了 27 年的 Google" /></p>

<h2 id="一jeff-dean-走了这才是最大的信号">一、Jeff Dean 走了——这才是最大的信号</h2>

<p>8 月 5 日，一条新闻炸了整个 AI 圈：</p>

<p><strong>Jeff Dean、Sanjay Ghemawat、Quoc Le、Oriol Vinyals，四个人一起从 Google 离职，成立了一家叫 Discovery Loop 的公益公司。</strong></p>

<p>这不是普通的跳槽。Jeff Dean 是 Google 第 30 号员工，1999 年加入，待了 27 年。MapReduce、TensorFlow、TPU、Google Brain——他参与或主导了 Google 技术史上几乎所有重大节点。Sanjay Ghemawat 是他合作了二十多年的搭档。Quoc Le 是 Google Brain 早期核心成员。Oriol Vinyals 是 DeepMind 核心研究员。</p>

<p>四个人同时走，我的判断是：<strong>他们在 Google 内部看到了某种东西，但判断这件事更适合在小团队、新结构里做。</strong></p>

<p>Dean 说了一句话：</p>

<blockquote>
  <p><strong>“我们认为 AI 有机会更完整地自动化那个传统上非常依赖人力的实验循环。”</strong></p>
</blockquote>

<p>他们的联合声明更直接：</p>

<blockquote>
  <p><strong>“AI 的下一个伟大前沿，不是回答问题，而是做出发现。”</strong></p>
</blockquote>

<p>Discovery Loop 公开方向是：<strong>用 AI 自动化完整实验循环，并探索用 AI 构建更强的 AI。</strong> 报道把它放在「递归自我改进」这条线上——不是人写代码让模型变强，而是 AI 自己做实验、自己迭代。Radical Ventures 和 Khosla Ventures 领投，Alphabet 参与。母公司跟投前员工创业公司，说明这件事至少被允许、被支持；至于为什么不在 Google 内部做，那是另一层判断。</p>

<p><img src="/assets/images/illust-20260809-jeff-dean-departure.webp" alt="Jeff Dean 27年后的选择" /></p>

<h2 id="二不止-jeff-dean所有人都在动">二、不止 Jeff Dean——所有人都在动</h2>

<p>Jeff Dean 走了是最大的信号，但不是唯一的。把最近两周的事情摊开看：</p>

<table>
  <thead>
    <tr>
      <th>时间</th>
      <th>事件</th>
      <th>信号</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>7 月 24 日</td>
      <td>Anthropic 发布 Claude Opus 5</td>
      <td>偏长程 Agent 能力，强调自验证、多步迭代</td>
    </tr>
    <tr>
      <td>8 月 4 日</td>
      <td>据报道 Anthropic 与云创业公司 Volta 签下约 100 亿美金算力合同</td>
      <td>Agent 工作负载需要大规模专属算力</td>
    </tr>
    <tr>
      <td>8 月 5 日</td>
      <td>Anthropic 开始招芯片设计团队</td>
      <td>垂直整合，不满足于只租算力</td>
    </tr>
    <tr>
      <td>8 月 5 日</td>
      <td>Jeff Dean 等四人离职创业</td>
      <td>AI 自动化科学研究</td>
    </tr>
    <tr>
      <td>8 月 6 日</td>
      <td>Google Maps 上线 Agentic 功能</td>
      <td>从导航工具变成能订餐、订酒店的助手</td>
    </tr>
  </tbody>
</table>

<p>这些事件单独看都是新闻。放在一起看，指向同一个方向：</p>

<p><strong>前沿实验室不是只在打磨现有的 Agent 工具，而是在给下一量级的系统补能力、补算力、补基础设施。</strong></p>

<p>Claude Opus 5 的发布说明里，有几个细节值得注意：官方示例里，它<strong>自己搭了一套计算机视觉流水线</strong>去还原 FreeCAD 零件；在 Frontier-Bench 上刷新了成绩；JetBrains 的工程师说，这是他们见过的 Claude 代际里最清晰的一次解题能力跃迁。</p>

<p>这不是「更快更强」四个字就能概括的。<strong>模型开始更像会自己验证、自己迭代的执行者。</strong></p>

<p><img src="/assets/images/illust-20260809-three-labs-racing.webp" alt="三大前沿实验室齐发力" /></p>

<h2 id="三tibo-那条-16m-浏览的帖子说穿了什么">三、Tibo 那条 1.6M 浏览的帖子，说穿了什么</h2>

<p>在 Jeff Dean 官宣离职的前一天，8 月 4 日，<strong>OpenAI Codex 负责人 Tibo</strong>（Thibault Sottiaux，<a href="https://x.com/thsottiaux">@thsottiaux</a>）在 X 上发了一条帖子，<strong>1.6M 浏览</strong>，原文是：</p>

<blockquote>
  <p><strong>“Given some of the results I’m seeing recently, it’s pretty clear Codex is a good harness. But it will seem primitive in 2-3 months and we’re about to go through another major evolution in how we use AI at the frontier. The next generation of models need more than your laptop.”</strong></p>
</blockquote>

<p>翻译成大白话：<strong>Codex 确实是个好工具——但两三个月后它就会显得原始。我们即将经历又一次 AI 使用方式的重大演化。下一代模型需要的，不止是你的笔记本。</strong></p>

<p>注意身份：Tibo 不是站在外面评 Codex 的人。公开报道里，他是 Codex 的 engineering lead / Head of Codex 之一，参与并主导了现代 agentic Codex 的建设。</p>

<p><strong>所以这句话的分量完全不一样：造 Codex 的人，在说自己做的东西很快会显得原始。</strong></p>

<p>我前几天在 <a href="/agent-runtime-beyond-laptop-infrastructure">你的公司电脑，可能连 Agent 的门都进不了</a> 里引用过这条帖子，当时还没把身份钉死。结合 Jeff Dean 离职创办 Discovery Loop 的消息，现在拼图完整了。</p>

<p><strong>Tibo 这条帖子至少传递了三层信号：</strong></p>

<p><strong>第一层：Codex 不是终态，只是一个过渡性的好工具。</strong> 他用了 “harness”（套具）这个词——不是 “platform”、不是 “system”，是套在马身上的工具。工具好用，但马要换了。自己造 harness 的人这么说，比任何测评都狠。</p>

<p><strong>第二层：时间窗口极短——两三个月。</strong> 不是「未来某天」，是 2026 年底之前。他说 “I’m seeing recently”——已经看到了，不是猜测。这意味着前沿实验室内部已经跑出了某种和现在完全不同的东西。</p>

<p><strong>第三层：本地笔记本级别的 harness 很快触到天花板。</strong> “The next generation of models need more than your laptop” 这句话，呼应了第二节那些基础设施信号——据报道的百亿算力合同、芯片团队、Opus 5 对长程任务的强化——<strong>算力需求正在从「单机」往「集群」走。</strong></p>

<p>这条帖子之所以引爆讨论，不是因为结论多惊人，而是因为<strong>发帖的人既在造 Codex，又用「我最近看到的结果」这种现在时说话</strong>。他不像在空谈时间表，更像在提前给市场打信号。</p>

<p>评论区也是同一类气氛：很多人点头，很少人公开细节。没人把内部 demo 摊开讲，但「我也有同感」的味道很浓。</p>

<p><strong>这种「先有内部体感、后有公开产品」的氛围，上一次大规模出现，是 2022 年底 ChatGPT 发布前。</strong></p>

<h2 id="四最合理的解释他们看到了自动化实验循环">四、最合理的解释：他们看到了自动化实验循环</h2>

<p>把 Jeff Dean 的行动、Codex 负责人 Tibo 的暗示、Anthropic 的基础设施布局叠在一起，<strong>最合理的解释</strong>不是「模型再大一点」，而是：</p>

<p><strong>AI 正在被推向「自己改进研究循环」这条线。</strong></p>

<p>不是「参数更多」那种改进。是<strong>AI 自己做实验、自己验证假设、自己迭代方案</strong>——把过去需要一个团队花很久的研究循环，压缩到更短的时间。</p>

<p>这就是 Jeff Dean 说的「自动化实验循环」。也是把 Tibo 那句「Codex 两三个月后会显得原始」接上的那根线。</p>

<p><strong>当前的 Agent 工具——Codex、Claude Code、WorkBuddy——本质上还是「人下指令，AI 执行」。</strong> 你告诉它做什么，它去做。你不说，它不动。</p>

<p>下一代系统如果按这条线走，就不是这样了。<strong>AI 自己定义任务、自己选择工具、自己迭代改进。</strong> 人的角色从「指挥官」变成「审计员」——你不再事无巨细地告诉它怎么做，而是检查它做得对不对。</p>

<p>这个跳跃的量级，可能和从 ChatGPT 聊天到 Agent 自主执行一样大。</p>

<h2 id="五为什么说-codex-和-claude-code-即将成为过去式">五、为什么说 Codex 和 Claude Code 即将成为过去式</h2>

<p>我不是在贬低这些工具。我自己每天都在用。八月初 <a href="/codex-stitch-two-hours-three-ends-recall">用 Codex 两小时交三端</a>，杠杆约 50 倍，体感非常强。</p>

<p>但冷静下来想：<strong>50 倍杠杆，本质上还是「人 × 50」。</strong></p>

<p>下一代系统要做的事情不是给你 50 倍杠杆。是<strong>把你从循环里拿出去</strong>。</p>

<table>
  <thead>
    <tr>
      <th>现在</th>
      <th>下一跳</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>人下指令，AI 执行</td>
      <td>AI 自己定义任务</td>
    </tr>
    <tr>
      <td>人审代码，AI 改</td>
      <td>AI 自己验证、自己迭代</td>
    </tr>
    <tr>
      <td>一次对话完成一个任务</td>
      <td>持续运行，自主探索</td>
    </tr>
    <tr>
      <td>工具是 Agent</td>
      <td>Agent 是同事</td>
    </tr>
  </tbody>
</table>

<p>这也是为什么 Anthropic 一边签大规模算力合同，一边招芯片团队。不是因为今天的聊天框已经吃不下这些资源——而是因为<strong>下一代 Agent 如果真的长时间运行、并行多任务、自己搭工具链，算力需求会完全换一个量级</strong>。</p>

<p>一台笔记本，扛不住那种工作负载。</p>

<p>这话不是空谈。我自己就有亲身体会。</p>

<p>三月我写过 <a href="/agent-arms-race-650-dollars-per-month">月投 650 刀订阅 AI Agent</a>：Claude Code + Codex + Gemini Ultra，固定月费约 650 刀；同时跑 20+ Agent 时，M2 Max 已经扛不住，只能再入一台 64G M5 Pro 专门跑 Agent 集群。六月又写了 <a href="/ai-storage-baseline-macbook-price-up">那台 M5 Pro 三个月涨了 6000</a>——内存和存储才是 AI 时代真正在变贵的东西。</p>

<p><strong>月花 650 刀、两台 Mac 并行，都只是今天这一代 Agent 的门槛。</strong> Tibo 说下一代需要的不止是笔记本，我信——因为我已经在今天这一代上，被笔记本卡过一次了。</p>

<p><img src="/assets/images/illust-20260809-paradigm-shift.webp" alt="从工具到同事：Agent 范式跳跃" /></p>

<h2 id="六这件事对你意味着什么">六、这件事对你意味着什么</h2>

<p>先别焦虑。三件事值得现在想清楚：</p>

<p><strong>第一，短期内 Codex 和 Claude Code 仍然是最好的工具。</strong> 「即将成为过去式」不等于「今天就不能用」。下一代系统商业化还需要时间，而你手上的项目不等人。该用就用。</p>

<p><strong>第二，要建的能力不是「会用某个 Agent 工具」，而是「理解 Agent 系统设计」。</strong> Codex 会过时，Claude Code 会迭代，但理解范式迁移的能力不会过时。弄清楚 Agent 需要什么运行环境、怎么做状态管理、怎么设计工具链——这些才是可迁移的能力。</p>

<p><strong>第三，Jeff Dean 用脚投票的方向值得认真看。</strong> 一个在 Google 待了 27 年、参与过几乎所有重大技术决策的人，判断「AI 自动化科学研究」是下一个伟大前沿——这不是空话，这是他把职业生涯压上去了。</p>

<h2 id="写在最后">写在最后</h2>

<p>压成五句：</p>

<ol>
  <li><strong>Jeff Dean 走了——Google 第 30 号员工，27 年后带着三个顶级研究员创办 Discovery Loop，做 AI 自动化科学研究</strong></li>
  <li><strong>Codex 负责人 Tibo 那条 1.6M 帖子更像预告——造工具的人自己说 Codex 两三个月后会显得原始</strong></li>
  <li><strong>Anthropic 据报道签约 100 亿算力合同、并招芯片团队——下一代 Agent 更可能需要专属基础设施，不是你的笔记本</strong></li>
  <li><strong>最合理的解释是：自动化实验循环——AI 自己做实验、自己迭代，而不只是回答问题</strong></li>
  <li><strong>Codex 和 Claude Code 还是好工具，但它们本质仍是「人 × 50」——下一跳如果成立，是把人从循环里拿出去</strong></li>
</ol>

<p>土话一句：</p>

<p><strong>别再只问哪个 Agent 工具更好用了。造工具的人，已经在往下一个世代押注了。</strong></p>

<p>我一个人打造的 <a href="https://zaokit.ai">Zaokit AI Agent 交易平台</a>，以及 AI PPT / 图文创作 <a href="https://zaokit.app">Zaokit.app</a>，助力大家高效完成图文创作和 PPT 生成。唯一网站：<a href="https://zaokit.app">https://zaokit.app</a>。</p>

<p>企业侧同一逻辑，已经融进可直接接入的服务：</p>

<ul>
  <li><a href="https://grok.zaokit.com">grok.zaokit.com</a></li>
  <li><a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a></li>
  <li><a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a></li>
  <li><a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a></li>
  <li><a href="https://junxinzhang.com/projects.html">完整产品列表</a></li>
</ul>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<p>如果你认可 Zaokit AI 的产品理念，欢迎后台留言加入社群。<strong>我们不卖课、不割韭菜，只聚焦 ToB 企业场景的 AI 落地实战。</strong> 希望在这里，能给你带来不一样的思维火花和真实的商业碰撞。</p>

<hr />

<p>延伸：<a href="/agent-runtime-beyond-laptop-infrastructure">你的公司电脑，可能连 Agent 的门都进不了</a> · <a href="/agent-arms-race-650-dollars-per-month">月投 650 刀订阅 AI Agent</a> · <a href="/ai-storage-baseline-macbook-price-up">我那台 M5 Pro，三个月涨了 6000</a> · <a href="/workbuddy-codex-positioning-threshold">WorkBuddy 和 Codex 谁更强？你问错了</a></p>

<p>公开参考：<a href="https://techcrunch.com/2026/08/05/jeff-dean-and-other-top-ai-researchers-are-leaving-google-to-launch-their-own-startup/">TechCrunch — Jeff Dean and other top AI researchers are leaving Google</a> · <a href="https://www.anthropic.com/news/claude-opus-5">Anthropic — Claude Opus 5</a> · <a href="https://techcrunch.com/2026/08/06/google-maps-adds-agentic-features-including-food-ordering-and-hotel-bookings/">TechCrunch — Google Maps agentic features</a> · <a href="https://www.reuters.com/business/anthropic-build-in-house-chip-design-team-claude-hire-engineers-2026-08-05/">Reuters — Anthropic chip design team</a></p>

<hr />

<table>
  <tbody>
    <tr>
      <td>唯一网站：<a href="https://zaokit.app">Zaokit.app</a></td>
      <td>Agent 交易平台：<a href="https://zaokit.ai">Zaokit.ai</a></td>
    </tr>
  </tbody>
</table>

<p>企业 Grok 服务：<a href="https://grok.zaokit.com">grok.zaokit.com</a></p>

<p>企业服务：<a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a> · <a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a> · <a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a> · <a href="https://junxinzhang.com/projects.html">完整产品列表</a></p>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p><em>我是 Jason，自己一个人做 AI 产品。造工具的人已经在往下一个世代押注了——你准备好了吗？</em></p>]]></content><author><name>Jason Zhang</name></author><category term="AI" /><category term="featured" /><category term="AI" /><category term="Jeff Dean" /><category term="Discovery Loop" /><category term="Agent" /><category term="范式跳跃" /><category term="Codex" /><category term="Claude Code" /><category term="递归自我改进" /><category term="Zaokit" /><summary type="html"><![CDATA[Jeff Dean 在 Google 待了 27 年，走了。Sanjay Ghemawat、Quoc Le、Oriol Vinyals 跟着一起走了。 他们成立了 Discovery Loop，要做 AI 自动化科学研究。据报道 Anthropic 签了约 100 亿美金算力合同。 所有人都在问同一个问题：他们到底看到了什么？]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="https://junxinzhang.com/assets/images/cover-20260809-what-did-they-see.webp" /><media:content medium="image" url="https://junxinzhang.com/assets/images/cover-20260809-what-did-they-see.webp" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">你还在切 chunk 做向量？RAG 早就不是这回事了</title><link href="https://junxinzhang.com/rag-to-agentic-rag-evolution/" rel="alternate" type="text/html" title="你还在切 chunk 做向量？RAG 早就不是这回事了" /><published>2026-08-06T00:00:00+00:00</published><updated>2026-08-06T00:00:00+00:00</updated><id>https://junxinzhang.com/rag-to-agentic-rag-evolution</id><content type="html" xml:base="https://junxinzhang.com/rag-to-agentic-rag-evolution/"><![CDATA[<p>2023 年我开始做 RAG 的时候，全网教程就一套动作：</p>

<p><strong>把文档切成 chunk，灌进向量库，查询时取 top-k，拼进 prompt，完事。</strong></p>

<p>那时候觉得这就是 RAG。今天回头看，那只是 RAG 的婴儿期。</p>

<blockquote>
  <p><strong>大部分人还停在”切 chunk 做向量”的阶段，以为自己在用 RAG。真正的 RAG 已经进化到 AI 自己决定用什么工具、查几轮、怎么合成。这中间差的不是几篇论文，是”固定管道”和”自主智能体”之间的范式鸿沟。</strong></p>
</blockquote>

<p><img src="/assets/images/cover-20260808-rag-agentic-evolution.webp" alt="从切 chunk 到自己找信息：RAG 这三年走了多远" /></p>

<h2 id="一先给结论rag-不是一种技术是一条进化路线">一、先给结论：RAG 不是一种技术，是一条进化路线</h2>

<p>很多人把 RAG 当成一个固定方案——检索增强生成，不就是”先搜后答”吗？</p>

<p>不是。RAG 是一条还在快速分裂的技术树。从 2020 年 Lewis 等人的原始论文到今天，它至少分化出了五代，每一代解决的问题都不一样：</p>

<table>
  <thead>
    <tr>
      <th>阶段</th>
      <th>时间</th>
      <th>核心解决的问题</th>
      <th>一句话</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>基础 RAG</td>
      <td>2020</td>
      <td>知识不在模型里</td>
      <td>先搜后答</td>
    </tr>
    <tr>
      <td>模块化 RAG</td>
      <td>2022–2023</td>
      <td>管道太僵硬</td>
      <td>像乐高一样组合</td>
    </tr>
    <tr>
      <td>反思+图谱</td>
      <td>2023–2024</td>
      <td>检索到垃圾也不知道</td>
      <td>给 RAG 装质检员和结构</td>
    </tr>
    <tr>
      <td>路由优化</td>
      <td>2024–2025</td>
      <td>什么都走 RAG 太贵</td>
      <td>简单直答，复杂才检索</td>
    </tr>
    <tr>
      <td>Agentic RAG</td>
      <td>2025–2026</td>
      <td>固定流程不够用</td>
      <td>AI 自己决定怎么找</td>
    </tr>
  </tbody>
</table>

<p>这条线的走向很清楚：<strong>从人设计管道，到 AI 自己决定怎么找信息。</strong></p>

<h2 id="二20202023从无脑检索到模块化乐高">二、2020–2023：从”无脑检索”到”模块化乐高”</h2>

<p>2020 年 Lewis 等人的 RAG 论文是起点：DPR 稠密检索 + 向量相似度 + 生成器。它第一次让 LLM 能”外接知识库”，缓解幻觉和时效性。</p>

<p>但这一代的问题很明显：<strong>无脑检索</strong>。所有文本切成 chunk 做向量索引，查询时取 top-k 就完事。chunk 彼此孤立，检索粗糙，对复杂问题无力。</p>

<p>2022 年 ColBERTv2 把”单向量匹配”改成 token 级多向量 + MaxSim 延迟交互，匹配精度上了一个台阶；残差压缩把存储降 6–10 倍。检索器本身从”粗”变”准”。</p>

<p>同期，Modular RAG 的思路出来了：RAG 不该是一条固定管道，而是一堆可编排模块——检索、重排、生成，像乐高一样按需组合。</p>

<p><strong>这一代解决的是”怎么让检索更准”和”怎么让管道更灵活”。但它还是个固定流程——你设计好管道，它就照着跑。</strong></p>

<p><img src="/assets/images/illust-20260808-basic-to-modular-rag.webp" alt="基础 RAG 到模块化 RAG" /></p>

<h2 id="三20232024给-rag-装上质检员和知识图谱">三、2023–2024：给 RAG 装上”质检员”和”知识图谱”</h2>

<p>上一代最大的坑是：<strong>检索到垃圾也不知道。</strong></p>

<p>top-k 返回的结果质量参差不齐，但生成器不管三七二十一全都拿来用——结果就是”一本正经地胡说八道”，而且引了来源看起来还挺靠谱。</p>

<p>Self-RAG 和 CRAG 就是给 RAG 装的”质检员”：</p>

<table>
  <thead>
    <tr>
      <th>方案</th>
      <th>做法</th>
      <th>解决什么</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td><strong>Self-RAG</strong></td>
      <td>用反思 token 让模型自己判断：要不要检索？检索到的对不对？</td>
      <td>模型不再无脑用检索结果</td>
    </tr>
    <tr>
      <td><strong>CRAG</strong></td>
      <td>轻量评估器三路径：正确→直接用；错误→重写或联网；模糊→混合</td>
      <td>检索到垃圾时自动纠偏</td>
    </tr>
  </tbody>
</table>

<p>同一时期，另一条线在解决”结构”问题。</p>

<p><strong>RAPTOR</strong> 用递归摘要树组织文档，适合全局性、多跳、总结类问题——向量检索擅长局部匹配，但”这篇文档整体在说什么”它答不了。</p>

<p><strong>GraphRAG</strong> 走得更远：把文本抽成实体–关系知识图谱，用图谱做多跳推理。微软的 GraphRAG 用 Leiden 社区摘要做全局问答；HippoRAG2 用个性化 PageRank 做精准路由。</p>

<p>但图谱路线有个硬伤：<strong>全量构建太贵。</strong> 这也催生了后面 LazyGraphRAG 的出现。</p>

<p><img src="/assets/images/illust-20260808-self-rag-quality.webp" alt="Self-RAG 质检流程" /></p>

<h2 id="四20242025不是什么问题都值得-rag">四、2024–2025：不是什么问题都值得 RAG</h2>

<p>前三代的进化方向都是”更准、更强、更结构化”。但到了 2024 年，大家发现一个土问题：</p>

<p><strong>简单问题也走 RAG，太贵了。</strong></p>

<p>“今天周几”不需要检索向量库；”这段代码有没有 bug”不需要知识图谱。Adaptive RAG 的思路很直接：<strong>按查询复杂度动态路由——简单问题直接 LLM 答，复杂问题才走多步检索。</strong></p>

<p>与此同时，LazyGraphRAG 把图谱路线的成本问题解决了：社区摘要不在索引时预算，而是延迟到查询时才算。<strong>索引成本降到 GraphRAG 的 0.1%。</strong> 这意味着图谱不再是大厂专属。</p>

<p>2M token 上下文窗口出来后，很多人问：长上下文能不能直接替代 RAG？</p>

<p>答案是<strong>不能替代，但可以分工</strong>：</p>

<ul>
  <li>简单查询 → RAG（几分钱）</li>
  <li>复杂多跳 → 长上下文（更贵但更准）</li>
  <li>视觉文档 → ColPali</li>
</ul>

<p>ICLR 2026 的 GraphRAG-Bench 给出了经验法则：<strong>图的价值随查询复杂度上升。</strong> 简单问题上图谱没优势，复杂多跳上它碾压纯向量。</p>

<p>同期火过一阵的 SAG（Search-Augmented Generation），本质是绕开向量库直接用搜索引擎——思路对但格局小，到了 Agentic RAG 阶段，搜索只是工具箱里的一个选项。SAG 不是主线进化，更像是 RAG 管道越来越复杂时的一次实用主义反弹。</p>

<p><strong>这一代的核心认知是：RAG 不该一刀切，该按需分流。</strong></p>

<p><img src="/assets/images/illust-20260808-adaptive-rag-routing.webp" alt="RAG 路由分流" /></p>

<h2 id="五20252026ai-自己决定怎么找信息">五、2025–2026：AI 自己决定怎么找信息</h2>

<p>终于到了今天这一代：<strong>Agentic RAG。</strong></p>

<p>前面所有代际的共同点是——<strong>人设计管道，系统按管道跑。</strong> 管道更灵活了、有质检了、会路由了，但本质还是人在设计流程。</p>

<p>Agentic RAG 把最后这层也交出去了：让 AI 智能体自己决定”用什么工具（向量库/网页/API/SQL）、查几轮、怎么合成”。</p>

<p>更激进的是 RL 端到端训练路线：</p>

<table>
  <thead>
    <tr>
      <th>方案</th>
      <th>做法</th>
      <th>效果</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td><strong>Search-R1</strong></td>
      <td>用 RL 训练 LLM 学会”何时搜、搜什么”</td>
      <td>Qwen2.5-7B 上比普通 RAG 提升 41%</td>
    </tr>
    <tr>
      <td><strong>DeepRetrieval</strong></td>
      <td>直接以检索指标（recall@k、NDCG）为奖励优化查询</td>
      <td>查询质量本身被强化学习优化</td>
    </tr>
    <tr>
      <td><strong>MCTS-RAG</strong></td>
      <td>蒙特卡洛树搜索融进推理</td>
      <td>把”找信息”变成搜索树博弈</td>
    </tr>
  </tbody>
</table>

<p>这条线的意义不在于某个方案提升了多少百分点，而在于<strong>范式本身的跳跃</strong>：</p>

<p><strong>从”固定流程”走向”会自己找信息的智能体”。</strong></p>

<p>这和 Agent 领域的大趋势完全一致。我在 <a href="/agentic-org-vs-informatization-six-months">组织还在信息化，别人已经在跑智能体</a> 里写过：核心变化不是工具更强，而是执行主体从人变成了 AI。RAG 这条线，走的是同一个方向。</p>

<p><img src="/assets/images/illust-20260808-agentic-rag-agent.webp" alt="Agentic RAG：AI 自主决策" /></p>

<h2 id="六2023-年做-rag-的体感">六、2023 年做 RAG 的体感</h2>

<p>说回我自己。</p>

<p>2023 年我开始做 RAG，踩过的坑现在看全是教科书级别的：</p>

<ul>
  <li><strong>chunk 切太小</strong>，检索出来的全是碎片，模型拼不出完整答案</li>
  <li><strong>chunk 切太大</strong>，噪音太多，top-k 里一半是废话</li>
  <li><strong>没有重排</strong>，向量相似度高不等于语义相关</li>
  <li><strong>没有质量评估</strong>，检索到错误信息照样生成，用户根本分不出来</li>
</ul>

<p>这些问题在 2024 年都有了系统性的解决方案。但<strong>大部分企业的 RAG 系统，到今天还停在 2022 年的水平</strong>——切 chunk、灌向量、取 top-k，一条管道走到底。</p>

<p>不是因为不知道有更好的方案，是因为<strong>没有人告诉他们”你的 RAG 只是婴儿期”。</strong></p>

<p>我一个人打造的 <a href="https://zaokit.ai">Zaokit AI Agent 交易平台</a>，在内部的知识检索、PPT 生成、图文创作流水线里，已经从基础 RAG 迁到了带路由和质量评估的架构。不是因为技术信仰，是因为<strong>基础 RAG 的幻觉率在真实业务里根本扛不住。</strong></p>

<h2 id="写在最后">写在最后</h2>

<p>压成五句：</p>

<ol>
  <li><strong>RAG 不是一种技术，是一条还在快速分裂的进化路线</strong>——从 2020 年到 2026 年，至少五代</li>
  <li><strong>大部分企业还停在 2022 年的”切 chunk 做向量”</strong>——以为自己在用 RAG，其实只碰到了起点</li>
  <li><strong>Self-RAG、CRAG 给检索装了质检员</strong>——检索到垃圾也不知道，是最常见也最致命的坑</li>
  <li><strong>GraphRAG 走结构化路线，LazyGraphRAG 把成本打下来了</strong>——图的价值随查询复杂度上升</li>
  <li><strong>Agentic RAG 是当前终态</strong>——AI 自己决定用什么工具、查几轮、怎么合成，从固定管道到自主智能体</li>
</ol>

<p>土话一句：</p>

<p><strong>别再跟人说”我们上了 RAG”了。先看看你的 RAG 是哪一代的。</strong></p>

<p>我一个人打造的 <a href="https://zaokit.ai">Zaokit AI Agent 交易平台</a>，以及 AI PPT / 图文创作 <a href="https://zaokit.app">Zaokit.app</a>，助力大家高效完成图文创作和 PPT 生成。唯一网站：<a href="https://zaokit.app">https://zaokit.app</a>。</p>

<p>企业侧同一逻辑，已经融进可直接接入的服务：</p>

<ul>
  <li><a href="https://grok.zaokit.com">grok.zaokit.com</a></li>
  <li><a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a></li>
  <li><a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a></li>
  <li><a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a></li>
  <li><a href="https://junxinzhang.com/projects.html">完整产品列表</a></li>
</ul>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<p>如果你认可 Zaokit AI 的产品理念，欢迎后台留言加入社群。<strong>我们不卖课、不割韭菜，只聚焦 ToB 企业场景的 AI 落地实战。</strong> 希望在这里，能给你带来不一样的思维火花和真实的商业碰撞。</p>

<hr />

<p>延伸：<a href="/agentic-org-vs-informatization-six-months">组织还在信息化，别人已经在跑智能体</a> · <a href="/agent-runtime-beyond-laptop-infrastructure">你的公司电脑，可能连 Agent 的门都进不了</a> · <a href="/workbuddy-codex-positioning-threshold">WorkBuddy 和 Codex 谁更强？你问错了</a></p>

<hr />

<table>
  <tbody>
    <tr>
      <td>唯一网站：<a href="https://zaokit.app">Zaokit.app</a></td>
      <td>Agent 交易平台：<a href="https://zaokit.ai">Zaokit.ai</a></td>
    </tr>
  </tbody>
</table>

<p>企业 Grok 服务：<a href="https://grok.zaokit.com">grok.zaokit.com</a></p>

<p>企业服务：<a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a> · <a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a> · <a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a> · <a href="https://junxinzhang.com/projects.html">完整产品列表</a></p>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p><em>我是 Jason，自己一个人做 AI 产品。2023 年切 chunk 做向量，2026 年 AI 自己找信息。技术在进化，你的 RAG 也该升级了。</em></p>]]></content><author><name>Jason Zhang</name></author><category term="AI" /><category term="featured" /><category term="AI" /><category term="RAG" /><category term="Agentic RAG" /><category term="GraphRAG" /><category term="Self-RAG" /><category term="检索增强生成" /><category term="知识图谱" /><category term="向量检索" /><category term="Zaokit" /><summary type="html"><![CDATA[2023 年我开始做 RAG，全网就一套动作：切 chunk、灌向量库、取 top-k。今天再看，那只是 RAG 的婴儿期。 从无脑检索到会自己决定"用什么工具、查几轮"的 Agentic RAG，这条路走了不到三年，但差了两个范式。]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="https://junxinzhang.com/assets/images/cover-20260808-rag-agentic-evolution.webp" /><media:content medium="image" url="https://junxinzhang.com/assets/images/cover-20260808-rag-agentic-evolution.webp" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">WorkBuddy 和 Codex 谁更强？你问错了</title><link href="https://junxinzhang.com/workbuddy-codex-positioning-threshold/" rel="alternate" type="text/html" title="WorkBuddy 和 Codex 谁更强？你问错了" /><published>2026-08-05T00:00:00+00:00</published><updated>2026-08-05T00:00:00+00:00</updated><id>https://junxinzhang.com/workbuddy-codex-positioning-threshold</id><content type="html" xml:base="https://junxinzhang.com/workbuddy-codex-positioning-threshold/"><![CDATA[<p>最近后台被问得最多的一个问题：</p>

<p><strong>WorkBuddy 和 Codex，到底谁更强？</strong></p>

<p>我的答案可能让两边粉丝都不爽：<strong>这个问题本身就问错了。</strong></p>

<p>一上来就问谁更强，就像问卡车和跑车谁更强。你先告诉我：你是要拉货，还是要下赛道？</p>

<blockquote>
  <p><strong>工具没有输赢，只有定位。而在国内，真正的分水岭不是能力，是上手门槛。</strong></p>
</blockquote>

<p><img src="/assets/images/cover-20260807-workbuddy-codex-positioning.webp" alt="WorkBuddy 和 Codex 谁更强？你问错了" />
<!-- baoyu-skill prompt: 2.35:1清线漫画+清新扁平封面，奶油到天蓝渐变底，干净描边，薄荷绿/蜜桃/天蓝平涂，留白充足。禁止品牌logo与深色赛博UI。左侧友好办公机器人举着Excel表格与PPT，标中文「WorkBuddy·办公」；右侧戴眼镜程序员机器人敲终端代码窗口，标中文「Codex·开发」；中间大大的问号被划掉，换成一把标尺，标尺上写中文「上手门槛」。中央粗体中文「别问谁更强，先问拿它干什么」。底部小字「定位不同，没有输赢」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="一先给结论我两个都用分工很清楚">一、先给结论：我两个都用，分工很清楚</h2>

<p>不搞悬念，直接上我自己的真实用法：</p>

<p><strong>复杂工程，我选 Codex；日常办公、做 PPT、远程调度又不想折腾，WorkBuddy 更顺手。</strong></p>

<table>
  <thead>
    <tr>
      <th>维度</th>
      <th>Codex</th>
      <th>WorkBuddy</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>出身</td>
      <td>为开发而生</td>
      <td>为办公而生</td>
    </tr>
    <tr>
      <td>典型任务</td>
      <td>复杂工程、多仓库协作、深度重构</td>
      <td>Excel、报表分析、PPT、远程调度</td>
    </tr>
    <tr>
      <td>依赖环境</td>
      <td>终端、runtime、网络、账号</td>
      <td>开箱即用</td>
    </tr>
    <tr>
      <td>目标用户</td>
      <td>码农、把 AI 用得更深的人</td>
      <td>普通白领、国内办公场景</td>
    </tr>
    <tr>
      <td>国内上手</td>
      <td>门槛极高</td>
      <td>门槛极低</td>
    </tr>
  </tbody>
</table>

<p>我八月一号写过 <a href="/codex-stitch-two-hours-three-ends-recall">用 Codex 两小时交三端</a>——那种活，WorkBuddy 碰都碰不了。但反过来，让一个从没开过终端的行政同事装 Codex？别闹了。</p>

<p>选择逻辑就一句话：</p>

<p><strong>普通白领用户选 WorkBuddy；码农或者想把 AI 用得更深的，选 Codex。</strong></p>

<p>定位不同，确实没必要硬分输赢。</p>

<h2 id="二门槛才是国内最现实的分水岭">二、门槛才是国内最现实的分水岭</h2>

<p>很多测评喜欢比模型能力、比 benchmark。但在国内的真实场景里，这些都排在第二位。</p>

<p><strong>排第一位的是：这个人能不能把工具跑起来。</strong></p>

<p>教 Codex，光网络和账号问题就能卡住 99% 的人。安装要终端，注册要海外手机号或邮箱，支付要外币卡，网络还要自己想办法——每一步都是一道劝退墙。国内非技术用户，光安装注册这一关就能被劝退大半。</p>

<p>而 WorkBuddy 呢？打开就能用。</p>

<p>所以我现在的建议非常简单粗暴：</p>

<p><strong>国内想要教别人用 AI，无脑 WorkBuddy 就完事了。合法、合规、合理。</strong></p>

<p>这不是说 Codex 不好——是说在「让一个普通人真正用上 AI」这件事上，<strong>可得性比能力更重要</strong>。一个跑不起来的顶级工具，价值等于零。</p>

<p><img src="/assets/images/illust-20260807-threshold-funnel.webp" alt="上手门槛漏斗" />
<!-- baoyu-skill prompt: 2.35:1清新知识漫画漏斗图，奶油底、清线描边扁平色。左侧一个大漏斗标中文「Codex 上手漏斗」，从上到下四层「想用 100人」「装好环境 30人」「搞定账号 10人」「真正跑通 1人」，漏斗口小人排队叹气；右侧一条平坦大道标中文「WorkBuddy：打开就能用」，小人轻松走过。顶部中文「门槛才是分水岭」；底部「跑不起来的顶级工具，价值等于零」。薄荷绿/蜜桃/天蓝平涂，中文清晰可读。禁止深色赛博风。 --ar 2.35:1 --></p>

<h2 id="三从推文里读到的几条信号">三、从推文里读到的几条信号</h2>

<p>这周刷到几条关于 WorkBuddy 和腾讯企业 AI 布局的公开讨论，信息密度不低。我没去现场聊，也没急着掏钱买企业席位——先把能核对的说法摊开，再叠自己的判断。</p>

<h3 id="1有人把它放到qq微信之后的位置">1）有人把它放到「QQ、微信之后」的位置</h3>

<p>圈子里传得最狠的一句话是：<strong>WorkBuddy 是腾讯历史上第三个战略级产品，前两个是 QQ 和微信，战略上抢的是企业 AI 的入口。</strong></p>

<p>这话要打折听——「战略级」最终由市场验证，不是由口号验证。但方向很清楚：如果腾讯真按这个级别押，它就不是一个「试试水」的工具型产品，而是下一个十年的入口卡位。</p>

<p>入口级产品的打法，通常不是先把硬核开发者伺候到爽，而是先把<strong>组织采购、合规、协同入口</strong>占住。这也解释了为什么它更像办公产品，而不是 Codex 那条开发原生路线。</p>

<h3 id="2企业-ai-转型每个人都有巨大的机会">2）企业 AI 转型，每个人都有巨大的机会</h3>

<p>把公开讨论里反复出现的路径压一下，企业觉醒基本是三段：</p>

<ol>
  <li><strong>超级个体先觉醒</strong>：让 AI 干活，人回归决策，效能直接翻 10 倍</li>
  <li><strong>能力外溢到团队</strong>：把方法分享给团队，整体提效 30%~50%</li>
  <li><strong>经验沉淀到组织</strong>：整个组织再提效 30%~50%，这已经是胜利</li>
</ol>

<p>但这里有个大坑：<strong>很多老板看到员工效能翻 10 倍，第一反应是裁人——这是最傻的，等于把最宝贵的人才赶走。</strong></p>

<p>反过来说，主动觉醒、先成为超级个体，才是每个人破局的关键。工具选 WorkBuddy 还是 Codex 是第二步；<strong>你自己有没有先把 AI 用进真实工作</strong>，才是第一步。</p>

<h3 id="3一个新岗位aibp">3）一个新岗位：AIBP</h3>

<p>过去有 HRBP，现在会有 <strong>AIBP（AI 伙伴）</strong>。</p>

<p>之前大家谈 FDE（驻场工程师），本质还是外包逻辑——派到企业做完转型，人一走，能力也带走了。</p>

<p>而 AIBP 是<strong>组织自己的人</strong>：老板把他派到一个部门，帮整个部门 Agent 化；效能提升了，再去下一个部门。这种长在组织内部的 AI 推手，现在极度稀缺。我的判断是：<strong>AIBP 比 FDE 更好。</strong></p>

<p>公开讨论里还有一条很土的供需错位：大厂和企业侧接触了大量需求，但<strong>能用 Agent 真正解决具体场景的人供给不上</strong>。这意味着：</p>

<ul>
  <li>会用 Agent 的人，比只会讲「赋能」的人值钱</li>
  <li>生态位缺口不在口号，在落地</li>
  <li>如果后续出现「走进腾讯」、架构师答疑、带业务骨干现场解题这类活动，本质也是在补这条供给链</li>
</ul>

<p>对我们自己的社群逻辑也一样：一边帮人把 Agent 用得更深，一边把用得好的人对接到真实企业场景——<strong>用得深的人挣到钱，企业拿到结果</strong>，才算闭环。</p>

<p><img src="/assets/images/illust-20260807-three-stage-awakening.webp" alt="超级个体三段觉醒" />
<!-- baoyu-skill prompt: 2.35:1清新知识漫画三段阶梯图，奶油底、清线描边。三级上升台阶，每级站一组小人：第一级中文「超级个体觉醒·效能×10」一个发光小人；第二级「外溢到团队·+30%~50%」三五个小人；第三级「沉淀到组织·再+30%~50%」一群小人围着知识库图标。台阶旁一个老板小人举着裁员牌被打上大红叉，标中文「看到10倍就裁人=最傻」。顶部「企业AI觉醒三段论」；底部「先成为超级个体，才是破局关键」。薄荷绿/天蓝/蜜桃平涂，中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="四说句不客气的workbuddy-满足的是付钱的老板">四、说句不客气的：WorkBuddy 满足的是付钱的老板</h2>

<p>信号看完，该说尖锐的了。对照它的产品形态和 Codex 那条开发原生路线，我必须说一句不太客气的话：</p>

<p><strong>WorkBuddy 是一款满足付钱的管理者，但还没有足够尊重底层使用者的软件。</strong></p>

<p>它精准命中了「付钱但不使用」的老板们对 AI 软件的全部预期：界面像个正经企业软件、数据在国内、能出报表、能对接组织架构、采购流程走得通。老板看一眼演示就愿意签单。</p>

<p>但对每天真正干活的人来说，它和 Codex 的差距是<strong>内核和底层</strong>的差距：</p>

<table>
  <thead>
    <tr>
      <th> </th>
      <th>WorkBuddy</th>
      <th>Codex</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>能力边界</td>
      <td>办公场景：Excel、报表分析、PPT</td>
      <td>完整工程能力：runtime、代码、长任务</td>
    </tr>
    <tr>
      <td>干活方式</td>
      <td>帮你把表做出来</td>
      <td>把整段工作委托出去</td>
    </tr>
    <tr>
      <td>天花板</td>
      <td>办公助手</td>
      <td>AI Native 的生产方式</td>
    </tr>
  </tbody>
</table>

<p>我昨天在 <a href="/agent-runtime-beyond-laptop-infrastructure">你的公司电脑，可能连 Agent 的门都进不了</a> 里写过：没有 runtime 的 Agent 就是个聊天框。WorkBuddy 目前的形态，离 AI Native 的真实价值——让 AI 真正接管整段工作、人回归决策——还有一段不小的距离。</p>

<p><strong>它满足了老板的预期，但还没满足 AI Native 的价值。</strong> 这一刀我必须切在这里，不然前面的夸就成了软文。</p>

<h2 id="五但窗口期是真的半年到一年">五、但窗口期是真的：半年到一年</h2>

<p>批评归批评，我的整体判断反而是乐观的：<strong>WorkBuddy 大有可为。</strong></p>

<p>原因有三：</p>

<p><strong>第一，它是更适合中国宝宝体质的 Agent 工具。</strong> 合法合规、开箱即用、数据不出境——这三条在国内企业采购里是一票否决项，它全过。</p>

<p><strong>第二，生态已经打通了国内外的一部分。</strong> 后续就是生态位的抢占：谁能打通得多，谁就先占住用户心智。企业 AI 入口这个位置，先到先得。</p>

<p><strong>第三，窗口期还在。</strong> 昨天我写了 Harness 层即将过时——本地笔记本级别的 Agent 工具很快会被下一代运行方式取代。但那是前沿玩家的时间表。<strong>对国内市场，至少还有半年到一年的窗口期。</strong> 这段时间里，谁能把「门槛低 + 合规 + 生态」三件事做扎实，谁就能在下一轮范式切换前攒下足够的用户资产。</p>

<p><img src="/assets/images/illust-20260807-window-period.webp" alt="生态位窗口期" />
<!-- baoyu-skill prompt: 2.35:1清新知识漫画时间轴图，奶油到天蓝渐变底、清线描边。一条水平时间轴，左端标中文「现在」，右端标「6~12个月后·范式切换」；轴上一扇缓缓关闭的大门标中文「窗口期」，门内一个友好机器人正在插旗抢占山头，山头分别标中文「合规」「低门槛」「生态」；远处地平线上一朵云标「下一代Agent运行方式」。顶部「谁打通得多，谁先占心智」；底部「窗口期半年到一年，先到先得」。薄荷绿/蜜桃/天蓝平涂，中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="写在最后">写在最后</h2>

<p>压成五句：</p>

<ol>
  <li><strong>别问谁更强，先问拿它干什么</strong>——复杂工程选 Codex，日常办公选 WorkBuddy，定位不同没有输赢</li>
  <li><strong>国内真正的分水岭是上手门槛</strong>——光网络和账号，就能把 99% 的非技术用户挡在 Codex 门外</li>
  <li><strong>公开讨论里它被放到 QQ、微信之后的战略级位置</strong>——抢的是企业 AI 的入口，方向比口号更重要</li>
  <li><strong>尖锐的一刀</strong>——它满足了付钱的老板，但离 AI Native 的真实价值还有距离，差距在内核和底层</li>
  <li><strong>窗口期半年到一年</strong>——门槛低 + 合规 + 生态三件事做扎实，就能在范式切换前占住心智</li>
</ol>

<p>土话一句：</p>

<p><strong>教普通人用 AI，无脑 WorkBuddy；自己想变强，老老实实上 Codex。</strong></p>

<p>我一个人打造的 <a href="https://zaokit.ai">Zaokit AI Agent 交易平台</a>，以及 AI PPT / 图文创作 <a href="https://zaokit.app">Zaokit.app</a>，做的就是同一件事：把门槛降下来，让真实工作流直接用上稳定的 AI 能力。唯一网站：<a href="https://zaokit.app">https://zaokit.app</a>。</p>

<p>企业侧同一逻辑，已经融进可直接接入的服务：</p>

<ul>
  <li><a href="https://grok.zaokit.com">grok.zaokit.com</a></li>
  <li><a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a></li>
  <li><a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a></li>
  <li><a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a></li>
  <li><a href="https://junxinzhang.com/projects.html">完整产品列表</a></li>
</ul>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<p>如果你认可 Zaokit AI 的产品理念，欢迎后台留言加入社群。<strong>我们不卖课、不割韭菜，只聚焦 ToB 企业场景的 AI 落地实战。</strong> 希望在这里，能给你带来不一样的思维火花和真实的商业碰撞。</p>

<hr />

<p>延伸：<a href="/agent-runtime-beyond-laptop-infrastructure">你的公司电脑，可能连 Agent 的门都进不了</a> · <a href="/agentic-org-vs-informatization-six-months">组织还在信息化，别人已经在跑智能体</a> · <a href="/codex-stitch-two-hours-three-ends-recall">产品召回三端，我用 Codex 和 Stitch 两小时交了</a></p>

<hr />

<table>
  <tbody>
    <tr>
      <td>唯一网站：<a href="https://zaokit.app">Zaokit.app</a></td>
      <td>Agent 交易平台：<a href="https://zaokit.ai">Zaokit.ai</a></td>
    </tr>
  </tbody>
</table>

<p>企业 Grok 服务：<a href="https://grok.zaokit.com">grok.zaokit.com</a></p>

<p>企业服务：<a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a> · <a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a> · <a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a> · <a href="https://junxinzhang.com/projects.html">完整产品列表</a></p>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p><em>我是 Jason，自己一个人做 AI 产品。工具的输赢是伪命题，人的定位才是真问题——你是要教会一百个人用 AI，还是让自己深一百倍。</em></p>]]></content><author><name>Jason Zhang</name></author><category term="AI" /><category term="featured" /><category term="AI" /><category term="WorkBuddy" /><category term="Codex" /><category term="腾讯" /><category term="Agent" /><category term="企业AI" /><category term="AIBP" /><category term="上手门槛" /><category term="生态位" /><category term="Zaokit" /><summary type="html"><![CDATA[最近一直被问 WorkBuddy 和 Codex 谁更强。答案是：问错了。复杂工程我选 Codex，日常办公、做 PPT、 远程调度不想折腾，WorkBuddy 更顺手。国内真正的分水岭不是能力，是上手门槛——光网络和账号， 就能把 99% 的非技术用户挡在 Codex 门外。]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="https://junxinzhang.com/assets/images/cover-20260807-workbuddy-codex-positioning.webp" /><media:content medium="image" url="https://junxinzhang.com/assets/images/cover-20260807-workbuddy-codex-positioning.webp" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">你的公司电脑，可能连 Agent 的门都进不了</title><link href="https://junxinzhang.com/agent-runtime-beyond-laptop-infrastructure/" rel="alternate" type="text/html" title="你的公司电脑，可能连 Agent 的门都进不了" /><published>2026-08-04T00:00:00+00:00</published><updated>2026-08-04T00:00:00+00:00</updated><id>https://junxinzhang.com/agent-runtime-beyond-laptop-infrastructure</id><content type="html" xml:base="https://junxinzhang.com/agent-runtime-beyond-laptop-infrastructure/"><![CDATA[<p>最近在外企工作的朋友问我：你天天说 Agent 能干这干那，我公司电脑连 Claude Code 都装不上，怎么玩？</p>

<p><strong>不是你不想装。是公司设备根本不给你装。</strong></p>

<p>没有管理员权限，没有 Node 环境，没有 Python runtime，git 凭证走公司代理读不到，连终端都是阉割版。你有一个最聪明的大脑，但它没有手、没有眼睛、读不到你桌上的任何一张纸。</p>

<p>这不是 IT 在刁难你。这是一个更大的问题的缩影：</p>

<blockquote>
  <p><strong>Agent 的运行环境，正在从「个人电脑上的一个程序」升级成需要专属基础设施的重系统。你的笔记本，可能真的不够用了。</strong></p>
</blockquote>

<p><img src="/assets/images/cover-20260806-agent-runtime-beyond-laptop.webp" alt="你的公司电脑，可能连 Agent 的门都进不了" /></p>

<h2 id="一没有-runtime-的-agent就是个聊天框">一、没有 runtime 的 Agent，就是个聊天框</h2>

<p>先把问题摊开。为什么 Agent 不是装个 app 就完事？</p>

<p>Agent 要真正帮你干活，至少需要四样东西：</p>

<table>
  <thead>
    <tr>
      <th>需要</th>
      <th>干什么</th>
      <th>公司电脑给不给</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td><strong>本地 runtime</strong></td>
      <td>跑脚本、装依赖、起服务</td>
      <td>多数锁死</td>
    </tr>
    <tr>
      <td><strong>凭证与身份</strong></td>
      <td>读 git 仓库、调 API、访问内部系统</td>
      <td>代理+白名单拦住</td>
    </tr>
    <tr>
      <td><strong>文件系统访问</strong></td>
      <td>读你的代码、改你的文件、写测试</td>
      <td>部分只读或沙箱</td>
    </tr>
    <tr>
      <td><strong>持久进程</strong></td>
      <td>长任务不断、状态不丢</td>
      <td>休眠策略会杀掉</td>
    </tr>
  </tbody>
</table>

<p>少了任何一样，Agent 就退化成聊天框——你问它一句，它答你一句，但它<strong>干不了活</strong>。</p>

<p>这就是为什么很多人装了 Copilot 觉得「也就那样」：不是模型不行，是<strong>运行环境被阉割了</strong>，模型的手脚被绑住了。</p>

<p>想象一下：你招了一个顶级程序员，但不给他电脑、不给他代码权限、不让他进办公室。他能帮你干什么？最多隔着门给你喊两句建议。</p>

<p>这就是今天大部分外企员工用 AI 的真实状态。</p>

<p><img src="/assets/images/illust-20260806-agent-no-runtime.webp" alt="没有 runtime 的 Agent 就是个聊天框" /></p>

<h2 id="二纯云端能完成-100-的工作吗">二、纯云端能完成 100% 的工作吗？</h2>

<p>有人会说：那直接用云端 Agent 不就行了？Codex 不就是云端跑的吗？</p>

<p>云端 Agent 能做很多事。但它有一个结构性的短板：</p>

<p><strong>它不在你的工作现场。</strong></p>

<p>你的项目状态、你的 <code class="language-plaintext highlighter-rouge">.env</code> 文件、你本地分支上昨晚改到一半的代码、你私有仓库的访问令牌、你跑了三天才配好的开发环境——这些东西不在云端。</p>

<table>
  <thead>
    <tr>
      <th>云端 Agent 能做</th>
      <th>云端 Agent 做不到</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>通用代码生成</td>
      <td>读你本地未提交的代码</td>
    </tr>
    <tr>
      <td>沙箱内运行测试</td>
      <td>用你的数据库凭证连真实环境</td>
    </tr>
    <tr>
      <td>独立 repo 的任务</td>
      <td>跨多个私有仓库协作</td>
    </tr>
    <tr>
      <td>标准环境的项目</td>
      <td>你公司特殊的构建链和 CI</td>
    </tr>
  </tbody>
</table>

<p>WorkBuddy 也好、Codex 也好、任何云端方案——<strong>不带本地 runtime 的 Agent，永远差最后一公里。</strong></p>

<p>真正高效的 Agent 工作流，是<strong>本地与云端的混合体</strong>：本地 harness 读你的状态、管你的凭证、守你的上下文；云端提供算力、推理、长任务执行。缺任何一端，都跑不满。</p>

<p>这不是理论讨论。我自己每天用 Claude Code 和 Codex，最大的体感就是：<strong>本地 runtime 才是 Agent 能力的地基。</strong> 没有它，再强的模型也只是在空中画饼。</p>

<h2 id="三有人已经看到了下一跳">三、有人已经看到了下一跳</h2>

<p>现在说一件更大的事。</p>

<p>8 月 4 日，科技领域知名创作者 <strong>Tibo</strong>（<a href="https://x.com/thsottiaux">@thsottiaux</a>）在 X 上发了一条帖子，<strong>1.6M 浏览</strong>，原文是：</p>

<blockquote>
  <p><strong>Given some of the results I’m seeing recently, it’s pretty clear Codex is a good harness. But it will seem primitive in 2-3 months and we’re about to go through another major evolution in how we use AI at the frontier. The next generation of models need more than your laptop.</strong></p>
</blockquote>

<p><img src="/assets/images/screenshot-20260806-tibo-codex-harness.webp" alt="Tibo (@thsottiaux) on X — 1.6M 浏览" /></p>

<p>翻译成大白话：<strong>他最近看到的一些结果表明，Codex 确实是个好工具——但两三个月后它就会显得原始。我们即将经历又一次 AI 使用方式的重大演化。下一代模型需要的，不止是你的笔记本。</strong></p>

<p>这条帖子引爆了讨论，因为它点出了三层意思：</p>

<p><strong>第一层：Codex 不是终态，只是一个过渡性的好工具。</strong></p>

<p>Codex 已经很能干了——我八月一号写过 <a href="/codex-stitch-two-hours-three-ends-recall">用 Codex 两小时交三端</a>，体感杠杆约 50 倍。但即便如此，在前沿玩家的眼里，它已经是「很快会显得原始」的东西。</p>

<p><strong>第二层：使用方式要再跳一次台阶，不是线性小改。</strong></p>

<p>不是「Codex 变快一点、聪明一点」，而是整个使用范式要变。就像从 ChatGPT 聊天到 Agent 自主执行是一次跳跃，下一次跳跃的量级至少一样大。</p>

<p><strong>第三层：本地笔记本级别的 harness 很快触到天花板。</strong></p>

<p>这才是最关键的一句。下一代模型的能力已经强到，单靠本地笔记本电脑的算力加上简单的 Agent 循环，已经不够用了。</p>

<p><img src="/assets/images/illust-20260806-codex-just-beginning.webp" alt="Codex 只是起点，不是终态" /></p>

<h2 id="四为什么你的笔记本不够用了">四、为什么你的笔记本不够用了</h2>

<p>把技术细节摊开，不绕概念。</p>

<p><strong>问题不是模型太笨，而是模型太能干。</strong></p>

<p>当 Agent 能力跳到下一代，它不是只帮你写一个函数、改一个 bug。它要同时做的事可能是：</p>

<ul>
  <li>并行跑 10 个子任务，每个都需要独立的运行环境</li>
  <li>持续运行数小时，不能因为你合上笔记本就断掉</li>
  <li>调用多个外部工具和 API，每个都有自己的认证链路</li>
  <li>维持跨任务的记忆和状态，不是每次从零开始</li>
  <li>遇到卡点时自动 escalate 到更强模型或人工审批</li>
</ul>

<p>一台笔记本能扛住一个 Agent 跑一个任务。但如果你有一百个任务呢？</p>

<p><strong>你需要不止一台电脑。否则会卡死，会 OOM，会网络超时。</strong></p>

<p>这就是为什么 Agent 的运行环境正在升级：</p>

<table>
  <thead>
    <tr>
      <th>现在</th>
      <th>很快</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>笔记本上装一个 CLI</td>
      <td>需要专属算力实例</td>
    </tr>
    <tr>
      <td>单 Agent 单任务</td>
      <td>多 Agent 并行协作</td>
    </tr>
    <tr>
      <td>跑完关掉</td>
      <td>7×24 持续运行</td>
    </tr>
    <tr>
      <td>状态在内存里</td>
      <td>需要持久化状态和记忆系统</td>
    </tr>
    <tr>
      <td>简单工具调用</td>
      <td>复杂工具生态 + 权限管理</td>
    </tr>
    <tr>
      <td>人盯着终端看</td>
      <td>需要可观测 + 自动告警</td>
    </tr>
  </tbody>
</table>

<p>换句话说：</p>

<p><strong>Agent 正在从「你电脑上的一个程序」，变成「一套需要基础设施支撑的系统」。</strong></p>

<p>就像网站从单机部署到上云、到微服务、到 K8s，Agent 的运行环境也在走同一条路——只不过快得多。</p>

<p><img src="/assets/images/illust-20260806-runtime-evolution.webp" alt="Agent 运行环境升级路线" /></p>

<h2 id="五这件事对你意味着什么">五、这件事对你意味着什么</h2>

<p>别把上面这些当远期预测。两三个月，很快。</p>

<h3 id="1外企员工别等-it-开口先把本地环境搞定">1）外企员工：别等 IT 开口，先把本地环境搞定</h3>

<p>如果你的公司电脑跑不了 Agent，那就用自己的设备。一台能装 Claude Code 或 Codex CLI 的开发机，现在是<strong>生产力工具</strong>，不是爱好。</p>

<p>这不是空话。三月我写过 <a href="/agent-arms-race-650-dollars-per-month">Agent 军备竞赛：每月 650 刀，还得再入一台 M5 Pro</a>：M2 Max 扛不住多 Agent 并行，只能再加一台 64G M5 Pro 专门跑 Agent 集群。六月又写了 <a href="/ai-storage-baseline-macbook-price-up">那台 M5 Pro 三个月涨了 6000</a>——内存和存储才是 AI 时代真正在变贵的东西。</p>

<p>工作电脑搞不定的，先用个人设备把非敏感任务跑通。等公司策略跟上来，你已经有了成熟的工作流可以平移。</p>

<h3 id="2技术负责人agent-基础设施该提上日程了">2）技术负责人：Agent 基础设施该提上日程了</h3>

<p>不是「给每个人买个 Copilot 账号」就叫 Agent 化。你需要考虑的是：</p>

<ul>
  <li>Agent 跑在哪里？本地还是云端？混合比例怎么分？</li>
  <li>凭证和权限怎么安全地交给 Agent？</li>
  <li>长任务怎么管理、怎么监控、怎么回滚？</li>
  <li>成本怎么控制——100 个 Agent 并行跑，token 费用谁买单？</li>
</ul>

<p>我昨天写过 <a href="/agentic-org-vs-informatization-six-months">组织还在信息化，别人已经在跑智能体</a>：工具已经换成 Agent 了，但组织图纸还是信息化时代的。Agent 基础设施也一样——<strong>你不能用管「桌面应用」的方式管 Agent。</strong></p>

<h3 id="3所有人理解运行环境比理解模型更重要">3）所有人：理解「运行环境」比理解「模型」更重要</h3>

<p>大部分讨论聚焦在模型多聪明、参数多大、评测多高。但在实际工作中，瓶颈往往不是模型——</p>

<p><strong>而是 Agent 有没有手、有没有眼睛、有没有一个不会被杀掉的进程。</strong></p>

<p>模型是大脑。运行环境是身体。没有身体的大脑，干不了活。</p>

<h2 id="写在最后">写在最后</h2>

<p>压成五句：</p>

<ol>
  <li><strong>外企办公设备装不了本地 Agent 环境——没有 runtime、没有凭证、没有持久进程，Agent 就是个聊天框</strong></li>
  <li><strong>纯云端也补不全——你的项目状态、本地代码、私有凭证不在云上</strong></li>
  <li><strong>Tibo 那条 1.6M 帖子说得很直白：Codex 两三个月后会显得原始，下一代模型需要的不止是笔记本</strong></li>
  <li><strong>Agent 正在从「个人电脑上的程序」升级成「需要基础设施支撑的系统」</strong></li>
  <li><strong>理解运行环境，比理解模型参数更重要——模型是大脑，环境是身体</strong></li>
</ol>

<p>土话一句：</p>

<p><strong>别再争哪个模型更聪明了。先问问你的 Agent，有没有一台不会被公司 IT 杀掉的电脑。</strong></p>

<p>我一个人打造的 <a href="https://zaokit.ai">Zaokit AI Agent 交易平台</a>，以及 AI PPT / 图文创作 <a href="https://zaokit.app">Zaokit.app</a>，做的就是帮你不需要折腾本地环境，直接用上稳定靠谱的 AI 能力。唯一网站：<a href="https://zaokit.app">https://zaokit.app</a>。</p>

<p>企业侧同一逻辑，已经融进可直接接入的服务：</p>

<ul>
  <li><a href="https://grok.zaokit.com">grok.zaokit.com</a></li>
  <li><a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a></li>
  <li><a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a></li>
  <li><a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a></li>
  <li><a href="https://junxinzhang.com/projects.html">完整产品列表</a></li>
</ul>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<p>如果你认可 Zaokit AI 的产品理念，欢迎后台留言加入社群。<strong>我们不卖课、不割韭菜，只聚焦 ToB 企业场景的 AI 落地实战。</strong> 希望在这里，能给你带来不一样的思维火花和真实的商业碰撞。</p>

<hr />

<p>延伸：<a href="/agent-arms-race-650-dollars-per-month">Agent 军备竞赛：每月 650 刀，还得再入一台 M5 Pro</a> · <a href="/ai-storage-baseline-macbook-price-up">我那台 M5 Pro，三个月涨了 6000</a> · <a href="/codex-stitch-two-hours-three-ends-recall">产品召回三端，我用 Codex 和 Stitch 两小时交了</a> · <a href="/agentic-org-vs-informatization-six-months">组织还在信息化，别人已经在跑智能体</a></p>

<p>公开参考：<a href="https://x.com/thsottiaux">Tibo (@thsottiaux) on X — Codex harness 原文</a></p>

<hr />

<table>
  <tbody>
    <tr>
      <td>唯一网站：<a href="https://zaokit.app">Zaokit.app</a></td>
      <td>Agent 交易平台：<a href="https://zaokit.ai">Zaokit.ai</a></td>
    </tr>
  </tbody>
</table>

<p>企业 Grok 服务：<a href="https://grok.zaokit.com">grok.zaokit.com</a></p>

<p>企业服务：<a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a> · <a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a> · <a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a> · <a href="https://junxinzhang.com/projects.html">完整产品列表</a></p>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p><em>我是 Jason，自己一个人做 AI 产品。Agent 再聪明，没有运行环境就是空谈。大脑要有身体，才能干活。</em></p>]]></content><author><name>Jason Zhang</name></author><category term="AI" /><category term="featured" /><category term="AI" /><category term="Agent" /><category term="Codex" /><category term="Claude Code" /><category term="运行环境" /><category term="基础设施" /><category term="本地Agent" /><category term="云端推理" /><category term="Zaokit" /><summary type="html"><![CDATA[外企办公设备装不了本地 Agent、读不到凭证、跑不了 runtime——这不是 IT 刁难你，是 Agent 的运行环境 正在从「个人电脑上的一个程序」升级成需要专属基础设施的重系统。下一代模型的能力已经强到， 单靠本地笔记本电脑 + 简单循环已经不够用了。]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="https://junxinzhang.com/assets/images/cover-20260806-agent-runtime-beyond-laptop.webp" /><media:content medium="image" url="https://junxinzhang.com/assets/images/cover-20260806-agent-runtime-beyond-laptop.webp" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">组织还在信息化，别人已经在跑智能体</title><link href="https://junxinzhang.com/agentic-org-vs-informatization-six-months/" rel="alternate" type="text/html" title="组织还在信息化，别人已经在跑智能体" /><published>2026-08-03T00:00:00+00:00</published><updated>2026-08-03T00:00:00+00:00</updated><id>https://junxinzhang.com/agentic-org-vs-informatization-six-months</id><content type="html" xml:base="https://junxinzhang.com/agentic-org-vs-informatization-six-months/"><![CDATA[<p>最近和企业侧聊落地，我越来越常碰到同一种错位：</p>

<p><strong>工具已经换成 Agent 了，组织图纸还是信息化时代的。</strong></p>

<p>一边是：主代理拆任务、子代理调工具、人在关键节点审批；<br />
另一边还在：岗位职责 → 员工登录系统 → 人工跑流程 → 系统存结果。</p>

<p>这不是「AI 用得不够多」，是<strong>组织运行单元还没换</strong>。</p>

<blockquote>
  <p><strong>新组织模型，需要新架构。产品和组织，都该按面向未来六个月来建。</strong></p>
</blockquote>

<p><img src="/assets/images/cover-20260805-agentic-org-six-months.webp" alt="组织还在信息化，别人已经在跑智能体" />
<!-- baoyu-skill prompt: 2.35:1大胆红色高对比封面，朱红到深红渐变，黑白辅色，粗线扁平信息图，中文清晰。左侧灰冷方块金字塔裂开标中文「信息化模型」；右侧鲜红多智能体网络外扩标中文「智能体组织」；中央粗体中文「组织图纸该换了」；顶部「面向未来6个月」；底部「流程驱动→目标驱动」。禁止品牌logo与深色赛博玻璃拟态。 --ar 2.35:1 --></p>

<h2 id="一先把两种模型摊开">一、先把两种模型摊开</h2>

<p>很多人嘴里的「上 AI」，其实还是把大模型塞进旧骨架。先对照，不绕概念。</p>

<table>
  <thead>
    <tr>
      <th>维度</th>
      <th>传统企业信息化模型</th>
      <th>智能体组织模型</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>中心</td>
      <td>岗位 + 流程</td>
      <td>目标 + 能力</td>
    </tr>
    <tr>
      <td>执行主体</td>
      <td>人为主，系统记账</td>
      <td>人类员工 + AI 智能体协同</td>
    </tr>
    <tr>
      <td>驱动方式</td>
      <td>流程驱动、节点推进</td>
      <td>目标驱动、智能体协同执行</td>
    </tr>
    <tr>
      <td>人的位置</td>
      <td>每个环节都上手</td>
      <td>关键节点审批、定边界、做验收</td>
    </tr>
    <tr>
      <td>系统角色</td>
      <td>登录、填单、保存结果</td>
      <td>给目标/规则/权限/知识/工具，记录全过程</td>
    </tr>
    <tr>
      <td>优化方向</td>
      <td>把已知流程跑得更快</td>
      <td>把可委托工作稳定委托出去</td>
    </tr>
  </tbody>
</table>

<p>信息化模型的典型链路很熟悉：</p>

<ol>
  <li>组织架构</li>
  <li>岗位职责</li>
  <li>员工登录系统</li>
  <li>人工操作流程</li>
  <li>系统保存结果</li>
</ol>

<p>特点：<strong>流程驱动 · 人工为主 · 被动执行</strong>。效率高度依赖「人有没有按节点点完」。</p>

<p>智能体组织的链路更像：</p>

<ol>
  <li>组织架构（仍在，但变薄）</li>
  <li>人类员工 + AI 智能体</li>
  <li>目标、规则、权限、知识、工具</li>
  <li>智能体协同执行</li>
  <li>人工审批关键节点</li>
  <li>系统记录全过程</li>
</ol>

<p>特点：<strong>协同驱动 · 智能执行 · 持续优化</strong>。人从「操作员」往「编排者 / 终审者」挪。</p>

<p>核心差异可以压成三句：</p>

<ul>
  <li><strong>执行主体</strong>：人工执行 → 智能体协同</li>
  <li><strong>驱动方式</strong>：流程驱动 → 目标驱动</li>
  <li><strong>价值创造</strong>：效率提升 → 价值创新（能接住更复杂、更并行的工作）</li>
</ul>

<p><img src="/assets/images/illust-20260805-two-org-models.webp" alt="传统信息化 vs 智能体组织" />
<!-- baoyu-skill prompt: 2.35:1大胆红色知识对比图。左栏灰+暗红中文「信息化模型」五步「组织架构→岗位职责→登录系统→人工流程→保存结果」；右栏鲜红中文「智能体组织」六步「组织→人+智能体→目标规则权限知识工具→协同执行→人审关键点→全程记录」；中央箭头「模型换了，架构必须换」；顶「从流程驱动到目标驱动」；底「岗位中心→能力中心」。粗线扁平，中文清晰。 --ar 2.35:1 --></p>

<h2 id="二为什么换工具换不出新组织">二、为什么「换工具」换不出新组织</h2>

<p>七月我写过 <a href="/enterprise-agent-build-choose-token-hub">企业端 Agent 怎么建、怎么选</a>：工具可以分部门，心脏只能有一颗。那篇钉的是 <strong>Token Hub 与使用轨迹</strong>。</p>

<p>这篇补另一半：</p>

<p><strong>就算工具选对了，若组织仍按信息化模型运行，Agent 最多变成「更聪明的填表工」。</strong></p>

<p>你会看到这些土现象：</p>

<ul>
  <li>全员发了助手账号，工作流一张没重画</li>
  <li>审批链还是七层，AI 只在第 0 层帮写邮件</li>
  <li>权限按岗位锁死，智能体调不动真实系统</li>
  <li>验收标准仍是「有没有走完流程」，不是「目标有没有完成」</li>
  <li>试点很多，规模化很少——因为竖井还在，结果责任还在旧 org chart 上</li>
</ul>

<p>信息化解决的是：<strong>业务线上化</strong>。<br />
智能体化要解决的是：<strong>工作可委托化</strong>——在可信边界内，把整段工作委托给能规划、能用工具的系统。</p>

<p>委托不出去，就不是智能体组织；只是信息化系统上多挂了一个聊天窗。</p>

<h2 id="三claude-那条纪律面向未来六个月">三、Claude 那条纪律：面向未来六个月</h2>

<p>产品侧有一条已经反复被验证的纪律，值得组织侧直接抄作业。</p>

<p>公开讨论里，Claude Code 一脉的产品与工程实践，核心不是「等更强模型再动手」，而是：</p>

<blockquote>
  <p><strong>别只为今天的模型能力建产品；要为六个月后更强、更稳、更长程的模型预留接口与空间。</strong></p>
</blockquote>

<p>翻译成工程土话：</p>

<ul>
  <li>今天模型还差一点的地方，先用清晰工具、清晰目标、清晰验收顶住</li>
  <li>交互与编排不要写死在「当前只会单轮问答」的假设上</li>
  <li>模型一跃迁，你删的是临时补丁，留下的是工作流、权限、数据契约和评测</li>
</ul>

<p>Anthropic 工程侧也公开过多 Agent Research 系统（orchestrator–worker）：主代理定策略、派活，子代理并行检索与处理，再回收综合。内部研究评测上，多 Agent 配置相对单 Agent 有大幅提升；同时多 Agent 更费 token，适合高价值、可并行、信息面宽的任务，不适合强耦合、强实时共享上下文的活。出处：<a href="https://www.anthropic.com/engineering/multi-agent-research-system">How we built our multi-agent research system</a>。</p>

<p>对企业组织，这句话几乎一一对应：</p>

<table>
  <thead>
    <tr>
      <th>产品侧（面向 6 个月）</th>
      <th>组织侧（面向 6 个月）</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>接口松耦合，模型可换</td>
      <td>工具与权限层可替换，不绑死一家助手</td>
    </tr>
    <tr>
      <td>目标与完成条件一等公民</td>
      <td>考核从「走完流程」转向「目标闭环」</td>
    </tr>
    <tr>
      <td>可观测、可接管</td>
      <td>轨迹、审计、人工升级路径必须先有</td>
    </tr>
    <tr>
      <td>为并行与多角色留槽位</td>
      <td>work chart 预留主代理 / 子代理 / 人审节点</td>
    </tr>
    <tr>
      <td>定期删除过时约束</td>
      <td>模型变强后，减少不必要的人工确认</td>
    </tr>
  </tbody>
</table>

<p><strong>以前是 Claude 这类团队面向未来六个月做产品；今天，公司和组织都需要面向未来，构建自己的组织架构。</strong></p>

<p><img src="/assets/images/illust-20260805-build-for-six-months.webp" alt="面向未来六个月去建" />
<!-- baoyu-skill prompt: 2.35:1大胆红色时间轴信息图。左小圈中文「今天的能力」；中虚线箭头；右大红圈中文「6个月后的能力」；产品与组织架构画在大红圈上；角标「预留接口·别写死」；顶「别只为今天建」；底「模型跃迁时，你该吃红利而不是推倒重来」。朱红主色、黑白辅、粗线扁平、中文清晰。 --ar 2.35:1 --></p>

<h2 id="四新架构到底改什么">四、新架构到底改什么</h2>

<p>别一上来画「全公司 Agent 中台蓝图」。架构问题可以落成五层，每层只问土问题。</p>

<h3 id="1目标层完成条件写清楚了吗">1）目标层：完成条件写清楚了吗？</h3>

<p>智能体组织以目标为中心。目标含糊，代理只会高效地跑偏。</p>

<p>要写的不是「提升客户满意度」，而是：</p>

<ul>
  <li>输入是什么</li>
  <li>输出长什么样</li>
  <li>什么叫完成</li>
  <li>什么情况必须停下来找人</li>
</ul>

<h3 id="2工具与权限层代理有手吗">2）工具与权限层：代理有手吗？</h3>

<p>没有稳定 API、没有清晰权限、工具描述写给人自己都看不懂——代理等于没手。</p>

<p>信息化时代的权限是「人能不能点这个按钮」；<br />
智能体时代还要回答「<strong>哪个代理、在什么目标下、能调哪些工具、留下什么审计</strong>」。</p>

<h3 id="3协同层单代理还是多代理">3）协同层：单代理还是多代理？</h3>

<p>不是所有活都要上多 Agent。可并行、面宽、超单上下文的，才值得 orchestrator–worker。</p>

<p>协同层要设计的是：</p>

<ul>
  <li>谁拆任务</li>
  <li>谁执行</li>
  <li>谁挑错 / 谁复核</li>
  <li>卡住时升级到更强模型还是升级到人</li>
</ul>

<p>我在 <a href="/workflow-agent-programmer-vs-boss">程序员在提效，老板在赚钱</a> 里写过：先别急着分 Workflow 和 Agent 的名词，先分清谁在为结果付钱。组织架构同理——名词不重要，<strong>结果责任和委托边界</strong>重要。</p>

<h3 id="4人机边界层人在环里还是在环上">4）人机边界层：人在环里，还是在环上？</h3>

<p>关键节点必须人批：合规口径、资金动作、对外承诺、不可逆变更。<br />
其余能委托的，尽量委托；否则你只是用 AI 加快了人工流水线。</p>

<p>人的新工作不是「把每个按钮再点一遍」，而是：</p>

<ul>
  <li>定目标与边界</li>
  <li>审异常与高风险</li>
  <li>改规则与工具</li>
  <li>对最终结果负责</li>
</ul>

<h3 id="5平台层有没有一颗心脏">5）平台层：有没有一颗心脏？</h3>

<p>七月那篇的 Token Hub 判断仍然：模型会换、工具会换，<strong>使用轨迹、成本、权限、成功失败模式</strong>要能收拢。没有观测与成本，智能体工厂很快变成账单炸弹；没有轨迹，组织能力沉淀不下来。</p>

<p><img src="/assets/images/illust-20260805-five-layers.webp" alt="智能体组织五层架构" />
<!-- baoyu-skill prompt: 2.35:1大胆红色分层架构图，五层横条由上到下中文「目标层」「工具与权限层」「协同层」「人机边界层」「平台层（轨迹·成本·观测）」；右侧小标「可替换·可审计·可升级」；顶「新组织模型的新架构」；底「先重画价值链，再谈全公司平台」。朱红/黑白、粗线扁平、中文清晰。 --ar 2.35:1 --></p>

<h2 id="五六个月内组织至少能动的五刀">五、六个月内，组织至少能动的五刀</h2>

<p>不用等完美中台。按反馈环从短到长排：</p>

<p><strong>1. 选一条高价值、可并行的价值链，按智能体重画</strong><br />
客服质检、研报初稿、合同初审、数据核对、代码迁移……用「主代理 + 子代理 + 人终审」跑通一条，而不是全公司口号式上 AI。</p>

<p><strong>2. 把工具生态当组织资产建</strong><br />
API 稳定、权限清晰、描述写给人<em>和</em>代理都能懂。工具描述含糊，代理就会乱走——和招了一个没手册的新员工一样。</p>

<p><strong>3. 写清人机边界，并写进制度</strong><br />
哪些必须人批，哪些代理可自动，哪些要双人复核。没有边界的「全自动」，最后一定是全不敢用。</p>

<p><strong>4. 考核从「有没有系统」转向「委托闭环」</strong><br />
看单位目标的代理完成率、人工介入率、周期时间、一次通过率。信息化 KPI 是上线率；智能体时代更要看<strong>委托出去的工作有多少真正闭环</strong>。</p>

<p><strong>5. 架构评审加一条硬标准</strong><br />
「若模型能力在六个月后明显增强，我们今天的设计是加速器还是刹车？」答不上来的方案，慎上。</p>

<p><img src="/assets/images/illust-20260805-six-month-checklist.webp" alt="六个月组织动作清单" />
<!-- baoyu-skill prompt: 2.35:1大胆红色清单信息图。五条横向大红条目中文「1重画一条价值链」「2工具生态资产化」「3写清人机边界」「4考核委托闭环」「5架构评审问6个月后」；右侧印章「面向未来建组织」；顶「六个月内至少动这五刀」；底「先跑通一条，再复制模式」。朱红主色、粗线扁平、中文清晰。 --ar 2.35:1 --></p>

<h2 id="写在最后">写在最后</h2>

<p>压成五句：</p>

<ol>
  <li><strong>很多组织已在迁向智能体协同</strong>——你若还停在岗位流程系统记账，跑的是旧内核</li>
  <li><strong>信息化 ≠ 智能体化</strong>——前者线上化业务，后者把工作可委托化</li>
  <li><strong>新模型需要新架构</strong>——目标、工具权限、协同、人机边界、平台五层要一起改</li>
  <li><strong>面向未来六个月</strong>——别把组织接口写死在今天的助手能力上</li>
  <li><strong>先重画一条价值链</strong>——全公司口号，不如一条可量化的委托闭环</li>
</ol>

<p>土话一句：</p>

<p><strong>别用 2018 年的中台图纸，盖 2026 年的智能体大楼。</strong></p>

<p>我一个人打造的 <a href="https://zaokit.ai">Zaokit AI Agent 交易平台</a>，以及 AI PPT / 图文创作 <a href="https://zaokit.app">Zaokit.app</a>，做的就是把可用能力送进真实工作流——让组织侧先有可委托的手，而不是永远停在聊天窗口谈「赋能」。唯一网站：<a href="https://zaokit.app">https://zaokit.app</a>。</p>

<p>企业侧同一逻辑，已经融进可直接接入的服务：</p>

<ul>
  <li><a href="https://grok.zaokit.com">grok.zaokit.com</a></li>
  <li><a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a></li>
  <li><a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a></li>
  <li><a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a></li>
  <li><a href="https://junxinzhang.com/projects.html">完整产品列表</a></li>
</ul>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<p>如果你认可 Zaokit AI 的产品理念，欢迎后台留言加入社群。<strong>我们不卖课、不割韭菜，只聚焦 ToB 企业场景的 AI 落地实战。</strong> 希望在这里，能给你带来不一样的思维火花和真实的商业碰撞。</p>

<hr />

<p><strong>参考</strong></p>

<ul>
  <li>Anthropic Engineering：<a href="https://www.anthropic.com/engineering/multi-agent-research-system">How we built our multi-agent research system</a></li>
  <li>站内前文：<a href="/enterprise-agent-build-choose-token-hub">企业端 Agent 怎么建、怎么选</a> · <a href="/workflow-agent-programmer-vs-boss">程序员在提效，老板在赚钱</a></li>
</ul>

<table>
  <tbody>
    <tr>
      <td>唯一网站：<a href="https://zaokit.app">Zaokit.app</a></td>
      <td>Agent 交易平台：<a href="https://zaokit.ai">Zaokit.ai</a></td>
    </tr>
  </tbody>
</table>

<p>企业 Grok 服务：<a href="https://grok.zaokit.com">grok.zaokit.com</a></p>

<p>企业服务：<a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a> · <a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a> · <a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a> · <a href="https://junxinzhang.com/projects.html">完整产品列表</a></p>]]></content><author><name>Jason Zhang</name></author><category term="AI" /><category term="featured" /><category term="AI" /><category term="智能体组织" /><category term="企业信息化" /><category term="Agent" /><category term="Anthropic" /><category term="Claude" /><category term="组织架构" /><category term="多Agent" /><category term="Zaokit" /><summary type="html"><![CDATA[很多组织已经在往智能体协同驱动迁了，你还在不在「岗位 + 流程 + 系统记账」的信息化模型里？ 新组织模型需要新架构；产品和组织，都该按面向未来六个月来建。]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="https://junxinzhang.com/assets/images/cover-20260805-agentic-org-six-months.webp" /><media:content medium="image" url="https://junxinzhang.com/assets/images/cover-20260805-agentic-org-six-months.webp" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">AI应用最尴尬的账单，可能正在被翻过来</title><link href="https://junxinzhang.com/gavin-baker-ai-app-cost-curve-flip/" rel="alternate" type="text/html" title="AI应用最尴尬的账单，可能正在被翻过来" /><published>2026-08-02T00:00:00+00:00</published><updated>2026-08-02T00:00:00+00:00</updated><id>https://junxinzhang.com/gavin-baker-ai-app-cost-curve-flip</id><content type="html" xml:base="https://junxinzhang.com/gavin-baker-ai-app-cost-curve-flip/"><![CDATA[<p>过去做 AI 应用，有个很土、却很致命的问题：</p>

<p><strong>产品卖得越好，模型账单越贵。</strong></p>

<p>客户多用一次，你就多给 OpenAI、Anthropic 交一笔钱。更麻烦的是，底层模型每升级一次，你辛苦做出来的功能，还有可能被直接吃掉。</p>

<p>圈子里因此形成一种半共识：<strong>AI 应用没有护城河，只是给大模型厂商打工。</strong></p>

<p>但最近，一位押中过英伟达、特斯拉和 SpaceX 的科技投资人，给出了更激进的判断：<strong>垂直聚焦的 AI 原生公司，可能要迎来一轮集体加速。</strong></p>

<blockquote>
  <p><strong>不是「套壳突然变香了」，而是成本曲线、数据闭环和模型归属，开始同时改写。</strong></p>
</blockquote>

<p><img src="/assets/images/cover-20260804-ai-app-cost-curve-flip.webp" alt="AI应用最尴尬的账单，可能正在被翻过来" />
<!-- baoyu-skill prompt: 2.35:1清线漫画+清新扁平封面，奶油到天蓝渐变，干净描边，薄荷绿/蜜桃/天蓝平涂，留白充足。禁止品牌logo与深色赛博UI。左侧漫画账单卡上扬曲线标中文「旧：增长=账单涨」；右侧友好机器人与下降成本曲线标中文「新：用得越多越便宜」。中央粗体中文「成本曲线在翻转」。顶部「Gavin Baker · 垂直AI加速」。底部「路由·开源·后训练，三件事同时成熟」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="一谁在说gavin-baker-不是口号型投资人">一、谁在说：Gavin Baker 不是口号型投资人</h2>

<p><strong>Gavin Baker</strong> 是美国科技投资圈里偏「硬」的那一类。他在富达工作约 18 年，管理过规模约 <strong>170 亿美元</strong> 的科技基金（Fidelity OTC 相关时期常被这样描述），后来创办 <strong>Atreides Management</strong>，也是英伟达、特斯拉和 SpaceX 的早期重要投资者之一。</p>

<p>他最近公开判断的大意是：接下来会看到<strong>一大批垂直聚焦的 AI 原生公司加速</strong>。驱动不是口号，而是三件同时成熟的工程现实——</p>

<ol>
  <li><strong>模型路由（Routers）</strong></li>
  <li><strong>开源模型</strong></li>
  <li><strong>专业化后训练（post-training）</strong></li>
</ol>

<p>他点名了像 <a href="https://fireworks.ai/">Fireworks AI</a> 这类把训推与后训练打通的平台，也点到法律 AI 等垂直场景已经在跑通这条路。原文语境可对照其 X 账号 <a href="https://x.com/GavinSBaker">@GavinSBaker</a> 近期发言。</p>

<p>翻译成大白话：</p>

<table>
  <thead>
    <tr>
      <th>以前</th>
      <th>现在开始成立</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>一个最强模型通吃所有任务</td>
      <td>简单任务走便宜专用模型</td>
    </tr>
    <tr>
      <td>应用层几乎不拥有模型</td>
      <td>用自己的业务数据后训练开源基座</td>
    </tr>
    <tr>
      <td>增长 = API 账单线性上涨</td>
      <td>增长 = 数据与评测变厚，单位成本可压</td>
    </tr>
  </tbody>
</table>

<p><strong>游戏规则变了：AI 应用公司不必永远只给大模型厂商交租。</strong></p>

<p><img src="/assets/images/illust-20260804-old-vs-new-cost.webp" alt="旧账单逻辑 vs 新成本逻辑" />
<!-- baoyu-skill prompt: 2.35:1清新知识漫画对比图，奶油/天蓝底，干净描边扁平色。左卡中文「旧模式」三条；右卡中文「新模式」三条；中央箭头中文「成本曲线翻转」；顶标「卖得越好，账单越贵？」；底标「规则正在改写」。禁止深色赛博风。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="二三件事同时成熟路由开源后训练">二、三件事同时成熟：路由、开源、后训练</h2>

<p>别被术语吓住。拆开看，都是很土的工程选择。</p>

<h3 id="1模型路由别让最贵的模型干最简单的活">1）模型路由：别让最贵的模型干最简单的活</h3>

<p>不是「所有请求都打 Claude Opus / GPT 最强档」，而是按难度、延迟、合规、成本，把任务分给不同模型：</p>

<ul>
  <li>抽取、分类、格式化、高频改写 → 便宜专用模型</li>
  <li>高风险推理、复杂综合、客户可见关键交付 → 再 escalate 到前沿模型</li>
</ul>

<p>路由做好了，<strong>质量可以接近「全上最强」</strong>，账单却不是按最强单价线性放大。</p>

<h3 id="2开源模型终于能扛一部分常规任务">2）开源模型：终于能扛一部分常规任务</h3>

<p>过去开源模型「能聊，不敢上生产」。现在一批开源权重在常规任务上已经够用，关键是：</p>

<p><strong>你能私有部署、能控数据、能后训练，而不是永远只做 prompt 租户。</strong></p>

<p>我前几天写 <a href="/kimi-k3-open-weights-private-deploy-cost">Kimi K3 开源与私有化成本</a> 时强调过另一面：前沿权重开源 ≠ 普通公司能私有化最强模型。这里说的不是「人人自建 64 卡超节点」，而是——</p>

<p><strong>垂直应用可以用「够强且可训」的开源基座，吃掉自己业务里那一大截高频 token。</strong></p>

<h3 id="3后训练把通用聪明拧成懂你的行当">3）后训练：把「通用聪明」拧成「懂你的行当」</h3>

<p>真正拉开差距的，是用<strong>真实业务轨迹</strong>做 SFT / RFT 一类后训练：合同怎么审、条款怎么抽、报告怎么过 rubric、失败案例怎么回灌。</p>

<p>结果不是「又一个通用助手」，而是：</p>

<p><strong>在你的评测集、你的工作流、你的错误代价上，专用模型开始比通用大模型更省、更稳、更可控。</strong></p>

<p><img src="/assets/images/illust-20260804-three-pillars.webp" alt="路由·开源·后训练三件套" />
<!-- baoyu-skill prompt: 2.35:1清新知识漫画信息图，三卡横排中文「模型路由」「开源基座」「专业化后训练」及副标，下方箭头「垂直AI原生公司加速」，顶「三件事同时成熟」，底「质量接近前沿，成本砍掉一大截」。奶油底、薄荷绿/天蓝/蜜桃平涂，清线描边。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="三工程侧证据harvey--fireworks-把账算清楚了">三、工程侧证据：Harvey × Fireworks 把账算清楚了</h2>

<p>判断再漂亮，也要有可核对的实验。</p>

<p>法律 AI 公司 <strong>Harvey</strong> 与 <strong>Fireworks</strong> 公开了一组很硬的对照（见 <a href="https://fireworks.ai/blog/open-source-agents-frontier-advisors">Fireworks 博客：Open-Source Agents, Frontier Advisors</a>）：在 Harvey 的 Legal Agent Benchmark（LAB）切片上——</p>

<table>
  <thead>
    <tr>
      <th>配置</th>
      <th>大致结果</th>
      <th>成本量级（100 tasks 切片）</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>端到端 Claude Opus 4.7</td>
      <td>all-pass <strong>14/100</strong>，mean 约 0.91</td>
      <td>约 <strong>$954</strong></td>
    </tr>
    <tr>
      <td>开源 worker（如 GLM）+ 稀疏调用 Opus 作 advisor</td>
      <td>all-pass <strong>18/100</strong></td>
      <td>约 <strong>$368</strong>（约 Opus 的 <strong>39%</strong>）</td>
    </tr>
    <tr>
      <td>开源基座 + SFT / RFT 后训练</td>
      <td>all-pass / mean 明显抬升，推理成本接近基座档</td>
      <td>远低于「全程前沿」</td>
    </tr>
  </tbody>
</table>

<p>两层意思叠在一起：</p>

<ol>
  <li><strong>混合 harness</strong>：开源模型当工人，前沿模型当顾问，平均每个任务只稀疏调用顾问（公开实验里约 0.83 次/任务量级）</li>
  <li><strong>后训练</strong>：用通过 rubric 的轨迹做 SFT，再用评测标准做 RFT，把开源模型往法律任务上拧</li>
</ol>

<p>文中那句结构很干净，值得记：</p>

<p><strong>open weights at the core, frontier intelligence called in only where it changes the answer.</strong><br />
（开源权重在核心，前沿智能只在能改变答案的地方被叫进来。）</p>

<p>这几乎就是 Baker 判断的工程版说明书。</p>

<p><img src="/assets/images/illust-20260804-hybrid-harness.webp" alt="开源工人 + 前沿顾问" />
<!-- baoyu-skill prompt: 2.35:1清新知识漫画流程图。左「法律任务」→「路由」分路「开源worker·高频」与「前沿advisor·稀疏」汇合「可验收交付」；角标「质量≥纯Opus · 成本约39%」；顶「前沿模型变成可调用工具」；底「不是永远绑在一个最贵API上」。奶油底、清线扁平、可爱图标。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="四商业侧证据legora-的增速在说工作流不只是-demo">四、商业侧证据：Legora 的增速在说工作流，不只是 demo</h2>

<p>如果说 Harvey × Fireworks 证明<strong>技术路径</strong>，<strong>Legora</strong>（法律 AI，前身常被称作 Leya 一脉）更像在证明<strong>客户愿不愿意把预算和工作流迁过来</strong>。</p>

<p>可核对的公开节点大致是：</p>

<ul>
  <li>约 <strong>18 个月</strong> 内 ARR 跨过 <strong>1 亿美元</strong> 量级（公司 <a href="https://legora.com/newsroom/legal-teams-adoption-of-ai-propels-legora-past-100-million-in-annual-recurring-revenue">新闻稿</a> 口径）</li>
  <li>Series D 及后续 extension 后，公开报道估值进入约 <strong>55–56 亿美元</strong> 区间，投资方包括 Accel，后续还有 Atlassian、NVIDIA NVentures 等（<a href="https://legora.com/newsroom/legora-extends-series-d-with-additional-50-million-welcomes-atlassian-and-nventures-as-investors">Series D extension 新闻</a>）</li>
  <li>团队公开披露：<strong>ARR 同比增长超过 10 倍</strong>；<strong>7 月净新增 ARR 比此前纪录高 90%+</strong></li>
</ul>

<p>这些数字要打折听——垂直 AI 赛道披露节奏快、口径各异——但方向一致：</p>

<p><strong>不是「又一个法律聊天框」，而是进入律所与公司法务的日常工作流：审查、表格化抽取、Word 内协作、多步 agent 流程。</strong></p>

<p>Baker 点名这类公司时，核心不是「法律赛道永远正确」，而是：</p>

<blockquote>
  <p>当一家公司同时掌握<strong>客户、数据、评测、工作流和专用模型</strong>，它就不再只是套壳应用。它开始拥有自己的模型能力。</p>
</blockquote>

<p>Cognition 一类 coding agent 公司身上，也能看到同构趋势：产品深度嵌入专业工作流，模型侧走向「自有/可训 + 路由 + 尖峰调用前沿」。路径细节各家不同，结构越来越像。</p>

<p><img src="/assets/images/illust-20260804-moat-forming.webp" alt="护城河刚开始形成" />
<!-- baoyu-skill prompt: 2.35:1清新知识漫画信息图。五齿轮中文「客户」「业务数据」「评测基准」「工作流」「专用模型」，外环「护城河」；右增长「ARR同比10x+」「净新增纪录+90%」；顶「过去担心没护城河」；底「真正的护城河可能才刚开始形成」。奶油底、薄荷绿/蜜桃、清线扁平。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="五翻转点客户越多不再只等于账单越大">五、翻转点：客户越多，不再只等于账单越大</h2>

<p>把逻辑压成一条链：</p>

<ol>
  <li>高频任务被专用模型吃掉 → <strong>边际 token 成本下降</strong></li>
  <li>客户用得越多 → <strong>轨迹、纠错、评测越厚</strong></li>
  <li>后训练继续跑 → <strong>专用模型更强，路由更敢把流量留在便宜侧</strong></li>
  <li>前沿模型仍会用，但更像「尖峰保险」而不是「全量底座」</li>
</ol>

<p>旧世界：</p>

<p><strong>客户增长 → API 账单增长 → 毛利被模型厂抽走。</strong></p>

<p>新世界（开始成立的那部分）：</p>

<p><strong>客户增长 → 数据飞轮 → 模型变强 → 单位成本可继续下降。</strong></p>

<p>这不是说 OpenAI / Anthropic 没生意了。恰恰相反：最难的那截推理、最强的那截智能，仍会很贵、很稀缺。变的是——</p>

<p><strong>应用公司第一次有机会，把「租户身份」改成「部分模型所有权 + 工作流所有权」。</strong></p>

<p>过去大家担心 AI 应用没有护城河。<br />
现在看，<strong>真正的护城河可能才刚刚开始形成</strong>——不在一句 prompt，而在数据闭环、评测体系、行业工作流，以及你敢不敢把路由和后训练做成产品内核。</p>

<h2 id="写在最后">写在最后</h2>

<p>压成五句：</p>

<ol>
  <li><strong>旧尴尬仍真实</strong>——卖得越好、账单越贵，功能还可能被模型升级吃掉</li>
  <li><strong>Baker 的判断很硬</strong>——路由 + 开源 + 专业化后训练，在推垂直 AI 原生公司加速</li>
  <li><strong>Harvey × Fireworks 算清了工程账</strong>——开源工人 + 稀疏前沿顾问，可更好且更便宜</li>
  <li><strong>Legora 在算商业账</strong>——ARR 同比 10x+、7 月净新增破纪录，说明工作流迁移是真的</li>
  <li><strong>护城河换定义了</strong>——客户 / 数据 / 评测 / 工作流 / 专用模型叠在一起，才开始像壁垒</li>
</ol>

<p>土话一句：</p>

<p><strong>以前 AI 应用怕增长；现在增长，有机会变成你的模型资产。</strong></p>

<p>我一个人打造的 <a href="https://zaokit.ai">Zaokit AI Agent 交易平台</a>，以及 AI PPT / 图文创作 <a href="https://zaokit.app">Zaokit.app</a>，做的也是同一方向：把可用能力送进真实交付，而不是永远只做最贵 API 的二道贩子。唯一网站：<a href="https://zaokit.app">https://zaokit.app</a>。</p>

<p>企业侧同一逻辑，已经融进可直接接入的服务：</p>

<ul>
  <li><a href="https://grok.zaokit.com">grok.zaokit.com</a></li>
  <li><a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a></li>
  <li><a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a></li>
  <li><a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a></li>
  <li><a href="https://junxinzhang.com/projects.html">完整产品列表</a></li>
</ul>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<p>如果你认可 Zaokit AI 的产品理念，欢迎后台留言加入社群。<strong>我们不卖课、不割韭菜，只聚焦 ToB 企业场景的 AI 落地实战。</strong> 希望在这里，能给你带来不一样的思维火花和真实的商业碰撞。</p>

<hr />

<p>延伸：<a href="/kimi-k3-open-weights-private-deploy-cost">Kimi K3 开源了，私有化却和普通公司无关了</a> · <a href="/jensen-huang-axios-chip-bubble-discount">黄仁勋说五年内很难泡沫</a> · <a href="/llm-pretrain-posttrain-skill-workflow-agent">LLM 预训练后训练与 Agent</a></p>

<p>公开参考：<a href="https://x.com/GavinSBaker">Gavin Baker on X</a> · <a href="https://fireworks.ai/blog/open-source-agents-frontier-advisors">Fireworks × Harvey 实验</a> · <a href="https://legora.com/newsroom/legal-teams-adoption-of-ai-propels-legora-past-100-million-in-annual-recurring-revenue">Legora 过 1 亿美元 ARR</a> · <a href="https://legora.com/newsroom/legora-extends-series-d-with-additional-50-million-welcomes-atlassian-and-nventures-as-investors">Legora Series D extension</a></p>

<hr />

<table>
  <tbody>
    <tr>
      <td>唯一网站：<a href="https://zaokit.app">Zaokit.app</a></td>
      <td>Agent 交易平台：<a href="https://zaokit.ai">Zaokit.ai</a></td>
    </tr>
  </tbody>
</table>

<p>企业 Grok 服务：<a href="https://grok.zaokit.com">grok.zaokit.com</a></p>

<p>企业服务：<a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a> · <a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a> · <a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a> · <a href="https://junxinzhang.com/projects.html">完整产品列表</a></p>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p><em>我是 Jason，自己一个人做 AI 产品。应用层真正翻身的时候，往往不是模型突然变神，而是账单逻辑和工作流归属先变了。</em></p>]]></content><author><name>Jason Zhang</name></author><category term="AI" /><category term="featured" /><category term="AI" /><category term="Gavin Baker" /><category term="Atreides" /><category term="Legora" /><category term="Harvey" /><category term="开源模型" /><category term="模型路由" /><category term="后训练" /><category term="垂直AI" /><category term="Fireworks" /><category term="Zaokit" /><summary type="html"><![CDATA[押中过英伟达、特斯拉和 SpaceX 的 Gavin Baker 判断：模型路由、开源模型、专业化后训练同时成熟， AI 应用公司不必永远给大模型交租。客户增长，有机会从「账单增长」变成「模型变强、成本下降」。]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="https://junxinzhang.com/assets/images/cover-20260804-ai-app-cost-curve-flip.webp" /><media:content medium="image" url="https://junxinzhang.com/assets/images/cover-20260804-ai-app-cost-curve-flip.webp" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">产品召回三端，我用 Codex 和 Stitch 两小时交了</title><link href="https://junxinzhang.com/codex-stitch-two-hours-three-ends-recall/" rel="alternate" type="text/html" title="产品召回三端，我用 Codex 和 Stitch 两小时交了" /><published>2026-08-01T00:00:00+00:00</published><updated>2026-08-01T00:00:00+00:00</updated><id>https://junxinzhang.com/codex-stitch-two-hours-three-ends-recall</id><content type="html" xml:base="https://junxinzhang.com/codex-stitch-two-hours-three-ends-recall/"><![CDATA[<p>最近做了一件很土、但很能说明问题的事。</p>

<p>产品召回相关的三端——<strong>H5、小程序、管理后台</strong>——我用 <strong>Codex + Google Stitch</strong>，大约 <strong>两小时</strong> 交了可演示、可继续硬化的初版。</p>

<p>不是「生成了几个静态页面截图」，是把主流程页面、后台管理骨架、多端一致的信息架构拉通；后面该接的接口、权限、审计再按企业节奏补。</p>

<p>五月我写过 <a href="/ai-one-person-army-full-delivery-sequoia-agi">一个人的 AI 军团</a>：从售前到运维，一个人顶一个 Team。那是<strong>项目全链路</strong>。今天这篇更窄，只钉交付里最容易被低估的一段：</p>

<blockquote>
  <p><strong>界面与三端实现，曾经是分工最碎、等待最长的一截；现在可以被同一条 AI 链路压进小时级。</strong></p>
</blockquote>

<p><img src="/assets/images/cover-20260801-codex-stitch-two-hours.webp" alt="产品召回三端，我用 Codex 和 Stitch 两小时交了" />
<!-- baoyu-skill prompt: 2.35:1电影感横版封面，深蓝到墨黑渐变，冷静厚重科技质感。左侧三块半透明终端卡片竖排标中文「H5」「小程序」「管理后台」；右侧沙漏与时钟标中文「约2小时」。中央粗体大字中文「两小时交三端」。顶部副标中文「Codex × Stitch · 产品召回」。底部中文「程序员杠杆，被压到小时级」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="一先把账摊开过去三端为什么慢">一、先把账摊开：过去三端为什么慢</h2>

<p>产品召回不是炫技场景。它通常要同时面对三类人：</p>

<table>
  <thead>
    <tr>
      <th>端</th>
      <th>谁在用</th>
      <th>典型页面</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td><strong>H5</strong></td>
      <td>消费者 / 渠道扫码</td>
      <td>查询批次、确认召回范围、指引与登记</td>
    </tr>
    <tr>
      <td><strong>小程序</strong></td>
      <td>同一批用户，微信生态里</td>
      <td>与 H5 同构的查询与进度，偏轻量入口</td>
    </tr>
    <tr>
      <td><strong>管理后台</strong></td>
      <td>运营 / 质检 / 客服</td>
      <td>批次配置、范围发布、进度看板、导出与处置</td>
    </tr>
  </tbody>
</table>

<p>传统路径很熟悉：</p>

<ol>
  <li>产品经理写需求与流程图</li>
  <li>UI 出多端稿，评审两轮</li>
  <li>H5 前端开干</li>
  <li>小程序另一套工程再开干</li>
  <li>管理后台再开一条</li>
  <li>联调、改交互、补权限</li>
</ol>

<p>就算人齐、需求清楚，<strong>「看起来像能演示」</strong>也常是按<strong>天到周</strong>计。慢不在某一行代码，而在<strong>等待</strong>：等稿、等排期、等三端对齐、等改完再改。</p>

<p>两小时交三端，不是证明「召回业务变简单了」，而是证明：</p>

<p><strong>设计与实现之间的那堵墙，被工具链凿开了。</strong></p>

<p><img src="/assets/images/illust-20260801-old-three-ends-wait.webp" alt="过去三端为什么慢" />
<!-- baoyu-skill prompt: 2.35:1宽幅时间线信息图，深色背景冷静科技。从左到右六个节点中文「需求」「UI多端稿」「H5」「小程序」「管理后台」「联调」，节点间虚线标注中文「等待」。右侧大箭头指向沙漏中文「天到周」。顶部标题中文「慢在等待，不在某一行代码」。底部中文「三端对齐成本，才是真实工期」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="二我实际怎么跑stitch-定界面codex-落代码">二、我实际怎么跑：Stitch 定界面，Codex 落代码</h2>

<p>工具分工很简单，不造概念。</p>

<h3 id="1google-stitch先把长什么样怎么点钉住">1）Google Stitch：先把「长什么样、怎么点」钉住</h3>

<p><a href="https://stitch.withgoogle.com/">Google Stitch</a> 是 Google Labs 的 AI UI 设计产品：用自然语言 / 画布把想法拉成高保真界面，再在 AI-native 画布上迭代多屏。对缺专职设计师、又要快速对齐产品感觉的人，它的价值很直接——</p>

<p><strong>先把信息架构和多端页面定下来，再进代码。</strong></p>

<p>这次我在 Stitch 里并行拉了两组画布（项目链接对内使用，文中不贴客户名与内部 ID）：一端偏<strong>用户侧</strong>（H5 / 小程序气质的查询与指引），一端偏<strong>管理侧</strong>（批次、范围、进度、处置）。</p>

<p>用户侧主路径，在画布上一屏就能看完：</p>

<p><img src="/assets/images/screenshot-20260801-stitch-recall-user-flow.webp" alt="Stitch 用户侧召回主路径多屏" />
<!-- 截图来源：Stitch 用户侧画布导出；演示数据，敏感字段已打码/示意 --></p>

<p>从左到右大致是：</p>

<ol>
  <li><strong>召回首页</strong>——通知、范围、办理步骤</li>
  <li><strong>罐底码 / 批次验证</strong>——在范围内才继续</li>
  <li><strong>购买证明上传</strong></li>
  <li><strong>申请信息填写</strong>（联系人、收款、退款金额）</li>
  <li><strong>核对并提交</strong></li>
  <li><strong>提交成功</strong></li>
  <li><strong>进度详情 / 补材料 / 退款完成</strong></li>
</ol>

<p>管理侧是另一组画布，模块比用户侧更「企业后台」：</p>

<p><img src="/assets/images/screenshot-20260801-admin-dashboard-list-detail.webp" alt="Stitch 管理后台：工作台 / 申请列表 / 资料核验" />
<!-- 截图：Stitch 管理侧画布；演示数据，非生产客户信息 --></p>

<p><img src="/assets/images/screenshot-20260801-admin-logistics-warehouse-refund.webp" alt="Stitch 管理后台：物流安排 / 仓库检查 / 退款处理" />
<!-- 截图：Stitch 管理侧画布；演示数据 --></p>

<p><img src="/assets/images/screenshot-20260801-admin-refund-complete-campaign.webp" alt="Stitch 管理后台：退款登记 / 完结详情 / 召回活动设置" />
<!-- 截图：Stitch 管理侧画布；演示数据 --></p>

<p>串起来就是：</p>

<table>
  <thead>
    <tr>
      <th>模块</th>
      <th>干什么</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td><strong>工作台</strong></td>
      <td>今日新增、待办、紧急事项、近期处理记录</td>
    </tr>
    <tr>
      <td><strong>申请列表 / 资料核验</strong></td>
      <td>消费申请排队、产品与购买证明核对、时间线</td>
    </tr>
    <tr>
      <td><strong>物流 / 仓库</strong></td>
      <td>取件承运、仓内质检、不合格原因</td>
    </tr>
    <tr>
      <td><strong>退款处理</strong></td>
      <td>授权金额、线下到账登记、凭证与审计</td>
    </tr>
    <tr>
      <td><strong>召回活动设置</strong></td>
      <td>活动周期、批次名单、物流伙伴、权限策略</td>
    </tr>
  </tbody>
</table>

<p>用户侧负责「申请人走完主路径」；管理侧负责「运营把单接住、核完、退完」。<br />
不在 CSS 里开产品会，是这两小时能成立的前提。</p>

<h3 id="2codex按画布与约束把三端骨架写出来">2）Codex：按画布与约束把三端骨架写出来</h3>

<p>界面方向定了之后，把约束写清楚交给 Codex：</p>

<ul>
  <li>三端信息架构一致，组件可复用处尽量复用</li>
  <li>先打通主路径，别一上来堆动画和边角</li>
  <li>管理后台预留权限、列表、详情、导出位</li>
  <li>业务文案与合规提示可配置，不写死在组件里</li>
</ul>

<p>Codex 负责的是<strong>实现带宽</strong>：页面、路由、状态、表单校验骨架、后台 CRUD 壳子。我负责的是<strong>边界与验收</strong>：哪些字段必须有、哪些动作不能自动、什么叫「这版能交」。</p>

<p>落到小程序 / H5 容器里，第一步往往就是「登记退货产品 + 验证批次」——设计稿上的节点，变成可点的表单：</p>

<p><img src="/assets/images/screenshot-20260801-miniprogram-batch-verify.webp" alt="落地页：罐底码验证 / 登记退货产品" />
<!-- 截图：实现侧界面示意；示例批次号，非生产数据 --></p>

<blockquote>
  <p><strong>Stitch 缩短「看起来对不对」；Codex 缩短「跑得起来吗」。人缩短的是「该不该这样做」。</strong></p>
</blockquote>

<p><img src="/assets/images/illust-20260801-stitch-codex-pipeline.webp" alt="Stitch 定界面 Codex 落代码" />
<!-- baoyu-skill prompt: 2.35:1宽幅流程图，深色背景冷静科技。从左到右四段箭头中文「业务边界」「Stitch多端界面」「Codex三端实现」「人审验收」。每段下方小字分别「召回范围·权限」「H5·小程序·后台」「路由·表单·骨架」「合规·联调·上线」。中央大字中文「设计与实现同一条链」。顶部标题中文「Stitch定界面，Codex落代码」。底部中文「人只守边界与验收」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="三两小时交了什么没交什么">三、两小时交了什么，没交什么</h2>

<p>必须把话说死，不然「两小时」会变成标题党。</p>

<h3 id="交了的">交了的</h3>

<ul>
  <li>用户侧主路径：查询 → 范围判断 → 指引 / 登记的页面闭环</li>
  <li>小程序与 H5 同构的信息架构（入口与容器不同，业务步骤对齐）</li>
  <li>管理后台：批次与范围配置、列表与详情骨架、进度与导出位</li>
  <li>多端视觉与组件节奏基本一致，能演示、能截图、能拉评审</li>
</ul>

<h3 id="没交也不该假装两小时交完的">没交、也不该假装两小时交完的</h3>

<table>
  <thead>
    <tr>
      <th>项</th>
      <th>为什么还要人 / 时间</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>真实接口与主数据</td>
      <td>批次、渠道、序列号规则在业务系统里</td>
    </tr>
    <tr>
      <td>权限、审计、操作留痕</td>
      <td>召回场景对「谁改过什么」敏感</td>
    </tr>
    <tr>
      <td>合规文案与法务口径</td>
      <td>对外话术不能靠模型自由发挥</td>
    </tr>
    <tr>
      <td>灰度、监控、回滚</td>
      <td>企业上线标准，不是 Demo 标准</td>
    </tr>
    <tr>
      <td>异常与边界</td>
      <td>查无批次、跨渠道、重复登记……</td>
    </tr>
  </tbody>
</table>

<p>所以更准确的表述是：</p>

<p><strong>两小时交付的是「企业级开发与交付的前端与管理骨架」——能进联调、能进评审、能当真实项目的 Day 0。</strong><br />
不是「两小时零风险全量上线」。</p>

<p>五月那篇写的是全链路一人交付；这篇补的是：<strong>交付链里最碎的一段，也被压进了小时级。</strong> 两者叠在一起，才是「企业级」四个字在 2026 年的新含义——不是堆人头，是<strong>把可硬化的骨架先立住</strong>。</p>

<p><img src="/assets/images/illust-20260801-delivered-vs-not.webp" alt="两小时交了什么没交什么" />
<!-- baoyu-skill prompt: 2.35:1宽幅对比信息图，深色背景。左栏冷绿勾选中文标题「两小时交了」条目「主路径闭环」「三端信息架构」「后台配置骨架」「可演示可联调」；右栏冷橙警告中文标题「仍要补」条目「真实接口」「权限审计」「合规口径」「灰度回滚」。顶部标题中文「企业级初版，不是零风险上线」。底部中文「Day 0骨架立住，后面才是硬化」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="四50-倍杠杆怎么算算在哪">四、50 倍杠杆：怎么算，算在哪</h2>

<p>我说「程序员的杠杆被放大了大约 50 倍」，不是实验室秒表，是<strong>交付体感的数量级</strong>。</p>

<p>粗账可以这样摊：</p>

<table>
  <thead>
    <tr>
      <th>传统粗算（小团队、需求相对清楚）</th>
      <th>量级</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>UI 多端稿 + 两轮小改</td>
      <td>1–3 人日</td>
    </tr>
    <tr>
      <td>H5 主路径</td>
      <td>2–4 人日</td>
    </tr>
    <tr>
      <td>小程序同构实现</td>
      <td>2–4 人日</td>
    </tr>
    <tr>
      <td>管理后台骨架</td>
      <td>3–5 人日</td>
    </tr>
    <tr>
      <td>对齐与返工缓冲</td>
      <td>2–3 人日</td>
    </tr>
    <tr>
      <td><strong>合计</strong></td>
      <td><strong>约 10–20 人日</strong></td>
    </tr>
  </tbody>
</table>

<p>一人日按 8 小时，就是 <strong>80–160 小时</strong>量级。<br />
压到 <strong>约 2 小时</strong> 可见交付，倍率落在 <strong>40–80 倍</strong> 区间；我说 50 倍，取的是中间、且偏保守的体感。</p>

<p>注意三个限定：</p>

<ol>
  <li><strong>比的是「可见三端骨架」</strong>，不是含全部联调与合规的终态上线</li>
  <li><strong>前提是边界清楚</strong>——召回主路径本身不复杂，复杂在数据和责任</li>
  <li><strong>杠杆落在会拆问题、会写约束、会验收的人身上</strong>；不会拆的人，只会更快堆技术债</li>
</ol>

<p>六月写过 <a href="/ai-biggest-leverage-frontier-intelligence-scarcity">AI 是普通人这辈子最大的杠杆</a>：最高级智能真正用满的人极少。这篇落到工程现场，就是同一句话的施工版——</p>

<blockquote>
  <p><strong>杠杆不在「会不会打开 Codex」，在「敢不敢把三端交付的目标、约束、验收写清楚，然后让工具链连续跑完」。</strong></p>
</blockquote>

<p><img src="/assets/images/illust-20260801-leverage-50x.webp" alt="50倍杠杆怎么算" />
<!-- baoyu-skill prompt: 2.35:1宽幅对比信息图，深色背景冷静科技。左侧柱状/沙漏标中文「传统约80-160小时」偏高；右侧短柱标中文「约2小时」；中央大字中文「约50倍」。下方三枚小印章中文「可见骨架」「边界清楚」「人会验收」。顶部标题中文「杠杆是数量级，不是秒表」。底部中文「比的是三端可见交付，不是零风险终态」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="五企业级交付到底多出来哪一层">五、企业级交付，到底多出来哪一层</h2>

<p>很多人听完「两小时三端」，第一反应是：那还要架构师、测试、项目经理干什么？</p>

<p>要。而且更要。</p>

<p>因为压缩掉的是<strong>绘图与写样板的时间</strong>，不是<strong>责任</strong>。</p>

<p>企业级和玩具项目的差别，从来不在「页面好不好看」，而在：</p>

<ol>
  <li><strong>边界</strong>：哪些自动，哪些必须人点确认</li>
  <li><strong>数据</strong>：批次、渠道、序列号以谁为准</li>
  <li><strong>权限</strong>：谁能扩召回范围，谁只能看</li>
  <li><strong>审计</strong>：出了事能否回放</li>
  <li><strong>口径</strong>：对外文案谁签字</li>
</ol>

<p>AI 把「做出来」变便宜了，于是「做对没有」反而更贵——<br />
错得更快，也传得更广。这和我在 <a href="/pe-context-harness-loop-graph-evolution">从 PE 到 Graph</a> 里说的「失败变贵，杠杆外移」是同一逻辑：<br />
<strong>工具越强，人越要站在验收和责任一侧，而不是和模型比手速。</strong></p>

<p>所以我自己的工作流，现在更像：</p>

<ol>
  <li>先写清：用户是谁、主路径三步是什么、后台最少管什么</li>
  <li>Stitch 出多端界面，当场改信息架构</li>
  <li>Codex 按约束落三端骨架</li>
  <li>我按清单验收：主路径、空态、权限位、文案位</li>
  <li>再进真实接口、合规与上线清单</li>
</ol>

<p>两小时省下的，是第 2–3 步里过去最磨人的等待。<br />
第 1、4、5 步，仍然是人的护城河。</p>

<h2 id="写在最后">写在最后</h2>

<p>压成五句：</p>

<ol>
  <li><strong>产品召回三端（H5 + 小程序 + 管理后台），我用 Codex + Stitch 大约两小时交了可演示初版</strong></li>
  <li><strong>慢通常慢在等待与三端对齐，不在某一行业务代码</strong></li>
  <li><strong>Stitch 管「长什么样」，Codex 管「跑得起来」，人管「该不该、算不算交」</strong></li>
  <li><strong>相对传统 10–20 人日量级的可见交付，体感杠杆大约 50 倍——比的是骨架，不是零风险终态</strong></li>
  <li><strong>企业级多出来的是边界、数据、权限、审计、口径；这些更需要人</strong></li>
</ol>

<p>土话一句：</p>

<p><strong>程序员的杠杆被放大，不是因为人变成了打字机，而是因为设计和实现终于能被同一条链路连续推动。</strong></p>

<p>再补一句更硬的：</p>

<p><strong>两小时能交骨架，不能交责任。谁签字、谁背锅、谁对用户说那句召回说明，仍然是人。</strong></p>

<p>我一个人打造的 <a href="https://zaokit.ai">Zaokit AI Agent 交易平台</a>，以及 AI PPT / 图文创作 <a href="https://zaokit.app">Zaokit.app</a>，做的是把可用的 AI 能力送进真实交付——该出界面出界面，该写代码写代码，而不是停在聊天窗口里谈「赋能」。唯一网站：<a href="https://zaokit.app">https://zaokit.app</a>。</p>

<p>企业侧同一逻辑，已经融进可直接接入的服务：</p>

<ul>
  <li><a href="https://grok.zaokit.com">grok.zaokit.com</a></li>
  <li><a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a></li>
  <li><a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a></li>
  <li><a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a></li>
  <li><a href="https://junxinzhang.com/projects.html">完整产品列表</a></li>
</ul>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p>延伸：<a href="/ai-one-person-army-full-delivery-sequoia-agi">一个人的 AI 军团</a> · <a href="/ai-biggest-leverage-frontier-intelligence-scarcity">AI 是普通人这辈子最大的杠杆</a> · <a href="/pe-context-harness-loop-graph-evolution">从 PE 到 Graph</a> · <a href="/workflow-agent-programmer-vs-boss">程序员在提效，老板在赚钱</a></p>

<p>公开参考：<a href="https://stitch.withgoogle.com/">Google Stitch</a> · <a href="https://blog.google/innovation-and-ai/models-and-research/google-labs/stitch-ai-ui-design/">Google Labs / Stitch 相关介绍</a></p>

<hr />

<table>
  <tbody>
    <tr>
      <td>唯一网站：<a href="https://zaokit.app">Zaokit.app</a></td>
      <td>Agent 交易平台：<a href="https://zaokit.ai">Zaokit.ai</a></td>
    </tr>
  </tbody>
</table>

<p>企业 Grok 服务：<a href="https://grok.zaokit.com">grok.zaokit.com</a></p>

<p>企业服务：<a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a> · <a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a> · <a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a> · <a href="https://junxinzhang.com/projects.html">完整产品列表</a></p>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p><em>我是 Jason，自己一个人做 AI 产品。两小时能交三端骨架，交不掉的是边界和责任。设计归 Stitch，实现归 Codex，签字归你。</em></p>]]></content><author><name>Jason Zhang</name></author><category term="AI" /><category term="featured" /><category term="AI" /><category term="Codex" /><category term="Stitch" /><category term="产品召回" /><category term="小程序" /><category term="H5" /><category term="管理后台" /><category term="程序员杠杆" /><category term="企业交付" /><category term="Zaokit" /><summary type="html"><![CDATA[产品召回相关的 H5、小程序、管理后台，我用 Codex + Google Stitch 大约两小时交了初版。 这不是「AI 写了几行代码」的故事，而是设计与实现被压到同一条链路上之后， 程序员真正能撬动的交付量，和过去不是一个数量级。]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="https://junxinzhang.com/assets/images/cover-20260801-codex-stitch-two-hours.webp" /><media:content medium="image" url="https://junxinzhang.com/assets/images/cover-20260801-codex-stitch-two-hours.webp" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">黄仁勋说五年内很难泡沫：打个折扣，盯一个指标</title><link href="https://junxinzhang.com/jensen-huang-axios-chip-bubble-discount/" rel="alternate" type="text/html" title="黄仁勋说五年内很难泡沫：打个折扣，盯一个指标" /><published>2026-07-31T00:00:00+00:00</published><updated>2026-07-31T00:00:00+00:00</updated><id>https://junxinzhang.com/jensen-huang-axios-chip-bubble-discount</id><content type="html" xml:base="https://junxinzhang.com/jensen-huang-axios-chip-bubble-discount/"><![CDATA[<p>最近中美韩股市，单日跌幅已经到了大家能明显感到的<strong>恐慌区间</strong>。</p>

<p>我先说操作，不绕：</p>

<p><strong>稳住心态。有杠杆的，尽快去掉。</strong></p>

<p>不是让你在情绪最低点「梭哈信仰」，也不是让你听完一篇访谈就立刻满仓芯片。恐慌日第一件事，是让自己还能活着看下一季的财报和下一轮的基建进度。</p>

<p>黄仁勋前几天接受了 Axios 大约 70 分钟的专访，正面回应芯片股大跌。信息量很大。我把访谈和公开报道对过一遍，下面只划能核对的重点；你要听原片细节，文末有视频。</p>

<blockquote>
  <p><strong>卖铲人讲长逻辑，可以听结构；恐慌日做决策，先管自己的杠杆。</strong></p>
</blockquote>

<p><img src="/assets/images/cover-20260731-huang-axios-discount.webp" alt="黄仁勋说五年内很难泡沫：打个折扣，盯一个指标" />
<!-- baoyu-skill prompt: 2.35:1电影感横版封面，深蓝到墨黑渐变，冷静厚重金融科技质感。左侧半透明下跌K线与恐慌情绪剪影标中文「恐慌日·先去杠杆」；右侧半透明芯片/电力塔与短缺锁链标中文「短缺约束·推迟泡沫」。中央粗体大字中文「打个折扣，盯一个指标」。顶部副标中文「黄仁勋 · Axios 长访」。底部中文「缓解之日，才是警惕之时」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="一半导体要崩盘吗他说短期不会">一、半导体要崩盘吗？他说短期不会</h2>

<p>核心判断很硬：</p>

<p><strong>这轮不是传统消费/季节性需求驱动，是计算范式切换带来的基建驱动。</strong></p>

<p>公开报道里他的原意大致是：历史周期里芯片会因需求回落而崩；这一次不同——计算机的底层技术在变，AI 在变成和能源、网络并列的基础设施层。半导体行业「小得离谱」，未来十年大概要扩大 <strong>5 到 10 倍</strong>。现在芯片、存储、电力、土地、建设人力多线短缺，不是「需求突然没了」的叙事。</p>

<p>出处可对照：<a href="https://www.axios.com/2026/07/24/nvidia-chips-ai-boom">Axios：no chip bust for a while</a> · <a href="https://fortune.com/2026/07/25/nvidia-ceo-jensen-huang-chip-stocks-boom-bust-soon-this-time-is-different/">Fortune 转述</a>。</p>

<p>翻译成大白话：</p>

<table>
  <thead>
    <tr>
      <th>旧周期语感</th>
      <th>他这轮的说法</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>手机/PC 卖不动 → 砍订单</td>
      <td>不是季节性需求，是工业级重建</td>
    </tr>
    <tr>
      <td>库存一高就崩</td>
      <td>多环节同时短缺，产能在追基建</td>
    </tr>
    <tr>
      <td>「又到了周期顶部」</td>
      <td>行业规模还要再上一个数量级</td>
    </tr>
  </tbody>
</table>

<p><strong>短期崩盘叙事，和他的时间表对不上。</strong> 对不上，不代表股价不能跌——股价可以先把恐惧打满，再跟基本面慢慢和解。</p>

<p><img src="/assets/images/illust-20260731-infra-not-demand.webp" alt="基建驱动不是需求崩盘" />
<!-- baoyu-skill prompt: 2.35:1宽幅对比信息图，深色背景冷静科技。左栏中文「旧周期」条目「消费回落」「季节性砍单」「库存见顶」；右栏中文「这轮」条目「计算范式切换」「基建驱动」「行业扩5-10倍」。中央大箭头中文「不是同一道题」。顶部标题中文「短期不是消费崩盘」。底部中文「短缺在追基建，不是需求蒸发」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="二泡沫呢总有一天会来但约束在帮时间买命">二、泡沫呢？「总有一天会来」，但约束在帮时间买命</h2>

<p>泡沫问题上，他没有说「永远没有」。</p>

<p>更接近的说法是：<strong>总有一天会来；但五年内非常不可能。</strong></p>

<p>理由反直觉——不是因为「AI 永不犯错」，而是因为：</p>

<p><strong>电力、土地、工人、芯片，全都缺。资本开支想砸，常常砸不出去。</strong></p>

<p>供过于求被不断推迟。他原话方向是：我们几乎在每个方向都被约束住了；<strong>这个约束是好事</strong>——它把系统往回拽，给基础设施扩建留时间。</p>

<p>Fortune 转述里写得很直：<em>That constraint is good. That constraint is what holds the system back.</em></p>

<p>我七月写过 <a href="/wang-yuquan-ai-bubble-2029-not-now">王煜全那篇</a>：<strong>现在不叫泡沫，泡沫却一定会来</strong>；危险的是高估到来速度。黄仁勋这轮是另一条时间表——更偏「短缺约束把泡沫往后推」。两条叙事不必合成一个年份神谕，但有一个共同动作：</p>

<blockquote>
  <p><strong>别用「永远不会泡沫」安慰自己；也别用「明天就崩」吓自己。先问：真正能砸出的产能，追没追上承诺的 CapEx？</strong></p>
</blockquote>

<p><img src="/assets/images/illust-20260731-constraints-good.webp" alt="约束推迟供过于求" />
<!-- baoyu-skill prompt: 2.35:1宽幅信息图，深色背景。四块锁链/瓶颈卡片横排中文「电力」「土地」「工人」「芯片」，每块下方小字中文「短缺」。右侧大字中文「约束是好事」。一条时间轴从左到右标中文「想砸的钱」到「砸得出去的产能」，中间缺口标中文「供过于求被推迟」。顶部标题中文「泡沫总有一天会来」。底部中文「五年内非常不可能·短缺在买时间」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="三kimi-冲击市场第二次搞错同一道题">三、Kimi 冲击：市场第二次搞错同一道题</h2>

<p>DeepSeek 那次，芯片股恐慌式重挫；Kimi 开源权重出来后，市场反应几乎复刻（二级报道里常把近月芯片板块跌幅和上次冲击并排讲）：</p>

<p><strong>免费/便宜、够强的模型 → 是不是不需要那么多卡了？</strong></p>

<p>黄仁勋的反驳很干脆：市场又误解了一次。<strong>免费的 AI 意味着更多人用、用得更勤，最终是更多算力、更多数据中心。</strong> 对硬件反而是利好。</p>

<p>这和我昨天写的 <a href="/kimi-k3-open-weights-private-deploy-cost">Kimi K3 开源与私有化成本</a> 是同一枚硬币的两面：</p>

<ul>
  <li>对<strong>普通公司</strong>：开源免费 ≠ 私有化可及，别被「开源了部署一下」绑架</li>
  <li>对<strong>算力侧</strong>：开源把使用门槛打下来，用量曲线往往比「模型变便宜」更重要</li>
</ul>

<p>华尔街爱把「效率提升」直接折成「CapEx 见顶」。工程现实里，效率提升常常先换来<strong>覆盖更多场景</strong>，总量未必下降。</p>

<blockquote>
  <p><strong>模型变便宜，不等于铲子没人买；有时只是更多人开始挖。</strong></p>
</blockquote>

<p><img src="/assets/images/illust-20260731-free-ai-more-compute.webp" alt="免费AI是硬件利好" />
<!-- baoyu-skill prompt: 2.35:1宽幅流程图，深色背景冷静科技。从左到右三步箭头：中文「免费/开源模型」→「更多人用、用得更勤」→「更多算力与数据中心」。下方对比条：左中文「市场读法：卡需求见顶」打叉；右中文「他的读法：硬件利好」打勾。顶部标题中文「Kimi冲击：同一道题又错了」。底部中文「DeepSeek那次，市场也这样反应」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="四开源会干掉-openai-和-anthropic-吗">四、开源会干掉 OpenAI 和 Anthropic 吗？</h2>

<p>恰恰相反。</p>

<p>他的逻辑是 freemium 老故事：<strong>最可能付费的，往往是用过免费 AI 的人。</strong> 开源把市场做大，闭源卖便利、可靠、更强能力与合规交付。他甚至放话说，这两家会是<strong>人类历史上最成功的 IPO 之一</strong>——因为 AI 有用，有用就能赚钱。</p>

<p>这句要打折听：英伟达深度绑定生态，公开唱多顶级实验室并不奇怪。但结构本身不荒唐——Linux 没消灭商业 Unix/云；开源模型也未必消灭托管 API。</p>

<h3 id="中国业务">中国业务？</h3>

<p>他很直：<strong>收入约等于零</strong>；多份纪要写他让投资者按零预期建模，近端别自动加回中国故事。</p>

<p>他还强调中国培养的 AI 研究员数量极多——<strong>比世界其他地方加起来还多</strong>，长期谁也挡不住谁。对投资者，这是风险披露；对中国产业，则是另一套自主算力与开源路径的题，我在 <a href="/nvidia-open-weights-vs-closed-ai-camps">开放权重与闭源阵营</a> 里写过利益结构，这里不重复。</p>

<h3 id="mythos-该不该锁起来">Mythos 该不该锁起来？</h3>

<p>Anthropic 有被严格管控的强网络安全相关模型（报道里称 Mythos）。黄仁勋的态度是：<strong>应该向所有人开放；加固是 Anthropic 自己的责任。</strong></p>

<p>这和「安全=少开放」的直觉相反。他的工程语感更接近：锁住一个模型，拦不住开源世界里已经存在的能力；真正要做的是像修软件一样修漏洞，而不是用封锁代替加固。</p>

<h3 id="蒸馏算偷吗">蒸馏算偷吗？</h3>

<p>要不要算违规，先看服务条款；条款被违反，走正常法律途径。但「从已有智能里学习」在他看来是智能的本质——模型本来就从人类互联网长大；再往后，互联网内容会大量由 AI 生成（他提到过几年后 <strong>99%</strong> 量级），<strong>模型蒸馏模型会变成常态</strong>，而不是例外。</p>

<h3 id="机器人的-chatgpt-时刻">机器人的 ChatGPT 时刻？</h3>

<p>他认为<strong>已经到了</strong>——机器人能推理出：把苹果放进抽屉前，得先打开抽屉。<br />
但从「有趣」到「有用」，他给的时间感是大约 <strong>3 到 4 年</strong>。</p>

<p><img src="/assets/images/illust-20260731-open-paid-long-game.webp" alt="开源付费与长跑" />
<!-- baoyu-skill prompt: 2.35:1宽幅信息图，深色背景。左上卡片中文「开源/免费」箭头指向中文「养成用户」再指向中文「付费闭源」；右上卡片中文「中国收入≈0」小字「不进指引」。下方三枚小徽章中文「Mythos该开放」「蒸馏看条款」「机器人3-4年有用」。顶部标题中文「开源做大市场，闭源卖可靠」。底部中文「AI是长跑，不是百米冲刺」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="五我自己的看法打一个折扣记一个指标">五、我自己的看法：打一个折扣，记一个指标</h2>

<p>访谈很好看。更好看的东西，更要防「听完就信」。</p>

<h3 id="1打一个折扣">1）打一个折扣</h3>

<p>黄仁勋是 AI 时代<strong>最大的卖铲人</strong>。他说行业要扩 5–10 倍、泡沫五年内很难、开源利好硬件——每一句都和他的订单簿同向。这不自动等于假话，但等于：</p>

<p><strong>结构可以认真听，仓位不能听完就满。</strong></p>

<p>折扣不是嘲讽，是职业卫生。听能源公司讲能源永续、听云厂商讲上云必胜，同一纪律。</p>

<h3 id="2记一个指标">2）记一个指标</h3>

<p>比背诵「2029」或「五年」更管用的，是盯<strong>真实瓶颈何时松动</strong>：</p>

<table>
  <thead>
    <tr>
      <th>盯什么</th>
      <th>为什么</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td><strong>电力</strong>并网与电价/批地</td>
      <td>决定数据中心能不能按规划站起来</td>
    </tr>
    <tr>
      <td><strong>先进封装</strong>产能</td>
      <td>决定高端加速器能不能按量出货</td>
    </tr>
    <tr>
      <td><strong>存储（HBM 等）与高端芯片齐套</strong></td>
      <td>决定训练/推理集群能不能按规划装起来</td>
    </tr>
  </tbody>
</table>

<p>他的乐观，很大一块建立在「约束还在、供过于求被推迟」。<br />
那反过来也干净：</p>

<blockquote>
  <p><strong>电力、封装、存储的短缺明显缓解之日，才是该提高警惕之时。</strong></p>
</blockquote>

<p>缓解不等于立刻崩盘；缓解意味着「想砸的钱」更容易变成「砸得出的产能」，周期时钟才真正往「可能过剩」拨一格。在那之前，用单日恐慌指数做人生仓位，性价比很差。</p>

<h3 id="3恐慌日的土办法">3）恐慌日的土办法</h3>

<ol>
  <li><strong>有杠杆先降杠杆</strong>——波动率惩罚的是存活率，不是信仰纯度</li>
  <li><strong>分清叙事时间表与自己的现金流时间表</strong>——他可以讲十年，你得先过下个月</li>
  <li><strong>少做「标题点位」交易</strong>——DeepSeek / Kimi 两次同构误读，说明市场会反复考同一道题</li>
  <li><strong>能力建设别停</strong>——泡沫年份可以吵，工作流、交付、成本结构不能等年份</li>
</ol>

<p>详细拆解与原片语境，见视频：<a href="https://x.com/Reportify_Xu/status/2082425124830286096/video/1">Reportify 整理的访谈视频</a>。</p>

<h2 id="写在最后">写在最后</h2>

<p>压成六句：</p>

<ol>
  <li><strong>恐慌日先去杠杆</strong>——活着，才有资格讨论长逻辑</li>
  <li><strong>短期不是消费式崩盘</strong>——他说这是基建驱动，行业还要扩 5–10 倍</li>
  <li><strong>泡沫会来，但约束在推迟</strong>——电、地、人、芯短缺被他称作「好事」</li>
  <li><strong>Kimi / DeepSeek 是同一道题</strong>——免费 AI 更像用量放大器，不是铲子墓志铭</li>
  <li><strong>开源做大市场</strong>——付费与 IPO 叙事和他的硬件叙事同向，记得打折</li>
  <li><strong>我的动作只有两个</strong>——对卖铲人打个折扣；盯短缺何时缓解</li>
</ol>

<p>土话一句：</p>

<p><strong>听黄仁勋，听的是约束与用量；管自己的钱，管的是杠杆与指标。</strong></p>

<p>我一个人打造的 <a href="https://zaokit.ai">Zaokit AI Agent 交易平台</a>，以及 AI PPT / 图文创作 <a href="https://zaokit.app">Zaokit.app</a>，做的是把可用的 AI 能力送进真实交付——在周期叙事之外，先把工作流跑稳。唯一网站：<a href="https://zaokit.app">https://zaokit.app</a>。</p>

<p>企业侧同一逻辑，已经融进可直接接入的服务：</p>

<ul>
  <li><a href="https://grok.zaokit.com">grok.zaokit.com</a></li>
  <li><a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a></li>
  <li><a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a></li>
  <li><a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a></li>
  <li><a href="https://junxinzhang.com/projects.html">完整产品列表</a></li>
</ul>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p>延伸：<a href="/wang-yuquan-ai-bubble-2029-not-now">现在不叫泡沫，泡沫却一定会来</a> · <a href="/kimi-k3-open-weights-private-deploy-cost">Kimi K3 开源了，私有化却和普通公司无关了</a> · <a href="/nvidia-open-weights-vs-closed-ai-camps">黄仁勋人生第一条帖子，直接对着闭源阵营开炮</a></p>

<p>公开参考：<a href="https://www.axios.com/2026/07/24/nvidia-chips-ai-boom">Axios 芯片 bust 报道</a> · <a href="https://fortune.com/2026/07/25/nvidia-ceo-jensen-huang-chip-stocks-boom-bust-soon-this-time-is-different/">Fortune 转述</a> · <a href="https://www.techflowpost.com/en-US/article/32794">TechFlow 访谈纪要</a> · <a href="https://x.com/Reportify_Xu/status/2082425124830286096/video/1">访谈视频</a> · <a href="https://www.youtube.com/watch?v=fr1IQspixmM">YouTube 完整访谈</a></p>

<hr />

<table>
  <tbody>
    <tr>
      <td>唯一网站：<a href="https://zaokit.app">Zaokit.app</a></td>
      <td>Agent 交易平台：<a href="https://zaokit.ai">Zaokit.ai</a></td>
    </tr>
  </tbody>
</table>

<p>企业 Grok 服务：<a href="https://grok.zaokit.com">grok.zaokit.com</a></p>

<p>企业服务：<a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a> · <a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a> · <a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a> · <a href="https://junxinzhang.com/projects.html">完整产品列表</a></p>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p><em>我是 Jason，自己一个人做 AI 产品。卖铲人的长逻辑可以听，自己的杠杆要先管住。短缺缓解之前，别让恐慌指数替你做人生决策。</em></p>]]></content><author><name>Jason Zhang</name></author><category term="AI" /><category term="featured" /><category term="AI" /><category term="黄仁勋" /><category term="英伟达" /><category term="Axios" /><category term="芯片股" /><category term="AI泡沫" /><category term="Kimi" /><category term="开源" /><category term="蒸馏" /><category term="机器人" /><category term="Zaokit" /><summary type="html"><![CDATA[中美韩股市恐慌日先稳住、有杠杆先去掉。黄仁勋 Axios 长访信息量很大： 短期不是消费崩盘、约束推迟泡沫；我只记两件事——对他打个折扣，盯短缺何时缓解。]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="https://junxinzhang.com/assets/images/cover-20260731-huang-axios-discount.webp" /><media:content medium="image" url="https://junxinzhang.com/assets/images/cover-20260731-huang-axios-discount.webp" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">LLM 不会给你最优排产，求解器会</title><link href="https://junxinzhang.com/or-aps-scheduling-inventory-llm-agent/" rel="alternate" type="text/html" title="LLM 不会给你最优排产，求解器会" /><published>2026-07-30T00:00:00+00:00</published><updated>2026-07-30T00:00:00+00:00</updated><id>https://junxinzhang.com/or-aps-scheduling-inventory-llm-agent</id><content type="html" xml:base="https://junxinzhang.com/or-aps-scheduling-inventory-llm-agent/"><![CDATA[<p>七月我写过 <a href="/ai-is-not-just-llm-full-landscape">AI 被大模型绑架了</a>：选型表里有一行很土——路径规划、资源调度，先考虑<strong>运筹优化 + 强化学习</strong>，而不是让 ChatGPT 算最优路线。</p>

<p>那一行很多人划过去了。今天把它落到真正会烧钱的场景：<strong>APS 排产排程</strong>，以及<strong>库存调拨</strong>。</p>

<p>两年前我写过一版 <a href="/aps">APS 基础介绍</a>，偏系统模块视角。这篇不重复名词解释，只钉一件事：</p>

<blockquote>
  <p><strong>LLM 负责把业务约束翻译成可求解问题；求解器负责在约束里找最优。把这两层搅在一起，排产项目最容易死在「看起来很智能」。</strong></p>
</blockquote>

<p><img src="/assets/images/cover-20260730-or-aps-llm.webp" alt="LLM 不会给你最优排产，求解器会" />
<!-- baoyu-skill prompt: 2.35:1电影感横版封面，深蓝到墨黑渐变，冷静厚重工业科技质感。左侧聊天对话框半透明标中文「LLM·翻译约束」，右侧工业求解器芯片/甘特网格发光标中文「求解器·算最优」。中央粗体大字中文「LLM不会给你最优排产」。顶部副标中文「运筹学 × APS × Agent」。底部中文「翻译归模型，最优归求解器」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="一先把账算清aps-吃的是运筹不是聊天">一、先把账算清：APS 吃的是运筹，不是聊天</h2>

<p>APS（Advanced Planning and Scheduling，高级计划与排程）解决的是一类很硬的问题：</p>

<ul>
  <li>订单交期、产能、换型时间、模具、人员技能、物料齐套</li>
  <li>哪些工单先上哪台设备、什么时候开、开多久</li>
  <li>插单、设备故障、物料晚到时，怎么重排还不把整厂打乱</li>
</ul>

<p>这类问题在运筹学里通常落成：</p>

<table>
  <thead>
    <tr>
      <th>方法</th>
      <th>在 APS 里干什么</th>
      <th>典型工具</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td><strong>MILP / MIP</strong>（混合整数规划）</td>
      <td>产能、批量、交期、成本目标一起建模求最优或近似最优</td>
      <td>Gurobi、CPLEX、SCIP</td>
    </tr>
    <tr>
      <td><strong>CP / CP-SAT</strong>（约束规划）</td>
      <td>工序先后、机器独占、班次规则等离散约束很强时</td>
      <td>Google OR-Tools CP-SAT</td>
    </tr>
    <tr>
      <td><strong>启发式 / 元启发式</strong></td>
      <td>规模太大、实时性要求高，求「够好且够快」</td>
      <td>遗传算法、禁忌搜索、局部搜索</td>
    </tr>
    <tr>
      <td><strong>仿真 + 优化</strong></td>
      <td>先仿真瓶颈，再优化关键资源</td>
      <td>数字孪生 / 产线仿真</td>
    </tr>
  </tbody>
</table>

<p>Google 公开文档把调度写得很直白：员工排班、<strong>Job Shop（车间作业排序）</strong> 都是 OR-Tools 的标准场景；CP-SAT 面向整数与约束问题，常被用作调度主力——Interval、<code class="language-plaintext highlighter-rouge">AddNoOverlap</code>、工序先后，目标常是压 makespan。出处：<a href="https://developers.google.com/optimization/scheduling">OR-Tools Scheduling</a> · <a href="https://developers.google.com/optimization/scheduling/job_shop">Job shop</a> · <a href="https://developers.google.com/optimization/cp/cp_solver">CP-SAT</a>。</p>

<p>工业级不是玩具题。Gurobi 公开的<a href="https://www.gurobi.com/resources/case-studies/yutong-bus-production-planning">宇通客车排产案例</a>：定制客车约 <strong>170–180 台/日开工</strong>、约 <strong>100 款并发车型</strong>、<strong>10 条产线</strong>；网络流拆成 <strong>6–10 个 MIP 序列</strong>，单个规模大约 <strong>10 万约束 / 6 万变量</strong>；<strong>Gurobi 约 45 分钟</strong> 跑完序列，对照原先 <strong>5 人团队约 9 小时</strong> 手工排程。市售通用 APS 包，曾被评估为盖不住这种定制化与多目标。</p>

<p>翻译成厂长能听懂的话：</p>

<p><strong>APS 的灵魂不是「会说话的计划员」，是「在约束下给出可执行最优（或近似最优）方案」的引擎。</strong></p>

<p>大模型很擅长解释「为什么这单要插」「换型为什么贵」。它不擅长在上百台设备、上千道工序、无数互斥约束里，稳定给出<strong>可证明更优</strong>的排程。组合爆炸是数学题，不是语感题。</p>

<p><img src="/assets/images/illust-20260730-aps-or-stack.webp" alt="APS 吃运筹不是聊天" />
<!-- baoyu-skill prompt: 2.35:1宽幅信息图，深色背景冷静科技。四层栈从下到上中文「数据·订单库存产能」「模型·目标与硬约束」「求解·MILP/CP-SAT/启发式」「界面·甘特与解释」。右侧大箭头指向中文「LLM在顶层·求解器在中层」。顶部标题中文「APS吃的是运筹，不是聊天」。底部中文「没有优化内核，只是好看的甘特图」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="二排产现场三个真实卡点对上三种数学武器">二、排产现场：三个真实卡点，对上三种数学武器</h2>

<p>别从「AI 赋能制造」空谈。车间里常见三类题，对应不同武器：</p>

<h3 id="1job-shop--产线排序工序先后--机器独占">1）Job Shop / 产线排序——工序先后 + 机器独占</h3>

<p>工件要过车、铣、磨；每台机器同时只能干一件；换型要时间。这是经典 <strong>Job Shop Scheduling</strong>。约束密、离散强，CP-SAT 或专用调度启发式往往比「让模型自由发挥」靠谱。</p>

<h3 id="2有限产能主计划交期齐套加班成本一起算">2）有限产能主计划——交期、齐套、加班成本一起算</h3>

<p>更上层是 MPS / 有限产能计划：本周接哪些单、外协多少、周末开不开线。目标函数通常是<strong>延期惩罚 + 加班成本 + 库存持有</strong>，变量多是整数（开不开线、做不做这批）。这是 MILP 主场。</p>

<h3 id="3实时重排故障插单缺料">3）实时重排——故障、插单、缺料</h3>

<p>优化模型要能<strong>热启动</strong>：固定已开工、只动未开工、加软约束保护原计划稳定。Agent 的价值在这里开始露头——监听事件、拉齐数据、触发重算、把结果翻译成人话——但<strong>重算本身仍是求解器的事</strong>。</p>

<table>
  <thead>
    <tr>
      <th>业务现象</th>
      <th>先别做什么</th>
      <th>更该做什么</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>插单一句「帮我重新排」</td>
      <td>直接让 LLM 输出完整甘特</td>
      <td>更新约束 → 调求解器 → LLM 解释差异</td>
    </tr>
    <tr>
      <td>设备坏了 2 小时</td>
      <td>凭经验口头改三单</td>
      <td>锁定在制、重优化后续、评估交期冲击</td>
    </tr>
    <tr>
      <td>领导要「最优」</td>
      <td>聊天框里拍脑袋排序</td>
      <td>先定义目标函数：交期？换型最少？负荷均衡？</td>
    </tr>
  </tbody>
</table>

<blockquote>
  <p><strong>「最优」不是形容词，是目标函数写清楚之后，求解器在可行域里比出来的结果。</strong></p>
</blockquote>

<p><img src="/assets/images/illust-20260730-three-weapons.webp" alt="三类排产题三种武器" />
<!-- baoyu-skill prompt: 2.35:1宽幅对比信息图，深色背景。三列卡片中文标题「Job Shop排序」「有限产能主计划」「实时重排」，副标分别「CP-SAT/启发式」「MILP主场」「热启动+事件触发」。每列底部小字中文「机器独占」「交期·加班·齐套」「故障·插单·缺料」。顶部标题中文「三类题，三种数学武器」。底部中文「最优是算出来的，不是聊出来的」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="三库存调拨另一张运筹试卷">三、库存调拨：另一张运筹试卷</h2>

<p>排产解决「厂里怎么造」。调拨解决「货在网里怎么动」。</p>

<p>多仓、多级（工厂仓 → 区域仓 → 门店 / 客户）、缺货替代、运输时效、批次效期——这是供应链里的 <strong>network optimization / multi-echelon inventory</strong> 题：</p>

<ul>
  <li>从哪几个仓调多少到哪</li>
  <li>先保谁的服务水平</li>
  <li>调拨成本 vs 缺货损失 vs 积压风险</li>
</ul>

<p>经典做法仍是运筹与库存论：</p>

<table>
  <thead>
    <tr>
      <th>层级</th>
      <th>常见做法</th>
      <th>说明</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>单点补货</td>
      <td>安全库存、再订货点、(s, S)</td>
      <td>规则简单，局部有效</td>
    </tr>
    <tr>
      <td>多级库存（MEIO）</td>
      <td>跨节点同时定安全库存与内部服务水平</td>
      <td>库存放在哪一层，往往比「各点各囤一点」更关键</td>
    </tr>
    <tr>
      <td>网络调拨</td>
      <td>多商品网络流 / 运输与库存联合优化</td>
      <td>跨仓、跨线路、跨时效</td>
    </tr>
    <tr>
      <td>滚动重算</td>
      <td>定期或事件驱动 re-optimize</td>
      <td>和 APS 一样，要能热更新</td>
    </tr>
  </tbody>
</table>

<p>单级各自最优，浪费常藏在<strong>节点缝里</strong>。MEIO 要的是网络总成本与服务水平，不是局部 KPI。对照见 <a href="https://www.microsoft.com/en-us/microsoft-cloud/blog/manufacturing/2018/06/22/multi-echelon-inventory-optimization-vs-inventory-optimization/">MEIO vs IO</a>。SAP IBP 一类产品把 multi-stage inventory optimization 写成正式能力，而不是「大模型随便搬货」。</p>

<p>LLM 的位置仍是三块：<strong>规则与例外入口</strong>、<strong>异常叙事</strong>、<strong>方案解释</strong>。不该替代的是：运力、库存、服务水平下的<strong>可执行调拨量</strong>。</p>

<p>厂商叙事也收敛：在计划与优化底座上叠 agentic AI，做解释、异常与编排。Blue Yonder 2025 的 Ops Agent 话术是 See–Analyze–Decide–Act，不是替换求解器（<a href="https://blueyonder.com/media/2025/blue-yonder-transforms-supply-chain-management-with-new-ai-agents">新闻稿</a>）；SAP 侧 Joule / agentic AI 往规划延伸（<a href="https://www.cio.com/article/3990312/sap-goes-all-in-on-agentic-ai-at-sap-sapphire.html">Sapphire 报道</a>）。</p>

<p><img src="/assets/images/illust-20260730-inventory-network.webp" alt="库存调拨是另一张运筹试卷" />
<!-- baoyu-skill prompt: 2.35:1宽幅信息图，深色背景冷静科技。左侧三层仓储节点中文「工厂仓」「区域仓」「门店」，箭头网络标中文「调拨量·路径·时效」。右侧两栏对比：上栏中文「LLM」条目「规则入口」「异常叙事」「方案解释」；下栏中文「求解器」条目「服务水平」「运力约束」「最优调拨」。顶部标题中文「货在网里怎么动」。底部中文「解释归模型，数量归优化」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="四llm-和-agent-到底干什么四层分工别抢方向盘">四、LLM 和 Agent 到底干什么：四层分工，别抢方向盘</h2>

<p>把系统拆成四层，选型会清爽很多：</p>

<table>
  <thead>
    <tr>
      <th>层</th>
      <th>谁主责</th>
      <th>典型工作</th>
      <th>失败长什么样</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td><strong>交互与意图</strong></td>
      <td>LLM</td>
      <td>听懂「优先保大客户交期」「今晚只动 3 号线」</td>
      <td>听错目标，排得再优也是错题</td>
    </tr>
    <tr>
      <td><strong>建模与数据对齐</strong></td>
      <td>LLM + 工程师规则</td>
      <td>自然语言 → 变量/约束/目标；主数据清洗</td>
      <td>模型写错约束，求解器一本正经算错题</td>
    </tr>
    <tr>
      <td><strong>求解</strong></td>
      <td>OR 引擎</td>
      <td>MILP / CP-SAT / 启发式求可行与更优</td>
      <td>不可行、超时、局部最优</td>
    </tr>
    <tr>
      <td><strong>闭环与编排</strong></td>
      <td>Agent / Workflow</td>
      <td>事件触发、重试、人审、回写 ERP/MES</td>
      <td>人成 cron；或无人乱改计划</td>
    </tr>
  </tbody>
</table>

<p>这和我在 <a href="/pe-context-harness-loop-graph-evolution">从 PE 到 Graph</a> 里说的「失败变贵，杠杆外移」是同一逻辑：<br />
排产场景里，<strong>失败最贵的一层往往是「算错约束」和「算不动最优」</strong>——前者靠建模纪律，后者靠求解器，不是靠更大的聊天模型。</p>

<p>研究侧两条线互相印证：</p>

<ol>
  <li><strong>OptiMUS</strong>：LLM Agent 从自然语言建立并迭代 (MI)LP 与求解代码，再交 Gurobi。困难集相对既有方法提升超 30%；后续版 NLP4LP 上 GPT-4o 约 <strong>73.7%</strong> vs 标准约 <strong>33.2%</strong>——增益在<strong>建模</strong>，不是取消求解。出处：<a href="https://arxiv.org/abs/2402.10172">arXiv:2402.10172</a> · <a href="https://arxiv.org/html/2407.19633v3">0.3 版</a>。</li>
  <li><strong>Microsoft OptiGuide</strong>：自然语言 what-if → LLM 改求解代码 → <strong>组合优化求解器</strong>出数 → LLM 解释；专有数据不必直接塞给模型。论文 GPT-4 端到端问答约 <strong>93%</strong>（不是排产最优率）。出处：<a href="https://arxiv.org/abs/2307.03875">arXiv:2307.03875</a> · <a href="https://www.microsoft.com/en-us/research/project/optiguide-genai-for-supply-chain-optimization/">MSR</a>。</li>
</ol>

<blockquote>
  <p><strong>LLM 擅长写/修优化模型；可行与更优解仍来自求解器。</strong></p>
</blockquote>

<p>车间同构五步：<strong>Agent 收集 → LLM 建模 → 求解器重算 → LLM 解释 + 人审 → Workflow 回写 ERP/MES/WMS</strong>。能画清路径用 Workflow；动态工具调用用小范围 Agent——和 <a href="/llm-pretrain-posttrain-skill-workflow-agent">Skill / Workflow / Agent</a> 的「能降级就降级」同构。</p>

<p><img src="/assets/images/illust-20260730-four-layers.webp" alt="四层分工别抢方向盘" />
<!-- baoyu-skill prompt: 2.35:1宽幅流程图，深色背景冷静科技。从左到右四段箭头中文「意图理解」「建模对齐」「求解优化」「闭环回写」，角色标签分别「LLM」「LLM+规则」「MILP/CP-SAT」「Agent/Workflow」。中央大字中文「别让聊天框抢方向盘」。顶部标题中文「四层分工」。底部中文「OptiMUS证明：模型写题，求解器答题」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="五落地清单比上一个排产大模型管用">五、落地清单：比「上一个排产大模型」管用</h2>

<ol>
  <li><strong>先写目标函数</strong>——交期 / 换型 / 负荷 / 库存，权重不写清后面全是扯皮。</li>
  <li><strong>硬软约束分开</strong>——安全与工艺是硬的；少改原计划、均匀加班用惩罚。全写成硬约束，求解器只会报不可行。</li>
  <li><strong>求解器匹配结构</strong>——离散调度偏 CP-SAT；成本产能批量偏 MILP；极大规模用分解 + 启发式 + 滚动窗口；只要解释与 what-if，别假装在求最优。</li>
  <li><strong>Agent 先触发与解释，再自动下发</strong>——建议→人审→低风险自动→跨仓/外协/改交期仍人在回路。裁判是业务指标与可行性，不是模型自信。</li>
  <li><strong>ERP/MES 接口与主数据</strong>——工艺、节拍、换型矩阵脏，再强求解器也是精密地算错。</li>
</ol>

<blockquote>
  <p><strong>排产 AI 的竞争，表面是模型，底下是约束库、主数据和重算闭环。</strong></p>
</blockquote>

<h2 id="写在最后">写在最后</h2>

<p>压成五句：</p>

<ol>
  <li><strong>APS 的内核是运筹</strong>——宇通级 MIP 序列用 45 分钟对 9 小时人工，不是聊天补全</li>
  <li><strong>库存调拨是网络 / MEIO 题</strong>——服务水平与运力约束下求调拨量，浪费常在节点缝里</li>
  <li><strong>LLM 的主场是翻译与解释</strong>——意图、规则、异常、what-if 叙事</li>
  <li><strong>Agent 的主场是闭环</strong>——监听、建模、调求解器、人审、回写</li>
  <li><strong>OptiMUS / OptiGuide 证明的分工</strong>——大模型写/修优化模型，求解器给可行与更优；别反着用来</li>
</ol>

<p>土话一句：</p>

<p><strong>大模型让更多人「说得清约束」；运筹学让系统「算得动最优」。前者降低门槛，后者守住质量。少了求解器的 APS，只是会说话的 Excel。</strong></p>

<p>再补一句更硬的：</p>

<p><strong>排产的难点从来不是「生成一个计划」，而是「证明这个计划在约束下可执行」。LLM 会写约束，但不会替你承担不可行解的产线停机。</strong></p>

<p>两年前写 APS，是把它当制造系统模块。今天补刀，是因为 2026 年的空气里，「万物皆可 Agent」太容易把求解器挤出架构图。挤出去的那一天，你得到的不是智能工厂，是<strong>自信的乱排</strong>。</p>

<p>我一个人打造的 <a href="https://zaokit.ai">Zaokit AI Agent 交易平台</a>，以及 AI PPT / 图文创作 <a href="https://zaokit.app">Zaokit.app</a>，做的是把可用的 AI 能力送进真实交付——该接工作流接工作流，该接工具接工具，而不是让聊天窗口假装成排产引擎。唯一网站：<a href="https://zaokit.app">https://zaokit.app</a>。</p>

<p>企业侧同一逻辑，已经融进可直接接入的服务：</p>

<ul>
  <li><a href="https://grok.zaokit.com">grok.zaokit.com</a></li>
  <li><a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a></li>
  <li><a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a></li>
  <li><a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a></li>
  <li><a href="https://junxinzhang.com/projects.html">完整产品列表</a></li>
</ul>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p>延伸：<a href="/ai-is-not-just-llm-full-landscape">AI 被大模型绑架了</a> · <a href="/aps">制造型企业 APS</a> · <a href="/pe-context-harness-loop-graph-evolution">从 PE 到 Graph</a> · <a href="/llm-pretrain-posttrain-skill-workflow-agent">预训练是别人的工厂</a></p>

<p>公开参考：<a href="https://developers.google.com/optimization/scheduling/job_shop">OR-Tools Job shop</a> · <a href="https://developers.google.com/optimization/cp/cp_solver">CP-SAT</a> · <a href="https://www.gurobi.com/resources/case-studies/yutong-bus-production-planning">Gurobi 宇通案例</a> · <a href="https://arxiv.org/abs/2402.10172">OptiMUS</a> · <a href="https://arxiv.org/abs/2307.03875">OptiGuide</a> · <a href="https://www.microsoft.com/en-us/microsoft-cloud/blog/manufacturing/2018/06/22/multi-echelon-inventory-optimization-vs-inventory-optimization/">MEIO vs IO</a> · <a href="https://blueyonder.com/media/2025/blue-yonder-transforms-supply-chain-management-with-new-ai-agents">Blue Yonder Agents</a> · <a href="https://www.cio.com/article/3990312/sap-goes-all-in-on-agentic-ai-at-sap-sapphire.html">SAP agentic AI 报道</a></p>

<hr />

<p><em>我是 Jason，自己一个人做 AI 产品。排产要的是约束下的最优，不是对话里的自信。翻译归模型，最优归求解器。</em></p>]]></content><author><name>Jason Zhang</name></author><category term="AI" /><category term="featured" /><category term="AI" /><category term="运筹学" /><category term="APS" /><category term="排产" /><category term="排程" /><category term="库存调拨" /><category term="OR-Tools" /><category term="Agent" /><category term="求解器" /><category term="Zaokit" /><summary type="html"><![CDATA[七月写过 AI 不止大模型，其中点名运筹学。今天落到 APS 排产排程与库存调拨： LLM 负责翻译约束和异常，MILP/CP-SAT 求解器负责算最优——别让聊天框替求解器。]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="https://junxinzhang.com/assets/images/cover-20260730-or-aps-llm.webp" /><media:content medium="image" url="https://junxinzhang.com/assets/images/cover-20260730-or-aps-llm.webp" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">Kimi K3 开源了，私有化却和普通公司无关了</title><link href="https://junxinzhang.com/kimi-k3-open-weights-private-deploy-cost/" rel="alternate" type="text/html" title="Kimi K3 开源了，私有化却和普通公司无关了" /><published>2026-07-29T00:00:00+00:00</published><updated>2026-07-29T00:00:00+00:00</updated><id>https://junxinzhang.com/kimi-k3-open-weights-private-deploy-cost</id><content type="html" xml:base="https://junxinzhang.com/kimi-k3-open-weights-private-deploy-cost/"><![CDATA[<p>月之暗面把 <strong>Kimi K3</strong> 的权重放开了。2.8T 参数，自称「全球首个开放的 3T 级模型」，Hugging Face 上能下，许可证也允许大多数内部商用。</p>

<p>圈子里第一反应很统一：<strong>开源了，咱们部署一下？</strong></p>

<p>第二反应更统一：<strong>笑一个。然后再加个 0。</strong></p>

<blockquote>
  <p><strong>开源权重免费，不等于私有化可及。前沿大模型，正在和普通公司脱钩。</strong></p>
</blockquote>

<p>四月我写过 <a href="/deepseek-v4-private-deployment-cost-analysis">DeepSeek-V4 私有化部署成本</a>：V4-Flash 年 TCO 约 60 万，V4-Pro（1.6T）约 232 万。今天把同一本账，摊到 K3 上——数字会难看很多。</p>

<p><img src="/assets/images/cover-20260729-kimi-k3-private-deploy.webp" alt="Kimi K3 开源了，私有化却和普通公司无关了" />
<!-- baoyu-skill prompt: 2.35:1电影感横版封面，深蓝到墨黑渐变，冷静厚重科技质感。左侧巨大半透明数字「2.8T」，右侧一排机架剪影标中文「64+加速器」。中央粗体中文「开源免费 ≠ 私有可及」。顶部副标中文「Kimi K3 权重开源」。底部中文「前沿模型，正在和普通公司脱钩」。右下小标签中文「对标 DeepSeek 1.6T」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="一先把规格钉死不是又一个大模型">一、先把规格钉死：不是「又一个大模型」</h2>

<p>官方与 model card 能核对的核心数字：</p>

<table>
  <thead>
    <tr>
      <th>项目</th>
      <th>Kimi K3</th>
      <th>说明</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>总参数</td>
      <td><strong>2.8T</strong></td>
      <td>3T 级开源权重</td>
    </tr>
    <tr>
      <td>激活参数</td>
      <td><strong>约 104B</strong></td>
      <td>每 token 激活 16 / 896 专家</td>
    </tr>
    <tr>
      <td>架构</td>
      <td>Sparse MoE</td>
      <td>KDA + AttnRes + Stable LatentMoE</td>
    </tr>
    <tr>
      <td>上下文</td>
      <td><strong>1M tokens</strong></td>
      <td>原生长上下文</td>
    </tr>
    <tr>
      <td>权重格式</td>
      <td><strong>MXFP4</strong></td>
      <td>量化感知训练；激活 MXFP8</td>
    </tr>
    <tr>
      <td>权重体积</td>
      <td><strong>约 1.4–1.5 TB</strong></td>
      <td>仅权重，不含 KV / 并发</td>
    </tr>
    <tr>
      <td>官方部署建议</td>
      <td><strong>64+ 加速器 supernode</strong></td>
      <td>高带宽通信域</td>
    </tr>
    <tr>
      <td>API 定价（参考）</td>
      <td>缓存命中 $0.30 / 未命中 $3 / 输出 $15（每百万 token）</td>
      <td>官方 blog</td>
    </tr>
  </tbody>
</table>

<p>出处：<a href="https://www.kimi.com/blog/kimi-k3">Kimi K3 官方博客</a> · <a href="https://huggingface.co/moonshotai/Kimi-K3">Hugging Face moonshotai/Kimi-K3</a></p>

<p>翻译成大白话：<strong>下载是免费的，跑起来是数据中心的事。</strong></p>

<p>很多人盯着「激活才 100B 出头」——这是推理算力的一面。另一面是：2.8T 总参要装进集群，896 专家的 all-to-all 要吃互联，1M 上下文还要给 KV 和并发留余量。官方原话很直：推理效率同样受益于更大的高带宽通信域，所以建议 <strong>64 个或更多加速器</strong> 的 supernode。</p>

<p><img src="/assets/images/illust-20260729-kimi-k3-specs.webp" alt="Kimi K3 规格：2.8T / 104B 激活 / 64+ 卡" />
<!-- baoyu-skill prompt: 2.35:1宽幅信息图，深色背景冷静科技。四块大卡片横排中文标题「总参2.8T」「激活约104B」「专家896/16」「建议64+卡」。下方一条细条标注中文「权重约1.4TB · 上下文1M · MXFP4」。顶部标题中文「先钉死规格，再谈能不能私有化」。底部中文「下载免费，跑起来是机房的事」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="二x-上为什么在算3000-万">二、X 上为什么在算「3000 万」</h2>

<p>权重一放，X 上的情绪比参数表更诚实。</p>

<p>有人开玩笑说部署成本「3000 万左右」；有人回「后面还得再加个 0」；有人直接写「3 个小目标可以搞 10 套」。也有人怕领导说：<strong>K3 开源了，咱们来部署一下，测测本地知识库。</strong></p>

<p>另一条更土：机房、服务器、UPS、制冷、网络、运维人员——「全下来要一个亿吧」。</p>

<p>这些不是官方报价单。它们是行业人对<strong>数量级</strong>的直觉。</p>

<table>
  <thead>
    <tr>
      <th>社区说法</th>
      <th>我怎么读</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>「3000 万左右」</td>
      <td>64 卡级高端集群 + 配套，中国市场常谈的 <strong>CapEx 量级</strong></td>
    </tr>
    <tr>
      <td>「后面再加个 0」</td>
      <td>多活、高并发、长上下文生产、冗余与多地——<strong>夸张，但方向对</strong></td>
    </tr>
    <tr>
      <td>「领导要本地知识库」</td>
      <td>把「权重可下」误当成「部门可上」</td>
    </tr>
    <tr>
      <td>「80 张 5090 跑通了」</td>
      <td>极客实验有价值；吞吐、稳定性、1M 并发与生产 SLA 是另一回事</td>
    </tr>
  </tbody>
</table>

<blockquote>
  <p><strong>别跟参数表吵架。先问一句：你的资产负债表，扛不扛得住 64 卡以上的超节点？</strong></p>
</blockquote>

<h2 id="三同一本-h20-账把-k3-摊开">三、同一本 H20 账：把 K3 摊开</h2>

<p>四月那篇 DeepSeek 文，我用的是 AWS 风格 <strong>H20 8 卡实例</strong>（大陆可稳定采购的高端卡档位），1 年合约含税大约：</p>

<ul>
  <li><strong>单台 8×H20：约 ¥57.2 万 / 年</strong></li>
  <li><strong>V4-Flash（1 台）：年 TCO ≈ ¥60 万</strong>（含 100M 专线量级）</li>
  <li><strong>V4-Pro（4 台）：年 TCO ≈ ¥232 万</strong></li>
</ul>

<p>K3 官方建议 <strong>64+ 加速器</strong>。按「每节点 8 卡」粗算，就是 <strong>至少 8 个节点</strong>：</p>

<table>
  <thead>
    <tr>
      <th>项目</th>
      <th>粗算（人民币）</th>
      <th>备注</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>GPU 云租（8 台 H20 节点）</td>
      <td><strong>≈ ¥458 万 / 年</strong></td>
      <td>8 × 57.2 万；仅实例</td>
    </tr>
    <tr>
      <td>高速互联 / 存储 / 带宽</td>
      <td>数十万级起</td>
      <td>EP 通信不能省</td>
    </tr>
    <tr>
      <td>电费、制冷、机房、UPS</td>
      <td>视自建或托管</td>
      <td>64 卡功耗是机房题</td>
    </tr>
    <tr>
      <td>运维人力</td>
      <td>2–4 名以上高阶</td>
      <td>不是「装个 Docker 就走」</td>
    </tr>
    <tr>
      <td><strong>云上年 OpEx 量级</strong></td>
      <td><strong>约 ¥500–700 万+</strong></td>
      <td>方向估算，非厂商报价</td>
    </tr>
    <tr>
      <td><strong>自建 CapEx 社区量级</strong></td>
      <td><strong>约 ¥2000–3000 万+</strong></td>
      <td>卡 + 服务器 + 网络 + 场地；看货源与代际</td>
    </tr>
  </tbody>
</table>

<p>再强调一次：<strong>这是用我既有 H20 账本做的数量级推演</strong>，不是月之暗面的价目表。换成 H100/H200/B200 或昇腾超节点，绝对数会变，<strong>「比 V4-Pro 再上一个台阶」这个结构不会变</strong>。</p>

<p>权重本身：MXFP4 大约 1.4TB。塞进显存只是门票；生产服务还要：</p>

<ol>
  <li>Expert Parallel 的高带宽域</li>
  <li>1M 上下文的 KV 与前缀缓存</li>
  <li>并发余量与故障切换</li>
  <li>vLLM / SGLang 等对 KDA、MXFP4 的生产级适配</li>
</ol>

<p>所以你会看到两种真实世界：</p>

<ul>
  <li><strong>API / 托管</strong>：按 token 付钱，缓存命中时输入可以很便宜</li>
  <li><strong>真私有化</strong>：先过 64 卡这道坎，再谈「本地知识库」</li>
</ul>

<p><img src="/assets/images/illust-20260729-cost-ladder.webp" alt="成本阶梯：60万 → 232万 → 500万+ → 两三千万" />
<!-- baoyu-skill prompt: 2.35:1宽幅信息图，深色背景。四级上升阶梯从左到右中文「V4-Flash 年约60万」「V4-Pro 年约232万」「K3 云上年约500-700万+」「K3 自建CapEx 约2000-3000万+」。每级高度明显递增，最高级标红中文「普通公司到此止步」。顶部标题中文「同一本H20账本，摊到K3」。底部中文「数量级推演，不是厂商报价单」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="四并排对照flash--pro--k3-是三档门槛">四、并排对照：Flash / Pro / K3 是三档门槛</h2>

<p>把 DeepSeek V4 和 Kimi K3 放一张表里，企业决策会清楚很多：</p>

<table>
  <thead>
    <tr>
      <th>维度</th>
      <th>V4-Flash</th>
      <th>V4-Pro</th>
      <th><strong>Kimi K3</strong></th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>总参数</td>
      <td>284B</td>
      <td><strong>1.6T</strong></td>
      <td><strong>2.8T</strong></td>
    </tr>
    <tr>
      <td>激活参数</td>
      <td>13B</td>
      <td><strong>49B</strong></td>
      <td><strong>约 104B</strong></td>
    </tr>
    <tr>
      <td>显存/权重量级</td>
      <td>~250GB</td>
      <td>~1.3TB</td>
      <td><strong>权重 ~1.4TB+</strong></td>
    </tr>
    <tr>
      <td>推荐部署</td>
      <td><strong>1×8 卡</strong></td>
      <td><strong>4×8 卡</strong></td>
      <td><strong>64+ 加速器</strong></td>
    </tr>
    <tr>
      <td>年 TCO 参考</td>
      <td><strong>~¥60 万</strong></td>
      <td><strong>~¥232 万</strong></td>
      <td><strong>云上 ~¥500–700 万+</strong></td>
    </tr>
    <tr>
      <td>CapEx 体感</td>
      <td>中小可谈</td>
      <td>中大企业</td>
      <td><strong>头部 / 国央企 / 超节点</strong></td>
    </tr>
    <tr>
      <td>更像谁的工具</td>
      <td>多数公司私有化甜点</td>
      <td>强合规多节点</td>
      <td>前沿能力声明 + 少数能扛</td>
    </tr>
  </tbody>
</table>

<p>V4-Flash：私有化「还在普通人公司的预算里」。<br />
V4-Pro：已经是「认真做数据主权」的价位。<br />
K3：直接跳到 <strong>超节点叙事</strong>——不是研发小组周末 Docker 一下的项目。</p>

<blockquote>
  <p><strong>开源解决的是「你有没有权利跑」。私有化解决的是「你有没有能力跑」。这两件事，从来不是一回事。</strong></p>
</blockquote>

<p>这也是我四月那篇的后半句，今天要写得更硬一点：V4-Flash 曾把私有化成本拉回可接受区间；K3 则提醒市场——<strong>开放权重的天花板，可以继续抬；可私有化的甜点区，不会自动跟着抬。</strong></p>

<p><img src="/assets/images/illust-20260729-three-tiers.webp" alt="三档门槛：可私有 / 认真做主权 / 超节点" />
<!-- baoyu-skill prompt: 2.35:1宽幅对比信息图，深色背景。三列卡片中文标题「V4-Flash」「V4-Pro」「Kimi K3」，副标分别「可私有甜点」「认真做主权」「超节点门槛」。每列下方中文数字「年约60万」「年约232万」「年500万+ / CapEx两三千万」。右侧大箭头中文「门槛上移」。顶部标题中文「三档门槛，别混为一谈」。底部中文「开源权利 ≠ 私有能力」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="五企业怎么选别被开源了三个字绑架">五、企业怎么选：别被「开源了」三个字绑架</h2>

<p>我的建议仍然土，但管用：</p>

<h3 id="1先分清你要的是能力还是主权">1）先分清你要的是「能力」还是「主权」</h3>

<ul>
  <li>要前沿长程 coding、重推理、偶尔 multimodal → <strong>K3 API / 认证托管</strong> 往往更优</li>
  <li>要数据不出域、稳定内网、可预期成本 → <strong>中型可私有模型</strong>（V4-Flash 量级）才是主盘</li>
</ul>

<h3 id="2混合架构而不是宗教站队">2）混合架构，而不是宗教站队</h3>

<ul>
  <li><strong>80% 日常</strong>：私有中型模型 + 内部知识库</li>
  <li><strong>20% 尖峰</strong>：K3 / 其他前沿 API</li>
  <li>核心数据留在你控得住的一侧；尖峰能力按量买</li>
</ul>

<h3 id="3领导说开源了部署一下时回三句人话">3）领导说「开源了部署一下」时，回三句人话</h3>

<ol>
  <li>权重免费，集群不免费</li>
  <li>官方建议 64+ 卡，不是一张消费级卡的故事</li>
  <li>先算 TCO，再定 POC；POC 用 API 也能验证业务价值</li>
</ol>

<h3 id="4许可证也要看一眼">4）许可证也要看一眼</h3>

<p>Kimi K3 License 对<strong>内部使用</strong>相对友好；若你做对外 MaaS，且收入跨过一定门槛，需要另行协议。私有化之前，法务比运维更早该进场。出处见 <a href="https://huggingface.co/moonshotai/Kimi-K3">HF LICENSE</a>。</p>

<p><img src="/assets/images/illust-20260729-decision.webp" alt="决策：能力走 API，主权走中型私有" />
<!-- baoyu-skill prompt: 2.35:1宽幅流程图，深色背景冷静科技。左侧菱形中文「你要什么」，分出两路：上路中文「前沿能力」指向「K3 API/托管」；下路中文「数据主权」指向「中型私有模型」。中间汇合框中文「混合：日常私有 + 尖峰API」。顶部标题中文「别被开源了三个字绑架」。底部中文「先算TCO，再谈本地知识库」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="写在最后">写在最后</h2>

<p>压成五句：</p>

<ol>
  <li><strong>K3 权重开源是真事</strong>——2.8T、约 104B 激活、1M 上下文、MXFP4，HF 可下</li>
  <li><strong>官方门槛也是真事</strong>——建议 64+ 加速器 supernode，不是「docker 一键」</li>
  <li><strong>同一本 H20 账</strong>——V4-Flash ~60 万/年，V4-Pro ~232 万/年，K3 云上 GPU 粗算就四五百万起</li>
  <li><strong>社区说的 3000 万</strong>——更像自建 CapEx 的体感量级，不是笑话本身有趣，是数量级对得上</li>
  <li><strong>普通公司的正解</strong>——别和前沿私有化硬刚；混合架构，把钱花在业务闭环上</li>
</ol>

<p><strong>开源让「权利」大众化了；算力与运维，仍在把「能力」精英化。</strong> 接下来几年，你会越来越常看到这种分裂：权重越放越开，能私有化前沿模型的组织名单却越缩越短。</p>

<p>这不是悲观。这是让你少做一件错事——<strong>别把别人的开源新闻，当成自己的采购依据。</strong></p>

<p>我一个人打造的 <a href="https://zaokit.ai">Zaokit AI Agent 交易平台</a>，以及 AI PPT / 图文创作 <a href="https://zaokit.app">Zaokit.app</a>，做的是把可用的 AI 能力送进真实交付，而不是先堆一个谁都养不起的私有前沿集群。唯一网站：<a href="https://zaokit.app">https://zaokit.app</a>。</p>

<p>企业侧同一逻辑，已经融进可直接接入的服务：</p>

<ul>
  <li><a href="https://grok.zaokit.com">grok.zaokit.com</a></li>
  <li><a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a></li>
  <li><a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a></li>
  <li><a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a></li>
  <li><a href="https://junxinzhang.com/projects.html">完整产品列表</a></li>
</ul>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p>延伸：<a href="/deepseek-v4-private-deployment-cost-analysis">DeepSeek-V4 私有化部署到底要花多少钱</a> · <a href="/nvidia-open-weights-vs-closed-ai-camps">黄仁勋第一条帖子对着闭源阵营开炮</a> · <a href="/ai-is-not-just-llm-full-landscape">AI 被大模型绑架了</a></p>

<p>公开参考：<a href="https://www.kimi.com/blog/kimi-k3">Kimi K3 官方博客</a> · <a href="https://huggingface.co/moonshotai/Kimi-K3">HF moonshotai/Kimi-K3</a> · <a href="https://platform.kimi.ai/docs/guide/kimi-k3-quickstart">K3 Quickstart</a></p>

<hr />

<table>
  <tbody>
    <tr>
      <td>唯一网站：<a href="https://zaokit.app">Zaokit.app</a></td>
      <td>Agent 交易平台：<a href="https://zaokit.ai">Zaokit.ai</a></td>
    </tr>
  </tbody>
</table>

<p>企业 Grok 服务：<a href="https://grok.zaokit.com">grok.zaokit.com</a></p>

<p>企业服务：<a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a> · <a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a> · <a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a> · <a href="https://junxinzhang.com/projects.html">完整产品列表</a></p>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p><em>我是 Jason，自己一个人做 AI 产品。开源解决权利，私有化考验能力。别把下载链接，当成部署方案。</em></p>]]></content><author><name>Jason Zhang</name></author><category term="AI" /><category term="featured" /><category term="AI" /><category term="Kimi" /><category term="K3" /><category term="Moonshot" /><category term="开源权重" /><category term="私有化部署" /><category term="DeepSeek" /><category term="V4" /><category term="企业AI" /><category term="Zaokit" /><summary type="html"><![CDATA[Kimi K3 2.8T 权重开源，官方建议 64+ 加速器超节点。对标 DeepSeek V4-Pro 1.6T： 开源免费不等于私有化可及，前沿模型正在和普通公司脱钩。]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="https://junxinzhang.com/assets/images/cover-20260729-kimi-k3-private-deploy.webp" /><media:content medium="image" url="https://junxinzhang.com/assets/images/cover-20260729-kimi-k3-private-deploy.webp" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">从 PE 到 Graph：不是新词接力，是失败变贵了</title><link href="https://junxinzhang.com/pe-context-harness-loop-graph-evolution/" rel="alternate" type="text/html" title="从 PE 到 Graph：不是新词接力，是失败变贵了" /><published>2026-07-28T00:00:00+00:00</published><updated>2026-07-28T00:00:00+00:00</updated><id>https://junxinzhang.com/pe-context-harness-loop-graph-evolution</id><content type="html" xml:base="https://junxinzhang.com/pe-context-harness-loop-graph-evolution/"><![CDATA[<p>社区每隔半年到一年，就会冒出一个新词。</p>

<p>Prompt Engineering 火的时候，大家天天改 system prompt。后来是 Context Engineering，Karpathy 一句话，风向就偏过去了。再后来是 Harness，Agent = Model + Harness 被讲成公式。接着是 Loop——有人说自己已经不 prompt 了，只写循环。到了 2026 年中，Graph 又上了桌面：多节点、共享状态、可恢复执行。</p>

<p>表面看是名词接力。我更愿意把它看成一件更土的事：</p>

<blockquote>
  <p><strong>不是新词更好听，是上一层的失败变贵了，工程杠杆被迫外移。</strong></p>
</blockquote>

<p>五月我写过 <a href="/ai-cognition-blind-spot-from-prompt-to-harness">从 Prompt 到 Harness</a>，六月写过 <a href="/loop-engineering-ai-fde-must-know">循环工程</a>，七月写过 <a href="/harness-continuous-learning-self-iteration">Harness 自我迭代</a>。那几篇分别钉住单层。这篇只做一件事：<strong>把五层串成同一条因果链，并回答——你现在卡在哪一层。</strong></p>

<p><img src="/assets/images/cover-20260728-pe-to-graph.webp" alt="从 PE 到 Graph：不是新词接力，是失败变贵了" />
<!-- baoyu-skill prompt: 2.35:1电影感横版封面，深蓝到暗青渐变背景，冷静厚重的科技质感。画面一条从左到右上升的五层台阶，每层发光标签中文「PE」「Context」「Harness」「Loop」「Graph」，台阶边缘有裂纹标中文「失败变贵」。中央粗体大字中文「失败变贵，杠杆外移」。顶部副标中文「PE→Context→Harness→Loop→Graph」。底部中文「多数模型不行，其实是标错楼层」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="一先把五层钉成诊断表别当词汇表">一、先把五层钉成诊断表，别当词汇表</h2>

<p>很多人把这五个词当「升级路线图」：PE 过时了上 Context，再上 Harness，一直叠到 Graph。错。它们是<strong>嵌套楼层</strong>，不是互相作废的版本号。还有一句要先钉死：<strong>这是瓶颈叙事，不是严格编年史</strong>——ReAct 的 loop（2022）和 LangGraph（2024）在日历上早于 context/harness 的正名潮（2025–2026）。命名滞后于实践。</p>

<table>
  <thead>
    <tr>
      <th>层级</th>
      <th>工程对象</th>
      <th>核心问题</th>
      <th>典型失败</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td><strong>PE</strong></td>
      <td>单次指令</td>
      <td>说清楚了吗</td>
      <td>误解意图、格式跑偏</td>
    </tr>
    <tr>
      <td><strong>Context</strong></td>
      <td>调用时看到的一切</td>
      <td>看到对的信息了吗</td>
      <td>缺事实、噪声、context rot</td>
    </tr>
    <tr>
      <td><strong>Harness</strong></td>
      <td>一次完整运行</td>
      <td>长跑会不会漂</td>
      <td>错误复利、假完成、权限失控</td>
    </tr>
    <tr>
      <td><strong>Loop</strong></td>
      <td>可重复的运行</td>
      <td>人不在时还动吗</td>
      <td>人成 cron、成本失控</td>
    </tr>
    <tr>
      <td><strong>Graph</strong></td>
      <td>多节点协作</td>
      <td>多专长如何协同</td>
      <td>职责污染、路由混乱</td>
    </tr>
  </tbody>
</table>

<blockquote>
  <p><strong>Prompt 是 Context 的一部分；Context 管道是 Harness 的子系统；Harness 撑起一次 Loop；Loop 往往只是 Graph 里的一个节点。</strong></p>
</blockquote>

<p><img src="/assets/images/illust-20260728-five-layers-nested.webp" alt="五层不是替代，是嵌套" />
<!-- baoyu-skill prompt: 2.35:1宽幅信息图，深色背景，冷静科技质感。五个同心或嵌套模块从内到外标中文「PE」「Context」「Harness」「Loop」「Graph」，箭头标注中文「包含而非取代」。右侧一列失败模式小标签中文「误解」「缺信息」「漂移」「人成瓶颈」「协调失败」。顶部标题中文「五层是楼层，不是版本号」。底部中文「烂 Prompt 仍会毒死漂亮 Graph」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="二根本原因每一层都在给上一层的硬伤买单">二、根本原因：每一层都在给上一层的硬伤买单</h2>

<h3 id="1pe把话说清楚然后撞上窗口外没有事实">1）PE：把话说清楚——然后撞上「窗口外没有事实」</h3>

<p>Prompt Engineering 解决的是采样分布问题：角色、few-shot、输出格式、拒绝边界。同一模型，换说法，输出可以天差地别。天花板很干净：</p>

<p><strong>再完美的措辞，也变不出上下文里没有的事实。</strong></p>

<p>任务从「写一段文案」变成「用我的代码库/工单/合同做事」时，瓶颈立刻从「表达」变成「信息」。PE 没死，它只是从主角变成了外层系统里的一个被管理对象——Harrison Chase 的说法更直：PE 是 context engineering 的子集。</p>

<h3 id="2context把对的东西喂进去然后撞上长了会烂">2）Context：把对的东西喂进去——然后撞上「长了会烂」</h3>

<p>Karpathy 在 X 上那句被反复引用的话，把风向说得很白：</p>

<blockquote>
  <p><strong>I really like the term “context engineering” over prompt engineering. It describes the core skill better: the art of providing all the context for the task to be plausibly solvable by the LLM.</strong><br />
—— <a href="https://x.com/karpathy/status/1937902205765607626">Andrej Karpathy</a></p>
</blockquote>

<p>Anthropic 写得更硬：context 是<strong>有限且有成本的注意力预算</strong>；窗口越长，越容易 <strong>context rot</strong>——不是断崖，是召回与专注的渐变衰减。原则也很土：找<strong>尽可能小的高信号 token 集合</strong>。出处：<a href="https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents">Effective context engineering for AI agents</a>。</p>

<p>这一层的进步，是把「写一句 prompt」升级成「每一次 inference 都重新策展：什么进窗、什么压缩、什么落盘、什么按需检索」。<code class="language-plaintext highlighter-rouge">CLAUDE.md</code>、git 状态、按需读文件，本质都是 context 工程。</p>

<p>但 Context 仍有硬伤：<strong>输入再干净，也没人盯执行过程。</strong> 第 1 步对、第 7 步漂、第 20 步在错误上盖楼、最后自信「做完了」——不是「再喂两段文档」能治的。</p>

<h3 id="3harness给一次运行上缰绳然后撞上你还是那个启动按钮">3）Harness：给一次运行上缰绳——然后撞上「你还是那个启动按钮」</h3>

<p>LangChain 把公式写得很干净：</p>

<blockquote>
  <p><strong>Agent = Model + Harness。</strong><br />
<strong>If you’re not the model, you’re the harness.</strong><br />
—— <a href="https://www.langchain.com/blog/the-anatomy-of-an-agent-harness">The anatomy of an agent harness</a></p>
</blockquote>

<p>Harness 是模型之外的一切：工具注册与校验、权限门、状态与记忆、compaction、重试与恢复、日志与可观测性。模型提议，Harness 执行、观察、决定能不能继续。</p>

<p>Anthropic 在长程 agent 文里点名真实失败：一上来想 one-shot 整个项目、跨 session 失忆、过早宣布完成。应对很工程化——initializer 先搭环境与 feature list，coding agent 每次只啃一块，用 progress 文件和 git 交接，并用真实端到端检查而不是自评。出处：<a href="https://www.anthropic.com/engineering/effective-harnesses-for-long-running-agents">Effective harnesses for long-running agents</a>。</p>

<p>这一层回答的是：<strong>一次 run 能不能持续做对。</strong> 天花板也清楚：再完美的 harness，默认仍控制「这一次」。启动、看结果、决定要不要再开一轮——人还在回路里。对高 stakes 单次任务没问题；一旦工作变成每天的 issue triage、每周的报表刷新，<strong>你就变成了 cron。</strong></p>

<h3 id="4loop把自己从循环里拿出来然后撞上单专长装不下">4）Loop：把自己从循环里拿出来——然后撞上「单专长装不下」</h3>

<p>Loop 层的公开信号已经很明确。OpenClaw 作者 Peter Steinberger 的方向是：别再一条条 prompt coding agent，去设计那些<strong>替你 prompt 它们的循环</strong>。Claude Code 负责人 Boris Cherny 更直：自己不再亲自 prompt，有一堆 loops 在跑，活是写 loops。LangChain 随后把 loop engineering 收成可叠加的层：agent loop、verification loop、event-driven loop、hill-climbing loop。出处：<a href="https://www.langchain.com/blog/the-art-of-loop-engineering">The art of loop engineering</a>。</p>

<p>边界要钉死：</p>

<table>
  <thead>
    <tr>
      <th> </th>
      <th>Loop</th>
      <th>Harness</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>管什么</td>
      <td>做什么、何时做、何时算完</td>
      <td>在哪跑、能碰什么、怎么恢复</td>
    </tr>
    <tr>
      <td>像什么</td>
      <td>节拍与裁判</td>
      <td>舞台与护栏</td>
    </tr>
    <tr>
      <td>缺了会怎样</td>
      <td>安全但等你按按钮</td>
      <td>无人看管却可能有 root</td>
    </tr>
  </tbody>
</table>

<p>Loop 真正难的不是画圆，是 <strong>verifier 与终止条件</strong>。弱验证的无人 loop，不会只是「给个坏答案」——它会整夜自信地生产垃圾，并按 token 计费。我在<a href="/loop-engineering-ai-fde-must-know">循环工程</a>里写过：循环不难设计，难在养得起；今天再补一句——</p>

<blockquote>
  <p><strong>Loop 的瓶颈往往不是模型，是裁判。</strong></p>
</blockquote>

<p>单 loop 的天花板：它擅长<strong>一个专长的重复</strong>。研究、写作、评审、测试天然要不同上下文、不同工具、不同成功标准时，一个 loop 会开始什么都沾一点，什么都做不稳。</p>

<h3 id="5graph把多个节点织成组织然后撞上分布式系统税">5）Graph：把多个节点织成组织——然后撞上「分布式系统税」</h3>

<p>Graph 不是 2026 年凭空发明的词。LangGraph 的定位一直是：面向长程、有状态 agent 的<strong>编排运行时</strong>——节点做功、边负责路由、共享 state 在图上流动，并强调 durable execution、human-in-the-loop、失败后可恢复。出处：<a href="https://docs.langchain.com/oss/python/langgraph/overview">LangGraph overview</a>。</p>

<p>一个 loop，本质上是「单节点 + 自环」的最简图。Graph 是你需要 fan-out / fan-in、条件回环、确定性步骤与 agentic 步骤混跑、显式审计路由时，才真正必要的结构。它解决的是：<strong>多专长如何可靠协同。</strong></p>

<p>它引入的新税也真实：状态契约、失败回边、并发冲突、职责污染、可观测性。过早上 Graph，常常不是更智能，是更贵、更难排障。</p>

<p><img src="/assets/images/illust-20260728-failure-cost-shift.webp" alt="失败变贵，杠杆外移" />
<!-- baoyu-skill prompt: 2.35:1宽幅流程图，深色背景，冷静科技质感。从左到右五个阶段箭头连接，每段上方中文标签「PE」「Context」「Harness」「Loop」「Graph」，每段下方对应失败成本中文「误解变贵」「缺事实变贵」「漂移假完成变贵」「人成瓶颈变贵」「协调失败变贵」。中央大字中文「失败成本上移，工程杠杆外移」。顶部标题中文「五次跃迁的真正发动机」。底部中文「不是概念时尚，是账单在投票」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="三公开信号在收敛大家其实在修同一栋楼">三、公开信号在收敛：大家其实在修同一栋楼</h2>

<p>近一两年的高信号材料，表述不同，结构很像：Karpathy 推 context engineering；Anthropic 写注意力预算与 long-running harness；LangChain 钉 Agent = Model + Harness，并把 loop 叠成 agent / verification / event / hill-climb；LangGraph 管状态图与可恢复执行。</p>

<p>Claude Code、Cursor、OpenAI Agents SDK 路线不同，但 harness 要管的东西在趋同：loop、工具、状态压缩、权限门、恢复与可观测。OpenAI 更偏显式 multi-agent handoff；Claude Code / Cursor 更偏强单 agent + 深集成；组织级复杂交付，才会真正需要图与状态机。</p>

<blockquote>
  <p><strong>模型在变强，但拉开差距的，越来越是模型周围那套系统能不能撑过第 50 步。</strong></p>
</blockquote>

<p>同样一个模型，换 harness / loop / graph，端到端完成率可以差一截。评估 agent，只报模型名几乎不可复现，得报完整壳。</p>

<h2 id="四一张诊断图别再把模型不行当万能锅">四、一张诊断图：别再把「模型不行」当万能锅</h2>

<p>日常最有用的不是背定义，是<strong>标楼层</strong>：</p>

<table>
  <thead>
    <tr>
      <th>你看到的现象</th>
      <th>先修哪层</th>
      <th>别先干什么</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>完全听不懂你的要求</td>
      <td>PE</td>
      <td>别先上多 agent</td>
    </tr>
    <tr>
      <td>话说得漂亮，事实错/过时/看不见业务系统</td>
      <td>Context</td>
      <td>别先微调权重</td>
    </tr>
    <tr>
      <td>开头对，后面漂；或自信完成但一跑就挂</td>
      <td>Harness（多半是 verifier 弱）</td>
      <td>别只加更长 prompt</td>
    </tr>
    <tr>
      <td>结果其实还行，但必须你亲手启动才动</td>
      <td>Loop</td>
      <td>别只堆人工值守</td>
    </tr>
    <tr>
      <td>单 agent 怎么调都平庸，任务天然多角色</td>
      <td>Graph</td>
      <td>别在 context 还烂时织大网</td>
    </tr>
  </tbody>
</table>

<p>多数「模型能力不够」的吐槽，拆开后是：指令含糊；该看的没进窗、不该看的噪声进了窗；没有独立验收，只有模型自评；人还在当启动器和质检员；过早把一个团队问题塞进一个大脑。</p>

<p>我自己做产品时的默认顺序也很土：</p>

<p><strong>先把单任务的 context 和 harness 做扎实 → 再写带 verifier 的 loop → 最后在确实需要时才拆 graph。</strong></p>

<p>这和 Anthropic「先找最简单的解法」是同一纪律，也和我在 <a href="/llm-pretrain-posttrain-skill-workflow-agent">Skill / Workflow / Agent</a> 里说的「能降级就降级」同构：路径能画清、要审计 → Workflow + Skill；路径写不全、环境动态 → 小范围 Agent + 强 harness；要无人值守重复 → Loop；要多专长并行与汇合 → Graph。</p>

<p><img src="/assets/images/illust-20260728-diagnosis-floors.webp" alt="你卡在哪一层" />
<!-- baoyu-skill prompt: 2.35:1宽幅诊断信息图，深色背景，冷静科技质感。左侧电梯楼层示意图，五层按钮中文「5 Graph」「4 Loop」「3 Harness」「2 Context」「1 PE」，当前高亮某一层并标中文「先修最低卡点」。右侧对应现象条目中文「听不懂」「事实错」「长跑漂移」「等人启动」「多角色打架」。顶部标题中文「别把模型不行当万能锅」。底部中文「先标楼层，再动手术」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="五graph-该不该上三问比口号管用">五、Graph 该不该上：三问比口号管用</h2>

<p>Graph 最容易被写成「更高级」。我更建议用三问过滤：</p>

<ol>
  <li><strong>任务是否天然多专长？</strong> 研究、写作、评审、测试是否需要不同工具集与成功标准？同一类活重复做，单 loop 通常更稳。</li>
  <li><strong>是否需要显式路由与审计？</strong> 合规、财务、发布闸这类场景，边和状态比「让模型自由发挥」更重要。确定性节点该手写就手写。</li>
  <li><strong>有没有独立 verifier 节点？</strong> 没有裁判的多 agent，只是把错误复利从串行变成并行。生成便宜，<strong>判定够不够好</strong>才贵。</li>
</ol>

<p>若三问里你一个都答不硬，却已经在画六七个 agent 的漂亮拓扑——停一下。你可能不是在做编排，是在给自己制造分布式系统。反过来，若单 agent 上下文互相污染、串行太慢、关键步骤必须可回放，那 Graph 不是炫技，是必要的组织图。</p>

<h2 id="写在最后">写在最后</h2>

<p>压成五句：</p>

<ol>
  <li><strong>不是 buzzword 接力</strong>——是失败成本上移后的杠杆外移</li>
  <li><strong>五层嵌套不互替</strong>——烂 prompt 仍会毒死漂亮 graph</li>
  <li><strong>公开材料已收敛</strong>——Karpathy / Anthropic / LangChain / LangGraph 修同一栋楼</li>
  <li><strong>先标楼层再施工</strong>——听不懂、缺事实、长跑漂、等人启动、多角色打架，手术不同</li>
  <li><strong>Graph 要克制</strong>——多专长、要审计、有独立 verifier 再上；否则单 loop 更诚实</li>
</ol>

<p><strong>模型是发动机。发动机不会自己赢。车会。2026 年拉开差距的，是谁先把失败变贵的那一层，工程化成壳、循环与图。</strong></p>

<p>我一个人打造的 <a href="https://zaokit.ai">Zaokit AI Agent 交易平台</a>，以及 AI PPT / 图文创作 <a href="https://zaokit.app">Zaokit.app</a>，做的也是同一条外移：把能力送进可交付的 harness 与工作流，而不是停在聊天窗口。唯一网站：<a href="https://zaokit.app">https://zaokit.app</a>。</p>

<p>企业侧同一逻辑，已经融进可直接接入的服务：</p>

<ul>
  <li><a href="https://grok.zaokit.com">grok.zaokit.com</a></li>
  <li><a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a></li>
  <li><a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a></li>
  <li><a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a></li>
  <li><a href="https://junxinzhang.com/projects.html">完整产品列表</a></li>
</ul>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p>延伸：<a href="/ai-cognition-blind-spot-from-prompt-to-harness">从 Prompt 到 Harness</a> · <a href="/loop-engineering-ai-fde-must-know">别再写提示词，去写循环</a> · <a href="/harness-continuous-learning-self-iteration">会学习的是外面那圈壳</a> · <a href="/llm-pretrain-posttrain-skill-workflow-agent">预训练是别人的工厂</a></p>

<p>公开参考：<a href="https://x.com/karpathy/status/1937902205765607626">Karpathy</a> · <a href="https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents">Anthropic context</a> · <a href="https://www.anthropic.com/engineering/effective-harnesses-for-long-running-agents">Anthropic harness</a> · <a href="https://www.langchain.com/blog/the-anatomy-of-an-agent-harness">LangChain harness</a> · <a href="https://www.langchain.com/blog/the-art-of-loop-engineering">Loop engineering</a> · <a href="https://docs.langchain.com/oss/python/langgraph/overview">LangGraph</a></p>

<hr />

<table>
  <tbody>
    <tr>
      <td>唯一网站：<a href="https://zaokit.app">Zaokit.app</a></td>
      <td>Agent 交易平台：<a href="https://zaokit.ai">Zaokit.ai</a> · 企业服务见 <a href="https://junxinzhang.com/projects.html">projects</a></td>
    </tr>
  </tbody>
</table>

<hr />

<p><em>我是 Jason，自己一个人做 AI 产品。新词会过时，失败账单不会。先找准你卡在哪一层，再决定是改一句话，还是改整张图。</em></p>]]></content><author><name>Jason Zhang</name></author><category term="AI" /><category term="featured" /><category term="AI" /><category term="Prompt Engineering" /><category term="Context Engineering" /><category term="Harness" /><category term="Loop" /><category term="Graph" /><category term="Agent" /><category term="LangGraph" /><category term="Anthropic" /><category term="Zaokit" /><summary type="html"><![CDATA[从 PE 到 Context、Harness、Loop、Graph，不是概念时尚，是上一层失败变贵后工程杠杆外移。 多数「模型不行」的抱怨，其实是标错了楼层。]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="https://junxinzhang.com/assets/images/cover-20260728-pe-to-graph.webp" /><media:content medium="image" url="https://junxinzhang.com/assets/images/cover-20260728-pe-to-graph.webp" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">AI 越替你记，你越需要自己记</title><link href="https://junxinzhang.com/ai-memory-paradox-brain-still-matters/" rel="alternate" type="text/html" title="AI 越替你记，你越需要自己记" /><published>2026-07-27T00:00:00+00:00</published><updated>2026-07-27T00:00:00+00:00</updated><id>https://junxinzhang.com/ai-memory-paradox-brain-still-matters</id><content type="html" xml:base="https://junxinzhang.com/ai-memory-paradox-brain-still-matters/"><![CDATA[<p>AI 能帮你查一切、算一切、总结一切。</p>

<p>但有一件事它替不了你：<strong>判断它给的答案到底对不对。</strong></p>

<p>最近读到一篇论文，名字就很直白——《The Memory Paradox》。作者是 Barbara Oakley 等人，发在 arXiv（2506.11015），跨了计算机科学和神经科学两个领域。核心结论一句话：</p>

<blockquote>
  <p><strong>外部 AI 工具越强大，大脑内部的知识结构越容易萎缩。而恰恰是这些内部结构，决定了你能不能用好 AI。</strong></p>
</blockquote>

<p>与此同时，Andrej Karpathy 从另一个角度说了类似的事：如果你还年轻，80% 的时间应该砸在数学、物理和 CS 上——不是因为它有用，而是因为它在大脑里刻沟槽。</p>

<p>两个人说的不是同一件事，但底层指向同一个问题：<strong>AI 时代，你脑子里的底子，比任何时候都重要。</strong></p>

<p><img src="/assets/images/cover-20260727-memory-paradox.webp" alt="AI 越替你记，你越需要自己记" />
<!-- baoyu-skill prompt: 2.35:1电影感横版封面，深蓝到暗紫渐变背景，冷静厚重的科技质感。画面中央一颗发光的大脑，大脑左半边清晰有神经网络纹路发光，右半边逐渐透明模糊消散成数据流。大脑下方一个AI芯片图标。中央粗体大字中文「AI越替你记 你越需要自己记」。顶部副标中文「记忆悖论」。底部中文「判断力的底子，工具替不了」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="一一篇论文揭了一个反直觉的事实">一、一篇论文揭了一个反直觉的事实</h2>

<p>《The Memory Paradox: Why Our Brains Need Knowledge in an Age of AI》——论文标题本身就是论点。</p>

<p>几个核心发现，直接摆数据和结论：</p>

<table>
  <thead>
    <tr>
      <th>发现</th>
      <th>说了什么</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td><strong>认知卸载风险</strong></td>
      <td>ChatGPT 和计算器会短路大脑的检索、纠错和图式建构过程</td>
    </tr>
    <tr>
      <td><strong>过早依赖 AI</strong></td>
      <td>实证表明过早依赖 AI 会抑制程序化学习和直觉掌握</td>
    </tr>
    <tr>
      <td><strong>发现式教学的坑</strong></td>
      <td>发现式教学法可能损害声明性和程序性记忆的巩固</td>
    </tr>
    <tr>
      <td><strong>人机协作的前提</strong></td>
      <td>有效的人机协作依赖于强大的内部模型——图式和神经流形</td>
    </tr>
  </tbody>
</table>

<p>翻译成大白话：</p>

<p>AI 让你不用记、不用算、不用反复练。<strong>但恰恰是记、算、反复练这些过程，在大脑里建起了判断的底座。</strong></p>

<p>论文还提了一个很有意思的类比：<strong>深度学习里的”Grokking”现象和人类大脑的过度学习惊人相似。</strong> AI 模型在训练数据上达到 100% 准确率之后，继续训练，才会突然「顿悟」底层规律。人脑也一样——初始掌握之后的反复练习，才是直觉形成的关键阶段。</p>

<p>这就解释了为什么「会用 ChatGPT 查答案」和「真正理解一个领域」之间，隔着一道很难跨越的鸿沟。</p>

<p><img src="/assets/images/illust-20260727-memory-schema.webp" alt="记忆不是存储，是建结构" />
<!-- baoyu-skill prompt: 2.35:1宽幅信息图，深色背景，冷静科技质感。左栏标中文「表层·能查到」下方图标：搜索框+AI聊天窗口，底部中文「信息检索」；右栏标中文「深层·记住了」下方图标：大脑神经网络发光互联，底部中文「图式·直觉·判断力」。中央一道鸿沟标中文「这道坎AI替不了」。顶部标题中文「能查到≠记住了」。底部中文「记忆是建结构，不是存文件」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="二谷歌效应的-ai-升级版">二、谷歌效应的 AI 升级版</h2>

<p>论文里引用了一个经典研究——2011 年 Sparrow 等人发现的「谷歌效应」：</p>

<blockquote>
  <p><strong>人一旦知道信息可以在网上找到，大脑就自动降低对这条信息的记忆编码。你记住的不是答案，而是去哪找答案。</strong></p>
</blockquote>

<p>这个效应在 AI 时代被放大了。以前你至少还要打开浏览器、输入关键词、筛选结果。现在直接问 AI 一句话，答案就来了。连「搜索」这个动作的认知负担都被卸掉了。</p>

<p>论文用了一个词叫 <strong>“元认知惰性”</strong>——当 AI 随时可用，人主动深入思考的动机会下降。不是不会想，是不想想。</p>

<p>这里有一个很容易忽略的陷阱：</p>

<p><strong>AI 给的答案通常看起来都很像对的。</strong> 格式整齐、逻辑通顺、引经据典。但如果你对这个领域没有足够的基础知识，你根本分不清哪些是真的、哪些是 AI 编的、哪些是「听起来有道理但经不起推敲」的。</p>

<p>论文的原话：</p>

<blockquote>
  <p><strong>有效的人机交互依赖于强大的内部模型。这些生物学意义上的「图式」和神经流形，使用户能够评估、修正和引导 AI 输出。</strong></p>
</blockquote>

<p>少了这层内部模型，你就不是在「用 AI」，而是在<strong>被 AI 用</strong>。</p>

<p><img src="/assets/images/illust-20260727-google-effect-ai.webp" alt="谷歌效应的AI升级版" />
<!-- baoyu-skill prompt: 2.35:1宽幅信息图，深色背景，冷静科技质感。左侧一条时间线，上方2011年标中文「谷歌效应·记住去哪找」图标为搜索框，下方2025年标中文「AI效应·连找都不用」图标为AI聊天气泡。右侧大脑图示逐渐变淡透明，标中文「元认知惰性·不是不会想·是不想想」。中央箭头向下标中文「认知卸载加速」。顶部标题中文「从谷歌效应到AI效应」。底部中文「答案越容易得到·大脑越懒得记」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="三karpathy-说得更狠在大脑里刻沟槽">三、Karpathy 说得更狠：在大脑里刻沟槽</h2>

<p>Andrej Karpathy 从另一个角度切入同一个问题。</p>

<p>他的原话：</p>

<blockquote>
  <p><strong>“If you are a teenager right now, I’d mass-dosage on math, physics, chemistry, CS. These carve grooves in the brain that last a lifetime.”</strong></p>
</blockquote>

<p>翻译：如果你现在是青少年，拼命灌数学、物理、化学、计算机。<strong>这些东西在大脑里刻下的沟槽，一辈子都在。</strong></p>

<p>他讨论的重点不是知识点，是<strong>大脑底层计算结构的形成</strong>：</p>

<table>
  <thead>
    <tr>
      <th>学科</th>
      <th>训练什么</th>
      <th>大脑里留下什么</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td><strong>数学</strong></td>
      <td>抽象能力</td>
      <td>从具象里提炼结构的回路</td>
    </tr>
    <tr>
      <td><strong>物理</strong></td>
      <td>第一性原理</td>
      <td>从现象回溯底层机制的回路</td>
    </tr>
    <tr>
      <td><strong>CS</strong></td>
      <td>系统思维</td>
      <td>拆解复杂系统、管理状态的回路</td>
    </tr>
  </tbody>
</table>

<p>注意他说的不是「这些科目有用」，而是「这些科目在大脑里刻沟槽」。</p>

<p>沟槽，不是知识点。知识点可以查，沟槽查不了。</p>

<p>年龄越大，这些沟槽越难刻。这跟神经科学里的突触可塑性窗口是对应的——青少年时期大脑重塑能力最强，错过了不是不能补，是成本指数级上升。</p>

<p>Karpathy 把这个逻辑拉到 AGI 时间线上：</p>

<ul>
  <li><strong>AGI 之前</strong>：这些认知基础帮你找到工作。</li>
  <li><strong>AGI 之后</strong>：这些认知基础让你成为一个有判断力的人。</li>
</ul>

<p>这才是最值得咀嚼的一句。当 AGI 真的来了，大部分「有用的技能」都可能被替代。到那时候，唯一不被替代的，是你脑子里的底层结构——你能不能看穿一个论证、能不能从第一性原理出发推导、能不能把一个模糊问题拆成可操作的步骤。</p>

<p><img src="/assets/images/illust-20260727-brain-grooves.webp" alt="在大脑里刻沟槽" />
<!-- baoyu-skill prompt: 2.35:1宽幅信息图，深色背景，冷静科技质感。中央一颗大脑俯视图，表面有三条发光的深刻沟槽分别标中文「数学·抽象」「物理·第一性原理」「CS·系统思维」。大脑周围淡色散落的知识碎片标中文「知识点可以查」，沟槽处标中文「沟槽查不了」。顶部标题中文「Karpathy：在大脑里刻沟槽」。底部中文「年龄越大越难刻·错过成本指数级上升」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="四论文和-karpathy-在说同一件事">四、论文和 Karpathy 在说同一件事</h2>

<p>两个人从不同入口走进了同一个房间：</p>

<table>
  <thead>
    <tr>
      <th> </th>
      <th>论文（Oakley 等人）</th>
      <th>Karpathy</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td><strong>切入角度</strong></td>
      <td>神经科学 + 教育心理学</td>
      <td>工程师直觉 + 教育建议</td>
    </tr>
    <tr>
      <td><strong>核心主张</strong></td>
      <td>记忆-检索-纠错循环构建图式和直觉</td>
      <td>数学物理 CS 的抽象训练在大脑中刻沟槽</td>
    </tr>
    <tr>
      <td><strong>对 AI 的态度</strong></td>
      <td>AI 可以是好的学习伙伴，但不能替代过程</td>
      <td>AI 时代认知基础比任何时候都重要</td>
    </tr>
    <tr>
      <td><strong>底层逻辑</strong></td>
      <td>认知基础设施不可外包</td>
      <td>认知基础设施不可外包</td>
    </tr>
  </tbody>
</table>

<p>底层是同一件事：<strong>有些东西必须经过你自己大脑的处理才能变成你的。</strong></p>

<p>AI 可以帮你查到公式，但推导公式的过程建立的神经回路，AI 替不了。AI 可以帮你写代码，但调试代码时形成的系统直觉，AI 替不了。AI 可以帮你总结一篇论文，但反复阅读和质疑论文时形成的批判性框架，AI 替不了。</p>

<p>这不是反 AI。恰恰相反——<strong>你的内部模型越强，你用 AI 的效率越高、判断越准。</strong></p>

<p>论文里提到的一个发现特别值得记住：在学习初期就大量使用 AI 辅助的学生，短期表现看起来不错，但长期保留率和迁移能力显著低于那些先经历了自主挣扎的学生。</p>

<p>原因不难理解：挣扎本身就是学习。不是因为挣扎「好」，而是因为<strong>挣扎时大脑在做检索、纠错和重编码——这些正是图式建构的核心机制</strong>。</p>

<p><img src="/assets/images/illust-20260727-same-conclusion.webp" alt="两个人说的是同一件事" />
<!-- baoyu-skill prompt: 2.35:1宽幅信息图，深色背景，冷静科技质感。左栏人物剪影标中文「Oakley论文」副标中文「记忆-检索-纠错→图式」；右栏人物剪影标中文「Karpathy」副标中文「数学-物理-CS→沟槽」。两侧箭头汇聚到中央一个发光节点标中文「认知基础设施不可外包」。顶部标题中文「两条路·同一个终点」。底部中文「内部模型越强·AI用得越好」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="五怎么办不是少用-ai是换一种用法">五、怎么办：不是少用 AI，是换一种用法</h2>

<p>说到这里，结论不是「别用 AI」。那是另一种极端。</p>

<p>论文和 Karpathy 都指向同一个实操方向：<strong>AI 应该是教练，不是代笔。</strong></p>

<p>具体来说：</p>

<ol>
  <li><strong>先挣扎，再求助。</strong> 碰到新问题，先自己想 10 分钟。想不出来再问 AI。那 10 分钟的检索和纠错，就是在建图式。</li>
  <li><strong>用 AI 验证，不是用 AI 替代。</strong> 自己写完答案，让 AI 检查。而不是让 AI 给答案，你来复制。</li>
  <li><strong>基础学科慢慢啃。</strong> 数学、物理、CS 这类刻沟槽的东西，不能 AI 速成。该推导的推导，该手写的手写。</li>
  <li><strong>定期离线思考。</strong> 每天给自己一段没有 AI 的时间，只靠脑子想问题。保持大脑的「肌肉记忆」。</li>
</ol>

<p>最终极的一条：<strong>如果你发现自己越来越不敢在没有 AI 的情况下做判断，那就是信号。</strong></p>

<h2 id="写在最后">写在最后</h2>

<p>压成五句：</p>

<ol>
  <li><strong>论文揭了一个悖论</strong>——AI 越能帮你记，你大脑的记忆结构越容易萎缩</li>
  <li><strong>谷歌效应被 AI 放大</strong>——元认知惰性让人不是不会想，而是不想想</li>
  <li><strong>Karpathy 说刻沟槽</strong>——数学物理 CS 不是学知识，是建大脑底层计算结构</li>
  <li><strong>底层是同一件事</strong>——认知基础设施不可外包，你的内部模型决定你用 AI 的上限</li>
  <li><strong>不是少用 AI</strong>——是先挣扎再求助，用 AI 验证而不是替代</li>
</ol>

<p><strong>AI 时代最危险的错觉：觉得什么都能查到，就什么都不用记。记忆的意义从来不是存储——是让你有底子判断，什么值得信，什么只是听起来像那么回事。</strong></p>

<p>我一个人打造的 <a href="https://zaokit.ai">Zaokit AI Agent 交易平台</a>，以及 AI PPT / 图文创作 <a href="https://zaokit.app">Zaokit.app</a>，做的也是同一件事——工具归工具，判断归你。唯一网站：<a href="https://zaokit.app">https://zaokit.app</a>。</p>

<p>企业侧同一逻辑，已经融进可直接接入的服务：</p>

<ul>
  <li><a href="https://grok.zaokit.com">grok.zaokit.com</a></li>
  <li><a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a></li>
  <li><a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a></li>
  <li><a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a></li>
  <li><a href="https://junxinzhang.com/projects.html">完整产品列表</a></li>
</ul>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p>延伸：<a href="/ai-is-not-just-llm-full-landscape">AI 被大模型绑架了</a> · <a href="/chatgpt-desktop-voice-gpt-live-appshots">语音不是聊天附件，是 Agent 调度台</a> · <a href="/nvidia-open-weights-vs-closed-ai-camps">开放 VS 闭源：公开站队</a></p>

<hr />

<table>
  <tbody>
    <tr>
      <td>唯一网站：<a href="https://zaokit.app">Zaokit.app</a></td>
      <td>Agent 交易平台：<a href="https://zaokit.ai">Zaokit.ai</a></td>
    </tr>
  </tbody>
</table>

<p>企业 Grok 服务：<a href="https://grok.zaokit.com">grok.zaokit.com</a></p>

<p>企业服务：<a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a> · <a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a> · <a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a> · <a href="https://junxinzhang.com/projects.html">完整产品列表</a></p>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p><em>我是 Jason，自己一个人做 AI 产品。AI 能替你记住一切，但替不了你脑子里的底子。有些沟槽，必须自己刻。</em></p>]]></content><author><name>Jason Zhang</name></author><category term="AI" /><category term="featured" /><category term="AI" /><category term="记忆" /><category term="认知科学" /><category term="Karpathy" /><category term="学习" /><category term="教育" /><category term="判断力" /><category term="Zaokit" /><summary type="html"><![CDATA[一篇论文揭了一个反直觉的事实：AI 越能替你记住一切，你的大脑越需要真正记住一些东西。 没有内化的知识结构，你连 AI 给的答案对不对都判断不了。Karpathy 说得更狠：80% 的教育应该是数学、物理、CS。]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="https://junxinzhang.com/assets/images/cover-20260727-memory-paradox.webp" /><media:content medium="image" url="https://junxinzhang.com/assets/images/cover-20260727-memory-paradox.webp" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">黄仁勋人生第一条帖子，直接对着闭源阵营开炮</title><link href="https://junxinzhang.com/nvidia-open-weights-vs-closed-ai-camps/" rel="alternate" type="text/html" title="黄仁勋人生第一条帖子，直接对着闭源阵营开炮" /><published>2026-07-26T00:00:00+00:00</published><updated>2026-07-26T00:00:00+00:00</updated><id>https://junxinzhang.com/nvidia-open-weights-vs-closed-ai-camps</id><content type="html" xml:base="https://junxinzhang.com/nvidia-open-weights-vs-closed-ai-camps/"><![CDATA[<p>黄仁勋在 X 上发了人生中第一条帖子。</p>

<p>不是产品发布，不是财报晒单，是转发了一封 NVIDIA 签署的公开信——《Open Weights and American AI Leadership》。几个小时浏览量冲到 1742 万。</p>

<p>一个在公众视野里只穿皮衣、不玩社交媒体的人，选择用这封信作为自己在 X 上的第一次发声。这件事本身就值得多看一眼。</p>

<p><img src="/assets/images/cover-20260726-nvidia-open-weights-vs-closed.webp" alt="黄仁勋人生第一条帖子，直接对着闭源阵营开炮" />
<!-- baoyu-skill prompt: 2.35:1电影感横版封面，深黑到深蓝渐变背景，冷静厚重的科技质感。画面左侧黄仁勋标志性皮衣人物剪影，右侧一封发光公开信文档图标。中央粗体大字中文「开放 VS 闭源：公开站队」。顶部副标中文「黄仁勋人生第一条X帖子」。底部中文「NVIDIA · Meta · Microsoft VS OpenAI · Anthropic · Google」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="一两封信正面对撞">一、两封信，正面对撞</h2>

<p>要看懂这封信的分量，先看它在回应谁。</p>

<p>此前不久，Google DeepMind CEO Demis Hassabis 发了一封公开信，主张建立一个全球性的安全标准机构。核心意思：所有前沿 AI 模型——包括中国的 DeepSeek 和阿里的 Qwen——都必须通过统一的安全评估，才能上市部署。</p>

<p>翻译成大白话：先过我定的考试，才能上路。</p>

<p>黄仁勋这封信，几乎是逐点反驳：</p>

<table>
  <thead>
    <tr>
      <th>Hassabis 的立场</th>
      <th>NVIDIA 公开信的立场</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>建全球安全标准机构，统一评估</td>
      <td>不要搞过早的限制，会扼杀竞争</td>
    </tr>
    <tr>
      <td>闭源更可控，安全更有保障</td>
      <td>闭源不天然更安全，开放才是安全路径</td>
    </tr>
    <tr>
      <td>所有前沿模型必须通过评估</td>
      <td>开放权重让更多人参与审查和改进</td>
    </tr>
    <tr>
      <td>暗示蒸馏是”窃取”</td>
      <td>蒸馏是合法技术，不应跟偷窃混为一谈</td>
    </tr>
  </tbody>
</table>

<p>两封信不是学术讨论。是两个阵营在抢话筒，争的是 AI 未来的游戏规则由谁来定。</p>

<p><img src="/assets/images/illust-20260726-two-letters-clash.webp" alt="两封信正面对撞" />
<!-- baoyu-skill prompt: 2.35:1宽幅对比信息图，深色背景，冷静科技质感。左栏冷红标中文「Hassabis·闭源阵营」副标中文「建标准·统一评估·限制开放」；右栏冷青标中文「黄仁勋·开放阵营」副标中文「开放权重·不要限制·透明更安全」。中央一道闪电裂痕标中文「正面对撞」。顶部标题中文「两封公开信」。底部中文「争的是游戏规则由谁来定」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="二闭源不等于安全这句话才是重点">二、闭源不等于安全，这句话才是重点</h2>

<p>公开信里有一段话，我觉得比整篇文章的政治站位都重要：</p>

<blockquote>
  <p><strong>仅仅依赖闭源模型并不天然更安全：它们也会被攻破、被滥用、以外界无法发现的方式失败。把先进 AI 集中在少数闭源模型手里，只会制造更多单点故障。</strong></p>
</blockquote>

<p>这句话戳的不是技术问题，是安全叙事里最大的一个假设——「关起门来就安全」。</p>

<p>闭源模型确实更难被直接复制权重。但安全不只是防复制：</p>

<ul>
  <li><strong>闭源模型被攻破的案例不少。</strong> Prompt 注入、越狱攻击、API 滥用，闭源没有因为「不公开」而少挨打。</li>
  <li><strong>出了问题外界看不见。</strong> 闭源模型的偏见、幻觉、安全漏洞，如果提供商不主动披露，用户根本无从发现。</li>
  <li><strong>单点故障风险集中。</strong> 全世界都依赖三五个闭源 API，任何一个出问题，波及面是系统性的。</li>
</ul>

<p>公开信的逻辑是：<strong>开放权重让更多人能检查模型行为、发现漏洞、开发防护，就像开源软件证明的那样——透明比黑箱更安全。</strong></p>

<p>这个论点是不是绝对正确？不一定。但它至少把「闭源 = 安全」这个默认假设打了一个问号。而这个问号，一直没人敢公开打。</p>

<p><img src="/assets/images/illust-20260726-closed-not-safe.webp" alt="闭源不等于安全" />
<!-- baoyu-skill prompt: 2.35:1宽幅信息图，深色背景，冷静科技质感。中央一个巨大的锁图标，锁上出现裂纹，裂纹处标中文「被攻破」「被滥用」「无法发现的失败」。锁下方标中文「闭源≠安全」。右侧一个透明的开放模型图标发光，标中文「开放→更多人检查→更多人修复」。顶部标题中文「安全叙事最大的假设」。底部中文「透明比黑箱更安全」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="三替蒸馏说公道话在替谁说话">三、替蒸馏说公道话——在替谁说话？</h2>

<p>信里还有一段专门替「蒸馏」正名：</p>

<blockquote>
  <p>蒸馏，即用一个模型的输出来训练或改进另一个模型，是广泛使用的模型改进技术。它延续了从开源软件运动以来的学习、借鉴、改进传统，不应与非法窃取混为一谈。</p>
</blockquote>

<p>这段话的潜台词，懂的人都懂。</p>

<p>DeepSeek 被指控通过蒸馏 OpenAI 的模型来提升自己的能力。OpenAI 公开表态「这是偷窃」，并推动政策层面对蒸馏行为的限制。</p>

<p>NVIDIA 这封信直接说：蒸馏是合法技术手段。真正有问题的是非法提取闭源模型的价值——但这应该用针对性的法律和商业框架解决，而不是一刀切禁止蒸馏本身。</p>

<p>再看签名名单，就更明白了。</p>

<p><img src="/assets/images/illust-20260726-distillation-defense.webp" alt="替蒸馏说句公道话" />
<!-- baoyu-skill prompt: 2.35:1宽幅信息图，深色背景，冷静科技质感。中央一个蒸馏瓶图标发光，瓶身标中文「蒸馏」，左侧箭头标中文「大模型输出」，右侧箭头标中文「小模型改进」。瓶下方标中文「合法技术手段」。右下角一个小天平图标标中文「不等于偷窃」。顶部标题中文「替蒸馏说句公道话」。底部中文「开源传统·学习借鉴改进」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="四签名名单才是真正的信号">四、签名名单才是真正的信号</h2>

<p>签了的：</p>

<p><strong>NVIDIA、Meta、Microsoft、a16z（Andreessen Horowitz）、Hugging Face、Mistral、Y Combinator、IBM、Dell、Mozilla、Palantir、Perplexity、Replit、The Linux Foundation、CrowdStrike、ServiceNow、Box</strong> 等 25 家。</p>

<p>没签的：</p>

<p><strong>OpenAI、Anthropic、Google。</strong></p>

<p>三家没签的，恰好是当前最大的三家闭源前沿模型提供商。</p>

<table>
  <thead>
    <tr>
      <th>阵营</th>
      <th>代表</th>
      <th>核心利益</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td><strong>开放阵营</strong></td>
      <td>NVIDIA、Meta、Microsoft、a16z</td>
      <td>卖算力、卖云、卖生态——开放模型越多，需求越大</td>
    </tr>
    <tr>
      <td><strong>闭源阵营</strong></td>
      <td>OpenAI、Anthropic、Google</td>
      <td>卖 API、卖订阅——护城河建在模型独占上</td>
    </tr>
  </tbody>
</table>

<p>这不是「开放好还是闭源好」的哲学辩论。这是商业利益驱动的阵营划分。</p>

<p>NVIDIA 卖 GPU，开放模型越多、跑模型的人越多，GPU 需求越大。Meta 推 Llama 开源，是要用开放生态对冲 OpenAI 的先发优势。a16z 投了一堆开源 AI 创业公司。</p>

<p>反过来，OpenAI 和 Anthropic 的收入几乎全靠 API 和订阅。模型权重一旦开放，它们的核心壁垒就被拆了。Google 卖云卖广告，Gemini 的闭源是保住 AI 搜索的关键筹码。</p>

<p>这不是对错之争，是利益之争。</p>

<p><img src="/assets/images/illust-20260726-two-camps-lineup.webp" alt="两个阵营公开站队" />
<!-- baoyu-skill prompt: 2.35:1宽幅对比信息图，深色背景，冷静科技质感。左栏冷青高亮标中文「开放阵营」，下方Logo排列标中文「NVIDIA」「Meta」「Microsoft」「a16z」「Hugging Face」「Mistral」「Y Combinator」，底部中文「卖算力·卖云·卖生态」；右栏冷红标中文「闭源阵营」，下方标中文「OpenAI」「Anthropic」「Google」，底部中文「卖API·卖订阅·护城河在模型独占」。中央大字中文「利益决定立场」。顶部标题中文「谁签了·谁没签」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="五黄仁勋选这封信发第一条帖子说明什么">五、黄仁勋选这封信发第一条帖子，说明什么</h2>

<p>黄仁勋不是随便发帖的人。他连社交媒体账号都几乎不用。</p>

<p>人生第一条 X 帖子，不发产品、不发财报、不发鸡汤，选了一封关于开放权重的政策公开信。这个选择本身就是信号：</p>

<p><strong>AI 的战场正在从技术竞赛转向规则制定。</strong></p>

<p>模型能力的差距在缩小——DeepSeek、Llama、Mistral 已经证明开放模型可以接近甚至某些场景超过闭源前沿。当技术差距不再是绝对壁垒，谁来定规则、谁的模型需要”通过评估”才能上市，才是真正的制高点。</p>

<p>Hassabis 推的安全标准机构，表面是「让所有人都安全」，潜台词是：评估标准由我们来定，通过门槛由我们来设。如果标准足够高、流程足够长，开放模型和后来者天然处于劣势。</p>

<p>NVIDIA 这封信反过来说：别搞准入限制，让市场和社区来检验。</p>

<blockquote>
  <p><strong>争的不是开放好还是闭源好。争的是下一个十年，AI 的规则由谁来写。</strong></p>
</blockquote>

<h2 id="写在最后">写在最后</h2>

<p>压成五句：</p>

<ol>
  <li><strong>黄仁勋第一条帖子</strong>——转发 NVIDIA 签署的开放权重公开信，几小时 1742 万浏览</li>
  <li><strong>正面对撞 Hassabis</strong>——一个要建标准限制，一个说开放才是正路</li>
  <li><strong>闭源不等于安全</strong>——也会被攻破、被滥用、以外界无法发现的方式失败</li>
  <li><strong>替蒸馏正名</strong>——合法技术手段，不是偷窃，懂的都懂</li>
  <li><strong>签名名单是真信号</strong>——NVIDIA/Meta/Microsoft 签了，OpenAI/Anthropic/Google 没签</li>
</ol>

<p><strong>这不是技术辩论，是利益之争。AI 的下一个十年，谁来定规则，比谁的模型跑分高，重要一百倍。</strong></p>

<p>我一个人打造的 <a href="https://zaokit.ai">Zaokit AI Agent 交易平台</a>，以及 AI PPT / 图文创作 <a href="https://zaokit.app">Zaokit.app</a>，核心是把 AI 能力送进真实交付，不站队、不依赖单一闭源 API。唯一网站：<a href="https://zaokit.app">https://zaokit.app</a>。</p>

<p>企业侧同一逻辑，已经融进可直接接入的服务：</p>

<ul>
  <li><a href="https://grok.zaokit.com">grok.zaokit.com</a></li>
  <li><a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a></li>
  <li><a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a></li>
  <li><a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a></li>
  <li><a href="https://junxinzhang.com/projects.html">完整产品列表</a></li>
</ul>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p>延伸：<a href="/ai-is-not-just-llm-full-landscape">AI 被大模型绑架了</a> · <a href="/chatgpt-desktop-voice-gpt-live-appshots">语音不是聊天附件，是 Agent 调度台</a> · <a href="/llm-pretrain-posttrain-skill-workflow-agent">预训练是别人的工厂</a></p>

<hr />

<table>
  <tbody>
    <tr>
      <td>唯一网站：<a href="https://zaokit.app">Zaokit.app</a></td>
      <td>Agent 交易平台：<a href="https://zaokit.ai">Zaokit.ai</a></td>
    </tr>
  </tbody>
</table>

<p>企业 Grok 服务：<a href="https://grok.zaokit.com">grok.zaokit.com</a></p>

<p>企业服务：<a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a> · <a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a> · <a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a> · <a href="https://junxinzhang.com/projects.html">完整产品列表</a></p>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p><em>我是 Jason，自己一个人做 AI 产品。开放还是闭源，别看嘴上喊的，看谁签了、谁没签。利益决定立场，永远比口号诚实。</em></p>]]></content><author><name>Jason Zhang</name></author><category term="AI" /><category term="featured" /><category term="AI" /><category term="NVIDIA" /><category term="黄仁勋" /><category term="开放权重" /><category term="闭源" /><category term="Meta" /><category term="OpenAI" /><category term="Google" /><category term="DeepSeek" /><category term="Zaokit" /><summary type="html"><![CDATA[黄仁勋在 X 上发了人生第一条帖子，转发 NVIDIA 签署的公开信《Open Weights and American AI Leadership》。 此前 Hassabis 要建安全标准限制开放模型，黄仁勋直接反过来：开放权重才是正路。两个阵营公开站队。]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="https://junxinzhang.com/assets/images/cover-20260726-nvidia-open-weights-vs-closed.webp" /><media:content medium="image" url="https://junxinzhang.com/assets/images/cover-20260726-nvidia-open-weights-vs-closed.webp" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">语音不是聊天附件，是桌面端的 Agent 调度台</title><link href="https://junxinzhang.com/chatgpt-desktop-voice-gpt-live-appshots/" rel="alternate" type="text/html" title="语音不是聊天附件，是桌面端的 Agent 调度台" /><published>2026-07-25T00:00:00+00:00</published><updated>2026-07-25T00:00:00+00:00</updated><id>https://junxinzhang.com/chatgpt-desktop-voice-gpt-live-appshots</id><content type="html" xml:base="https://junxinzhang.com/chatgpt-desktop-voice-gpt-live-appshots/"><![CDATA[<p>ChatGPT 桌面端（原来的 Codex App 体系并入后的桌面 App）今天把语音控制推到了前台。</p>

<p>macOS 和 Windows 用户可以直接用嘴指挥 AI：操控电脑、启动 Codex 写代码、调度 ChatGPT Work 执行任务。开着一条语音对话，同时管理多个后台 Agent——有点像一个人坐在那儿口述，几个助手分头干活。</p>

<p>很多人会把它读成「ChatGPT 终于会在电脑上聊天了」。这把尺子量短了。</p>

<blockquote>
  <p><strong>真正变的，不是模型更会说话，而是语音从聊天附件，升级成了桌面端的 Agent 调度台。</strong></p>
</blockquote>

<p>瓶颈也跟着挪位：以前卡在打字和复制粘贴；现在更卡在——你敢不敢把现场上下文和任务权柄交出去。</p>

<p><img src="/assets/images/cover-20260725-chatgpt-voice-desktop.webp" alt="语音不是聊天附件，是桌面端的 Agent 调度台" />
<!-- baoyu-skill prompt: 2.35:1电影感横版封面，深蓝夜色到冷青渐变，冷静厚重的科技质感。画面中央一个发光麦克风节点标中文「语音指挥」，向右分出三条并行光路分别指向三个工作台标中文「Codex写代码」「Work执行任务」「操控电脑」。中央粗体大字中文「用嘴指挥Agent干活」。顶部副标中文「ChatGPT桌面端语音」。底部中文「GPT-Live · 全双工 · Appshots」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="一这件事到底更新了什么">一、这件事到底更新了什么</h2>

<p>别先被 Demo 带走。先把能力边界钉死：</p>

<table>
  <thead>
    <tr>
      <th>能力</th>
      <th>现在能做什么</th>
      <th>注意点</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td><strong>桌面语音</strong></td>
      <td>macOS / Windows 桌面端开 Voice，自然语言指挥</td>
      <td>完整 Voice 要从空会话 <code class="language-plaintext highlighter-rouge">Start new voice chat</code> 进入</td>
    </tr>
    <tr>
      <td><strong>操控电脑</strong></td>
      <td>在权限范围内做 Computer Use：点界面、操作本地文件、多步任务</td>
      <td>敏感动作会要确认；可随时停下接管</td>
    </tr>
    <tr>
      <td><strong>调度 Codex</strong></td>
      <td>语音启动编码任务：跑测试、查失败、改代码</td>
      <td>任务消耗常规 Codex / 智能体额度</td>
    </tr>
    <tr>
      <td><strong>调度 Work</strong></td>
      <td>语音推动研究、文档、交付类任务</td>
      <td>与 Codex 同属 agent 工作栈</td>
    </tr>
    <tr>
      <td><strong>多 Agent 并行</strong></td>
      <td>一条语音会话里开多条后台线程，回收进度与阻塞</td>
      <td>同一时刻只能有一条活跃语音会话</td>
    </tr>
    <tr>
      <td><strong>Appshots</strong></td>
      <td>macOS 看见当前最前窗口（截图 + 可访问文本）</td>
      <td>Windows 暂无；组织可禁用</td>
    </tr>
    <tr>
      <td><strong>手机遥控</strong></td>
      <td>iPhone 远程配对后，用 iOS 语音指挥桌面 Codex</td>
      <td>Android 还在路上</td>
    </tr>
  </tbody>
</table>

<p>它不是「多了一个语音输入框」，而是把 <strong>Chat + Work + Codex + 本地权限</strong> 接到了同一条嘴控通道上。</p>

<p>官方文档写得很直：Voice 活在 Chat、Work、Codex 里；你可以一边说话，一边让后台线程继续跑，再把进度、阻塞、结果拉回对话。</p>

<h2 id="二gpt-live从对讲机到真人对话">二、GPT-Live：从对讲机到真人对话</h2>

<p>这套桌面语音的底座，是 OpenAI 在 <strong>7 月 8 日</strong>上线的 <strong>GPT-Live</strong>。</p>

<p>旧模式更像对讲机：你说完 → 停顿 → 它再开口。中间那一拍空白，会把思路打断。</p>

<p>GPT-Live 是<strong>全双工</strong>：能同时听和说。你可以打断它，它也能在你停顿时选择继续听或接话。模型层还在持续做「现在该听还是该说」的判断，而不是等一个硬切的回合结束。</p>

<p>更关键的一层，是<strong>交互与推理解耦</strong>：</p>

<ul>
  <li>前台 GPT-Live 负责把对话撑住——听清、接得上、不冷场；</li>
  <li>遇到复杂问题，把推理、检索、更重的 agent 活丢给后台前沿模型（公开材料里常见表述是 GPT-5.5 一代）；</li>
  <li>前台继续聊，不会整段卡死。</li>
</ul>

<p>付费侧默认更大的 <strong>GPT-Live-1</strong>，免费侧在其他语音场景里常见 <strong>GPT-Live-1 mini</strong>。今天这条桌面「指挥 Work / Codex」能力，面向的是付费与企业套餐，不是免费聊天玩具。</p>

<blockquote>
  <p><strong>全双工解决的是节奏；解耦解决的是深度。没有前者，语音像功能开关；没有后者，语音一深就断。</strong></p>
</blockquote>

<p><img src="/assets/images/illust-20260725-gpt-live-duplex.webp" alt="从对讲机到全双工" />
<!-- baoyu-skill prompt: 2.35:1宽幅对比信息图，深色背景，冷静科技质感。左栏冷灰标中文「旧模式·半双工」副标中文「你说完→停顿→它再回」画对讲机图标；右栏冷青高亮标中文「GPT-Live·全双工」副标中文「同时听与说·可打断」画双向声波环。右下角小模块标中文「复杂推理丢给后台模型」。顶部标题中文「从对讲机到真人对话」。底部中文「交互层与推理层解耦」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="三语音调度台一人口述多助手分头干">三、语音调度台：一人口述，多助手分头干</h2>

<p>这才是我认为今天最值得盯的点。</p>

<p>以前语音多半停在「说 → 转文字 → 得到回答」。今天在桌面端，语音可以直接变成：</p>

<ol>
  <li><strong>派活</strong>：启动 Codex 跑测试、开 Work 做研究；</li>
  <li><strong>并行</strong>：一条会话对应多个后台线程；</li>
  <li><strong>回收</strong>：把进度、阻塞、结果说回来；</li>
  <li><strong>改道</strong>：中途追加指令、换方向、叫停。</li>
</ol>

<p>你可以把它想成一个<strong>口头项目经理</strong>：</p>

<ul>
  <li>「先把今天发布简报里需要审批的决策摘要出来。」</li>
  <li>「开一个 Codex 任务跑测试，失败的项查清楚。」</li>
  <li>「看看当前在跑的任务，卡在哪。」</li>
</ul>

<p>你还在同一条语音里说话；助手已经分头进线程了。</p>

<p>这和「语音输入法」不是一类产品。输入法解决的是打字速度；调度台解决的是<strong>组织工作</strong>——谁去干、干到哪、结果怎么回来。</p>

<p><img src="/assets/images/illust-20260725-voice-agent-desk.webp" alt="一人口述，多助手分头干" />
<!-- baoyu-skill prompt: 2.35:1宽幅信息图，深色背景，冷静科技质感。左侧一个人形剪影对着麦克风口述，中央一条发光对话环标中文「一条语音会话」，右侧三个并行 Agent 工作卡分别标中文「Agent A · 查资料」「Agent B · 写代码」「Agent C · 跑任务」，箭头回流到左侧标中文「进度与阻塞回传」。顶部标题中文「一人口述，多助手分头干」。底部中文「语音是调度台，不是输入法」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="四appshotsmacos-把看见现场做成默认能力">四、Appshots：macOS 把「看见现场」做成默认能力</h2>

<p>macOS 用户还多了一块 Windows 暂时没有的能力：<strong>Appshots / 屏幕上下文</strong>。</p>

<p>语音对话时，ChatGPT 可以直接看到你<strong>当前最前面的窗口</strong>。捕获的不只是一张图，还有应用提供的<strong>可访问文本</strong>——包括可见部分，以及部分滚出可视区、但应用暴露出来的文本。</p>

<p>典型用法很土，也很狠：</p>

<ul>
  <li>代码窗口开着，直接说「这个函数有什么问题」；</li>
  <li>报错界面放前台，说「怎么修」；</li>
  <li>设计稿或文档置顶，说「按这个改间距」。</li>
</ul>

<p>以前你要把世界「翻译」给模型：截图、复制、描述、粘贴。Appshots 把这层摩擦砍掉——<strong>现场本身成为上下文</strong>。</p>

<p>权限是硬门槛：macOS 需要「屏幕与系统音频录制」和「辅助功能」。组织管理员可以禁用。敏感窗口别随手喂。</p>

<p>官方触发路径也很清楚：窗口置前，双 Command（或自定义快捷键），或在已开屏幕上下文的语音里说「Take a look at this / 看看这个」。</p>

<blockquote>
  <p><strong>Appshots 的意义，不是多了一个截图按钮，而是把「喂上下文」从人工搬运，变成系统默认能力。</strong></p>
</blockquote>

<p><img src="/assets/images/illust-20260725-appshots-mac.webp" alt="Appshots：别复制粘贴，直接看屏幕" />
<!-- baoyu-skill prompt: 2.35:1宽幅信息图，深色背景，冷静科技质感。中央一台 Mac 窗口发光，窗口内代码编辑器抽象界面，窗口上方徽章标中文「Appshots」。右侧箭头指向 ChatGPT 语音气泡，气泡内标签中文「看见当前最前窗口」「截图+可访问文本」。左下角小字中文「仅 macOS」。顶部标题中文「别复制粘贴，直接看屏幕」。底部中文「上下文搬运成本被砍掉」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="五边界比口号重要">五、边界比口号重要</h2>

<p>能力上线时，最容易被营销话术抹平的，是边界。先把板子钉牢：</p>

<table>
  <thead>
    <tr>
      <th>平台 / 人群</th>
      <th>现状</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td><strong>macOS 桌面</strong></td>
      <td>语音 + Appshots + Computer Use（在权限内）</td>
    </tr>
    <tr>
      <td><strong>Windows 桌面</strong></td>
      <td>有语音调度；<strong>暂无 Appshots</strong></td>
    </tr>
    <tr>
      <td><strong>iPhone 远程</strong></td>
      <td>配对后可用 iOS 语音指挥桌面 Codex</td>
    </tr>
    <tr>
      <td><strong>Android</strong></td>
      <td>还在路上</td>
    </tr>
    <tr>
      <td><strong>套餐</strong></td>
      <td>Plus / Pro / Business / Edu / Enterprise；<strong>免费暂不可用</strong></td>
    </tr>
    <tr>
      <td><strong>企业/教育</strong></td>
      <td>工作区策略 + 早期访问窗口，管理员可开关高级语音等能力</td>
    </tr>
  </tbody>
</table>

<p>还有几条使用细节，决定你是不是「以为有、其实没有」：</p>

<ol>
  <li><strong>完整 Voice ≠ 听写。</strong> 必须从空会话启动语音聊天；否则只是把嘴变成键盘。</li>
  <li><strong>一条活跃语音。</strong> 同一 App 内同时只能挂一条 voice chat。</li>
  <li><strong>额度拆开。</strong> 语音有独立计量；派出去的 Work / Codex 任务走原来的 agent 额度。</li>
  <li><strong>权限分层。</strong> 麦克风是底线；屏幕与辅助功能是 macOS 看见现场的钥匙；敏感动作仍会要确认。</li>
</ol>

<p><img src="/assets/images/illust-20260725-platform-boundary.webp" alt="谁能用、谁还没有" />
<!-- baoyu-skill prompt: 2.35:1宽幅对比信息图，深色背景，冷静科技质感。四宫格：左上「macOS」标签中文「语音+Appshots」；右上「Windows」标签中文「有语音·暂无Appshots」；左下「iPhone远程」标签中文「可遥控桌面Codex」；右下「Android」标签中文「支持还在路上」。中央大字中文「能力边界比口号重要」。顶部标题中文「谁能用、谁还没有」。底部中文「Plus/Pro/Business/Edu/Enterprise · 免费暂不可用」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="六摩擦从输入挪到了授权与判断">六、摩擦从「输入」挪到了「授权与判断」</h2>

<p>如果只把它当新功能清单，你会错过真正的产品位移。</p>

<p>过去两年，桌面 AI 一直在补三块板：</p>

<ol>
  <li><strong>嘴</strong>——说得自然；</li>
  <li><strong>眼</strong>——看见你在看什么；</li>
  <li><strong>手</strong>——在权限里操作电脑与工具。</li>
</ol>

<p>GPT-Live 补嘴，Appshots 补眼，Computer Use + Codex / Work 补手。拼起来之后，交互主路径不再是「打开聊天框 → 打字 → 粘贴上下文」，而是：</p>

<p><strong>口述目标 → 系统感知现场 → 多 Agent 分头执行 → 语音回收结果。</strong></p>

<p>对普通人：写纪要、改方案、整理材料，可以从「先组织一段完美提示词」变成「边看材料边说」。</p>

<p>对开发者：边看报错边口述排查，或者人在沙发上、手机遥控桌面 Codex，都不再是科幻分镜，而是权限开对之后的工作流。</p>

<p>但落点别写成鸡汤式的「赶紧用起来」。更冷的一句是：</p>

<blockquote>
  <p><strong>输入摩擦下降之后，真正变贵的是授权、隐私边界，以及你是否分得清：什么活该口述派发，什么活仍要盯着键盘确认。</strong></p>
</blockquote>

<p>模型越能看见屏幕、越能动手，你就越不能把「方便」和「可交付」混为一谈。语音调度台放大的是吞吐，也放大误派活的代价。</p>

<h2 id="写在最后">写在最后</h2>

<p>压成五句：</p>

<ol>
  <li><strong>桌面语音上线</strong>——macOS / Windows 可用嘴指挥 ChatGPT、Codex、Work</li>
  <li><strong>底座是 GPT-Live</strong>——全双工 + 复杂推理可丢后台，交互与推理解耦</li>
  <li><strong>语音是调度台</strong>——一条会话并行多 Agent，回收进度与阻塞</li>
  <li><strong>Appshots 仅 macOS</strong>——看见最前窗口；Windows 暂无这只「眼」</li>
  <li><strong>付费与边界清晰</strong>——Plus 到 Enterprise；免费暂不可用；iPhone 可远程，Android 在路上</li>
</ol>

<p><strong>以后比的不是谁打字快，是谁更会口述目标、交出恰到好处的上下文，并守住不该交出的权柄。</strong></p>

<p>我一个人打造的 <a href="https://zaokit.ai">Zaokit AI Agent 交易平台</a>，以及 AI PPT / 图文创作 <a href="https://zaokit.app">Zaokit.app</a>，核心仍是把能力送进真实交付，而不是停在聊天窗口。唯一网站：<a href="https://zaokit.app">https://zaokit.app</a>。</p>

<p>企业侧同一逻辑，已经融进可直接接入的服务：</p>

<ul>
  <li><a href="https://grok.zaokit.com">grok.zaokit.com</a></li>
  <li><a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a></li>
  <li><a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a></li>
  <li><a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a></li>
  <li><a href="https://junxinzhang.com/projects.html">完整产品列表</a></li>
</ul>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p>延伸：<a href="/ai-is-not-just-llm-full-landscape">AI 被大模型绑架了</a> · <a href="/llm-pretrain-posttrain-skill-workflow-agent">预训练是别人的工厂</a> · <a href="/gpt56-sol-ultra-mode">GPT-5.6 Sol 的 Ultra 模式</a></p>

<hr />

<table>
  <tbody>
    <tr>
      <td>唯一网站：<a href="https://zaokit.app">Zaokit.app</a></td>
      <td>Agent 交易平台：<a href="https://zaokit.ai">Zaokit.ai</a></td>
    </tr>
  </tbody>
</table>

<p>企业 Grok 服务：<a href="https://grok.zaokit.com">grok.zaokit.com</a></p>

<p>企业服务：<a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a> · <a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a> · <a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a> · <a href="https://junxinzhang.com/projects.html">完整产品列表</a></p>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p><em>我是 Jason，自己一个人做 AI 产品。语音好看的是嘴，值钱的是调度台——派得出去，收得回来，还知道什么不该交出去。</em></p>]]></content><author><name>Jason Zhang</name></author><category term="AI" /><category term="featured" /><category term="AI" /><category term="ChatGPT" /><category term="GPT-Live" /><category term="Voice" /><category term="Codex" /><category term="Appshots" /><category term="OpenAI" /><category term="Agent" /><category term="桌面端" /><category term="Zaokit" /><summary type="html"><![CDATA[ChatGPT 桌面端语音上线：一边说话，一边派 Codex / Work 干活，macOS 还能用 Appshots 看见当前窗口。 真正变的不是「会说话」，是语音从聊天附件升级成了 Agent 调度台。]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="https://junxinzhang.com/assets/images/cover-20260725-chatgpt-voice-desktop.webp" /><media:content medium="image" url="https://junxinzhang.com/assets/images/cover-20260725-chatgpt-voice-desktop.webp" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">AI 被大模型绑架了</title><link href="https://junxinzhang.com/ai-is-not-just-llm-full-landscape/" rel="alternate" type="text/html" title="AI 被大模型绑架了" /><published>2026-07-24T00:00:00+00:00</published><updated>2026-07-24T00:00:00+00:00</updated><id>https://junxinzhang.com/ai-is-not-just-llm-full-landscape</id><content type="html" xml:base="https://junxinzhang.com/ai-is-not-just-llm-full-landscape/"><![CDATA[<p>现在问任何人「AI 是什么」，十个有九个答 ChatGPT、Claude、DeepSeek——大语言模型已经把大众对 AI 的认知<strong>完全覆盖</strong>了。</p>

<p>但 LLM 只是当前的主流，不是 AI 的全部。它是冰山露出水面最耀眼的一角，水面下的东西，比多数人想象的大得多。</p>

<p><img src="/assets/images/cover-20260724-ai-not-just-llm.webp" alt="AI 被大模型绑架了" />
<!-- baoyu-skill prompt: 2.35:1电影感横版封面，深蓝海面渐变到深黑海底。海面以上一座发光的冰山尖角标中文「LLM·大模型」，海面以下巨大的冰体分区标中文「计算机视觉」「机器学习」「强化学习」「机器人学」「世界模型」。中央粗体大字中文「AI被大模型绑架了」。顶部副标中文「你看到的只是冰山一角」。底部中文「一个爆款≠整个学科」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="一你嘴里的-ai只是冰山一角">一、你嘴里的 AI，只是冰山一角</h2>

<p>把 AI 等于大模型，像把交通等于高铁——高铁确实快、确实火，但公路、航空、水运都没消失，各有各的不可替代。</p>

<p>AI 这棵树，至少有这些粗枝干：</p>

<table>
  <thead>
    <tr>
      <th>分支</th>
      <th>在干什么</th>
      <th>落地在哪</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td><strong>机器学习（ML）</strong></td>
      <td>结构化数据挖掘与预测</td>
      <td>金融风控、推荐算法、故障预测、广告 CTR</td>
    </tr>
    <tr>
      <td><strong>计算机视觉（CV）</strong></td>
      <td>让机器看懂图像和视频</td>
      <td>自动驾驶目标检测、医疗影像、工业质检</td>
    </tr>
    <tr>
      <td><strong>自然语言处理（NLP）</strong></td>
      <td>让机器理解和生成语言</td>
      <td>LLM 是当前最强形态；NER、信息检索仍在</td>
    </tr>
    <tr>
      <td><strong>强化学习（RL）</strong></td>
      <td>在规则和约束下寻优</td>
      <td>AlphaGo、物流路径规划、高频交易、游戏 AI</td>
    </tr>
    <tr>
      <td><strong>机器人学</strong></td>
      <td>感知-决策-行动的物理闭环</td>
      <td>机械臂、SLAM 导航、传感器融合</td>
    </tr>
    <tr>
      <td><strong>语音</strong></td>
      <td>听懂声音、生成声音</td>
      <td>语音助手、TTS、会议转录</td>
    </tr>
  </tbody>
</table>

<p>LLM 属于 NLP 里的一个演化节点。把它当成 AI 全部，就像只看到树冠最高的叶子，忘了底下还有根系和主干。</p>

<p>传统 ML 模型（XGBoost、随机森林、SVM）至今仍是金融风控和推荐系统的主力。工业安防和产线质检，对延迟要求极高，跑的是专用 CV 模型（YOLO 系列），不是多模态大模型。AlphaGo 击败世界冠军，核心是深度强化学习，不是语言模型。</p>

<p>这些领域不需要 LLM 去「理解人类语言」，它们各自有各自的最优解。</p>

<p><img src="/assets/images/illust-20260724-ai-family-tree.webp" alt="AI 不只是大模型" />
<!-- baoyu-skill prompt: 2.35:1宽幅信息图，深色背景，冷静科技质感。中央一棵发光科技树，树根标中文「人工智能」，主干分出六根粗枝分别标中文「机器学习」「计算机视觉」「自然语言处理」「强化学习」「机器人学」「语音」。NLP枝条最顶端一片发光叶子标中文「LLM」。顶部标题中文「AI家谱：不只是大模型」。底部中文「LLM是最亮的叶子，不是整棵树」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="二为什么会形成这个错觉">二、为什么会形成这个错觉</h2>

<p>不怪你，怪三件事。</p>

<p><strong>第一，交互门槛被砸碎了。</strong></p>

<p>以前的 AI 模型——推荐算法、风控系统、工业视觉——都在后台静默运行，普通人感知不到。LLM 第一次让所有人能用自然语言直接跟 AI 对话。能被感知的，才会被等号。</p>

<p><strong>第二，通用性太震撼。</strong></p>

<p>以前识别猫的模型不能识别狗，做翻译的不能做算术。大模型展示出的泛化能力和涌现现象，让人以为「一个模型解决一切」。</p>

<p><strong>第三，资本和媒体的聚光灯只照一个方向。</strong></p>

<p>爆款效应 + 商业叙事，让几乎所有注意力和资源都倾斜到 Transformer 和大模型。其他分支没消失，只是不在舞台中央。</p>

<blockquote>
  <p><strong>能被感知的，不等于全部存在的。LLM 被看见，是因为它打破了交互壁垒；没被看见的 AI 分支，不需要你打字，但每天都在跑。</strong></p>
</blockquote>

<p><img src="/assets/images/illust-20260724-why-illusion.webp" alt="为什么会有这个错觉" />
<!-- baoyu-skill prompt: 2.35:1宽幅信息图，深色背景，冷静科技质感。中央一盏聚光灯从上方打下，光圈内标中文「LLM·大模型」发光醒目；光圈外暗处散落多个图标分别标中文「CV」「ML」「RL」「机器人」「语音」半隐半现。左侧竖排三条原因中文「交互门槛砸碎」「通用性震撼」「资本聚光灯」。顶部标题中文「为什么AI=大模型？」。底部中文「能被感知的≠全部存在的」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="三世界模型和具身智能transformer-只是引擎之一">三、世界模型和具身智能：Transformer 只是引擎之一</h2>

<p>还有一层更深的误解：既然大模型用 Transformer，那所有 AI 前沿是不是都在「把 Transformer 做大做强」？</p>

<p>不是。</p>

<p><strong>世界模型（World Model）</strong> 的目标是让 AI 在脑子里对物理世界建立内部模拟：如果施加动作 A，世界会变成什么样。</p>

<p>Sora 用的是 DiT（Diffusion Transformer），结合了扩散模型的去噪能力和 Transformer 的序列建模。但 Transformer 擅长预测下一个 Token——离散文本。真实物理世界的重力、碰撞、连续运动是连续且高维的，纯靠 next-token prediction 很难学会物理守恒定律。</p>

<p>Yann LeCun 推的 V-JEPA（联合嵌入架构）就不是自回归 Transformer——它不预测像素级细节，而是在隐空间学物理结构与动态演化。世界模型的核心是物理规则建模，Transformer 只是当前的一套工具选项。</p>

<p><strong>具身智能（Embodied AI）</strong> 是让 AI 拥有物理身体，在真实环境做感知-决策-行动的闭环。</p>

<table>
  <thead>
    <tr>
      <th>层</th>
      <th>负责什么</th>
      <th>用什么</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td><strong>大脑</strong></td>
      <td>意图理解、高层规划</td>
      <td>VLA 模型（Vision-Language-Action，含 Transformer）</td>
    </tr>
    <tr>
      <td><strong>小脑</strong></td>
      <td>步态平衡、抓取力控</td>
      <td>强化学习（PPO / SAC），百万次模拟训练</td>
    </tr>
    <tr>
      <td><strong>脊髓</strong></td>
      <td>关节实时控制</td>
      <td>控制理论、逆运动学、MPC</td>
    </tr>
  </tbody>
</table>

<p>一个关键数字：机器人关节电机控制周期在 <strong>1 毫秒</strong>，而 Transformer 大模型推理一次要<strong>几百毫秒</strong>。大模型来不及救一个正在摔倒的机器人。</p>

<blockquote>
  <p><strong>Transformer 是目前最强的数据处理引擎。但让 AI 理解重力、让机器人捏起鸡蛋，还需要控制论、物理仿真和硬件传感器。把 Transformer 等于 AI 前沿，跟把 AI 等于 LLM，是同一个错误。</strong></p>
</blockquote>

<p><img src="/assets/images/illust-20260724-world-model-embodied.webp" alt="世界模型和具身智能不只是 Transformer" />
<!-- baoyu-skill prompt: 2.35:1宽幅对比信息图，深色背景，冷静科技质感。左半标题中文「世界模型」，下方三个节点中文「DiT扩散」「JEPA隐空间」「物理仿真」，底部中文「预测物理世界」；右半标题中文「具身智能」，下方三层中文「大脑·VLA」「小脑·强化学习」「脊髓·1ms控制」，底部中文「身体在现实中行动」。中央大字中文「不只是Transformer」。顶部标题中文「前沿≠把模型做大」。底部中文「引擎是引擎，系统是系统」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="四对你有什么用选型别只带一把锤子">四、对你有什么用：选型别只带一把锤子</h2>

<p>知道 AI 版图更大，不是为了炫耀词汇量。是为了选型时别只看 LLM。</p>

<table>
  <thead>
    <tr>
      <th>你的问题</th>
      <th>先考虑</th>
      <th>不是</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>结构化数据分类 / 预测</td>
      <td>传统 ML（XGBoost、随机森林）</td>
      <td>砸大模型</td>
    </tr>
    <tr>
      <td>产线质检、缺陷检测</td>
      <td>专用 CV 模型（YOLO 系列）</td>
      <td>多模态大模型（延迟扛不住）</td>
    </tr>
    <tr>
      <td>路径规划、资源调度</td>
      <td>运筹优化 + RL</td>
      <td>让 ChatGPT 算最优路线</td>
    </tr>
    <tr>
      <td>文本理解、生成、对话</td>
      <td>LLM（这里它确实最强）</td>
      <td>—</td>
    </tr>
    <tr>
      <td>机器人控制</td>
      <td>RL + 控制论 + VLA</td>
      <td>纯靠大模型指挥</td>
    </tr>
  </tbody>
</table>

<p>未来真正强大的系统是组合拳——用 CV 感知物理世界，用传统 ML 处理结构化决策，用 RL 做路径规划，再用 LLM 做顶层的意图理解与人机交互接口。</p>

<p>拿着锤子看什么都是钉子。LLM 是你工具箱里最亮的那把锤子，但有些螺丝需要扳手。</p>

<p><img src="/assets/images/illust-20260724-right-tool.webp" alt="选型别只带一把锤子" />
<!-- baoyu-skill prompt: 2.35:1宽幅信息图，深色背景，冷静科技质感。左侧一把发光锤子标中文「LLM」，右侧工具箱展开，内含扳手标中文「ML」、螺丝刀标中文「CV」、钳子标中文「RL」、量尺标中文「控制论」。中央大字中文「别只带一把锤子」。顶部标题中文「AI选型地图」。底部中文「有些螺丝需要扳手」。中文清晰可读。 --ar 2.35:1 --></p>

<h2 id="写在最后">写在最后</h2>

<p>压成五句：</p>

<ol>
  <li><strong>AI ≠ 大模型</strong>——LLM 是 NLP 里的一个演化节点，不是全部</li>
  <li><strong>错觉来自三处</strong>——交互门槛、通用性震撼、资本聚光灯</li>
  <li><strong>Transformer ≠ AI 前沿</strong>——世界模型和具身智能需要 RL、控制论、物理仿真</li>
  <li><strong>1 毫秒 vs 几百毫秒</strong>——大模型来不及救摔倒的机器人</li>
  <li><strong>选型看全局</strong>——结构化数据用 ML，质检用 CV，调度用 RL，对话才用 LLM</li>
</ol>

<p>土话一句：</p>

<p><strong>AI 是一整个学科，不是 ChatGPT 的别名。拿一把短尺丈量整个学科，你不是在用 AI，是在被 AI 营销用。</strong></p>

<p>我一个人打造的 <a href="https://zaokit.ai">Zaokit AI Agent 交易平台</a>，以及 AI PPT / 图文创作 <a href="https://zaokit.app">Zaokit.app</a>，核心是把不同层级的 AI 能力送进真实交付。唯一网站：<a href="https://zaokit.app">https://zaokit.app</a>。</p>

<p>企业侧同一逻辑，已经融进可直接接入的服务：</p>

<ul>
  <li><a href="https://grok.zaokit.com">grok.zaokit.com</a></li>
  <li><a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a></li>
  <li><a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a></li>
  <li><a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a></li>
  <li><a href="https://junxinzhang.com/projects.html">完整产品列表</a></li>
</ul>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p>延伸：<a href="/ai-beginner-literacy-basics-training">AI 扫盲：半小时基础知识培训</a> · <a href="/llm-pretrain-posttrain-skill-workflow-agent">预训练是别人的工厂</a> · <a href="/workflow-agent-programmer-vs-boss">程序员在提效，老板在赚钱</a></p>

<hr />

<table>
  <tbody>
    <tr>
      <td>唯一网站：<a href="https://zaokit.app">Zaokit.app</a></td>
      <td>Agent 交易平台：<a href="https://zaokit.ai">Zaokit.ai</a></td>
    </tr>
  </tbody>
</table>

<p>企业 Grok 服务：<a href="https://grok.zaokit.com">grok.zaokit.com</a></p>

<p>企业服务：<a href="https://cx.zaokit.com">cx.zaokit.com</a> · <a href="https://cc.zaokit.com">cc.zaokit.com</a> · <a href="https://tokenhub.zaokit.ai">tokenhub.zaokit.ai</a> · <a href="https://gift.junxinzhang.com">gift.junxinzhang.com</a> · <a href="https://junxinzhang.com/projects.html">完整产品列表</a></p>

<p>稳定靠谱的 AI 全家桶，开箱即用。</p>

<hr />

<p><em>我是 Jason，自己一个人做 AI 产品。AI 不等于大模型，就像交通不等于高铁。把版图看全，才知道自己该接哪根线。</em></p>]]></content><author><name>Jason Zhang</name></author><category term="AI" /><category term="featured" /><category term="AI" /><category term="大模型" /><category term="LLM" /><category term="计算机视觉" /><category term="机器学习" /><category term="强化学习" /><category term="世界模型" /><category term="具身智能" /><category term="Zaokit" /><summary type="html"><![CDATA[一提 AI 全是 ChatGPT，但 AI 的版图远不止大语言模型。机器学习、计算机视觉、强化学习、 具身智能、世界模型——你手里的尺子太短了，拿一个爆款代表了整个学科。]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="https://junxinzhang.com/assets/images/cover-20260724-ai-not-just-llm.webp" /><media:content medium="image" url="https://junxinzhang.com/assets/images/cover-20260724-ai-not-just-llm.webp" xmlns:media="http://search.yahoo.com/mrss/" /></entry></feed>