跳转到主内容
流量杠杠GEO

AI高烧退场,账单进场:当大厂开始'限流'Token,AI真的好用吗?

梅 梅永钢 · · 1 分钟阅读 · 147 字

AI Costs and ROI

一、一个“脑壳炸开”的瞬间:被透支的AI预算

2026年4月中旬,Uber的首席技术官(CTO)Neppalli Naga看着财务报表,冷汗直冒。

“我们2026年全年的AI预算,已经提前被吹飞了。”

此时,距离2026年开年,还不到四个月。

5月底,Uber首席运营官(COO)Andrew MacDonald在《Rapid Response》播客中,用了一个极具画面感的词来形容他得知此事时的心情——“脑壳炸开的时刻”(head-exploding moment)。

导致Uber预算提前见底的罪魁祸首,并不是什么宏大的云端超级计算,而是Uber内部员工疯狂调用的AI编码助手——Claude Code。为了止血,Uber不得不紧急对员工的AI调用实施“额度管控”,开始抠抠搜搜地过日子。

几乎在同一时期,在大洋彼岸的另一家科技巨头亚马逊(Amazon),也发生了一场荒诞的闹剧。

亚马逊为了鼓励员工使用生成式AI,在内部建立了一个“Token消费排行榜”。结果,这一举措直接激发了程序员们体内的“刷榜”基因。为了爬到榜单前列,员工们开始用AI生成各种毫无意义的废话和垃圾任务去疯狂消耗Token,把内部资源刷得底朝天。

最后,亚马逊高管不得不紧急下线了该榜单,并在内部群发邮件,语气极其无奈:“请大家不要为了使用AI而使用AI。”

这两起真实发生的巨头逸闻,撕开了2026年科技圈最敏感的一道口子:第一阶段,人们怀疑AI的能力;第二阶段,人们神化AI的威力;而现在,第三阶段来了——大家开始肉疼AI的账单。

一场关于AI ROI(投资回报率)的“清算大潮”(Vibe Shift),正在 Corporate America 轰轰烈烈地展开。


二、从“自助餐”到“按量计费”:AI商业模式的骨感现实

过去两年里,企业界对AI的态度像极了刚进自助餐厅的饕餮食客,高喊着“全员接入,全面智能化”。但当“Token吞噬者”的账单真正递到CEO们的办公桌上时,大家才发现,这根本不是什么可以无限续杯的软件服务,而是一台二十四小时不停运转的吞金碎钞机。

最大的行业震荡来自于 GitHub。

作为全球程序员几乎人手必备的AI编程工具,GitHub Copilot 终于熬不住了。长期以来,Copilot凭借固定包月费、不限用量(Unlimited)的温和形象获取了数百万用户。但就在本周,GitHub宣布将其核心服务转向**“基于用量的账单模式”(usage-based billing)**。

这一变动震惊了开发者群体。习惯了用 Copilot 自动生成大段代码的程序员们,突然被推到了残酷的“真实成本”面前。

GitHub 坦承,这是为了创造一个“可持续发展”的商业模式。说白了:AI不是免费的,大模型算力不是自来水,每一次 Token 交互,都是真金白银。

连大模型的核心布道者、OpenAI CEO Sam Altman,在近期面对铺天盖地的成本质疑时,也不得不承认:

“AI的巨额支出何时能转化为等额的营收,是当前行业内最公平、最合理的批评。”


三、算不过来的Token账本:为什么AI不像以前的SaaS?

在传统互联网时代,企业对SaaS(软件即服务)的认知是“边际成本递减”。一套CRM软件,1万个员工用和2万个员工用,对软件提供商来说,服务器带宽的增加几乎可以忽略不计。所以,“买断制”和“固定年费制”是黄金法则。

但生成式AI彻底粉碎了这个公式。

AI的边际成本,是恒定的,甚至在极高频调用下呈线性上升。

每一次你让大模型帮你写一段文案、运行一个测试、甚至是分析一份 PDF,在云端,GPU 都在进行极其高密度的矩阵乘法计算,消耗着海量的电力和水资源。

  1. Token是按字算钱的。
  2. 长上下文(Long Context)是指数级增加算力消耗的。
  3. 高频 Agent(智能体)的自我迭代,是个Token黑洞。

当Uber的程序员用 Claude Code 自动重构一个老旧代码库时,AI在后台不停地读取上下文、分析、修改、报错、重新读取、再次修改——在这个自动化的“闭环”里,Token正在以每秒数万个的速度疯狂燃烧。

“省下来的时间,可能还不够付Token钱。” 这成了许多中小企业数字化转型主管的真实心碎声。


四、企业自救指南:如何从“AI崇拜”走向“AI计算器”?

当高烧退去,泡沫破裂,并不意味着AI技术本身没用了。相反,正是因为“清算期”的到来,那些真正务实、能够带来真金白银ROI的AI应用,才会被淘洗出来。

在这个阶段,企业和职场人应该如何调整策略?

               [ AI 任务请求 ]
                      │
            ┌─────────┴─────────┐
            ▼                   ▼
     ( 低价值/常规任务 )    ( 高价值/高风险任务 )
      [ 免费/开源模型 ]     [ 闭源前沿旗舰模型 ]
      ( 如 Qwen/Llama )     ( 如 Claude/GPT-4o )
            │                   │
            └─────────┬─────────┘
                      ▼
               [ 最终业务产出 ]

1. 拒绝伪需求:砍掉80%的“为了AI而AI”

在你的企业里,是不是也有员工在用极其昂贵的旗舰大模型,去写那些原本花3秒钟就能套用模板的日常请假申请,或者用GPT-4o去总结一条只有十几个字的Slack消息?

  • 行动:进行“Token审计”。盘点公司内部的所有API密钥调用,明确区分哪些是“生产力飞跃”,哪些是“员工在偷懒刷酷”。

2. 拥抱“Token效率架构”:多模型混合部署(Hybrid LLMs)

不要用大炮轰蚊子。

  • 做法:在企业架构中建立“语义路由”(Semantic Routing)。
    • 常规、简单、高频的客服和初级助理任务:交给本地化部署的、成本几乎为零的开源轻量大模型(如 Llama 3 8B, Qwen 等);
    • 核心、高价值、高风险的决策任务(如系统安全审计、核心代码重构):才调用昂贵的旗舰商业模型(如 Claude 3.5 Sonnet)。
  • 效果:这套混合架构能够帮企业在不降低核心体验的前提下,降低 60% 以上的 API 调用账单。

3. 回归高价值场景:让AI去干“人类干不了”的事

如果AI仅仅是帮人类少打几个字,它的商业价值永远无法覆盖成本。AI真正的性价比,在于它能做**“人类规模(Human Scale)之外”**的工作。

  • 案例支撑:前文提到的“AI Agent发现FFmpeg 21个零日漏洞”。如果雇佣世界顶级网络安全专家去人工审计这数百万行代码,需要花费数月时间以及数十万美金的薪资,且不一定能找全。而AI Agent(如 Mythos 模型)只花了不到1万美元的Token,在几天内就揪出了这些漏洞。
  • 启示:把AI部署在安全审计、海量数据清洗、24小时无缝监控、复杂系统极限压力测试等高难度、高价值的卡脖子环节。

五、结语:“全凭感觉”的时代结束了,“精打细算”的时代已到来

AI的这场 Vibe Shift,绝不是技术的倒退,而是技术的成年礼。

正如Uber的 Andrew MacDonald 所说,在经历过那次“脑壳炸开”的预算超支后,他们并没有禁用AI,而是学会了如何把每一分钱花在刀刃上。

无限续杯的免费午餐已经结束,那些能在这场账单清算中存活下来的,绝对不是那些喊口号喊得最响的企业,而是手里握着计算器,把 Token 算到分厘,将 AI 完美嵌入业务核心的“务实派”。

AI高烧退场,生存者进场。

分享文章 邮件分享
梅

梅永钢

流量杠杠GEO · 内容团队