一家只有创始人、没有全职员工的 AI 初创公司,月度 AI 账单一度烧到 120 万美元,这个数字比很多团队的全年研发预算还夸张。Polsia 后来改用中国开源模型,把月度成本压到约 10 万美元,降幅超过 90%。这条消息真正刺眼的地方不在“省钱”两个字,而在于它把 AI 应用创业最现实的一层问题摊开了:模型能力再强,如果推理成本吞掉毛利,产品越增长,亏损可能越快。
同一批资讯里,Kimi K3 开放 2.8T 级参数权重,Anthropic 让 Claude 一个周末跑通 AMD MI355X 适配,Spectro Cloud 靠 GPU 统一调度完成超过 1 亿美元融资,TeraWulf、Hut 8 等比特币矿企也在把电力和场地转成 AI 数据中心资源。几件事放在一起看,AI 行业的竞争已经不只是“谁的模型更聪明”,而是开始追问另一个更工程化的问题:谁能把模型、芯片、调度和应用收入之间的账算平。
成本变成生死线
Polsia 的案例很极端,但并不离谱。AI 应用公司早期常常先用前沿闭源模型验证产品体验,因为这样接入速度最快,效果也相对稳定。问题是,当用户规模上来后,每一次对话、检索、生成、改写、Agent 调用都会变成真实账单。只要产品依赖高频推理,成本曲线就会跟着使用量一起上升,甚至比收入增长更快。
这类公司最怕的不是没人用,而是有人用却不挣钱。传统软件的边际成本通常比较低,用户越多越容易摊薄研发和服务器成本;但 AI 应用不同,如果每次调用都要向上游模型付费,而且任务链路里还嵌套了搜索、长上下文、工具调用、多轮反思和结果验证,那么单个用户的真实成本可能被低估。Polsia 从 120 万美元降到约 10 万美元,本质上是把“产品能不能继续存在”的问题重新拉回可控范围。
开源模型的价值不只在免费
很多人提到开源模型,第一反应是“模型权重免费”。但对应用公司来说,真正重要的是可控性。开源模型可以私有化部署,可以针对固定任务做蒸馏、量化、路由和缓存,也可以把高成本任务拆成多级模型处理:简单问题走轻量模型,复杂问题再交给强模型。这样一来,公司不必让所有请求都挤进同一个昂贵入口。
Kimi K3 开源的意义,也不只是参数规模达到 2.8T、支持百万 Token 上下文,或者推理成本相对更低。更关键的是,大模型生态正在从“只能租用黑盒能力”走向“可以围绕开放权重搭建自己的推理体系”。对于写作、客服、数据分析、研发辅助、营销自动化这类场景,企业未必每一步都需要最贵模型。只要任务拆分合理,开源模型反而能在稳定性、预算和数据控制上形成综合优势。
算力生态也在松动

模型成本下降不能只靠模型本身,还要靠底层算力生态变化。Anthropic 让 Claude 独立完成 AMD MI355X 适配,并持续优化性能,这件事之所以值得关注,是因为它触碰到了 CUDA 长期形成的生态壁垒。过去很多 AI 工作负载天然围绕英伟达生态展开,迁移到其他 GPU 往往意味着工程成本、兼容性风险和性能折损。现在 AI 自己开始阅读芯片文档、改写适配代码、调试性能路径,硬件替代的门槛正在被重新估算。
AMD 推出的 ROCm.AI 工具链,以及 Anthropic 计划在 AMD Helios 系统上部署大规模 GPU,都说明算力市场不再只是采购单点硬件。未来企业要看的可能是整套栈:芯片供给、驱动、编译器、模型适配、推理框架、调度系统和应用侧成本。只要非英伟达路线能在一部分推理或训练场景里跑通,哪怕不是全面替代,也会给 AI 应用公司带来议价空间和架构选择。
GPU利用率比买更多卡更急
Spectro Cloud 完成超过 1 亿美元融资,估值突破 10 亿美元,它讲的故事不是制造更多 GPU,而是让企业已有 GPU 从约 30% 利用率提升到约 60%。这个方向很现实。很多企业一边抱怨 GPU 紧缺,一边又把训练、测试、推理、边缘部署和本地数据中心切成多个孤岛。资源不能统一排队、统一回收、统一监控,最后就会出现“账面有算力,业务还是排队”的尴尬。
对 AI 应用公司来说,GPU 调度能力最终会反映到产品成本里。一次推理请求能不能被正确路由到合适硬件,长上下文任务能不能错峰执行,批量生成能不能合并调度,低优先级任务能不能使用便宜算力,这些细节决定了毛利率。AI 成本优化不是简单换一个模型供应商,而是模型选择、上下文控制、缓存策略、任务路由、硬件适配和调度系统共同作用的结果。
应用公司要学会分层用模型
Polsia 的转身给很多 AI 创业者一个提醒:不要把模型能力当成单一开关。真实产品里,用户请求可以分层,任务链路可以分段,模型也应该分角色。比如意图识别、格式整理、关键词抽取、轻量问答可以交给便宜模型;专业判断、复杂推理、长文生成、关键业务决策再交给更强模型;而一些固定问题,则应该优先通过知识库、缓存和规则系统解决。
这种分层并不是降级体验,而是让体验可持续。如果所有请求都用最强模型,短期可能效果漂亮,但账单会迅速变成系统性风险;如果所有请求都用便宜模型,又可能牺牲质量和用户信任。更稳妥的做法是建立评估体系:哪些任务对准确率极敏感,哪些任务只需要足够好,哪些任务可以异步处理,哪些任务必须实时返回。把这些边界划清楚,模型成本才可能被管住。
从模型崇拜回到商业闭环
AI 行业过去很容易被排行榜、参数规模和发布会牵着走,但 Polsia 的账单故事说明,应用层最终要面对的是收入、成本和交付结果。一个模型再先进,如果不能支持稳定价格、可预测延迟、可控数据边界和可持续毛利,就很难成为长期业务基础。开源模型、国产模型、AMD GPU、GPU 调度平台和矿场转型数据中心,看似来自不同方向,其实都在共同回答“AI 怎么变便宜、变稳定、变可运营”。
这也是近期 AI 产业更值得关注的变化:模型竞争没有结束,但应用公司已经不能只等下一个更强模型。它们需要主动设计自己的成本架构,选择适合的模型组合,控制上下文和工具调用,做好算力调度与质量评估。真正能留下来的 AI 产品,不一定是最会喊“智能”的产品,而是能把智能能力稳定装进业务流程,同时让账算得过来的产品。







暂无评论内容