AI公司开始抢纸质书后,大模型竞争进入数据资源重估期

AI 公司把目光投向二手纸质书,这个信号比表面上更重。互联网公开数据被大规模训练消耗之后,行业终于开始面对一个尴尬问题:下一代模型需要的不只是更多算力,还需要足够干净、足够多样、足够高质量的新语料。Anthropic 被曝光的“巴拿马计划”把这个矛盾推到台前:先合法购买纸质书,再高速扫描数字化,最后把原书作为回收物处理。法院将这类行为认定为“转化性合理使用”,也让“买正版书训练模型”成为新的争议焦点。

Directional sign pointing to Xiamen University in an outdoor setting.

这不是一条孤立的版权新闻,而是大模型竞争进入深水区后的资源再分配。人类历史累计出版的书籍规模庞大,但即便把书架搬空,也未必能满足下一代模型对训练 token 的胃口。于是,模型公司一边向物理世界寻找被遗漏的高质量知识,一边开始在企业协作、端侧设备、推理系统和机器人世界模型里寻找新的增长点。AI 行业的竞争正在从“谁模型更大”转向“谁能拿到更好的数据、入口和工程效率”。

纸质书成了新矿山

纸质书重新变成训练资源,背后是公开互联网数据红利的衰减。过去几年,大模型主要依赖网页、代码仓库、论坛、论文、问答社区和开放文本完成能力跃迁,但这些来源并非无限。高质量公开文本被反复消耗之后,再继续扩大训练规模,很容易遇到重复、低质、合成内容污染和版权边界不清的问题。纸质书的吸引力在于,它们经过编辑、出版和长期筛选,信息密度更高,风格也更稳定。

但这条路并不轻松。购买纸质书可以解决一部分授权形式问题,却无法抹平作者、出版机构、图书馆、读者和模型公司之间的利益分歧。尤其是“扫描后销毁原书”这一细节,会让公众产生强烈的不适感:书籍不再被视为文化载体,而像一次性训练燃料。对模型公司来说,这可能是合法路径;对内容产业来说,这却意味着知识生产者被卷入一套更难参与分配的机器。

数据荒会改变模型竞争

数据瓶颈出现后,模型公司的竞争方式会发生变化。单纯堆参数和堆训练语料不再足够,如何提升数据质量、过滤合成噪音、构建可追溯语料、把企业内部知识安全接入模型,都会变成核心能力。谁能建立更稳定的数据供应链,谁就能在模型效果、合规风险和商业交付之间取得更好的平衡。

这也解释了为什么同一批资讯里,飞书并入豆包值得关注。飞书沉淀的是企业组织结构、协作文档、会议纪要、项目流和知识库,恰好是 Agent 真正进入企业时最需要的上下文。相比从互联网抓取泛化文本,企业数据更贴近业务流程,也更能训练出“会接活”的智能体。但企业数据天然敏感,权限、审计、隔离和可控调用会成为产品能否落地的关键。

企业入口重新洗牌

字节把飞书产品团队并入豆包、商业化团队并入火山引擎,本质上是在重新定义 ToB AI 的入口。过去飞书强调协作软件,豆包强调大模型产品,火山引擎承接云和商业化能力。三者被重新组织后,可能形成从模型、办公场景到企业部署的一体化链条,让 AI 不只是嵌在文档里的辅助按钮,而是能贯穿组织流程的执行层。

这种变化会给企业服务市场带来压力。传统办公软件如果只把 AI 当成写作、总结、翻译工具,很容易被更贴近业务流程的 Agent 平台替代。企业真正需要的是:能读取正确资料、理解部门权限、跟踪任务进展、把结果写回系统,并在关键节点交给人类确认。飞书和豆包的合流,正是朝这个方向下注。

端侧 AI 也在抢入口

Tiiny AI 的融资和 PC 预装订单,则代表另一条路线:把个人 AI 从云端推向本地。TiinyOS 获得 PC 厂商万台预装机订单,Tiiny AI Pocket 以低功耗运行千亿参数模型,说明端侧 AI 不再只是手机上的语音助手,而可能成为个人电脑和随身设备的新系统层。对用户来说,本地运行意味着更低延迟、更强隐私感和离线能力;对厂商来说,则意味着能绕开单一云平台,把入口掌握在设备和操作系统手里。

这条路线与数据荒并不矛盾。云端大模型需要更多高质量训练数据,本地 AI 则需要更聪明的压缩、调度和模型协同。未来用户可能不会关心任务到底由云端大模型、本地小模型还是企业私有模型完成,只会关心它是否足够快、足够便宜、足够安全。谁能把这些能力封装成自然体验,谁就能拿到下一代入口。

效率竞争变得更硬核

OpenAI 让 GPT-5.6 Sol 自主重写生产 GPU 内核,使服务成本降低 20%、token 生成效率提升超过 15%,这条消息说明模型已经开始反向改造自己的基础设施。过去优化推理系统主要靠人类工程师、编译器团队和硬件厂商协作,如今 AI 开始参与线上生产系统级优化,意味着成本战进入更硬核的阶段。

无问芯穹发布的跨集群异构推理架构同样指向这个方向:通过分离式推理和中继接力,把首 token 延迟压低、单 token 成本降低。微软财报中 Azure 年度营收破千亿美元、资本开支继续大增,也说明大模型商业化背后仍是巨量基础设施投入。数据、算力、推理效率和云收入正在互相绑定,模型公司不能只讲能力,也必须讲单位成本和交付稳定性。

机器人和创作支线继续升温

莫刻机器人用 32 张真武 810E 卡训练 LJM 世界模型,并在 WorldArena 冲到全球第二,体现出机器人路线正在从“看起来像”转向“理解物理结果”。它采用双脑协作架构,先在隐空间推演交互,再生成视频结果,试图解决视频扩散模型重画面、轻物理的老问题。对具身智能来说,真正困难的不是生成漂亮画面,而是让机器理解动作之后会发生什么。

创作侧也在快速变热。Opus 5 游戏提示词爆火,有人用 24 小时复刻 3A 游戏玩法;VAST 在 SIGGRAPH 2026 拿下多个技术成果,Tripo P1.0 可快速生成可导入游戏引擎的 3D 资产;商汤 Seko 3.0 则把 AI 视频创作做成带 Agent 和 Skill 的平台。它们看似分散,却都在说明同一件事:AI 的下一步价值不只来自聊天,而来自把知识、工具、素材和工作流变成可交付成果。

行业进入资源重估阶段

把这些资讯放在一起看,AI 行业正在重新估算所有资源的价值。纸质书、企业文档、个人设备、GPU 内核、跨集群推理、机器人训练数据、3D 资产和办公流程,都可能成为新的竞争筹码。过去大家争的是模型榜单和发布会声量,现在更关键的是谁能把稀缺资源转化成长期壁垒。

对普通用户和企业来说,这意味着 AI 产品会越来越贴近真实工作,但也会带来更复杂的选择。企业需要关心数据是否可控,个人需要关心设备是否可信,开发者需要关心模型成本是否可持续,内容产业则需要重新讨论知识被用于训练时的收益分配。AI 公司开始抢纸质书,只是表面新闻;真正的变化是,模型时代的燃料、入口和规则都在被重新定价。

© 版权声明
THE END
喜欢就支持一下吧
点赞15 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容