开源视频模型的竞争今天又往前推了一步。Sand.ai 放出 MAGI-2-preview,把 114B 总参数、约 6B 激活的 MoE 架构带进视频生成模型;同一天,影溯开源的 QuerySplat 让几张照片秒级变成可探索 3D 场景,Acti 则把 AI 操作入口压缩到键盘长按动作里。这几条新闻放在一起看,信号很清楚:AI 的焦点不只是聊天框里谁回答得更好,而是模型、工具和交互方式开始同时向“可生产、可部署、可进入工作流”推进。

这轮变化的关键,不在于单个模型参数又大了多少,而在于视频、3D、Agent 键盘、本地推理和企业安全都在补齐真实使用里的短板。生成式 AI 从文本走向视频和空间,从云端大模型走向本地部署,从人工点按钮走向 Agent 自主调用 API,也让企业和个人用户重新评估:哪些能力只是演示,哪些能力已经接近生产工具。
视频模型开源
Sand.ai 开源 MAGI-2-preview,是这批新闻里最有产业冲击力的一条。它号称全球首个千亿参数 MoE 视频生成模型,总参数 114B,单次激活约 6B,采用 Multi-Head LatentMoE 架构,把视频、音频和文本放进统一建模框架。对视频生成来说,这不只是模型规模变大,而是把成本、序列长度和跨模态一致性放到同一套工程体系里处理。
更值得注意的是成本叙事。新闻中提到,MAGI-2-preview 生成 10 秒 1080P 视频的成本约 5 毛钱,接近行业常见成本的十分之一。如果这个数字能在真实调用中稳定成立,视频生成的商业逻辑会明显改变。过去很多 AI 视频产品卡在两个地方:一是质量波动大,二是单次生成成本高,导致创作者反复试错时成本不可控。MoE 架构如果能把高质量生成和低激活成本结合起来,视频模型就更接近“高频生产工具”,而不是偶尔尝鲜的特效玩具。
开源本身也很关键。视频模型过去比语言模型更难开源落地,因为训练和推理都吃硬件,音画同步、长序列稳定性、数据版权和部署成本都是问题。MAGI-2-preview 公开后,开发者、芯片厂商和云平台可以围绕它做推理优化、插件生态、私有化部署和垂直内容工具,这会把竞争从单一模型榜单推向完整工具链。谁能让视频模型真正进入剪辑、广告、短剧、游戏素材和企业培训内容生产,谁才有机会拿到更持久的价值。
空间生成提速
影溯开源 QuerySplat(Topos-Lite)则补上了另一个方向:从二维内容生成走向可探索三维场景。它基于前馈式 3D Gaussian Splatting 技术,用户只需要拍摄几张不同角度照片,不需要手动做相机标定,就能在秒级生成可自由切换视角的 3D 场景。在 DL3DV-Evaluation 基准的多种视图设置中,Topos-Lite 的 PSNR、SSIM、LPIPS 等指标都达到最优。
这类技术的意义,不只是让 3D 重建更快。过去 3D 内容生产门槛高,建模、贴图、扫描、清理网格和资产优化都需要专业流程。前馈式 3D 生成如果能用少量照片快速恢复空间结构,就会直接影响电商展示、房产看房、游戏场景、机器人仿真、数字孪生和文旅内容制作。它把“拍几张图”变成“得到一个可浏览空间”,这对非专业用户尤其重要。
视频 MoE 和 3D Gaussian Splatting 放在一起看,会发现多模态生成正在从“生成一张好看的图”转向“生成可编辑、可观察、可交互的世界状态”。视频强调时间连续性,3D 场景强调空间一致性,二者都会倒逼模型理解物体、视角、运动和环境关系。未来真正有价值的内容生成工具,可能不再是一个独立按钮,而是一套能持续理解素材、生成资产、修改局部并保持整体一致的生产系统。
入口开始变轻
Acti 这款 AI 键盘看起来没有大模型发布那么轰动,但它代表了 AI 应用层的另一个现实方向:入口越轻,使用频率越高。Acti 支持用户在聊天框里长按空格键调用 AI,直接查信息、找文件、创建会议,不需要在多个 App 之间来回切换。它还能连接 Gmail、Slack、Notion 等应用,调用 150 多个 API,覆盖 95 种语言,并已经完成 530 万美元种子轮融资。
这类产品的价值在于,它绕过了“再打开一个 AI 应用”的心理门槛。对普通用户来说,AI 能不能被持续使用,往往取决于它是否出现在正在发生的任务现场。聊天时要查日程、写邮件时要找资料、协作时要创建会议,如果 AI 需要切换窗口、复制粘贴、重新描述上下文,很多人就会放弃。键盘级入口把 AI 放到输入动作旁边,等于让 Agent 能力更贴近真实工作流。
不过,入口变轻也会带来新的竞争问题。键盘、浏览器、Office、IM、操作系统都想成为 AI 的默认入口,但用户不可能接受每个入口都要求一套权限和订阅。Acti 这类产品要走得远,不只要调用 API 多,还要解决权限边界、数据可信、企业合规和失败兜底。Agent 不是越主动越好,而是要在合适场景里给用户明确控制感。
本地推理重算
Kimi K3 本地部署实验也值得放进同一张图里看。开发者用约 200KB C 代码实现 Kimi K3 CPU 推理,通过稀疏专家架构仅激活 3.7% 参数,再结合权重流式加载,把峰值内存压到 8.24GB。限制也很明显:权重存储需要 1.56TB NVMe 硬盘,速度只有 0.03 Token/s。它不适合日常对话,却证明前沿模型正在以一种很粗糙但真实的方式进入个人桌面。
这个实验的意义不在于“8GB 内存就能流畅跑最强模型”,那显然还不现实。真正重要的是模型部署边界被重新打开了。过去大模型能力几乎等同于云端 API,用户只能接受厂商的价格、隐私策略和可用性限制。现在稀疏激活、量化、流式加载、CPU 推理和消费级硬件优化一起推进,让本地大模型从小参数玩具逐渐靠近可用工具。
对企业来说,本地部署还有另一层价值:数据和流程可以留在内网。金融、医疗、政企、制造等场景并不总能把资料交给外部云模型,即使云端模型能力更强,也会受合规和安全约束。随着 DeepSeek V4 Flash、Kimi K3 等模型不断出现更低成本的部署方案,未来很可能形成混合格局:高复杂任务交给云端强模型,敏感数据、稳定流程和低延迟任务交给本地或私有化模型。
安全成为底座
AI 能力越接近真实工作流,安全就越不再是附属话题。Cloudflare 发布面向 AI 智能体的可编程钱包 Cloudflare Wallets,让 Agent 拥有可读用户名和虚拟钱包,并通过预算上限控制损失范围。Glow 完成 1.8 亿美元 A 轮融资、估值 12 亿美元,方向是用 AI 驱动端点安全,监控员工设备上的软件和 Agent 风险。这两条新闻说明,AI 正从“会说话”走向“会操作、会花钱、会接触企业系统”。
当 Agent 能调用工具、发起支付、访问文件、连接 SaaS 和执行跨系统任务时,传统权限管理就不够用了。过去企业主要管人和设备,接下来还要管 AI 代理:它能代表谁行动,能花多少钱,能访问哪些数据,失败后谁负责,异常行为如何拦截。Cloudflare Wallets 的思路是给 Agent 一个可控的钱包和身份,Glow 的思路是从端点侧识别软件与 Agent 风险,二者都在给 AI 行动能力加安全边界。
这也是 AI 应用从演示走向生产必须经历的一关。很多企业不是不知道 AI 有用,而是不敢把关键流程交给不可控系统。安全、审计、预算、身份和权限如果不能工程化,Agent 再聪明也只能停留在辅助建议层。等这些底座逐步成熟,AI 才可能真正进入采购、客服、运营、研发、投研和财务等高价值流程。
行业进入生产期
把这些新闻连起来看,AI 行业正在从模型能力竞争转向生产系统竞争。MAGI-2-preview 代表视频生成模型的开源和低成本化,QuerySplat 代表空间资产生成的提速,Acti 代表入口和交互方式轻量化,Kimi K3 本地实验代表部署边界扩大,Cloudflare Wallets 与 Glow 则代表 Agent 行动能力背后的安全基础设施。
这几条线同时推进,会让 AI 产品的评估标准变得更具体。用户不会只问模型榜单排第几,而会问生成一次视频多少钱,能不能稳定改局部,3D 场景能不能导入生产工具,Agent 能不能在当前聊天框里完成任务,本地部署是否足够保护数据,企业能不能审计每次操作。换句话说,AI 的竞争正在从“模型有没有能力”转向“能力能不能被低成本、可控地用起来”。
接下来一段时间,最值得观察的不是单个爆款模型,而是这些能力如何汇合到真实产品里。视频生成会进入剪辑台,3D 重建会进入资产管线,键盘和浏览器会争夺 Agent 入口,本地模型会进入私有化部署,安全平台会给 Agent 上护栏。等这些环节连成闭环,AI 才算真正从炫技阶段走向生产力阶段。







暂无评论内容