Meta把Muse Spark 1.3的升级重点放在了一个比跑分更接近真实使用的问题上:一个Agent完成同样的工程任务,到底要调用多少次工具、消耗多少Token、又会不会在中途忘掉限制条件。按照Meta工程团队给出的内部对比,新模型相较Muse Spark 1.2平均减少约20%的工具调用和约25%的Token消耗,并同步强化长任务、编程、多任务处理与复杂指令遵循能力。
这组数字之所以重要,是因为Agent的成本从来不只是模型报价。一次看似简单的开发任务,背后可能包含搜索代码、读取文件、运行命令、修改内容、执行测试和修复错误等数十个动作。模型每多走一步,等待时间、调用费用和失败概率都会累积。Muse Spark 1.3试图做的,是让模型用更少的动作完成更长的工作,并在需要帮助或涉及高影响操作时主动询问用户。
长任务不只拼记忆
Meta对Muse Spark 1.3的描述显示,模型会在开放式任务中主动收集上下文,从杂乱甚至相互冲突的信息里整理线索,发现计划缺口后调整步骤,并持续记录已经获得的结果。它还在多种Agent运行框架中接受训练,目标是不依赖某一套固定工具链,也能保持相对稳定的执行能力。新模型已经进入Muse Code和Meta Model API,更高计算量的推理版本仍在等待额外安全测试。
这意味着长任务能力不能再简单等同于“上下文窗口更大”。真正的工程任务会不断产生新信息,模型必须判断哪些状态需要保留、哪些计划已经失效、什么时候继续尝试、什么时候应该停下来请求确认。Meta展示的航空工程案例需要同时读取仿真数据与机翼CAD文件,提取边界条件、材料属性和受力数据,再分析流动现象并生成指定结构的报告。考验的是资料理解、工具协同、状态管理和最终交付,而不是一段孤立答案。

成本进入任务层
过去比较模型价格,常用的是每百万Token输入与输出单价;进入Agent阶段后,这个指标仍然重要,却不再完整。便宜模型如果频繁误判、重复搜索或反复调用工具,总成本可能高于单价更贵但路径更短的模型。Muse Spark 1.3减少工具调用与Token消耗,实际上是在争夺“每个完成任务的成本”,这会直接影响编程助手、企业自动化和个人Agent能否长期运行。
企业评估Agent时,也需要把账算到任务结果上。除了Token,还要记录工具调用次数、总耗时、人工接管次数、失败恢复成本和最终成功率。对于需要搭建隔离测试环境、内部知识库或弹性开发机的团队,可以用速维云云服务器把实验环境与生产系统分开,保留日志、权限和回滚点。基础设施的价值不是替模型做决定,而是让每次自动执行都能被复查和恢复。
三家模型卷向同一目标
Meta发布新模型的同时,谷歌的Gemini 3.8 Flash也把速度和成本推到竞争中心。公开信息显示,其输入价格为每百万Token 0.75美元,生成速度达到305 tokens/s,并在DeepSWE v1.1软件工程基准上取得73.7%的成绩。谷歌的路线是用低单价、高速度和更多迭代,把Agent的反复试错变成可承受的工作方式。它提醒市场:模型不一定每一步都追求最重推理,只要整体循环足够快、足够便宜,同样可能得到可用结果。
Fable 5.1的第三方实测则展示了另一面。它在ARC-AGI-2测试中达到90.0%,相关任务成本较前代降低32%,并在长篇写作、编程和知识工作中表现出更高效率;但当任务存在严格字数、数量和引用限制时,仍可能超额输出,甚至生成不存在的引用。三条路线放在一起看,竞争焦点已经从“谁能答出更难的问题”扩展为“谁能持续遵守要求、控制预算并把任务交付完整”。
会求助也是能力
Muse Spark 1.3强化了主动澄清:提示含义不明确时询问用户,任务受阻时寻求帮助,涉及不可逆或影响较大的操作时先确认。这个变化看似不如基准分数亮眼,却直接决定Agent是否适合进入真实工作。一个不会承认信息不足的模型,越能操作工具,越容易把猜测放大成真实后果;一个懂得在关键节点停下来的模型,反而更接近可靠同事。
进度汇报也需要因人而异。有些用户希望持续看到Agent做到了哪一步,有些人只关心最终结果。模型若能根据偏好调整通知频率,可以减少长任务中的打扰,同时避免“沉默运行”造成失控感。不过,语言层面的自我约束不能替代系统权限。删除数据、发布内容、修改生产配置或调用外部账户等动作,仍应由运行框架设置硬性确认与最小权限,不能只相信模型会主动询问。
科研Agent开始做判断
长任务竞争也在从软件开发延伸到科研。前DeepMind团队创立的Inherent获得5000万美元种子融资,并推出科研智能系统Faraday。它基于Qwen3.6-27B后训练,把具体编码与实验执行交给Coding Agent,自己负责判断研究什么、如何设计实验、怎样在有限预算下缩小实验,以及结果是否真正支持论文主张。其定位不是替代某个工具,而是成为多个工具之上的科研决策层。
为了训练这种“科研品味”,Inherent构建Replica框架,将一百篇论文拆成三百一十项复现任务,要求Agent在受限算力与时间内恢复被删去的关键结果。评分不仅看图像是否相似,还检查核心主张、实验忠实度、算力使用和科研规范。Faraday在预留测试集上的平均得分达到0.791,高于对比系统。这个案例说明,Agent要处理越开放的任务,越需要可验证的中间过程,而不是只对最终答案进行一次性打分。
物理世界需要闭环
软件Agent之外,群核科技与英伟达、英特尔、浙江大学等团队公布的三项ECCV 2026工作,把同样的思路带入物理AI。SPEAR仿真器在1080P下达到73FPS,并通过共享内存减少图像传输开销;Syn-GRPO让模型在训练循环中生成更有挑战性的视觉样本;WalkerBench则用覆盖多城市的交互环境测试空间感知与导航。三项工作分别解决训练环境、数据演化和能力评估问题。
这类基础设施与通用Agent模型面对的是同一个难题:系统不能只执行一次漂亮的演示,而要在行动、反馈、纠错和再次行动之间形成闭环。WalkerBench的结果显示,未经辅助的视觉语言Agent在长程空间任务中容易遗忘路径,引入显式拓扑记忆和目标导向感知后,多种模型的平均成绩明显提高。状态外化、过程记录与独立验证,既适用于机器人,也适用于编程、办公和科研Agent。
企业采购要换指标
如果企业准备引入新一代Agent,最先改变的应当是测试方法。不要只让模型回答几道题,而要选择真实但可控的任务,记录它使用了哪些工具、是否遗漏限制、失败后能否恢复、需要多少人工介入,并用固定验收条件判断结果。同一任务至少比较多次,因为长流程中一次偶然成功无法代表稳定性。涉及敏感数据时,还要分别测试读取权限、外发限制、日志完整性与删除流程。
Muse Spark 1.3、Gemini 3.8 Flash和Fable 5.1共同释放出的信号很明确:模型能力正在从单次生成转向持续执行,价格竞争也从Token单价转向完成任务的总成本。接下来真正拉开差距的,不会只是更大的参数或更高的榜单名次,而是谁能在复杂约束中少走弯路、知道何时求助、保留可审计证据,并把一次成功变成可以稳定复制的交付。






暂无评论内容