浏览器、长上下文与工业Agent,AI开始争夺真实世界的执行入口

Anthropic把Claude装进浏览器之后,AI智能体终于拥有了一个更像“工位”的入口。8月26日上线的Claude in Chrome面向付费用户开放,用户只需交代目标,Claude便可以在独立浏览器里浏览网页、点击链接、填写表单并提取信息,不必反复切换窗口。这个变化看起来只是多了一个产品功能,实际却把大模型竞争从“回答得好不好”推向了“能不能替人把网页上的事情办完”。

围绕这一变化,腾讯混元、阿里Qwen、具身智能和工业软件也在给出不同答案:模型要更长的上下文、更低的调用成本,Agent要接上工具和流程,机器人要进入真实环境,企业软件则要把百年积累的工程经验变成可执行的智能系统。AI的下一轮竞争,正在从聊天框里走出来,争夺浏览器、办公流程、实验设备和生产现场。

浏览器变成智能体工位

Claude in Chrome的价值,不在于它能代替用户打开网页,而在于它开始拥有连续完成任务的能力。过去的聊天式AI通常需要用户复制文本、粘贴链接,再根据每一步结果发出下一条指令;内置浏览器则让智能体直接读取页面结构、跟随网页跳转、填写信息并汇总结果。对于资料搜集、后台录入、订单比价、表格核对等重复工作,这种减少人工搬运的能力更接近真正的生产力。

Anthropic同时加入探针扫描和安全分类器防护,说明浏览器Agent并不是普通插件的放大版。网页中可能藏着诱导指令,表单可能涉及付款或隐私信息,点击一个按钮也可能造成不可逆的业务后果。因此,成熟的浏览器智能体必须把只读、填写、提交、支付等动作分级,并在高风险节点请求人工确认。用户真正需要的不是一个“什么都敢点”的AI,而是一个知道边界、能解释行动、出错后可以回退的数字员工。

长上下文不等于长任务

阿里发布的Qwen3.8-Flash被视为Qwen4的早期预览版,125B参数采用MoE结构,加入51B N-gram Embedding,训练时间降至原来的九分之一,API价格约为旗舰版的十二分之一。更引人注意的是,它被设计为可以在24GB显存的单张RTX 4090上运行而无需量化。模型能力继续提升,但成本和部署门槛却被往下压,这会让更多开发者有机会把模型放进自己的工具链。

不过,长上下文和低价格只是Agent的基础设施,不等于任务一定能完成。一个浏览器任务可能横跨多个页面、账号和文件,模型需要记住目标、判断信息是否可信、处理页面变化,还要在中途失败时重新规划。真正的长程能力依赖结构化记忆、权限控制、任务状态和验证机制。企业部署时应把大任务拆成可检查的阶段,为每一步保留输入、输出和操作日志,而不是把所有希望寄托在一次超长提示词上。

AI智能体在电脑浏览器中执行网页任务的开发工作台
AI智能体开始从对话窗口进入浏览器和软件工作台,连续执行网页任务。

验证器决定Agent能走多远

斯坦福团队发布的LLM-as-a-Verifier框架提供了一个值得重视的思路:让DeepSeek V4 Flash先生成五条候选轨迹,再由模型自验证并筛选结果,Terminal-Bench 2.1成功率从79%提升到88%,超过Claude Fable 5,成本还低约11倍。这里的关键不是简单多问几遍,而是把“提出方案”和“检查方案”拆开,让模型拥有一层对自身工作进行复盘的机制。

软件工程尤其需要这种机制。代码Agent写出程序只是开始,真正的交付还包括运行测试、检查依赖、复现错误和确认边界条件。Specula在67个开源系统中发现382个深层Bug,并让coding agent自动生成TLA+模型和正确性不变量,再通过模型检查把反例带回代码。这样的流程说明,AI写代码的速度越快,验证、审计和回滚越不能缺席。对服务器、数据库和线上业务而言,任何自动修改都应该先在隔离环境中验证,再经过人工审批进入生产。

工业Agent要懂现场规则

西门子推出Eigen工程智能体等工业AI产品矩阵,试图把长期积累的工程知识接入Xcelerator平台。Eigen可以独立完成端到端工程任务,效率提升约2至5倍,已经在全球多个国家的企业部署。它与普通聊天机器人最大的差异,是面对的不是一段空白文本,而是设备参数、工艺约束、标准规范和项目交付,任何一个环节出错都可能影响生产。

这类工业智能体的核心竞争力,不只是底层模型有多大,而是能不能读懂企业已有的文档、配置和流程,并把动作限制在可控范围内。一个好的系统会先检查工艺条件,再提出修改方案,模拟运行结果,最后把变更记录交给工程师确认。算力、网络稳定性和数据隔离同样重要。需要部署这类业务的团队,可以按测试、试运行和正式生产阶段弹性配置速维云的云服务器资源,把模型服务、日志系统和业务接口分开部署,避免为了追求一次性高配置而承担长期浪费。

机器人正在补上真实数据

穹彻智能发布的Noe-0采用全链路无本体数据训练,数据来自真实环境,覆盖超过50个城市、数万采集员以及数十万小时和数十万种任务类型。它试图绕开传统遥操作数据对设备和场景的依赖,让机器人在预训练阶段就接触更丰富的人类行为与物理环境。对于具身智能来说,这条路线的意义在于,机器人学习的对象不再只是某一台机器人的动作轨迹,而是现实世界中任务、物体和反馈之间的关系。

港科大(广州)与腾讯开源的VibeWorlding则从另一侧降低了3D世界构建门槛。用户可以用自然语言描述“荒漠神殿”等场景,由AI自主生成可探索的三维世界。这样的系统离稳定的工业仿真还有距离,但它展示了模型从生成一张图、一个物体,继续走向生成可交互环境的趋势。未来机器人训练可能需要大量可控的虚拟世界,再用真实数据校正其中的物理规律,仿真和现实之间的闭环会成为重要基础设施。

应用落地先算清安全账

AI进入浏览器、工业设备和机器人之后,风险也会从“回答错误”升级为“动作错误”。浏览器可能误提交表单,工业Agent可能调用错误参数,机器人可能在异常环境中继续执行。应用方需要建立最小权限、分级确认、沙箱运行、异常中止和全程审计等机制,并明确哪些任务允许自动完成,哪些任务必须由人拍板。

这也意味着,AI产品的评价标准正在改变。模型榜单仍然可以反映基础能力,但企业更关心一次任务的成功率、失败后的恢复速度、每次交付的成本以及是否能留下可追溯记录。无论是Qwen低成本本地部署、Claude浏览器执行,还是西门子工程智能体和Noe-0机器人模型,最后都要回到同一个问题:它能否在真实约束下稳定工作。谁能把模型、工具、数据、算力和安全流程连成闭环,谁才更有机会把AI从演示现场带进日常业务。

© 版权声明
THE END
喜欢就支持一下吧
点赞12 分享