Claude开始拥有自己的浏览器之后,AI助手与网页之间那层“请用户代为点击”的隔膜正在变薄。Anthropic向付费用户开放Claude in Chrome,用户只需交代目标,Claude便可在独立浏览环境里浏览网页、点击链接、填写表单和整理信息;与此同时,Hermes Agent推出Real Profile Browsing,尝试把Chrome登录态复制到隔离浏览器,让代理以用户身份完成更复杂的网页操作。一个是把浏览器做成智能体的工作台,一个是把身份带进浏览器,二者共同把AI竞争推向了新的入口:模型不只要会回答,还要能在真实网页里连续办事。

这条变化的价值不在于“AI会点鼠标”本身,而在于网页终于从资料库变成了可执行环境。过去的聊天机器人擅长总结、改写和生成建议,最后一步仍要人打开网站、登录账号、核对字段、提交结果。浏览器Agent试图接管这段最琐碎也最有价值的链路,但它同时把权限、隐私、误操作和责任归属推到台前。AI真正进入工作流的标志,可能不是生成了多少字,而是它能否在边界清楚的情况下,把任务可靠地做完。
浏览器成为工作台
Claude in Chrome的产品思路很明确:浏览器不是另一个需要用户主动打开的独立应用,而是Claude执行任务时使用的工具。用户可以让它查找资料、比较网页内容、整理信息,甚至完成需要多个页面跳转的流程。对研究、采购、客服、运营和行政工作来说,这类能力最直接的价值是减少窗口切换,把“看网页、做判断、填系统”串成一个连续任务。
Anthropic为该功能加入探针扫描和安全分类器,说明网页操作比普通文本生成更容易触发风险。一个页面可能含有隐藏指令、诱导性内容或与任务无关的危险操作,Agent如果把网页中的文字都当成主人命令,就可能被提示注入带偏。因此,浏览器Agent的核心能力不只是视觉定位和点击准确率,还包括区分用户意图、网页内容与系统规则,并在不确定时停下来请求确认。
身份带来便利
Hermes Agent的Real Profile Browsing更进一步,它尝试将Chrome的登录状态复制到隔离浏览器,让AI可以使用用户已经登录的服务。对于需要访问会员资料、企业后台或个性化推荐页面的任务,这种方式确实比每次重新登录顺畅。AI不再只是替用户寻找公开信息,而是开始站在用户的数字身份里行动。
但身份一旦被交给Agent,风险等级也会显著上升。相关实测已经暴露出浏览器调用卡顿、Cookie被新会话覆盖、macOS加密导致解密失败等问题。即使技术故障最终能够修复,用户仍应把“让AI以我身份操作”视为授权行为,而不是普通插件安装。登录态意味着订单、通讯、文件、支付和内部系统都可能被触及,权限范围必须小到足够明确,撤销方式也必须足够简单。
从一次回答到连续执行
浏览器Agent的真正难点是长链路。查一件商品可能要打开多个页面、理解规格差异、排除广告内容、记录价格并输出结论;填一份表格则要读取附件、判断字段、处理格式、回到原页面复核。任何一步失败,最终结果都可能看起来完成,实际却无法使用。它需要保持上下文,知道已经做过什么,也知道哪些动作尚未得到验证。
这与近期自验证框架在Terminal-Bench 2.1上的表现形成呼应:DeepSeek V4 Flash生成多条候选轨迹,再由模型自己验证筛选,成功率从79%提高到88%,成本还明显低于闭源旗舰。对浏览器Agent来说,类似的“先执行、再检查”机制同样重要。提交表单后重新读取结果、下单前核对金额、发送邮件前确认收件人,验证环节不是额外负担,而是智能体从演示走向生产的基本配置。
模型能力重新定价
腾讯混元Hy4 Preview把参数规模从295B提升到770B,并强化Coding Agent能力;阿里Qwen3.8-Flash则以125B总参数、仅6B激活参数和较低API价格,展示了另一条路线:更大的能力上限与更低的调用门槛同时推进。浏览器任务往往不是一次性问答,Agent会持续读取页面、调用工具和重试,因此模型价格、首字延迟和上下文效率会直接影响一项业务是否值得自动化。
这也解释了为什么行业竞争开始从“谁的榜单分数最高”转向“谁能把单位任务成本压下来”。强模型适合处理复杂判断,小模型适合页面分类、字段抽取和重复校验,路由系统则根据风险和难度动态分配模型。对于企业而言,最经济的方案通常不是所有步骤都交给旗舰模型,而是把高风险决策、低风险执行和人工复核拆开,让每次调用都有清晰的成本与责任边界。
安全不只是沙箱
浏览器Agent面对的安全问题至少有三层。第一层是网页内容攻击,恶意页面可能通过提示注入诱导代理泄露信息或改变任务目标;第二层是身份与权限风险,登录态被滥用后,影响范围可能远大于一次错误回答;第三层是执行结果风险,Agent可能正确理解了目标,却在金额、对象或提交时机上犯错。只把它放进隔离浏览器,并不能自动解决所有问题。
更可靠的做法是把权限拆细:只开放必要域名和操作,只读任务默认禁止写入,涉及付款、发信、删除、发布和账号设置时强制人工确认,同时保留完整操作日志。企业还需要建立凭证轮换、会话过期、敏感字段遮蔽和异常中断机制。未来浏览器Agent能否普及,很大程度取决于它能否让用户看见“AI准备做什么、已经做了什么、为什么这么做”。
入口之争进入下一阶段
从Claude的内置浏览器,到Hermes对真实身份的调用,再到Cocode把DeepSeek Harness包装成普通人可用的桌面端,AI产品正在争夺的已经不是一个聊天窗口,而是用户完成任务时最靠近动作的那一层。桌面端、浏览器、办公软件和手机系统都在尝试成为Agent的工位,模型则变成工位背后的推理与执行引擎。
这场竞争不会只由发布速度决定。浏览器Agent要同时满足足够强的理解能力、可接受的成本、稳定的工具调用和清晰的安全边界。对普通用户来说,最值得尝试的不是把所有账号都交给AI,而是从低风险、可回滚的任务开始;对企业来说,则应先建立权限、审计和人工接管机制,再扩大自动化范围。AI正在走进网页,但真正成熟的产品,必须让它既能行动,也知道什么时候不该行动。






暂无评论内容