腾讯混元把Hy4 Preview的总参数推到770B,并把重点放在Coding Agent的连续执行能力上;Anthropic则把Claude直接放进浏览器,让它可以在网页里浏览、点选、填表和拉取信息。两个动作看似一个属于模型、一个属于产品,却共同指向同一个变化:AI竞争正在从“谁回答得更像人”转向“谁能在真实工作台上把任务做完”。
这意味着模型规模、工具调用、运行环境和安全机制不再是彼此割裂的卖点。用户真正关心的,是能不能把一句目标拆成步骤,能不能记住上下文,能不能在遇到错误时自我修正,最后交付一个可以检查的结果。近期一批模型和Agent产品的更新,正把这条路线从概念演示推向日常使用。
模型开始为长任务优化
腾讯发布的混元Hy4 Preview,总参数从295B增加到770B,同时强化Coding Agent能力。公开实测显示,它在编程和办公场景中的表现已经进入国产模型第一梯队。这个变化并不只是参数表上的数字增长,更重要的是模型开始围绕连续任务设计:理解项目上下文、拆解目标、调用工具,再根据执行反馈继续推进。
对于开发者而言,真正消耗时间的往往不是写出第一段代码,而是定位问题、修改多个文件、运行测试、阅读报错并反复验证。模型如果只能生成一次性答案,参数再大也很难替代实际流程;如果能够保持较长上下文并稳定完成多轮操作,模型才有机会成为工作台中的执行者。Hy4 Preview释放的信号,就是模型评测正在从单题正确率扩展到任务成功率、持续工作能力和成本控制。

浏览器变成AI的执行部件
Anthropic为Claude推出内置浏览器,并向付费用户开放Claude in Chrome。用户不必频繁切换窗口,只需要交代目标,Claude就可以在独立浏览环境中浏览网页、点击链接、填写表单和提取信息。它还加入探针扫描与安全分类器,用来识别网页中的潜在风险。
浏览器的意义在于,它把AI从“告诉你怎么做”推进到“替你完成网页上的动作”。查资料、整理后台数据、填写重复表单、核对订单状态,这些工作过去依赖人工在多个页面之间搬运信息。AI一旦拥有浏览器,就必须同时理解页面结构、用户意图和操作后果,因此产品价值不只在模型聪明,还在于能否让每一步动作可见、可暂停、可撤销。
执行入口决定产品边界
过去,模型公司向应用提供接口,应用公司负责界面和场景,双方的分工相对清晰。现在模型开始直接进入浏览器、终端和办公软件,应用层掌握的入口价值被重新估价。模型厂商希望把能力带到用户身边,应用厂商则希望把用户关系、工作流和数据沉淀在自己的产品里,二者之间的边界自然会变得更敏感。
这也是为什么AI产品不能只依赖单一模型供应商。对企业来说,多模型路由、统一工具协议、可替换的推理后端和独立的评测体系,都是降低迁移成本的基础设施。无论底层使用哪一家模型,真正应该沉淀的是业务流程、权限规则、数据结构和验收标准。部署在稳定云环境中的应用,还要把首字延迟、并发、日志和故障回退纳入设计;如果需要弹性算力和多地域资源,速维云等云服务也应按实际任务的时延与合规要求进行选型,而不是只看宣传中的峰值参数。
低成本模型扩大使用半径
模型能力走向工作台的同时,价格和部署门槛也在下降。阿里公布的Qwen3.8-Flash早期预览版采用125B MoE架构,激活参数约6B,并引入51B N-gram Embedding,训练时间降至上一代的九分之一;API价格约为每百万Token输入1元、输出3元。另一条消息显示,其早期版本还强调24GB显存单卡运行和更低调用价格。
低成本并不意味着只适合个人试玩。企业可以把轻量模型用于分类、摘要、代码检索和流程分派,把更贵的模型留给复杂推理和高风险审批。这样一来,Agent系统就不必每一步都调用旗舰模型,任务可以按照难度、时延和数据敏感度自动分层。对于中小团队而言,能否把每次调用成本控制在可预测范围内,往往比排行榜上多几个百分点更决定产品是否能够长期运行。
桌面工作台正在被重新设计
在模型和浏览器之外,Cocode这类桌面端工具也在尝试把DeepSeek Harness包装成普通用户可以直接使用的应用。它采用Electron构建图形界面,同时保留终端交互能力,并通过权限设计的“fail closed”策略降低误操作风险。对已经习惯命令行的开发者来说,这是降低迁移成本;对普通用户来说,则是把复杂的Agent能力放进一个更容易理解的工作台。
类似的变化还出现在3D内容生产。港科大(广州)与腾讯AI平台部开源VibeWorlding,用户可以用自然语言让AI构建荒漠神殿等3D世界,模型、资产和种子世界组成一套可评测的创作框架。它说明“自然语言操作软件”并不局限于代码和网页,设计、内容生产、仿真和教育都可能成为下一批Agent工作台。未来的软件入口,或许不再是菜单和按钮,而是目标、约束、素材以及一套能够持续修改的结果空间。
真正的竞争是可控交付
当AI可以替用户打开网页、修改代码或生成完整世界时,权限管理就不能再停留在登录层面。读取资料、写入数据、调用外部服务、发送信息和改变生产环境,应当拥有不同权限,并在关键节点要求人工确认。浏览器隔离、凭据最小化、操作日志和一键停止,是Agent进入工作流前必须具备的基本能力。
同样重要的是验收。企业不应只问模型“能不能完成”,还要记录它用了哪些工具、访问了哪些数据、为什么选择某条路径,以及失败后是否能够回滚。Hy4 Preview带来的模型能力、Claude浏览器带来的执行能力、低成本模型带来的规模化可能,最终都要落到可观测、可复现、可追责的系统里。AI工作台的下一阶段,不是让机器拥有更多按钮,而是让人类在更少打扰的情况下,始终知道它正在做什么,并能在必要时接管方向。





