Meta把个人AI助手Muse推向长期在线,腾讯WorkBuddy把办公Agent拆成人人可组合的“赛博乐高”,阿里则选择不造手机,先把跨应用执行能力做成AI手机底座。三条消息放在一起看,智能体的竞争重点正在发生变化:用户不再满足于问一句、答一句,而是希望AI记住偏好、理解上下文、调用软件,并在后台把事情推进下去。
这条路线的难点也随之改变。模型会不会写得漂亮只是起点,真正决定产品能否留下来的,是它能否在授权范围内持续工作,能否在出错时停下来,能否把一次成功变成可复用的流程。个人助理、办公平台和手机系统,正在争夺同一个位置:用户下一步动作的执行入口。
个人助理开始长期在线
Meta公布的Muse把个人AI助手从聊天窗口搬到了后台。它可以记住用户偏好,连接社交账号和日历,并持续运行一些任务,还整合云端电脑、浏览器操作和内容生成能力。上线后短时间内下载量达到约280万,并冲上美国App Store免费榜前列,说明不少用户已经愿意尝试把部分日常事务交给一个持续存在的数字助手。
但“长期在线”不是简单地把对话历史保存得更久。助理必须区分临时请求和长期偏好,判断哪些信息可以跨任务调用,知道日历里的安排能否被修改,也要让用户随时看见它正在做什么。一个真正可用的个人Agent,至少需要任务列表、权限提示、执行记录、撤销入口和异常通知,否则它越主动,越容易从方便变成打扰。
办公Agent变成可组装系统
腾讯WorkBuddy给出的思路更偏向办公生产力。它把Agent能力组织成专家广场、人机双写、团队空间等模块,用户可以像搭积木一样选择和组合功能。这样的产品不要求每个人从零设计提示词,也不把所有决策都藏在一个黑盒助手里,而是让个人、团队和企业按照自己的任务拆解方式搭建工作流。
“赛博乐高”的价值在于降低使用门槛,同时保留一定的控制权。销售团队可以组合客户资料整理、开发信生成和跟进提醒,内容团队可以把选题、资料搜集、初稿和审核串起来,管理者则需要看到每个Agent使用了哪些数据、调用了哪些工具、由谁批准了最终动作。未来办公软件的竞争,不只是谁拥有最强模型,还包括谁能把能力包装成员工愿意复用的模块。

手机成为跨应用执行底座
阿里发布的Qwen Intelligence选择了另一条路径:不直接制造手机,而是向手机厂商提供任务规划、跨应用执行和影像创作等Agent能力。首批搭载设备的综合任务准确率达到91.8%,复杂长程任务可以超过100步,端到端闭环率达到90%。这意味着手机里的AI不再只负责总结屏幕内容,而是试图理解目标后连续调用多个应用。
如果用户说“安排一次出差”,系统可能需要读取日历、比较交通、打开支付工具、整理确认信息,再把结果交回用户确认。跨应用执行的关键不在于步骤越多越好,而在于每一步都能识别当前状态。页面加载失败、登录过期、价格变化或用户临时改变要求,都需要Agent重新判断。手机厂商因此必须把系统权限、账号隔离、敏感操作确认和本地计算能力一起纳入设计。
成本决定后台能跑多久
智能体一旦从偶尔对话变成持续任务,Token账单就会从产品后台浮到经营层面。OpenAI近期公布的GPT-6提示缓存机制,把命中缓存的输入成本降到普通输入的十分之一,首次写入则按更高价格计算。对于需要反复读取相同规则、企业知识或任务状态的Agent,缓存可以显著减少重复输入,但前提是共享前缀必须精确匹配,缓存保留时间也不是无限的。
这会促使开发团队重新组织上下文。稳定的系统规则、工具说明和不常变化的业务约束,应尽量形成可复用前缀;临时数据、用户隐私和实时状态,则要单独管理。不同步骤也不必全部交给旗舰模型,分类、路由、格式检查和简单判断可以使用更轻量的模型。对需要部署执行型Agent的团队来说,网络、CPU、内存、日志和缓存策略同样会影响最终成本,像速维云这类云服务器资源可以用于承载任务编排、状态存储和业务接口,但权限与审计仍需由企业自行设计。
桌面终端带来新的协作方式
千问办公还发布了QwenNote Eva桌面AI Agent,售价899元,支持人脸和声纹识别,可辅助制作PPT、发送消息、提醒日程,也能完成会议听记和口语陪练。它把Agent从纯软件界面带到了桌面设备,强调的是随时可调用和面对面的陪伴感。对办公用户而言,这种入口可能比打开一个网页更自然,但也会让唤醒、误识别和旁听边界变得更加敏感。
桌面设备的价值不应只是增加一个会说话的外壳。它真正有意义的地方,在于把会议、提醒、文档和沟通动作连接起来,同时明确哪些内容只在本地处理,哪些任务可以上传云端,哪些指令必须再次确认。声音和视觉识别一旦参与身份验证,就不能只追求交互顺滑,还要考虑家庭成员、访客和公共办公环境中的误触发风险。
从会回答到可托付
个人Muse、WorkBuddy和手机Agent的共同方向,是让AI从“给建议”走向“替用户推进”。但可托付并不等于完全自动化。高质量的Agent应该把任务拆成可检查的阶段,在读取信息、提出方案、执行动作和对外发送之间设置不同级别的确认;当目标不清、权限不足或结果异常时,它应当主动停下,而不是为了完成率继续猜。
企业真正需要评估的,也不只是模型跑分和演示中的成功案例。更关键的问题包括:数据是否按角色隔离,工具调用是否有审计,长任务能否恢复,错误动作能否撤销,供应商变更模型后流程是否仍稳定,以及高并发时成本会不会失控。只有这些条件逐步成熟,Agent才会从新鲜的聊天功能变成可靠的工作基础设施。
接下来,AI产品的入口可能越来越分散,但竞争会越来越集中在同一件事上:谁能在不越权、不失控的前提下,把用户的一句话变成真实世界里完成的一串动作。模型只是其中一环,记忆、权限、系统连接、运行资源和人机协作机制,才共同构成智能体真正的执行力。





