豆包工作伙伴进入飞书群聊:AI开始以团队成员身份接管协作

当AI开始被拉进群聊、接管文件和会议,它面对的就不再是“能不能回答一个问题”,而是能不能在一支真实团队里持续记住上下文、判断权限、推进任务并留下结果。飞书联合豆包发布的“豆包工作伙伴”,把团队共享Agent直接放进企业群聊:它可以读取文档、参与会议、记忆成员信息,还能在判断合适时主动介入。这个变化比又一个聊天机器人上线更值得关注,因为AI第一次以“团队成员”的姿态进入协作系统。

同一天的几条消息,正好把这条路线的不同侧面拼在了一起:OpenAI计划收购Glass Imaging,补强端侧视觉和AI-ISP能力;Anthropic开始上线Claude Mods,让开发者用插件重塑Claude Code的工具调用和界面;生数科技发布Vidu S2,尝试让数字人和视频编辑进入实时交互。它们看起来分属办公、硬件、开发工具和内容生产,底层却指向同一个问题:AI的价值正在从“生成一段内容”转向“进入一个环境,理解环境,并在环境里持续行动”。

AI先成为团队成员

“豆包工作伙伴”的关键不只是把一个模型拉进群,而是给它配置独立的人设、权限和记忆。传统办公助手往往等人打开页面、复制材料、发出指令,团队共享Agent则试图直接出现在工作发生的地方。它可以读取群内文档,理解会议讨论,跟进待办事项,并根据上下文判断什么时候应该发言、什么时候应该保持安静。

这会改变企业使用AI的最小单位。过去,企业采购模型通常从个人账号和单点插件开始;未来更可能从一个项目群、一条业务流程或一个跨部门任务开始。Agent要记住的也不只是用户偏好,还包括谁负责审批、哪些资料可以访问、任务截止时间是什么、某个结论由哪份文件支撑。只要记忆与权限没有绑定,所谓“主动协作”就可能变成主动打扰,甚至越权读取。

权限比人设更重要

团队Agent真正进入生产环境后,最难的问题不会是它会不会写会议纪要,而是它能不能准确区分“建议”和“执行”。例如,它可以整理采购报价,却不应绕过审批直接下单;它可以根据会议内容生成合同草稿,却不能自行对外发送;它可以提醒负责人补充材料,却不能因为发现一个缺口就擅自修改源文件。

因此,企业需要把Agent拆成可审计的权限单元:能读哪些空间,能调用哪些工具,能代表谁发起动作,超过什么额度必须人工确认,失败后如何撤销。日志也不能只记录最终回复,而要保留关键依据、工具调用、权限判断和异常分支。对需要稳定网络、隔离运行环境和持续任务调度的团队来说,像速维云这类云基础设施服务,价值也不只是提供一台机器,而是帮助业务把运行环境、访问边界与资源成本纳入同一套管理。

办公桌上的笔记本电脑与数字协作设备,象征团队AI工作流
办公设备与数字协作工具正在成为团队AI工作流的共同入口。

开发工具变成可改造系统

Claude Mods的出现,则把“Agent如何工作”这件事交给了开发者。基于Function Hooks的插件机制,可以拦截工具调用、改变交互组件、扩展代码助手的行为,甚至让社区在Claude Code界面中实现游戏等非传统功能。它意味着开发者不必等待厂商为每一种需求发布官方开关,而是可以在运行过程中插入自己的规则和能力。

这会让AI编程工具从单一产品变成一套可编排的工作台。有人可以为代码审查增加组织规范,有人可以给部署动作加审批闸门,也有人可以把项目文档、测试系统和发布平台连接起来。不过,可插拔性越强,供应链风险越高。插件能看到什么、能修改什么、是否会把敏感代码发送到第三方、升级后行为是否变化,都必须像管理生产环境依赖一样管理,不能因为它披着“开发效率工具”的外衣就放松审查。

端侧视觉补上最后一公里

OpenAI计划以3亿美元收购Glass Imaging,关注点并不只是获得一家影像公司的品牌。Glass Imaging由前苹果工程师创立,核心产品GlassAI面向端侧AI-ISP,目标是让小型摄像头获得更接近专业相机的成像效果。对于正在发展多模态助手的模型公司来说,镜头、图像处理和设备端推理是一条不能长期依赖外部供应商的链路。

端侧视觉的意义在于,它让AI获得更稳定、更低延迟的现实输入。手机、眼镜、摄像头或机器人首先要把复杂光线、运动模糊和局部细节处理成可理解的数据,模型才有机会继续完成识别、规划和控制。如果所有画面都上传云端,延迟、隐私、带宽和成本都会限制使用场景;如果设备本地具备更强的影像处理能力,AI才可能从“看一张照片”走向持续理解周围环境。硬件收购因此不是模型公司的旁支动作,而可能是多模态产品补齐执行链的重要一步。

实时生成正在改变内容生产

生数科技发布的Vidu S2,把另一个方向推向了更低延迟的交互现场。S2-Avatar可以根据一张图片生成实时数字人,并在对话过程中更换角色、场景和衣物;S2-Editing则尝试直接对视频流进行风格和内容修改,覆盖风格迁移、虚拟试穿等任务。720p与25到42帧每秒的指标,说明重点已从“能不能生成”转向“能不能跟得上用户的动作”。

这类能力的商业价值不在于把短视频批量做得更热闹,而在于缩短创作反馈回路。直播导购可以即时试换服装,培训系统可以根据学员反应调整演示,品牌团队可以在现场快速验证不同视觉方案。但实时意味着错误也会实时发生,人物身份、服饰细节、声音和画面修改都需要可控。内容生产平台必须提供回滚、审核和素材来源记录,否则速度越快,品牌风险扩散得也越快。

AI竞争进入环境之争

从团队Agent到端侧影像,再到可插拔编程工具和实时视频,模型本身仍然重要,却已经不是唯一的胜负手。真正拉开差距的,正在变成模型能否接入真实权限体系、能否理解持续变化的上下文、能否在设备限制下保持响应,以及能否在出错后给出足够证据。一个只会生成漂亮答案的系统,很难独立承担长期任务;一个能够调用工具、接受反馈、保留记忆并服从边界的系统,才有机会成为业务基础设施。

这也解释了为什么近期AI产品越来越像“模型加环境”的组合。模型负责理解和规划,设备负责采集与推理,插件负责扩展动作,云端负责调度和审计,人工负责关键节点的确认。企业在选型时,不应只比较参数、榜单和演示速度,而要把连续运行成本、数据隔离、权限粒度、失败恢复、人工复核和供应商迁移能力一起算进去。AI真正走进组织之后,最稀缺的资源不只是算力,而是可信的运行环境。

从会回答到能负责

接下来,团队共享Agent可能会成为办公软件的新入口,端侧视觉会成为多模态产品的感知底座,插件机制则会把开发工具变成一个个可定制的执行系统。它们共同带来的变化,是用户不再需要反复把任务翻译成提示词,而是直接把目标、材料和权限交给一个能够持续工作的数字协作者。

但“能负责”不等于“替人负责”。越接近真实业务,AI越需要明确的授权链、可追溯日志和人类最终确认。只有让每一次读取、判断和执行都能被解释、复盘和撤销,AI才不会停留在令人兴奋的演示阶段,而会真正进入企业、设备和创作现场,成为一种可管理、可交付的生产力。

© 版权声明
THE END
喜欢就支持一下吧
点赞14 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容