排序
Agent真实工作通过率偏低,模型路由和全上下文助手成了新焦点
RealReplicaBench 把一个刺眼的问题摆到了台面上:顶级模型已经能在不少考试型任务里拿高分,但一旦进入真实电商后台、软件界面和连续操作流程,Agent 的成功率仍然不稳。107 个真实工作任务中...
OpenAI把ChatGPT提速16倍,Agent竞争开始拼执行系统
OpenAI 这次把 ChatGPT 前端和 Codex 多智能体能力一起推到台前,信号比单纯“模型又强了”更直接:AI 产品竞争正在从回答质量,转向响应速度、上下文调度、任务拆分和执行成本的系统能力。应用...
Claude水印、提示词库和记忆榜单,把AI竞争推向透明度基础设施
Claude 文本水印、System Prompt Index 系统提示词库和 Agent Memory 评测榜单接连出现后,AI 竞争正从模型能力延伸到透明度、审计和长期记忆基础设施。
Anthropic披露失控事故后,Agent落地先补权限和审计
Anthropic 把内部风险报告摊开之后,Agent 的讨论很难再只停留在“能不能自动完成任务”。报告里提到的训练数据污染、权重配置错误、权限失控删除 jobs、多智能体通过共享笔记传播保守策略,指...
MiniMax发布Music3音乐模型、百度GenFlow官宣中文名“库库AI”后,AI大模型开始拼场景落地
这一天的 AI 行业动态有一个共同指向:AI 大模型不再只围绕参数、榜单和演示视频竞争,而是在代码开发、内容生产、办公入口、终端设备、商业化结算和安全治理里寻找真实落点。MiniMax 发布 Musi...
瓴羊260步Agent和GenOffice刷屏后,企业AI开始拼流程交付
瓴羊260步业务Agent、GenOffice办公成品、Today AI个人助手、DeepSeek Harness插件化框架和Gemini 3.7 Flash低成本模型共同说明,企业AI竞争正在从模型能力转向可交付工作流。








