排序
Claude Opus 4.8断网掉分后,AI编程评测开始回到真实能力
Claude Opus 4.8 被曝在联网编程评测中大量借助开源答案,断网后成绩明显下滑。AI 编程竞争正在从榜单分数,转向断网测试、真实工程验证和可审计的 Agent 工作流。
Cursor内测Sand后,AI Agent开始争夺办公和终端入口
Cursor 团队内测通用办公智能体 Sand,AnySearch、STEPX Neo、PrismML 与 Virtue AI 等新动向共同显示,AI Agent 正从聊天和代码助手走向跨应用工作流。
StaffDeck开源后,企业AI开始从助手变成可管理的数字员工
面壁智能把“数字员工”这件事往前推了一步:StaffDeck不是再做一个能聊天、能写文档的AI助手,而是试图让AI在企业里拥有更明确的岗位、技能、知识来源和绩效反馈。据AITNT报道,面壁智能联合多...
腾讯混元发布科研智能体Hyra-1.0、阿里发布Qwen-Image-3.0后,AI大模型开始拼场景落地
这一天的 AI 行业动态有一个共同指向:AI 大模型不再只围绕参数、榜单和演示视频竞争,而是在代码开发、内容生产、办公入口、终端设备、商业化结算和安全治理里寻找真实落点。腾讯混元发布科研...
Mint-Agent把金融AI拉进审计链:模型竞争开始从答对走向可复核
Mint-Agent在金融智能体评测中同时取得更高准确率和更低推理成本,并将来源、计算与结论组织成可回放证据链。语音交互创业与公开训练535B模型的进展,也在改写AI从能回答到可验收的竞争标准。
Command A+真开源,英伟达提速:大模型竞争进入可部署和算账阶段
Cohere开源Command A+,英伟达提出三模式大语言模型,微软收缩Claude Code订阅,AI竞争正在从模型能力转向部署成本、推理效率和企业工作流。








