最新发布第38页
排序
Agent真实工作通过率偏低,模型路由和全上下文助手成了新焦点
RealReplicaBench 把一个刺眼的问题摆到了台面上:顶级模型已经能在不少考试型任务里拿高分,但一旦进入真实电商后台、软件界面和连续操作流程,Agent 的成功率仍然不稳。107 个真实工作任务中...
Claude锁定5GW算力,SubQ和Gemma把大模型竞争推向算力与效率双战场
Claude长期锁定AWS算力,SubQ与Gemma从长上下文和推理速度切入,大模型竞争进入算力供给、架构效率和企业部署共同较量的新阶段。
GenCeption改造视频模型后,AI视频开始从生成走向可交互世界
GenCeption把文生视频模型改造成通用视频理解系统,Xmax、爱诗科技和抖音互动内容同步推进,AI视频正在从素材生成走向可交互世界。
衔远开源OpenMLE之后,AI造AI开始进入工程化阶段
当一家中国创业团队把“让AI自己改进AI”的方法拆成公开模型、训练配方和评测工具时,AI造AI就不再只是硅谷融资故事里的口号。衔远科技发布Frontis-MA1-35B与开源套件OpenMLE,公开信息显示,相...















