排序
DeepSeek补上视觉API后,AI竞争开始争夺真实现场
DeepSeek上线视觉模型API,图片输入开始成为Agent和企业应用的基础能力。随着模型路由、执行框架、AI ERP和医疗筛选同步推进,AI竞争正在从单点回答转向可感知、可执行、可审计的系统工程。
Luma开放图像API,开源多模态模型把视觉AI推向内容生产线
Luma Uni-1.1 API、字节 Mamoda2.5 和阿里 PromptEcho 同时出现,说明视觉 AI 正从单张生成走向可调用、可控、可批量交付的内容生产线。
商汤把多模态做到可交付后,AI生图竞争开始拼生产闭环
商汤SenseNova-U1 Pro强调8K直出、文字精准度和可交付创作能力,AI生图与智能体竞争正在从单点模型能力转向企业内容生产、工作流闭环和系统交付。
触觉基础模型来了,物理AI开始从看见世界走向摸懂世界
机器人真正难的地方,从来不只是“看见”世界。视觉模型可以识别杯子、桌面、门把手和工具位置,但一只机器手要把杯子拿起来、知道力道是否过大、判断物体有没有滑落,还需要触觉反馈。Sharpa ...






