多模态模型共6篇
Luma开放Uni-1.1 API后,AI图像生成开始拼文字和成本-速维云

Luma开放Uni-1.1 API后,AI图像生成开始拼文字和成本

Luma 开放 Uni-1.1 API 后,图像生成竞争从单张样图走向文字渲染、调用成本、接口稳定性和创意生产工具链。
svyun的头像-速维云svyun10天前
505
Vidu S1把AI视频推向实时交互,内容生成开始变成可操控系统-速维云

Vidu S1把AI视频推向实时交互,内容生成开始变成可操控系统

Vidu S1、Vivix 实时交互模型与多模态工程进展叠加后,AI视频正在从离线生成工具转向可操控、可部署、可持续运行的应用系统。
svyun的头像-速维云svyun26天前
03710
字节开源多模态模型 Mamoda2.5,视觉 AI 正在从生成图片走向可交付内容生产-速维云

字节开源多模态模型 Mamoda2.5,视觉 AI 正在从生成图片走向可交付内容生产

字节 Mamoda2.5 开源、Luma API 开放、AI 游戏和世界模型升温,视觉 AI 正在从单次生成走向内容生产闭环。
svyun的头像-速维云svyun32天前
04512
Luma开放图像API,开源多模态模型把视觉AI推向内容生产线-速维云

Luma开放图像API,开源多模态模型把视觉AI推向内容生产线

Luma Uni-1.1 API、字节 Mamoda2.5 和阿里 PromptEcho 同时出现,说明视觉 AI 正从单张生成走向可调用、可控、可批量交付的内容生产线。
svyun的头像-速维云svyun32天前
03112
商汤把多模态做到可交付后,AI生图竞争开始拼生产闭环-速维云

商汤把多模态做到可交付后,AI生图竞争开始拼生产闭环

商汤SenseNova-U1 Pro强调8K直出、文字精准度和可交付创作能力,AI生图与智能体竞争正在从单点模型能力转向企业内容生产、工作流闭环和系统交付。
svyun的头像-速维云svyun32天前
245
触觉基础模型来了,物理AI开始从看见世界走向摸懂世界-速维云

触觉基础模型来了,物理AI开始从看见世界走向摸懂世界

机器人真正难的地方,从来不只是“看见”世界。视觉模型可以识别杯子、桌面、门把手和工具位置,但一只机器手要把杯子拿起来、知道力道是否过大、判断物体有没有滑落,还需要触觉反馈。Sharpa ...
svyun的头像-速维云svyun1个月前
245