多模态AI共15篇
Qwen3.8-27B开源后,家用显卡也被拉进多模态模型战-速维云

Qwen3.8-27B开源后,家用显卡也被拉进多模态模型战

阿里把 Qwen3.8-27B 放到开源社区时,最值得注意的不是又多了一个参数规模标签,而是它把多模态、长上下文和本地运行放进了同一个讨论里。一个 270 亿参数的 Dense 模型,原生支持图像和视频理...
svyun的头像-速维云svyun41天前
559
Qwen3.7-Plus登场,多模态Agent竞争从看懂界面走向协作执行-速维云

Qwen3.7-Plus登场,多模态Agent竞争从看懂界面走向协作执行

通义千问 Qwen3.7-Plus、MuleRun Messages、MobileGym 和 GUI Agent 研究共同说明,AI 正从看懂界面走向团队协作、任务执行和系统交付。
svyun的头像-速维云svyun1个月前
05414
GPT-5.5 免费升级叠加实时语音公开,AI入口战正在逼近九亿用户-速维云

GPT-5.5 免费升级叠加实时语音公开,AI入口战正在逼近九亿用户

GPT-5.5 Instant 推向免费默认入口,Realtime API 架构公开,Claude 主动助手、多模态 API 与 AI 游戏融资同步升温,AI 竞争正在从模型能力转向入口、延迟、工作流和商业化。
svyun的头像-速维云svyun1个月前
0537
Qwen3.8全模态模型接进生产流程:AI开始拼看懂并办完-速维云

Qwen3.8全模态模型接进生产流程:AI开始拼看懂并办完

全模态模型正在从“能看懂图片”走向“能把看见的内容接进工作流程”。通义千问发布Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入,拥有百万级上下文,并把规划任务、调用工具和内容创作...
svyun的头像-速维云svyun7天前
04910
世界模型同时补上交互和声音,AI应用开始从生成内容走向生成现场-速维云

世界模型同时补上交互和声音,AI应用开始从生成内容走向生成现场

HiDream-O1-World 与 HelixWorld 1.0 把世界模型推向可交互、有声音的现场,OpenRouter、办公 Agent 和机器人新品则显示 AI 正在从单次生成走向可执行场景。
svyun的头像-速维云svyun38天前
04710
DeepSeek识图翻车后,多模态AI开始接受安全与信任考验-速维云

DeepSeek识图翻车后,多模态AI开始接受安全与信任考验

DeepSeek识图全量上线后暴露多模态稳定性问题,OpenAI与Anthropic推进身份验证和安全测试,AI产品竞争正在从能力展示转向可信边界。
svyun的头像-速维云svyun1个月前
04411