多模态AI共15篇
Qwen3.8全模态模型接进生产流程:AI开始拼看懂并办完-速维云

Qwen3.8全模态模型接进生产流程:AI开始拼看懂并办完

全模态模型正在从“能看懂图片”走向“能把看见的内容接进工作流程”。通义千问发布Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入,拥有百万级上下文,并把规划任务、调用工具和内容创作...
svyun的头像-速维云svyun7天前
04910
Gemini 3.8 Live把等待藏到后台:语音Agent开始边聊边办事-速维云

Gemini 3.8 Live把等待藏到后台:语音Agent开始边聊边办事

Gemini 3.8 Live把实时语音、视觉与后台工具调用放进同一条交互链路。专业模型、具身系统和KV Cache基础设施也在补齐执行、验证与规模化能力。
svyun的头像-速维云svyun8天前
405
3899元AI牙刷把摄像头塞进牙缝:垂直AI开始为每一次动作负责-速维云

3899元AI牙刷把摄像头塞进牙缝:垂直AI开始为每一次动作负责

戴森推出可视成像AI牙刷,尝试用微距摄像头识别牙缝并完成定向护理。与此同时,服装审美模型、视觉证据训练和精密装配机器人说明,垂直AI正在从生成内容走向感知细节、执行动作与验证结果。
svyun的头像-速维云svyun21天前
398
李飞飞Atlas让世界模型走向真实空间:AI开始学习如何理解和行动-速维云

李飞飞Atlas让世界模型走向真实空间:AI开始学习如何理解和行动

李飞飞团队发布多模态世界模型Atlas,支持三维重建、视频生成与机器人仿真。世界模型正在把AI从内容生成推进到可观察、可推演、可验证的真实环境。
svyun的头像-速维云svyun23天前
295
世界模型同时补上交互和声音,AI应用开始从生成内容走向生成现场-速维云

世界模型同时补上交互和声音,AI应用开始从生成内容走向生成现场

HiDream-O1-World 与 HelixWorld 1.0 把世界模型推向可交互、有声音的现场,OpenRouter、办公 Agent 和机器人新品则显示 AI 正在从单次生成走向可执行场景。
svyun的头像-速维云svyun38天前
04710
Qwen3.8-27B开源后,家用显卡也被拉进多模态模型战-速维云

Qwen3.8-27B开源后,家用显卡也被拉进多模态模型战

阿里把 Qwen3.8-27B 放到开源社区时,最值得注意的不是又多了一个参数规模标签,而是它把多模态、长上下文和本地运行放进了同一个讨论里。一个 270 亿参数的 Dense 模型,原生支持图像和视频理...
svyun的头像-速维云svyun41天前
559