多模态AI 第2页
Gemini 3.8 Live把等待藏到后台:语音Agent开始边聊边办事-速维云

Gemini 3.8 Live把等待藏到后台:语音Agent开始边聊边办事

Gemini 3.8 Live把实时语音、视觉与后台工具调用放进同一条交互链路。专业模型、具身系统和KV Cache基础设施也在补齐执行、验证与规模化能力。
svyun的头像-速维云svyun8天前
405
3899元AI牙刷把摄像头塞进牙缝:垂直AI开始为每一次动作负责-速维云

3899元AI牙刷把摄像头塞进牙缝:垂直AI开始为每一次动作负责

戴森推出可视成像AI牙刷,尝试用微距摄像头识别牙缝并完成定向护理。与此同时,服装审美模型、视觉证据训练和精密装配机器人说明,垂直AI正在从生成内容走向感知细节、执行动作与验证结果。
svyun的头像-速维云svyun22天前
398
字节开源多模态模型,视觉 AI 从生成图片走向视频、游戏和世界模型-速维云

字节开源多模态模型,视觉 AI 从生成图片走向视频、游戏和世界模型

字节开源多模态模型、Luma开放图像API、阿里PromptEcho与世界模型升温,视觉AI正从单张图片生成走向视频、游戏和可交互空间。
svyun的头像-速维云svyun1个月前
0367
GenCeption改造视频模型后,AI视频开始从生成走向可交互世界-速维云

GenCeption改造视频模型后,AI视频开始从生成走向可交互世界

GenCeption把文生视频模型改造成通用视频理解系统,Xmax、爱诗科技和抖音互动内容同步推进,AI视频正在从素材生成走向可交互世界。
svyun的头像-速维云svyun1个月前
03611
OpenAI硬件路线图曝光后,AI入口竞争从聊天窗口打到手机和无屏设备-速维云

OpenAI硬件路线图曝光后,AI入口竞争从聊天窗口打到手机和无屏设备

OpenAI硬件路线图曝光、GPT-5.6 Sol自优化、Grok语音模型和智元全模态模型同步出现,说明AI竞争正从聊天窗口走向手机、无屏设备、语音入口和真实应用场景。
svyun的头像-速维云svyun1个月前
03611
OpenAI挖来Vision Pro硬件负责人后,AI入口战开始走向真实设备-速维云

OpenAI挖来Vision Pro硬件负责人后,AI入口战开始走向真实设备

苹果 Vision Pro 硬件工程负责人保罗·米德离开苹果、转投 OpenAI 主管硬件部门,这条消息把 AI 行业一个长期悬着的问题重新推到台前:下一代 AI 入口到底还会不会是手机、网页和聊天框。过去两...
svyun的头像-速维云svyun2个月前
335