DeepSeek补上视觉API后,AI竞争开始争夺真实现场

DeepSeek把视觉能力接进API之后,模型的竞争焦点又往前挪了一步:用户不必先把截图、表格和照片翻译成文字,模型就可以直接从现场信息开始工作。8月21日,DeepSeek上线多模态模型 deepseek-v4-flash-vision-exp,支持图片输入,单张图片最高转换为384 tokens,价格延续V4-Flash体系,缓存命中成本最低可到每百万tokens 0.05元。它未必意味着视觉模型已经解决所有问题,却清楚说明了一个变化:多模态不再只是产品展示页上的“看图问答”,而是开始成为Agent、办公软件和内容工具的输入层。

这条消息值得关注的地方,不只是DeepSeek补上了图片能力,而是它把视觉理解放进了开发者能够调用的低成本接口。模型能不能看懂一张截图,当然重要;但更重要的是,看懂之后能不能继续查资料、修改文件、生成代码、整理数据,并在整个流程里保持上下文。AI真正进入业务,靠的正是这段从感知到执行的链路。

视觉输入变成基础能力

过去,企业把图片接入AI,通常要先经过OCR、表格识别、人工校正,再把结构化文本送进语言模型。这个流程并非不可用,但每增加一个转换环节,就多一层格式损失和维护成本。扫描件中的布局、图表里的相对位置、产品照片里的细节,往往不是几段文字能够完整表达的。

deepseek-v4-flash-vision-exp的意义在于,它尝试把图像输入直接放到通用模型接口中。办公人员可以把合同截图、报错页面、流程图和数据看板交给同一个模型;开发者可以让Agent先观察界面,再决定调用浏览器、终端或代码工具。模型不再只处理“别人已经整理好的问题”,而是开始接触问题最初的现场。

从看懂到做完

多模态模型进入API以后,最先受影响的会是那些信息本来就混在文字、图像和操作界面里的工作。比如客服需要根据用户截图定位故障,销售要从报价单和产品照片整理客户需求,运营要从后台看板找出异常,开发者要根据界面变化调整前端代码。这些任务以前常常需要人在不同工具之间来回搬运信息。

如果视觉模型能够稳定识别页面结构,再调用浏览器或终端执行动作,AI就从“回答图片里的问题”变成“根据图片继续推进任务”。这也是Agent产品竞争越来越重视输入层的原因。没有可靠的视觉感知,Agent只能处理结构化、干净、已经被人类预处理过的世界;有了视觉输入,它才有机会面对真实办公环境中的混乱资料。

AI多模态模型运行所依赖的GPU与图形计算芯片特写
多模态模型从图片理解走向业务执行,背后仍离不开GPU与推理基础设施。

成本决定能否普及

视觉能力能不能真正进入日常产品,价格和延迟往往比演示效果更关键。图片输入会带来额外的编码、传输和推理消耗,如果每次看图都要付出高昂成本,企业就只能把它留给少数高价值任务。DeepSeek延续V4-Flash的定价,并把缓存命中价格压低,释放出的信号是:视觉模型要被频繁调用,而不是只在发布会里偶尔展示。

低价并不等于没有工程问题。企业仍然要考虑图片压缩、敏感信息脱敏、缓存策略、并发控制和错误重试。真正成熟的系统,通常会先判断一张图片是否值得送入大模型,再根据任务难度选择模型和分辨率。简单的票据字段可以用轻量模型完成,复杂的流程图或多页文档才交给更强的视觉推理链路。

神秘模型搅动路由层

同一天,OpenRouter匿名上线了名为“Ox Alpha”的模型,宣称面向高效编程和长时间Agent任务,支持100万Token上下文以及文本、图像、视频输入,社区测试中取得了较高通过率。模型到底来自哪家公司尚未确认,猜测本身不是新闻的核心,真正值得注意的是它出现的位置:模型聚合平台正在成为新模型被发现、比较和快速试用的第一站。

当开发者可以在同一个路由层测试多个模型,竞争就不再只看厂商发布会上的榜单。上下文长度、图像处理、工具调用、稳定性、价格和限流策略会被放在真实任务里一起比较。未来企业采购模型,可能更像采购一组可替换的推理能力:不同任务由不同模型承担,平台负责路由、缓存、监控和故障切换。

Agent开始接近工作系统

OpenAI开源Codex Harness核心框架的消息,也说明模型本身正在退到执行系统后面。相关测试显示,Harness可以让Agent更好地规划任务、调用工具并保留中间状态,在复杂任务上减少输出Token。开发者得到的不是一个更会聊天的接口,而是一套可以嵌入产品、接入权限和组织流程的运行环境。

这类框架与视觉模型放在一起看,方向就更清楚了:视觉模型负责理解现场,Harness负责组织步骤,终端、浏览器和业务系统负责产生结果。企业真正要部署的不是某个单独模型,而是一个有输入、有计划、有工具、有审计的执行系统。系统越接近生产环境,越需要记录每次图片来源、模型判断、工具调用和人工接管节点。

企业应用不再只看聊天

AI ERP平台Rillet完成1亿美元C轮融资,估值达到10亿美元,客户数量超过600家。它可以从Salesforce等系统提取数据,帮助财务人员处理账目。这样的产品没有炫目的机器人形象,却比聊天机器人更接近企业每天愿意付费的地方:数据能否自动归集,账务能否减少重复录入,异常能否及时被发现。

AI算力调度公司Callosum获得1亿美元种子轮融资,则把另一层基础设施问题摆到台前。它试图把任务匹配到更合适的模型和芯片,并与Cerebras、Rebellions等厂商合作。模型数量越来越多后,企业不可能让所有请求都走同一条昂贵路径,路由和调度会成为控制成本、提升可用性的关键组件。

从实验结果走向验证

医疗领域的进展也在提醒行业,AI应用的价值不能只用下载量或演示效果衡量。基于Gemma开发的C2S-Scale模型,对4000多种抗癌药物进行虚拟筛选,发现一种药物可能帮助“冷肿瘤”增强抗原呈递,并已经在活细胞实验中得到验证。这里最重要的不是模型参数,而是从候选生成到实验验证之间是否形成了闭环。

这和视觉模型的落地逻辑其实相通。模型看懂图像只是起点,企业还要知道它做出的判断是否准确、能否复现、出了错由谁负责。无论是财务单据、代码截图还是医学影像,最终都需要数据留痕、人工复核和结果评测。AI产品的下一阶段,不是把“能做”讲得更热闹,而是把“做错了怎么办”设计得更具体。

竞争进入系统工程

DeepSeek的视觉API、OpenRouter的新模型、Codex Harness以及企业Agent融资消息,表面上属于不同新闻,底层却指向同一件事:模型正在从单一能力竞争转向系统能力竞争。输入是否丰富,路由是否灵活,执行是否稳定,成本是否可控,结果是否可审计,都会影响用户最终愿不愿意把工作交给AI。

对开发者来说,接下来最值得做的不是盲目追逐每一个新模型,而是拿真实业务做一组小规模评测:同一份截图能否准确理解,同一个任务能否连续完成,失败后能否恢复,成本是否随着调用量可预测。对企业来说,能把这些结果沉淀成权限、日志和流程的团队,才更可能把多模态能力变成长期生产力。AI已经开始看见更多现场,下一关是证明自己能够对现场负责。

© 版权声明
THE END
喜欢就支持一下吧
点赞6 分享