成本墙之后,前沿AI开始进入数亿台终端

三星与牛津大学、北京大学提出的TrOPD方法,把大模型能力下沉到端侧设备这件事,从“压缩参数”推进到了“筛选有效监督”。在Qwen3-SFT-1.7B上,这套方法让数学、代码、指令遵循和STEM基准分别提升3.34、4.00、5.11和6.18分。它传递出的信号很明确:前沿智能未必只能依靠规模越来越大的云端模型,关键在于小模型能否学到教师模型真正可靠的推理部分。

这条技术路线与机器人流式记忆、手机端AI系统、线性注意力优化正在形成呼应。设备侧AI的竞争标准不再只是“能不能离线运行”,而是有限算力下能否持续理解环境、保存必要记忆、调用本地工具,并在用户可接受的延迟内完成任务。模型的能力上限仍然重要,但延迟、功耗、隐私和每次调用成本,已经开始决定AI能否进入数亿台真实设备。

小模型学什么

传统知识蒸馏常把大模型输出当作统一的学习材料,但教师模型并非在所有样本、所有步骤上都同样可靠。错误推理如果被小模型完整继承,不仅浪费有限容量,还可能放大不稳定行为。TrOPD的核心价值,是识别教师模型更可信的监督区域,让端侧模型优先吸收有效信息,而不是机械模仿全部输出。

这种思路更符合端侧部署的现实。手机、摄像头、车载设备和机器人无法无限增加参数,它们需要在固定内存与功耗预算中取舍。对开发者来说,训练目标也应从“尽量复制大模型”转向“围绕设备任务保留最有价值的能力”。如果设备主要负责意图识别、局部规划和工具路由,就没有必要为低频知识问答付出同等计算成本。

端侧AI芯片与主板处理器
端侧AI的竞争正在延伸到芯片、内存与本地推理效率。

延迟决定体验

面壁智能等机构推出的SimpleMemVLA,为端侧智能提供了另一块关键拼图:把视觉历史直接放进上下文,让机器人能够记住刚刚发生过什么。其四项记忆基准达到领先水平,在126秒历史窗口下,任务成功率达到63.6%,比此前最强模型高17.4个百分点。这说明机器人要完成连续任务,不能只看当前一帧,还要理解动作与环境变化之间的因果关系。

更值得关注的是流式推理带来的延迟下降。通过复用历史计算,SimpleMemVLA把决策延迟从1.02秒降到0.68秒,并能在超长视觉上下文中维持流式决策。几十或几百毫秒的差异,在聊天产品里可能不明显,但在机械臂、移动机器人和交互设备上,会直接影响动作是否自然、是否安全。端侧AI的产品体验,最终由持续响应而非单次跑分定义。

手机成为试验场

OPPO在ColorOS 17中提出“端侧模型自研、记忆为核心、AIOS三层架构”的路线,并推出“即将发生”和“记忆后台”等功能。同内存机型后台保活率提升55.6%,说明手机AI竞争正在进入系统资源调度层。模型能回答问题只是起点,真正困难的是让它在权限明确、资源受控的前提下长期工作。

手机拥有位置、相册、日程、通知和应用状态等丰富上下文,也是隐私风险最集中的设备。更多推理留在本地,可以减少敏感数据频繁上传云端,但这并不自动等于安全。系统仍需限制模型能够读取哪些数据、何时调用摄像头或麦克风,以及执行跨应用操作前是否需要确认。端云协同的合理边界,应由任务风险决定,而不能只由速度决定。

线性注意力提速

哈工大(深圳)与鹏城实验室发布的PolaFormer++,从模型计算结构上改善端侧和长序列任务的效率。该方法通过极性感知的通道级尖锐特征映射,处理线性注意力容易丢失负值信息、注意力分布不够集中的问题。在ImageNet上达到82.8%精度,并在20万长度序列下实现5.25倍提速。

长上下文并不只属于云端聊天模型。机器人要保存视觉轨迹,手机助手要理解连续操作,工业终端要分析传感器序列,这些都需要在有限内存中处理不断增长的历史信息。更高效的注意力结构若能在精度与速度之间取得稳定平衡,就有机会减少设备对云端请求的依赖,也让断网、弱网和高并发场景下的智能功能更加可靠。

能力下沉到行业

阿里达摩院联合医疗机构研发的通用医疗影像模型DAMO RADAR,展示了垂直场景对模型能力的另一种要求。该模型聚焦腹部增强CT,在涵盖18个解剖结构、146种临床相关影像表现的近4万次系统评估中,平均AUC达到0.913。医疗AI的价值不在于生成更流畅的描述,而在于是否经过足够严格、可追溯的评估。

未来这类能力若进一步下沉到医院边缘节点和影像设备,可能缩短数据传输链路,并支持更及时的辅助分析。但医疗场景不能简单套用消费电子的更新节奏。模型需要明确适用范围、保留原始影像证据、记录版本变化,并由专业人员完成最终判断。越接近现实决策,部署效率与责任边界就越需要同时设计。

成本墙后的新路线

端侧AI并不意味着云端大模型失去价值。更可行的架构,是让小模型承担高频、低风险和对延迟敏感的任务,把复杂推理、跨领域知识和大规模规划交给云端模型。设备可以先完成数据筛选、隐私处理和意图判断,再按需调用更强能力,从而避免每个动作都产生远程请求和高额Token消耗。

三星TrOPD、机器人流式记忆、手机AIOS和高效注意力结构指向同一个变化:AI产业正在从单纯追逐更大参数,转向重新分配每一层算力。谁能让合适的模型在合适的位置完成合适的任务,谁就更可能把演示能力变成可规模复制的产品。端侧模型不是云端模型的缩小版,而会逐步成为连接传感器、用户数据与现实动作的独立执行层。

商业化看稳定交付

当模型进入数亿台终端,商业价值将更多来自调用频率和任务完成率,而不是一次发布会上的最高分。设备厂商需要同时维护模型版本、芯片适配、功耗策略、权限系统和故障回退。任何一环不稳定,都可能让“智能功能”变成耗电、发热或误操作的来源。因此,端侧AI首先是一项系统工程,其次才是模型竞赛。

对用户而言,真正有感的进步也许不是参数标签,而是相机能够更快理解现场、机器人记得刚才做过什么、手机助手在弱网中仍能完成常用操作。成本墙并没有终结Scaling,而是迫使行业把扩展方向从单一参数规模,改成模型、算法、芯片和系统共同优化。前沿能力能否被可靠地装进每一台设备,将成为下一阶段AI普及速度的关键。

© 版权声明
THE END
喜欢就支持一下吧
点赞13 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容