Anthropic这次把Claude带进蛋白质设计实验室,真正让人改变判断的不是“AI又完成了一项科研任务”,而是它开始同时处理设计、筛选和实验数据。Claude从头生成1320个蛋白质候选,交给外部实验室生产验证后,354个成功结合目标,15个靶点中有14个拿到有效结果;在部分任务上,命中率达到35.1%,明显高于常见的10%至15%。它随后还读取NMR和LC-MS原始文件,用23分钟和19分钟完成分析,测得样品纯度96.4%,与实验室96.33%的结果只差0.07个百分点。
这件事的分量在于,AI不再只负责把论文写得像论文,或者给科学家提供一份候选清单。它开始进入“提出方案—调用工具—等待实验—解释反馈”的长流程。即使这离自动研发新药还有很远,科研工作中最昂贵、最容易卡住的搜索和验证环节,已经出现了被重新组织的可能。
从预测结构到设计分子
许多人听到蛋白质和AI,第一反应会想到AlphaFold。两者解决的问题并不相同:AlphaFold主要根据氨基酸序列预测蛋白质结构,而这次Claude面对的是一个目标蛋白,需要从零设计此前不存在的微型结合蛋白,让它精准黏住目标位置。这个任务更接近药物研发中的分子设计,而不是对已有答案做识别。
微型结合蛋白通常只有几十个氨基酸,但它要在复杂的三维表面上找到合适位置,并同时满足形状、稳定性和结合强度等条件。传统流程需要研究人员调度多个专业模型,生成大量候选,再依靠计算筛选和实验验证逐轮缩小范围。每个靶点可能要经历数周甚至数月,失败本身也很难快速转化为下一轮设计经验。
让智能体跑完科研流程
Anthropic披露的结果显示,Claude使用Mythos Preview和Opus 4.8,能够访问论文、网络资料、专业蛋白质模型以及GPU算力。人类给出目标和约束后,系统负责拆解任务、设计候选、调用模型、整理结果,并把值得实验验证的方案交给外部实验室。它不是简单地让一个聊天模型“猜一条蛋白质序列”,而是把多个工具编排成一条可复核的工作流。
结果也说明,智能体的价值不等于每次都得到正确答案。单靶点模式下,Mythos Preview的最高命中率达到35.1%,但在另一些结构复杂的目标上仍会失败,挑战麦芽糖结合蛋白时,90个设计只有一个出现微弱信号。更强的模型也不保证在所有科研问题上稳定领先,真正重要的是系统能否记录失败、调整策略,并让专家知道哪些结果值得继续投入。

实验数据才是硬考场
设计出候选分子只是前半程,实验数据决定它有没有资格进入下一步。Claude在NMR分析中整理信号峰、估算氢原子数量,并根据异常提出重水验证建议;在LC-MS分析中,它先理解厂商文件的编码方式,再复现扫描记录,输出色谱图、质谱图、纯度表和分子量结果。这里没有漂亮的演示界面,只有格式混乱、步骤繁琐而且必须谨慎处理的原始数据。
这也是AI科研最值得关注的变化。模型可以生成假设,但实验会把假设变成可检验的对象;模型可以写代码,但仪器结果会暴露代码和推理中的错误。未来评价科研智能体,不能只看它提出了多少想法,而要看它能否理解数据来源、保留中间过程、主动发现矛盾,并把结论交给研究人员复核。可追溯性和可重复性,会比一次偶然命中更重要。
硬件也在接入智能体
乐鑫发布的ESP-Mosaico从另一端说明了同一个趋势:AI生成代码之后,必须有真实设备接住结果。这套模块化开发板支持多机拼接,提供摄像头、传感器、按键、灯光和电机等可组合模块。Chat Coding可以从一句自然语言需求生成并运行硬件原型,Vibe Coding则把构建、部署、真机测试和持续修复接成完整流程。
它的意义不只是让初学者更容易做出一个小游戏。设备能够把触摸输入、运行状态、性能指标和故障信息整理成结构化反馈,再交给Agent继续修改代码。这样一来,AI编程从“写出看起来合理的代码”变成“让代码在具体设备上运行、接受测试、根据反馈返工”。这与蛋白质设计中的实验闭环,本质上都是把模型输出送进现实环境,再把结果带回下一轮判断。
从家庭娱乐到可玩产品
Nex Playground则把端侧AI放进了家庭客厅。这款无手柄体感游戏主机通过摄像头和端侧计算机视觉识别跳跃、挥手、躲避等动作,最多支持四人同时参与,主要面向儿童和亲子家庭。公司披露,产品在2025年销量超过65万台,截至2026年年中累计销量超过100万台,并凭借硬件加订阅的模式进入独角兽行列。
但体感设备能不能长期成立,不能只看一次演示或节日销量。识别系统要适应不同房间、光线、身高和多人遮挡,平台还要持续提供低门槛内容,才能让摄像头和端侧模型真正转化为使用频率。AI在这里不是单独的卖点,而是连接设备、动作、内容和家庭关系的底层能力。能否把技术稳定地变成可重复的体验,决定了产品的商业寿命。
普通人也能参与创作
Spellcaster把类似的思路推向游戏制作。它让Rule、Level、Asset、Playability、Simulation、Repair六个Agent协作,把自然语言想法转成可运行的游戏原型。传统代码助手通常交付一段代码,开发者还要自己运行、找Bug、调整玩法;Spellcaster试图把“生成—试玩—检查—修复”一起完成,基础小游戏最快约15分钟可以得到可玩版本。
可玩性是这类产品必须面对的现实验证。代码成功运行,并不意味着游戏有趣;画面生成出来,也不代表关卡节奏合理。让Agent自己试玩和修复,意味着评价标准从“有没有产出”转向“用户能不能继续使用”。这正是AI应用从模型展示走向产品交付时的共同难题:结果必须落在真实环境里,经受用户、设备、实验或业务流程的反复检验。
算力之外的基础设施
这些新闻放在一起看,AI竞争的关键正在从单次生成转向验证闭环。Claude需要GPU来运行复杂设计和分析任务,ESP-Mosaico需要稳定的构建、部署与设备反馈,Nex需要端侧推理和内容分发,Spellcaster需要多Agent协作与运行环境。模型只是其中一层,数据、工具、权限、日志、网络和存储同样决定最终结果。
对企业或开发团队来说,部署这类系统时,不能只问“选哪个模型”,还要计算显存、并发、数据隔离、任务队列和失败重试。需要弹性GPU或稳定云端环境做实验时,可以通过速维云这类云服务器先验证工作流,再按照真实负载调整规格。尤其是科研和Agent任务,峰值算力与日常负载差异很大,先把成本、监控和权限边界跑通,往往比一开始重投入固定集群更稳妥。
真正的答案在反馈里
AI进入科研、硬件、家庭娱乐和游戏创作后,评价标准会越来越接近现实结果。蛋白质设计要看实验命中和数据准确,硬件Agent要看真机运行和故障恢复,体感主机要看识别稳定与订阅留存,游戏生成要看玩家是否愿意继续玩。它们的领域不同,却都在要求模型对外部世界负责。
因此,下一阶段最有价值的AI产品,未必是参数最大或演示最炫的那个,而是能把目标、工具、环境、反馈和人工确认组织起来的系统。模型能力仍然重要,但它只是起点。谁能把一次生成变成可重复、可审计、可交付的结果,谁才真正接近AI应用的产业答案。








暂无评论内容