从数学证明到物理实验:AI开始为科研结果负责

GPT-6 Astra上线第一天就在FME数学基准中解出5道Erdős难题,Claude则用数十个智能体协作完成费马大定理的形式化证明。两条消息放在一起看,意义并不只是“哪个模型更强”:AI正在从展示流畅答案,走向提交可验证成果。与此同时,Anthropic开始在API层验证思考过程的一致性,Physical Superintelligence把模型接进物理实验,AI数据公司则把医生、律师等专业人士的工作过程变成训练材料。模型竞争的下一站,已经从参数规模转向推理、证据和真实世界闭环。

数学不再只是演示题

OpenAI公布的GPT-6 Astra在FME数学基准中成为唯一取得非零成绩的模型,在68道Erdős难题中解出5道,得分率为3%,单题解题期望成本约1万美元。这个数字看上去并不高,却说明评价AI科研能力不能只看平均正确率。对于前沿数学而言,一次真正有效的突破,可能就来自一组此前长期没有进展的具体问题。

更值得关注的是形式化验证。Claude被报道在11天内完成费马大定理首个完整形式化证明,写下约1300万行Lean代码并证明30300个定理。无论最终怎样评价这项成果的研究边界,Lean这类工具提供了一条重要路径:模型的猜想、推导和代码必须接受计算机检查,AI输出不再只依赖“看起来合理”的文字说服人类。

模型能力变成工程约束

Anthropic发布Fable 5.1后,在API中加入“上下文一致性验证”,严格检查返回的思考块是否与原始上下文一致。若思考内容被篡改,服务将报错拒绝;开发者也可以选择非严格模式,由系统自动删除思考块。这项变化的直接影响是,模型的内部过程不再只是调用方可以随意搬运的一段文本。

它也反映出大模型产业正在进入更复杂的工程阶段。过去,开发者主要关心提示词怎么写、模型分数多高;现在还必须考虑上下文是否完整、缓存是否可信、输出能否审计,以及不同模型之间的数据边界。对企业来说,稳定的API行为和可追溯的执行记录,往往比一次测试中的极限分数更能决定采购结果。

这类机制也会改变模型服务的成本结构。上下文缓存如果可靠,重复提交的资料就不必反复计算;思考过程如果可以验证,团队就能把高风险任务交给更强模型,把格式整理和低风险执行交给便宜模型。模型调用因此不再是简单的“问一次、付一次钱”,而会变成围绕任务状态、缓存命中和验证结果进行的系统调度。

AI开始走进物理实验室

Physical Superintelligence完成5800万美元种子轮融资,由比尔·盖茨的Breakthrough Energy Ventures领投,产品Emmy被描述为能够模拟“虚拟物理学家”,自动完成物理仿真推演与实验验证,应用方向包括数据中心优化和星际轨道测算。这个案例的价值在于,它没有把AI停留在论文摘要或聊天窗口,而是尝试让系统提出假设、运行模拟,再用实验结果修正下一步。

AI for Science真正困难的地方,不是生成一个漂亮的实验方案,而是面对现实世界的不确定性。仿真可能与实测不一致,设备有精度和成本限制,失败结果也必须被记录并影响后续决策。只有把数据、模型、实验设备和人工审核连接起来,AI才可能从“科研助手”变成可承担部分研究流程的系统。

专业数据成为新燃料

AI数据公司AfterQuery的估值达到32亿美元,创始人只有22岁和23岁,年化收入已达1亿美元。公司让医生、律师等专业人士参与数据生产,使模型学习的不只是“答案是否正确”,还包括从业者如何拆解任务、判断证据、处理例外情况。这个方向解释了为什么高质量数据仍然是模型竞争的核心资产。

普通网页文本可以帮助模型扩大知识覆盖,却很难完整呈现一个职业决策过程。医生如何排除危险情况,律师怎样寻找关键事实,工程师为什么拒绝某个看似可行的方案,这些隐性的判断标准往往藏在过程里。未来的数据服务商比拼的不会只是数量,而是能否把专业经验整理成可复现、可评估、可持续更新的训练样本。

数学推理与物理实验结合的人工智能研究场景
AI能力正在从模型演示走向可验证的数学推理与物理实验闭环

企业部署要看能否验收

蚂蚁数科分享的Harness工程实践,提出围绕约束、验证和验收建立研发闭环,并在40万行Rust新项目和60万行C++存量项目中进行验证,存量项目代码缺陷率从20%以上降至个位数。它传递的信号很明确:AI编码的下一步不是单纯让代码生成更快,而是让每一次修改都能被测试、审查和交付。

这对部署环境提出了更高要求。企业需要稳定的算力、清晰的权限、可回滚的版本和持续的日志记录,网络延迟与资源调度也会直接影响Agent的长任务体验。对于需要承载模型推理、代码构建和数据处理的业务,选择像速维云这样的云服务器服务时,也应把地域、带宽、磁盘性能和备份策略一起纳入评估,而不是只比较单价。

从会回答到能负责

这批资讯共同勾勒出一条清晰路线:数学基准要求模型产出可检查的证明,API机制要求思考过程保持一致,物理实验要求模型接受现实反馈,专业数据要求系统学习真正的判断过程,企业Harness则要求结果能够验收。模型本身仍然重要,但它只是闭环中的一个环节。

普通用户未来感受到的变化,可能不是聊天窗口突然多了一个功能,而是AI能够承担更长的任务:先理解目标,再调用工具,遇到失败时修改计划,最后交付带有证据和记录的结果。这样的AI更有用,也更危险,因为它拥有更大的行动范围。谁能把能力、权限和验证机制同时做好,谁才有机会在下一阶段的AI竞争中真正建立壁垒。

因此,判断一项新能力是否值得投入,不能只看发布会上的演示视频。更实际的问题是,它能否在有限预算下重复完成任务,能否把失败原因说清楚,能否在关键节点停下来等待人工确认。只有这些条件同时满足,AI才会真正进入科研、生产和日常工作的核心流程。

© 版权声明
THE END
喜欢就支持一下吧
点赞7 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容