Claude把黎曼猜想推进到67.25%,数学研究进入发现、简化与机器验证闭环

黎曼猜想仍未被彻底证明,但围绕它的一项新进展已经把数学研究的分工方式推到了新阶段。据公开论文与研究团队披露,Claude参与得到的证明把已知位于临界线上的黎曼ζ函数零点比例推进到67.25%,明显高于长期停留在四成左右的既有界限。更值得注意的是,数论学家Youness Lamzouri随后给出更简洁的证明,而AxiomProver又在数小时内完成Lean形式化。模型探索、人类提炼、机器核验,由此连成了一条过去很少在前沿数学中完整出现的链路。

这不是“AI已经解决黎曼猜想”。67.25%距离猜想要求的100%仍有明显差距,预印本、同行评议与后续复核也不能被一句“机器验证”取代。但这次进展的重要性恰恰在于,它没有停留在一段难以追踪的模型输出:人类数学家能够理解、重写并加强论证,形式化工具则把逻辑步骤转成可检查的证书。AI科研的价值判断,正在从“是否给出惊人答案”转向“能否进入人类知识体系”。

数学开始形成新流水线

黎曼猜想研究的是ζ函数非平凡零点的位置。猜想认为这些零点都位于实部为二分之一的临界线上,而此次工作的目标,是提高能够被严格证明位于这条线上的零点比例。报道显示,Claude借助矩阵的迹、Hilbert–Schmidt范数以及秩—迹不等式等工具构造论证,把边界推进到67.25%。路径并不简短,也不完全符合数学家追求结构清晰的阅读习惯,却提供了一个可继续加工的突破口。

Lamzouri的后续工作说明,人类的作用并没有被压缩成“按下运行按钮”。他用更简洁的希尔伯特空间不等式替换复杂矩阵工具,把问题归约到关联和估计,再借助已有定理完成证明。AI擅长在广阔组合空间里寻找能走通的路线,人类则更擅长识别结构、删去冗余并解释为什么有效。二者结合后,研究成果既保留探索速度,也更接近可以教学、复用和继续推导的数学知识。

形式化验证接过最后一棒

传统同行评议依赖专家逐行阅读,面对长证明和跨领域工具时,确认过程可能持续数月甚至数年。Lean等形式化语言提供了另一种方式:把定义、前提和推理步骤写成机器可检查的对象,让证明是否遵守逻辑规则不再只依赖读者的耐心。AxiomProver对简化证明的快速形式化,展示了自动化工具如何把“看起来正确”进一步推进到“逻辑链可由证明助手复核”。

机器核验也有边界。形式化证书能确认推理是否从给定公理与定义合法推出,却不能自动判断研究问题是否重要、采用的定义是否准确对应现实意图,也不能替代学术共同体对原创性与意义的评价。如果最初输入或依赖库存在错误,形式化过程仍可能严谨地验证一个错误目标。因此,更可靠的科研工作流应同时公开论文、关键假设、代码、依赖版本与证书,让其他研究者能够独立复现,而不是把“Lean通过”当成无需解释的权威印章。

人工智能辅助数学研究与形式化证明场景
AI探索、人类简化与形式化验证正在组成新的数学研究协作链。

世界模型开始制造训练环境

同样的“生成之后还要可用”逻辑,也出现在空间智能研究中。北航团队公布的MetaEarth3D可根据文字或卫星图生成连续、可扩展的三维地球场景,覆盖地形、城市与街区等不同尺度。模型拥有46亿参数,研究数据显示,消费级RTX 3090约两小时可生成约17平方公里城区级场景。生成结果还包含高度、距离等空间标注,并可导入UE、Unity等图形引擎继续编辑和交互。

它的产业意义不只是让三维画面更逼真,而是为无人机、自动驾驶和空间智能系统制造规模化训练环境。真实三维数据采集昂贵,罕见危险场景更难反复收集;生成模型可以按条件构造沙漠、海岸、道路或复杂城区,补充现实数据的盲区。论文报告称,相关生成数据让空天AI模型的空间理解能力平均提升22.85%。不过当前场景仍主要描述静态时刻,对季节变化、建筑变迁、激光雷达和热红外等多传感器物理属性的模拟,还有待进一步完善。

长视频先学会正确回忆

视频模型面对的另一个实用难题,是角色离开画面后再次出现时容易“换脸”或“换衣服”。浙大与港大团队开源的LayerRecall没有简单扩大全部缓存,而是把问题拆成“检索哪段历史”和“在哪些网络层使用记忆”。系统先用紧凑摘要定位相关片段,再把被选中片段的完整键值信息交给记忆敏感层,其他层继续维持当前动作与局部连续性。

在论文设置下,LayerRecall的MemoBench综合分达到0.548,MovieBench达到0.578;额外生成耗时约3.5秒,路由权重只有约6.6MB。研究还发现,把远期记忆注入所有层反而可能引起画面突变,这说明“记得越多越好”并不成立。对长视频、虚拟角色和生成式游戏而言,真正有价值的记忆系统需要知道何时回忆、回忆什么,以及哪些模块应该忽略过去,避免旧信息干扰正在发生的动作。

百万行代码重写验收标准

Bun 1.4的开发案例把AI生产力推到了更激进的规模。公开信息显示,核心开发者Jarred Sumner搭建Agent工作框架,在11天内完成6778次提交,将大量底层代码从Zig迁移到Rust,新增代码超过100万行,模型调用成本约16.5万美元。主体工程形成后,团队又用数月时间持续修复缺陷、运行测试和打磨,最终随正式版本交付给用户。

这个案例最值得讨论的不是代码行数,而是人类已经难以逐行审查机器生成的庞大产物。开发者的工作会更多转向定义需求、拆分任务、设计测试、设置性能门槛和回滚方案。未来代码可能只是生成过程中的中间材料,真正稀缺的是能够证明系统行为符合预期的测试资产、可观测性与责任边界。Agent让产量上升后,如果验收能力没有同步增强,团队得到的只会是更快堆积的缺陷。

人才与社区改变创新路径

基础模型竞争也在争夺能把视觉、文本与长上下文连接起来的人才。据报道,前DeepSeek核心研究员魏浩然已加入百度基础模型研发部,负责文心多模态算法方向。他此前参与DeepSeek-OCR研究,探索用视觉表征压缩长文本信息;相关方案在较高压缩条件下仍保持约97%的OCR解码准确率。加入百度后,其团队开源的Unlimited OCR在OmniDocBench评测中取得领先成绩。

这类人才流动说明,多模态能力已经不只是识图或看文档的附加功能,而是在重构模型处理信息的方式。文档感知、视觉Token压缩和端到端OCR可以降低长文档进入模型时的显存与计算压力,也会直接影响企业知识库、票据处理、研发资料检索等应用。谁能把研究成果变成稳定的数据管线和可部署能力,谁才可能把实验室领先转化成真实产品优势。

产品从社区里长出来

模型和论文之外,AI产品的发现机制也在变化。B站首届AI创造公开赛吸引1.34万人参赛,作品超过3万件,88%的参赛者粉丝不足一万,超过八成为一人团队。参赛项目不只有生成图片和短片,还包括AI机器人、助盲设备、生成式游戏与陪伴角色。评论、弹幕和连续发布的视频,让尚未成熟的Demo能够快速获得第一批真实反馈。

这对创业者的意义很直接:开发工具降低了做出原型的门槛,但找到用户仍然困难。公开开发把产品演示、用户调研与版本记录放进同一个社区,投资机构也能观察创作者的技术积累、迭代速度和真实需求。一些参赛项目已获得融资,26%的参赛者表示开始认真考虑创业或继续做产品。AI创业的起点,正在从封闭路演转向“先公开、再验证、边使用边改”。

科研AI要交付证据

黎曼猜想进展、三维世界生成、长视频记忆和百万行代码看似属于不同领域,却共同指向一个变化:生成能力不再稀缺,可检查的结果正在变得更重要。数学需要形式化证书,空间模型需要真实任务评测,视频模型需要长期一致性指标,代码Agent则需要测试、性能和安全边界。没有证据链的惊艳输出,很难跨过生产和科研的门槛。

企业在部署相关系统时,也应把服务器、日志和权限当作交付体系的一部分。使用速维云云服务器承载模型接口、评测任务或Agent工作流时,应同步规划资源隔离、调用记录、备份、超时与故障恢复,避免把一次成功演示误当成长时间稳定运行。AI可以加快探索,但结论仍要能够复核,动作仍要能够追踪,失败仍要能够恢复。

下一阶段的竞争不会只是模型能生成多少内容,而是谁能把发现、解释、验证和部署连成闭环。Claude参与数学突破所展示的,不是机器取代数学家,而是研究角色重新分配:模型拓宽搜索空间,人类提供理解与品味,证明工具守住逻辑底线。只有当这三部分彼此制约、相互补强,AI才真正从会给答案的工具,变成能够进入知识生产与现实系统的协作者。

© 版权声明
THE END
喜欢就支持一下吧
点赞9 分享