DeepMind预计算90亿种基因变异:AI正在把生命科学变成可查询的基础设施

Google DeepMind把人类基因组中超过90亿种可能的单碱基变化提前算了一遍,并将约1PB的结果做成可查询的AlphaGenome Atlas。这个消息的分量不只在于数字惊人,更在于AI第一次把一项原本需要研究团队反复部署模型、准备算力的工作,整理成面向科研人员的公共数据基础设施。研究者面对一个遗传变异时,今后可以先查询它可能影响的基因表达、RNA剪接和染色质状态,再决定是否投入实验验证。

同一批新消息还显示,AI正在沿着两条路线同时加速:一条深入科学研究和复杂推理,另一条进入视频制作、语音客服与网页操作等日常流程。模型能力的上限仍然重要,但能否把结果沉淀为数据库、工程工具或稳定服务,正成为衡量AI影响力的新标准。

把九十亿种变化变成可检索资源

人类单倍体基因组大约包含30亿个碱基位置,每个位置理论上有另外三种单碱基替换可能,因此组合起来约有90亿种变化。真正棘手的地方在于,人类基因组中直接编码蛋白质的区域只占约2%,大量与疾病和人体性状相关的变异位于非编码区域。它们可能影响调控序列,却很难仅凭肉眼或单项实验判断作用机制。

AlphaGenome能够读取约100万个碱基,并预测染色质开放、转录因子结合、组蛋白修饰、RNA剪接、基因表达和三维接触等多类分子特征。DeepMind团队再通过模型蒸馏、GPU计算优化和减少重复计算,把大规模预测提前完成。对研究人员来说,价值不是“AI替你宣布结论”,而是让大量候选变异先获得一份可比较的分子层面线索。

基因组科研实验室中的显微镜与生物信息分析设备
基因组科研需要实验设备与大规模计算共同参与,AlphaGenome Atlas试图把其中的计算环节变成可查询资源。

分数不能替代实验,但能改变优先级

Atlas同时提供AVI变异影响分数,将AlphaGenome对基因调控的预测与AlphaMissense对蛋白质影响的预测结合起来,并提供特征归因。研究人员可以进一步查看一个分数主要来自RNA剪接、基因表达还是染色质开放等因素。这样的设计比给出一个孤立的“风险值”更有用,因为它保留了后续提出机制假设的入口。

公开案例已经体现出这种筛选价值。在罕见病研究中,团队借助AVI重新排序此前难以解释的候选变异,发现一个可能影响DNM1基因异常RNA剪接的位点,后续实验支持了这一预测。在人群遗传学研究中,利用预测结果筛选非编码变异后,研究人员发现的遗传关联增加了22%,并把一组候选从526个缩小到4个。

但这并不意味着高分就是确诊结果。基因调控还受细胞类型、发育状态和远距离调控关系影响,Atlas主要预测分子层面的变化,不能直接预测疾病结局。它最合适的定位,是科研人员的导航图:帮助实验室少在噪声里盲目搜索,把有限预算优先投向更值得验证的方向。

AI开始把研究流程里的工程环节接走

OpenAI公开的内部数据,则从组织实践角度展示了AI如何进入科研生产线。截至2026年8月中旬,研究部门每一个人类工作日对应约3.1个AI Agent工作日在运行。Agent的工作已经从补代码扩展到实验运行、技术支持、结果分析和监控,研究员同时启动四个或更多Agent的情况也在增加。

这不等于AI已经独立完成科学发现。对于耗时4到8小时的复杂任务,超过一半的成功案例仍需要至少一次人工干预;代码贡献速度和实验密度上升,也不能简单等同于科学突破同比增加。真正发生的变化是,研究员的工作颗粒度正在上移:从逐行检查工具调用,转向设定目标、审阅证据、判断方向并处理新的瓶颈。OpenAI把当前阶段称为“自动化AI研究实习生”,并提出在2028年3月前进一步迈向自动化AI研究人员。

Anthropic的Claude Code团队也分享了类似经验:团队称70%到80%的日常工作已交给原生AI Agent处理,工程师不再逐条监督每一次工具调用,而是给出目标并检查结果。这个方法的前提不是盲目信任,而是让权限、验证、代码审查、反馈和监控成为可组合的原语。当底层模型快速变化时,固定脚手架可能迅速过时,能够替换和回滚的控制层反而更耐用。

验证码失效,网页开始重新认识访问者

GPT-6通过“我不是机器人”网页游戏的48个关卡,把另一个变化推到普通用户面前。传统验证码利用人类和程序之间的视觉差异,让机器识别扭曲字符、图片或简单图形;但现代模型已经能够理解界面、定位对象,并通过鼠标和键盘完成连续操作。报道还提到,GPT-6在ScreenSpot-Pro无工具测试中得分92.7%,这意味着“看懂屏幕并操作”正在成为通用能力。

因此,网站防护正在从出题式验证码转向基于行为、设备和风险信号的无感评分机制。问题也随之变得复杂:一个替用户查票或整理资料的Agent在技术上是机器人,但意图可能完全正常;一个真人也可能实施刷票和垃圾信息。未来的重点不能只是确认访问者是不是人,还要确认操作是否获得授权、权限能否撤回、异常行为能否及时停止,以及被误判的用户有没有申诉路径。

内容工具竞争转向连续交付

AI视频和语音产品正在把模型能力变成更低门槛的生产流程。vivago R1宣称可以突破传统视频时长限制,一次生成任意时长的视频;Pavo的极速模式主打十秒内生成带声音的短视频;ElevenLabs则继续从个人配音扩展到企业语音代理,并计划为可能的上市建立更成熟的财务和销售体系。

这些产品真正争夺的不是一次生成的惊艳效果,而是用户能否在失败后快速修改。角色一致性、镜头衔接、声音情绪、版本管理、素材权限和发布接口,都会决定工具是否能进入团队生产。一个企业如果要把生成服务接入网站、客服或内部流程,也必须准备任务队列、对象存储、日志、监控和失败重试。像速维云这样的云环境,可以承载接口服务与数据处理,再根据调用量逐步扩容,让模型输出变成可追踪、可交付的业务结果。

基础设施决定AI能走多远

从AlphaGenome Atlas到科研Agent,再到验证码防护和内容生产,几条新闻共同指向一个朴素结论:AI的下一阶段不只是“模型更聪明”,而是“系统更能承担责任”。科学数据库需要稳定存储和检索,长任务需要状态保存与权限隔离,网页Agent需要可撤销的执行边界,视频服务需要并发调度和大文件管理。

这也解释了为什么AI产业的竞争会不断向基础设施下沉。模型可以通过一次发布获得关注,但真正的用户价值要经过长期运行才能验证:数据是否可查询,结果是否能复核,任务失败后能否恢复,成本是否随着规模可控。对于企业和开发者来说,选择AI服务时不妨少问一句“榜单第几”,多问几句“如何部署、如何监控、如何验收”。当这些问题都有明确答案,AI才算真正从演示走进生产。

© 版权声明
THE END
喜欢就支持一下吧
点赞15 分享