蚂蚁百灵这次开源的重点,不只是又多了两个模型名字,而是把模型从“拿来调用”往“拿来继续训练”推进了一步。Ling-3.0-tiny-base拥有7.9B总参数,Ling-3.0-flash-base拥有124B总参数,官方还同步开放预训练、中期训练和WSM合并三个阶段的六个checkpoints。开发者不必从一个已经封装好的成品模型起步,而可以根据自己的数据、算力和目标任务,选择更合适的训练节点继续往前做。
同一天,OpenAI开源Codex Harness核心框架,开始把另一层能力交给开发者:如何让Agent稳定地调用工具、处理环境并交付结果。一个开放了训练过程,一个开放了执行框架,二者放在一起看,AI产业的竞争焦点正在变得清楚:模型要更容易被改造,Agent要更容易被嵌入业务,真正有价值的产品则要把二者连接起来。
开源不只是一组权重
过去用户说“开源模型”,很多时候指的是下载权重、部署推理,或者在成品模型上做少量微调。但对需要打造行业模型的团队来说,真正重要的往往是模型在训练过程中形成的能力结构。Ling-3.0同时开放三阶段checkpoints,意味着开发者可以从更接近预训练的状态开始持续训练,也可以从已经完成中期训练的节点出发,直接围绕代码、推理、长上下文等方向进行领域适配。
这会改变开源模型的使用方式。教育团队可以围绕本地教材和评测数据调整模型,企业可以围绕内部知识、代码规范和业务流程建立专属能力,研究人员也能观察不同训练阶段对模型行为的影响。相比只拿最终版本做指令微调,训练节点的开放为模型提供了更大的可塑空间,也让“为什么它会这样回答”有机会被更多人研究。
训练节点降低试错门槛
模型训练最昂贵的地方,不只在显卡和电力,还在于一次路线选择错误后,很难回到合适的中间状态。一个团队如果只有最终模型,就只能围绕既定能力做修补;如果能拿到不同阶段的checkpoint,就可以根据数据质量、目标场景和预算,选择继续预训练、做中期训练,或者直接进入强化学习和应用适配。
当然,开放checkpoint不等于训练成本突然消失。124B总参数模型仍然需要相当规模的算力、存储和工程团队,训练数据的版权、安全与质量也不能靠下载模型解决。但节点开放至少把部分基础工作从黑箱中拿了出来,开发者可以把有限资源用在更具体的差异化任务上。对中国开发者和中小企业来说,能否找到合适的起点,常常比单纯追求最大参数更现实。

Harness补上执行这一层
如果说Ling-3.0解决的是“模型怎样被继续塑造”,Codex Harness面对的就是“模型怎样真正干活”。OpenAI披露,在ARC-AGI-3测试中,接入Harness后GPT-5.6 Sol得分从13.3%提升到38.3%,输出Token减少六倍;在税务试点中,系统处理7000份申报表的时间缩短了三分之一。这里的关键不应简单理解成某个框架让模型突然变聪明,而是执行环境、工具调用和任务管理会直接影响模型能否把能力变成结果。
企业部署Agent时,模型只是系统的一部分。它还需要知道哪些文件可以读取,哪些工具可以调用,什么时候应该重试,何时需要把任务交给人,如何保存中间结果,以及如何让每一步都能被审计。Harness把这些通用能力抽出来,开发者就不必从空白目录开始搭建Agent运行时,可以把更多精力放在业务权限、数据接入和结果验收上。
从聊天走向业务闭环
这两条消息也解释了为什么AI应用正在从聊天框转向工作流。百度在AI Day展示的文心助手任务引擎2.0,覆盖信息搜集到成品交付的完整流程;钉钉推出QwenNote,把语音转写、双语翻译、会议纪要和Agent执行连在一起;有开发者甚至用AI编程工具为一万多只羊搭建养殖管理系统,让成本核算效率提升五十倍。
这些案例看起来分属搜索、办公和农业,底层逻辑却相近:用户不再只需要一个回答,而是需要一组可以继续推进的动作。系统要读取资料、理解约束、调用工具、生成结果,再根据反馈修正。模型能力越强,越需要稳定的执行边界;执行框架越成熟,越能把模型能力嵌入原本没有专职研发团队的行业。
开放之后还要看什么
开放训练节点和Harness框架,会让开发者获得更多自由,但也会把责任一起下放。模型经过企业数据继续训练后,是否记住了不该记住的内容;Agent拥有文件和网络权限后,是否会被恶意工具或提示注入利用;中间过程可以被复盘吗,错误结果能够追责吗,这些问题都不能由“开源”二字自动回答。
对于准备落地的团队,比较稳妥的路线是先把任务拆小,建立数据分级、权限隔离、沙箱运行和人工确认机制,再逐步扩大Agent可以执行的范围。基础设施层面,稳定的网络、可观测的调用链和弹性的算力同样重要。像速维云这类云服务器服务,适合为模型推理、私有知识库和Agent工具服务提供独立运行环境,企业可以根据地域、配置和访问压力调整资源,而不是把所有业务都塞进一台难以审计的机器里。
对开发者来说,这也意味着评估模型时要多看一层。参数、榜单和价格仍然重要,但训练可接续性、工具生态、权限模型、日志审计和部署便利性,会越来越影响最终体验。一个模型如果只能在演示页面表现亮眼,却难以接入真实数据和真实流程,它的商业价值会被快速压缩;反过来,一个能力不是最夸张、但能被稳定训练、部署和监管的系统,可能更容易进入企业预算。
AI的下一轮竞争,可能不再是“谁的模型参数更大”这么简单。能提供可训练的底座、可组合的执行框架、可验证的业务结果,并且把成本和风险控制在可接受范围内,才有机会把一次技术演示变成长期生产力。Ling-3.0开放训练节点,Codex Harness开放执行骨架,说明模型和Agent正在同时向基础设施靠拢。接下来真正值得观察的,是开发者能否在这些开放能力之上,做出更贴近行业现场的新系统。







暂无评论内容