35M小模型与可验证代码模型开源后,AI竞争开始重算有效参数

35M 参数的 BarunLM 开源后,小模型赛道又一次把“规模越大越强”的直觉往回拽了一下。独立开发者 Harshal Singh 声称,这个基础语言模型是 100M 参数以内表现最好的模型之一:它只用单张 H200 GPU 训练,却在九项零样本基准测试里拿到 41.01% 的平均准确率,还超过了参数量约为它 6.55 倍的 LFM2.5-230M-Base。这个数字不一定足以改变大模型主战场,但它释放出的信号很清楚:开源模型竞争正在重新计算“每一个参数到底值不值”。

Silhouette of a ferris wheel in Sokcho city, South Korea, against an urban backdrop.

同样值得注意的是,清华团队开源 VeriLoop Coder-E1,把可验证反馈引入代码模型的自我改进流程。它基于 Qwen3.6-27B,在 Hugging Face 四项软件工程 Benchmark 中有三项排名第一,核心不是单纯堆大参数,而是让模型在反证、探索、修订和复验中积累通过验证的经验。一个偏小、一个偏代码,但两条新闻放在一起看,指向的是同一件事:AI 模型正在从“扩大规模”走向“提高有效性”。

小模型重新算效率

BarunLM 最抓人的地方,不只是 35M 参数这个体量,而是它把训练资源、模型结构和开源可复现性放在了同一个叙事里。今天的大模型动辄数百亿、数千亿参数,训练和推理都需要昂贵集群,小团队很难参与正面竞争。一个独立开发者用单张 H200 GPU 训练出可公开评测的小模型,说明在极小参数区间里,结构设计、数据选择和训练策略仍然有很大挖掘空间。

它采用局部与全局注意力交替的设计,比例为 3:1。这个思路并不神秘,却很贴近小模型的现实约束:参数少、算力少,就不能像大模型那样奢侈地把所有上下文都当成同等成本处理。局部注意力更适合捕捉近距离模式,全局注意力则补上跨片段的信息连接。通过这种节奏安排,小模型可以在有限容量里更精细地分配注意力预算。

对开发者来说,小模型的意义不只是“便宜”。它还意味着部署门槛更低、实验迭代更快、可控性更强。很多实际场景并不需要一个无所不能的通用大脑,而需要一个能在固定任务里稳定、快速、低成本运行的模块。客服分流、文本分类、轻量摘要、边缘设备上的辅助判断,都可能从这类小模型优化里受益。

开源不只拼参数

过去开源模型竞争很容易被参数规模牵着走:谁开源了更大的权重,谁支持更长上下文,谁在榜单上多赢几个点。但 BarunLM 这样的项目提醒行业,开源生态里还有另一种价值——把一个可理解、可复现、可改造的模型放到社区面前,让更多人能看见设计取舍。对于研究者和工程团队来说,这类模型往往比一个无法训练、无法微调、只能远程调用的巨型黑盒更适合做实验底座。

小模型也会推动模型评测回到更细的层面。如果一个 35M 模型能在某些零样本任务上追近甚至超过更大的模型,问题就不再是“参数多不多”,而是“这些参数有没有被有效利用”。这会倒逼团队重新审视训练数据质量、注意力结构、优化过程和基准覆盖。规模仍然重要,但规模不是唯一答案。

当然,小模型不会取代前沿大模型。复杂推理、多模态理解、长程任务和高可靠代码生成,仍然需要更强大的基础能力支撑。但小模型能把 AI 能力带进更多低成本、低延迟、私有化的场景里。未来的模型生态很可能不是一个超级模型包打天下,而是大模型负责规划和复杂推理,小模型承担大量高频、明确、可控的局部任务。

代码模型要会复盘

VeriLoop Coder-E1 的重点则在“可验证”。代码任务和普通文本生成不同,很多结果可以被测试、编译、执行环境或形式化工具直接检验。模型写错一段解释,用户可能只是觉得不满意;模型写错一段代码,测试会失败,系统会崩,安全问题也可能被带进生产环境。因此,代码模型如果只追求一次性生成漂亮答案,很难真正进入工程流程。

清华团队提出的“循证螺旋”机制,把失败和纠正变成可积累的训练信号。模型每一轮生成后,不是简单看结果对错,而是接受反证、探索替代方案、修订输出,再做复验。通过验证的纠正会沉淀为经验,并约束后续方法。这比传统“错了再让模型重试”更进一步,因为它试图让模型从一次错误里学到可迁移的方法,而不是只修补当前样例。

这类机制对 Coding Agent 尤其关键。真实软件工程里,任务很少是一次生成就结束:需求会变,依赖会冲突,测试会暴露边界条件,旧代码还会带来隐藏约束。一个能复盘失败、记住验证经验、逐步修正策略的代码模型,才更接近可以参与长期工程工作的助手。VeriLoop Coder-E1 采用 Apache 2.0 开源,也方便社区围绕量化、适配和工程集成继续探索。

应用侧开始要结果

模型效率提升的另一面,是应用产品对“可落地结果”的要求越来越明确。前 Meta 企业 AI 负责人 Clara Shih 创办 New Work Foundation,推出面向年轻求职者的免费 AI 工具,覆盖职业方向、岗位匹配和招聘标准信息。这类应用并不需要炫技式回答,而要把复杂就业信息翻译成可执行建议。美国大学生就业不足率和年轻人在 AI 相关岗位下降的数据,也让这件事带上了现实压力。

办公场景同样如此。金山办公把“灵犀专业版”带到 ChinaJoy,表面上有些反差,实际展示的是一个很具体的需求:AI 不能只生成一份看似完整的文档,还要能“边聊边改”,直接修改 WPS 云文档里的文字、标点和格式。知识工作者每年花大量时间处理重复信息,如果 AI 只能给半成品,效率提升就会被后续手工整理吃掉。

这也解释了为什么小模型、可验证代码模型和办公 Agent 会在同一阶段显得重要。用户不再只问“模型会不会说”,而是问“它能不能把事情推进到可交付状态”。求职工具要给出职业路径,办公助手要直接改文档,代码模型要通过测试,小模型要在成本约束下稳定运行。AI 的价值判断正在从演示效果转向任务闭环。

娱乐内容也在试水

技术主线之外,AI 内容娱乐也在快速试水。《12星练赛》这类 AI 选秀综艺播放量破亿,AI 练习生靠网友投票决定出道命运,商单占比最高超过八成。它看起来像花边,却反映了 AIGC 内容商业化的另一种路径:当人物、剧情、互动和粉丝投票被打包成可持续运营的内容资产,AI 不只是生成视频,而是在参与一种新的偶像工业。

这类案例不一定代表所有内容行业都会被 AI 选秀改写,但它说明用户已经愿意为“虚拟但可互动”的内容投入注意力。和传统虚拟偶像相比,AI 练习生的迭代速度更快,剧情和人设可以根据反馈动态调整,商业植入也更容易被嵌入节目机制。风险同样存在,比如审美同质化、情感诱导、版权边界和虚假热度,但它已经不再只是实验室里的 demo。

娱乐化应用的价值,在于它会用最直接的用户反馈检验 AI 内容是否有吸引力。模型公司喜欢讲基准,企业客户看重 ROI,普通用户则用停留时间、投票、评论和付费表达态度。如果 AI 内容能持续吸引用户,背后需要的就不仅是生成能力,还包括角色运营、互动设计、审核机制和商业化节奏。

下一步看工程化

把这些消息放在一起,最明显的变化是:AI 行业开始从“大模型单点突破”进入“模型效率、验证机制和应用闭环”共同竞争的阶段。BarunLM 证明小模型仍有结构优化空间,VeriLoop Coder-E1 证明代码模型需要把验证反馈变成自我改进能力,求职工具和办公 Agent 说明用户开始追求直接结果,AI 选秀则展示了内容消费端的商业实验。

这对企业和开发者都是提醒。选模型不能只看参数表,也不能只看某个榜单分数,而要看任务边界、成本预算、验证方式和可集成程度。能用小模型解决的高频任务,不必强行调用昂贵大模型;需要可靠输出的代码和业务流程,则要优先考虑测试、回滚、审计和人类确认机制。AI 越进入真实场景,越不能只靠一次漂亮回答赢得信任。

未来一段时间,真正值得关注的不是某个模型又大了多少,而是它能否在有限资源下稳定产生价值:更少参数能不能完成更多任务,错误能不能被验证和吸收,应用能不能减少人工返工,内容能不能形成可持续运营。模型竞争还会继续,但胜负越来越可能发生在工程化细节里。

© 版权声明
THE END
喜欢就支持一下吧
点赞14 分享