Kimi把百万上下文下放到全会员,AI竞争转向工程闭环

Kimi把K2.8 Preview推向全部Kimi Code会员,并把约100万Token的上下文窗口一并开放。更值得注意的是,这次升级不要求用户更换原有的kimi-for-coding入口:同一套配置背后,模型已经转向编码与智能体能力更强的新版本。对于长期维护大型代码库的人来说,模型升级不再只是榜单变化,而是可能直接改变一次任务能够读取多少文件、保留多少约束,以及能否把排查、修改和验证连成一条链路。

但百万上下文不是“把整个仓库全部塞进去”的通行证。K2.8 Preview默认使用Max思考强度,切换模型或思考档位还可能让旧缓存失效,带来额外Token消耗和等待时间。Kimi建议日常补全、接口修改等任务优先使用K2.8 Preview,复杂任务再考虑K3;这也揭示了模型产品的新竞争点:不仅要能力强,还要让用户在上下文、推理强度、缓存与额度之间做出可理解的选择。

百万上下文下放

长上下文对编程最直接的价值,是让模型在一次会话里同时对照前端页面、后端接口、日志、测试结果和历史需求。过去常见的失败并非模型不会写代码,而是它只看见局部文件,修改一个接口后忘记同步类型定义,或修复当前报错时破坏了上游约束。窗口扩大后,多文件重构、跨模块排障和长程智能体任务拥有更充足的信息空间。

窗口越大,信息管理反而越重要。无关日志、重复文档和过期讨论持续进入会话,会稀释真正关键的约束,也会抬高调用成本。更稳妥的方式是先给出任务边界、报错证据和相关模块,让模型定位缺口后再补充材料。团队部署编码Agent时,还应记录模型版本、思考档位、缓存命中与每项任务的Token成本,而不是只比较一次演示写出了多少代码。

通用模型闯入制药

模型能力的外溢也在生命科学领域出现新信号。GPT-6 Astra在DDD Benchmark的抗体可开发性测试中获得37.98分,超过参与评测的其他模型。该任务关注的不是抗体能否与靶点结合,而是它是否容易聚集、能否保持稳定,以及最终有没有机会成为可生产、可储存、可使用的药物。许多候选分子并不是倒在“发现”环节,而是倒在后续成药性评估上。

这项结果真正值得观察的地方,是通用大模型在没有外部专用工具的情况下进入了传统上依赖专用模型的任务。不过,基准第一仍不能直接等同于临床成功,数据隔离、实验复现、湿实验验证和监管审查都不可跳过。更现实的影响是,研究团队可能先用通用模型扩大候选范围、解释风险并生成分析工具,再由专用系统和实验人员完成验证,从而缩短早期筛选链路。

代码编辑器与开发工作台
Kimi百万上下文能力的核心应用场景,是让开发者在更长的代码与任务链路中保持上下文。

模型开始优化芯片

科大讯飞星火X2.5展示了另一种闭环:国产算力训练模型,模型再反过来优化国产算力。星火X2.5采用293B-A30B的MoE架构,在万卡规模国产910B集群完成预训练与后训练。团队披露,关键Attention算子效率提升超过2倍,长文本训练效率提高30%以上,机器有效训练时长超过97%。这些数字说明,大规模训练的瓶颈并不只在卡的数量,还在算子、通信、负载均衡和故障恢复能否协同。

更有代表性的是DSA稀疏注意力算子优化。模型在真实昇腾910B环境中进行约1600次工具调用,经历编写、编译、运行、性能反馈和继续修改,最终相较torch_npu实现获得3.5倍加速。它还不是完全自主的底层工程师,因为目标、初始代码、硬件环境和评估脚本仍需预先设置;但只要优化结果可测量、可回滚,智能体就有机会把过去高度依赖专家经验的性能调优变成持续实验流程。

银行Agent办成业务

网商银行推出的百灵2.0则把Agent带到4200万小微经营者面前。公开案例中,一名餐饮商家只表达了“想把额度提一提”,系统通过追问开店位置、面积、时间和资金用途,把模糊需求还原为新店融资计划,并结合经营与信贷记录,在约10分钟内形成40万元、可分笔支用的方案。变化不只是速度更快,而是对话入口能够连接风控、审批和产品配置。

金融场景也提醒行业,Agent绝不能绕开人的责任。另一个案例中,AI最初因为保证人逾期、同业支持较弱和近期多次申贷而建议拒绝提额,人类审批专家补充经营背景后,系统重新推理并给出不同结果。真正可用的金融Agent需要证据链、量化评测、知识库、权限隔离和人工复核。模型负责分析与试算,人负责设定边界、纠正偏差并承担最终责任,这比“全自动”口号更接近生产环境。

机器人学会记路

蚂蚁灵波开源的LingBot-Map获得约1.69万GitHub Stars,相关论文入选ECCV 2026 Oral。它用普通RGB摄像头进行流式三维重建,通过锚点上下文、局部姿态参考窗口和轨迹记忆三层结构,解决机器人边移动边建图时的长期记忆问题。在万帧序列里,所需Token由传统方案约500万压缩到约7万,内存与计算量几乎不随视频长度持续增长。

开源社区已经把它适配到Apple Silicon Mac、RTX 4060和智能眼镜等设备,模型可达到约20 FPS,并在ETH3D数据集取得98.98的F1分数。它的意义不只是多了一种三维扫描工具,而是说明模型只有从“看见当前画面”进化到“记住自己走过哪里”,机器人才能稳定完成导航、巡检和空间操作。消费级硬件适配越充分,这类研究越容易从论文进入真实环境。

竞争转向工程闭环

K2.8 Preview、抗体预测、算子优化、金融Agent和流式三维重建看似分属不同赛道,背后却有同一条逻辑:模型能力必须进入可验证的工程闭环。编程任务要看修改后能否通过测试,药物预测要等待实验验证,算子优化要用真实性能数据验收,金融决策要保留证据和人工复核,机器人建图则要承受长序列与设备差异。

对企业而言,选模型也应从“哪个分数更高”转向“哪个系统能稳定交付”。如果团队要承载代码仓库索引、任务队列、日志与内部工具,可以结合速维云云服务器规划隔离环境、备份和监控,并把单项任务成本、失败恢复时间、人工介入比例与权限审计纳入验收。真正拉开差距的,不会只是更大的上下文或更多参数,而是谁能把模型、工具、数据、基础设施和人的判断组织成可靠系统。

接下来值得持续观察的,是百万上下文能否在真实项目中降低返工,通用模型在科学任务上的成绩能否被独立复现,AI优化算子是否能迁移到更多硬件,以及高风险行业能否形成成熟的人机分工标准。当这些问题有了稳定答案,AI才算从“能展示能力”走到“能长期承担工作”。

© 版权声明
THE END
喜欢就支持一下吧
点赞7 分享