Harvey用Kimi K3训练法律模型,垂直AI开始摆脱API依赖

法律AI公司Harvey没有把首个自有模型继续建立在闭源API之上,而是选择开放权重的Kimi K3作为底座,训练出面向法律任务的Tenet。对一家服务大型律所、金融机构和专业服务公司的企业来说,这个选择比一次普通模型发布更值得关注:最接近高价值客户的应用公司,开始主动掌握模型权重、后训练流程和推理成本。

Harvey仍会在平台中接入多家前沿模型,Tenet并不是简单替换所有外部服务。它更像一块能够自主调整的核心能力,让公司在合同审查、尽职调查和法律研究等任务上拥有自己的性能基线,也让模型供应商与应用公司的关系从单向采购变成新的竞合。

法律AI自建底座

公开信息显示,Harvey目前服务约1300家机构和超过10万名律师,业务覆盖多个国家和地区。法律工作需要处理大量合同、判例、监管文件和交易材料,单个项目的上下文很长,错误成本也远高于一般内容生成。一个结论如果漏掉关键条款,可能直接影响交易判断或诉讼策略。

Tenet选择Kimi K3,首先看中的是开放权重、长上下文和可继续训练的空间。K3采用大规模混合专家架构,支持百万Token级上下文。Harvey可以在行业数据、专家反馈和自建评测上继续优化模型,而不是只能在闭源接口外层反复调整提示词。

成本推动模型所有权

Harvey每月处理的Token规模达到万亿级,模型调用不再是一项可以忽略的软件费用。只依赖外部API,意味着单价、限额、版本变化和服务稳定性都掌握在供应商手中。随着上游模型厂商开始直接进入法律服务,应用公司还要面对供应商成为竞争对手的现实。

据报道,Tenet使用约150张NVIDIA B300训练两个月,推理成本不到主流前沿模型的四分之一。这并不代表训练行业模型已经变得便宜,而是说明企业不必从零预训练一个通用大模型。开放底座承担通用能力,企业把资金集中到行业数据、强化学习、评测和部署,投入更容易对应具体业务结果。

专家反馈取代提示词

法律模型的关键不是记住更多术语,而是按专业标准完成整项工作。Harvey邀请执业律师构造并购纠纷、合同审查等任务,再逐项检查风险识别、判例引用和推理链条。评测采用严格的全通过口径,只要关键条件遗漏,整个任务就不能算完成。

这种训练方式把行业专家从内容提供者变成模型教练。律师不需要逐字告诉模型如何回答,而是定义什么结果可以交付、什么错误不能接受,再让模型通过反馈改进执行策略。Harvey公布的结果显示,Tenet在其法律基准上的全通过率相对K3底座提升82%,说明垂直模型的增量主要来自任务环境和验收体系。

企业法律文档审查与模型工作站
配图依据=文章核心新闻点:Harvey以开放权重模型构建法律文档审查与专家反馈工作流。

开放模型成为筹码

开放权重模型的商业价值正在发生变化。过去企业采用开源模型,常被解释为降低授权费用或满足私有化部署;现在更重要的能力是可控制。企业可以调整模型、建立自己的安全边界、固定版本并选择部署位置,也可以根据不同任务在自有模型与外部API之间动态路由。

对高频调用企业而言,自有模型还是谈判筹码。即使Tenet只承担部分法律任务,Harvey也能用真实成本和效果与外部供应商比较,避免被单一平台锁定。医疗、金融、工程设计等行业同样具备长文档、高价值和强规则特征,可能复制“开放底座加专家反馈加严格评测”的路径。

旗舰竞赛回到经济性

另一条消息称Anthropic可能准备推出Opus 5.1,并强化编程、复杂推理和长时间Agent能力,但目前仍属于市场传闻,正式规格和发布日期应以官方信息为准。传闻本身反映出旗舰模型仍在快速迭代,厂商希望通过更高的单Token智能水平争夺开发者和企业工作流。

然而,Harvey的选择说明“最强”不再是唯一采购标准。企业会同时计算任务成功率、调用价格、响应速度、上下文长度、数据控制和供应风险。最后少量性能提升如果带来数倍成本,未必适合规模化业务;一个可定制、可验证且足够强的模型,反而可能获得更多真实工作量。

应用层开始分化

AI视频领域也出现类似变化。Agnes Video 2.5上线Pavo后,Flash版本开放低成本试用,并提供720p、4至12秒生成能力。平台同时用无限画布管理角色、分镜和版本,再通过短剧Agent把剧本、资产与镜头串成工作流。竞争重点已经从单段视频效果转向完整作品的返工成本和可控程度。

具身智能则把模型带入更严格的物理环境。一段跨宇树与智元本体的机器人演示展示了擦窗、收纳、任务中断恢复和协作,但发布方仍未充分公开团队身份、模型架构和第三方验证,因此更适合视为值得跟踪的演示,而不是已经完成商业验证的产品。它提醒行业,视频效果、跨本体泛化和真实可靠性必须分开评价。

企业部署看完整系统

垂直模型真正进入生产环境,还需要模型之外的工程能力。企业应建立可回放的评测集,记录每次模型版本、提示、工具调用和人工修改;高风险任务要设置权限边界、人工复核和停止条件;数据层还要区分哪些材料可以进入云端,哪些内容必须在私有环境处理。

部署方式也要根据调用量决定。稳定高频的任务可以考虑自托管模型与专用推理资源,低频或能力要求变化快的任务可以继续使用外部API。使用速维云云服务器承载模型网关、任务队列、日志和知识库时,应重点评估带宽、磁盘IO、备份、监控和故障恢复,不要只按模型参数选择配置。

垂直AI进入深水区

Harvey训练Tenet的意义,不是证明开放模型会立刻取代所有闭源旗舰,而是展示了应用公司获得模型主动权的可行路径。底座能力逐渐商品化之后,真正难以复制的资产会集中在专业数据、专家反馈、任务流程、评测标准和客户关系。

接下来判断垂直AI是否成熟,应少看一次演示,多看长期任务成功率、人工复核比例、推理成本和错误责任。模型能回答专业问题只是起点,能在严格规则下持续完成工作、让结果可追溯,并把成本稳定控制在业务能够承受的范围内,才是行业模型进入生产系统的标志。

© 版权声明
THE END
喜欢就支持一下吧
点赞14 分享