金融机构不会因为模型回答得像分析师,就把它交给投研、风控或审计团队。华东师范大学上海人工智能金融学院团队发布的金融原生 Agentic 基座模型 Mint-Agent,给出的答案更接近一份工程验收报告:27B 版本 Mint-Ag 在 FinanceAgentBench v2 上取得 60.49% 的成绩,超过 GPT-5.6-Sol 与 Claude Opus 4.8;单题推理成本约为两者的 22% 和 10%。更关键的是,它把来源、报告期、指标、单位、计算和最终结论串成一条可以回放的证据链,商业订单已经超过亿元。
这件事的价值不只在于一个金融模型登上评测榜单,而在于它重新定义了“完成任务”。通用聊天模型给出一个听起来合理的数字,可能已经足够应付普通问答;金融智能体却必须找到权威材料,判断正确期间,处理口径差异,完成计算,再让研究员能够沿着原始证据重新检查。AI 的竞争由此从“谁更会回答”转向“谁能在高风险场景里把答案做成可接手的工作成果”。
金融模型先过证据关
Mint-Agent 家族包含 9B 的 Mint-Cu 和 27B 的 Mint-Ag,定位不是把金融语料继续塞进通用模型,而是围绕金融研究中的知识、抽取、计算、分析和验证任务重新组织训练。团队将来自 EDGAR、公司投资者关系页面、XBRL、交易所记录、FRED 等来源的材料绑定到实体、报告期、指标、数值、单位和原始位置,只有证据支持、计算可重放且答案唯一的样本,才进入训练体系。
这种设计解决的是金融 AI 最容易被忽视的错误。模型可能把年度数据当成季度数据,把预测值当成实际值,也可能在单位换算后忘记说明口径。文字表面没有明显破绽,结论却已经失真。对投研人员而言,引用一个链接并不等于完成核查,真正有用的是知道数字从哪一页抽出、经过了什么运算、使用的是哪个报告期,以及别人能否按相同步骤得到同一个结果。
从回答变成长程执行
真实的金融研究很少能用一次调用结束。一个问题可能要求 Agent 搜索监管文件,打开动态页面,比较多家公司披露,统一币种,再按照指定公式推演。Mint-Agent 把这类工作拆成有状态的执行链:模型决定下一步行动,Harness 检查工具、预算和输出格式,并把已经确认的事实写入证据账本。
证据账本不是聊天记录的另一个名字。它保留实体、期间、指标、数值、单位、来源位置和获取时间,把有效结果与失败的检索路径分开。上下文变长后,旧对话可以被压缩,但账本和完整动作轨迹仍然留在模型上下文之外。网页失效、搜索转向或任务经历多轮重试时,系统能够保留已经确认的材料,也能说明哪一步失败、为什么更换路径。

成本下降不等于标准下降
Mint-Ag 在评测中同时取得更高准确率和更低单题成本,说明金融模型未必只能靠堆更大的参数量或更长的推理预算获得收益。9B 的 Mint-Cu 也显示,紧凑模型经过场景化训练后,可以承担金融搜索与执行中的一部分工作。对企业来说,这意味着模型组合有机会从“所有问题都交给最强模型”变成按任务分层。
高难度的跨来源推理可以使用更强模型,分类、摘要、字段抽取和格式转换则交给更轻量的模型;已经确认的材料可以缓存,稳定的计算流程可以固定为工具,减少 Agent 每次自由探索的调用次数。部署这类系统时,企业还应记录首字延迟、平均工具调用次数、失败重试率、人工接管比例和单项任务成本。使用 速维云 这类云服务器承载知识库、推理服务和审计日志时,也要把磁盘、带宽、备份、密钥隔离与访问权限纳入同一张成本表。
语音正在补上交互层
同一天出现的另一条创业消息,来自前 MiniMax 技术合伙人杨斌创立的音频模型公司 BreezeBlue。团队推出 Breeze TTS 2,在 Artificial Analysis 的 Text-to-Speech 榜单中全球并列第四,模型首字节延迟低至 40 毫秒,并获得 600 万美元种子轮融资。它的方向不是提供一组固定音色,而是让用户用自然语言设计角色声音、指导表演,并在实时互动中保持角色一致。
这条路线与金融 Agent 并不矛盾,反而揭示了另一个瓶颈:模型执行得越快,人越需要用低摩擦方式了解进展、补充背景和改变目标。未来的语音智能不只是把文字读出来,而是要判断什么时候倾听、何时回应、是否主动确认,能否接受打断并继续推进任务。虚拟主播、游戏角色、互动内容和智能客服会先验证这种能力,随后它也可能成为企业 Agent 的操作界面。
公开训练打开模型黑箱
基础设施与研究方式也在变化。斯坦福大学教授 Percy Liang 宣布 Marin 开放实验室公开训练 Marin 535B-A23B 模型,总参数量 5350 亿、激活参数 230 亿,准备使用 18.75 万亿 Token 和约 792 颗 GB200 GPU,训练预计持续三个月。团队还公开训练曲线、数据构成、实验日志、工程问题和 Scaling Ladder,让外部研究者能够观察模型从小规模试验走向主训练的过程。
公开训练的意义不在于让所有人复制同样的算力规模,而在于把过去只能看到结果的模型研发过程变成可讨论、可复查的工程记录。数据混合比例是否影响损失曲线,规模扩展预测是否准确,路由偏置为何在某个阶段出现峰值,都会成为可以共同分析的问题。对开发者和企业团队而言,这种透明度有助于理解模型能力的来源,也能提醒大家:评测分数只是最终截面,训练稳定性、数据治理和失败恢复同样决定系统能否进入生产。
验收标准正在改写
Mint-Agent 的亿元级商业订单说明,金融客户愿意为“可审计的智能”付费,但这并不意味着模型可以直接接管投资或风控决策。更现实的路径,是先让 Agent 处理证据整理、财报抽取、指标计算、研究初稿和异常提示,再由专业人员确认高风险结论。系统必须允许人随时查看原始来源、纠正口径、重跑计算和撤销错误动作。
企业选择金融 AI 时,可以把验收表从“答案是否流畅”改成五个问题:来源是否权威且定位准确,报告期和单位是否正确,计算能否复现,失败后能否恢复,整个过程是否留下权限和操作记录。语音交互的低延迟、公开训练的可观察性,以及 Mint-Agent 的证据账本,指向的是同一个产业变化:AI 不再只靠展示聪明来获得信任,而要把每一次行动变成可以解释、可以检查、也可以被人接管的生产流程。






暂无评论内容