企业做AI,最容易踩的坑,是把一次令人惊艳的演示,当成产品已经可用的证明。
高盛数字平台Marquee负责人、全球银行与市场AI工作组联席主席Chris Churchman,最近在一期播客中给出了一个更残酷的标准:AI Demo 只展示“最好的一次表现”;但机构产品上线后,最糟糕的输出会被市场与客户审视。
这句话击中了企业AI从PoC走向生产的真正断点。前沿模型接上企业数据,很容易生成一份流畅、完整、看起来专业的答案;但在金融等高风险场景里,“大体正确”没有意义。
事实是否准确、计算能否复核、结论是否越过权限、错误能否及时停止,决定了企业能否让系统进入真实流程。
这场访谈给出四条产品化边界:不用Demo代替验收;不押注模型的暂时缺陷;重做工作流;不把人的判断力外包。
高盛的“AI实验”
Marquee是高盛面向机构和企业客户的数字平台,目标是帮助客户在高度不确定中作出决策,并进入其投资流程。
平台汇集数以百万计的研究文章、交易台评论、交易前分析,以及来自数十家数据供应商的内容。Churchman把其中的Market View比作“资本市场的Pinterest”:每个组件都由领域专家制作,平台上已有数以百万计的分析组件。
目前仍只在高盛内部使用的Marquee AI,尝试把这些分散能力变成一个统一入口。
用户提出问题后,系统会拆解研究主题,寻找相关研究、交易台观点和分析组件,需要时编写并运行Python计算,再返回有证据支撑的结论。
它要解决的不是“再做一个聊天机器人”,而是让复杂机构能力能够被自然语言调动。
金融业不能接受“差不多对”的AI
Churchman在访谈中提到,一个模型即使在假设中有90%的事实是对的,也可能没有实际价值。因为使用者不知道错误藏在哪10%里,最终仍要核对全部事实。AI看似节省了写作时间,却把成本转移到了逐条验证。
普通用户可以容忍一次不准确的推荐,机构产品却必须严谨面对权限错误、数据过期、来源冲突、工具调用失败和异常市场条件。平均准确率无法回答错误落在哪里、影响多大,以及系统能否被安全接管。
Churchman用了一个很形象的比喻:事实和推断一旦进入上下文窗口,都会经过“同一台香肠机”,模型自己无法区分哪一个是事实、哪一个是插值。它不是故意误导,而是根本不知道两者的区别。
0
评论 (0)