AI学习笔记⑰|七成AI项目折戟同一原因:启动前缺乏精算
90天AI成长计划 · 第17讲
据Gartner对782名AI项目负责人的调研,仅28%达成了预期的投资回报率,20%直接以失败告终;麦肯锡的报告数据更为严峻——88%的企业已部署AI应用,但真正能称得上「高绩效」的只有6%。这些项目的折戟,几乎都不是源于「模型能力不足」,而是在启动前缺乏精细的收益测算。
L16的二维矩阵(可行性×价值)能迅速锁定价值甜点区,但它忽略了三个关键要素——而这恰恰是Gartner所指出的失败根源:
L17将粗筛迭代为四维精算模型:可行性×价值×成本×风险,各项独立打分后按「价值÷(成本+风险)」排序确定优先级。Gartner同样明确建议采用统一评分模型,对每个用例的可行性、风险、成本和预期业务影响进行评估——本框架正是这一方法的具体落地。
一秒法则(L16已介绍过)只是初步筛选。但仅靠它远远不够,AI项目还面临两个传统软件不曾遭遇的陷阱:
数据冷启动:先有鸡还是先有蛋的困局
AI需要数据才能持续优化,但缺乏用户又无从获取数据。新功能上线前若未明确「首批数据从何而来」,产品一上线便陷入空转。这是AI项目独有的难题——传统软件开发完毕即可投入使用,而AI开发完成还必须先完成「数据喂养」过程。 白话:你招聘了一名实习生,必须分配工作让他历练成长;但若因他尚未熟练就闲置不用,他便永远无法独当一面。
能力漂移:可行性评估需要附加时间维度
当下无法实现的功能,下季度新型模型发布后或许就能轻松应对。因此可行性评估必须明确标注评估时点(截至2026年X月),并设定重新评估的触发条件。切勿将「当前不可行」等同于「永久不可行」。 白话:去年尚无法实现的实时语音翻译,今年已变为现实。评估结论本身存在时效性。
此外还需考虑数据就绪程度——数据是否具备?数量是否充足?使用是否合规?在医疗领域这一问题尤为敏感,病历资料与问诊记录能否合规获取,直接关乎项目能否顺利启动。
TCO(总拥有成本)涵盖三个组成部分,但多数项目仅计算了第一项:
类比说明:购置宠物花费不高,但终身养育成本不菲。多数AI项目只盘算了「采购」阶段的支出,却忽略了「运维」阶段的持续投入。
传统软件虽存在bug,但bug性质明确、可定位修复。AI则存在幻觉问题——在医疗场景中,幻觉等同于责任事故。
L14曾讲到Faithfulness(忠实度)是RAG系统的核心命脉:一条凭空捏造的用药建议便可能酿成一起医疗事故。传统IT评估框架未对「bug」与「幻觉」加以区分,但医疗场景必须严格区分:bug属于开发质量层面的问题,幻觉则属于业务风险层面的问题,二者的处置逻辑截然不同。
AI的三类独特风险
① 幻觉风险:在医疗场景中错误应答即等于事故,绝非普通bug可类比。接L14的Faithfulness命脉论述。 ② 漂移风险:模型迭代升级后行为模式可能发生改变,昨天的正确输出今天可能变为错误。 ③ 评估成本:golden set+RAGAS每周例行运行需持续投入资金(L14刚介绍过相关知识)。
为何风险维度最为关键:若一个AI项目「运维成本高昂」,最坏结果不过是砍掉项目;但若该项目「潜藏事故风险」,则远不止经济损失那么简单。医疗AI正是后者的典型代表——因此风险评估环节不可或缺,且应赋予最高权重。
吴恩达曾指出:市场上已有的成熟解决方案应优先采购;唯有真正前沿的创新才考虑自研。但在AI时代,这一判断标准需要更新升级。Gartner原文表述为:
「AI项目的ROI高低并不取决于模型本身的复杂程度,而取决于其整合深度、治理水平以及与真实业务需求的契合程度。」
通俗解读:模型能力正趋于同质化,真正的差异化竞争集中在应用层——具体体现在工作流整合能力、数据壁垒构建以及治理体系完善,而非「自主训练模型」本身。
核心转变:过去的决策逻辑是「核心能力必须自建」,AI时代的决策逻辑则变为「自建对象应为应用层与整合层,而非模型本身」。模型可直接采用现成方案(如Claude/GPT),差异化优势构建在工作流与数据资产上。 这恰好呼应L14所学的「生成环节依托主模型、质检环节依托独立强模型」理念——模型层均为「采购」所得,你「自建」的仅仅是将这些模型接入医桥通问诊业务逻辑的应用中间层。
完成四个维度评分后,按既定公式进行排序:
优先级 = 价值 ÷(成本 + 风险)
按优先级从高到低排列,优先推进性价比最优的项目。这正是L16中甜点区候选项目的「作战排序」。
举例说明(以下数字仅为示意,旨在传达思维方法):
诊链云价格应答项目风险较低、成本可控,性价比最为突出;症状判断项目虽然价值显著但风险同样居高(幻觉可能引发医疗事故),因此排在末位。这便是「精算到位」的价值所在——并非放弃某些项目,而是明确优先顺序与推进节奏。
下集预告(L18) 进入「AI产品执行」新阶段——重点探讨评估完成后的方案落地路径:MVP如何合理切分、人工兜底机制如何设计、如何从小型试点逐步过渡到全面上线。
本框架综合借鉴Gartner官方「统一评分模型」与Andrew Ng「Generative AI Projects」方法论