免费开始

为什么 AI 试点会失败:GenAI 分化揭示的企业 AI 投资回报(ROI)真相

AI 采用/2026-07-27/作者:Presentation Intelligence

ChatGPT Image 2026年7月24日 10_32_09.png


启动一个 AI 试点很容易。要把它变成可靠的业务系统却并非如此。

一个团队可以连接模型,上传内部文档,并在数天内生成一场令人印象深刻的演示。进入生产阶段时,会出现不完整数据、访问控制、遗留软件、审批步骤、异常情况,以及已经形成固定工作习惯的员工。

这些环境之间的差距解释了:为什么企业采用 AI 的热度可能会上升,却无法带来预期的财务回报。IBM 的2025 年 CEO 调研发现,被调查的高管中,只有 25% 的 AI 举措实现了符合预期的投资回报率(ROI),而 16% 的举措已经在全企业范围内规模化部署。

德勤的企业生成式 AI 现状则提供了一个有益的对照。超过三分之二的受访组织预计:在未来三到六个月内,他们的实验中只有 30% 或更少能够被完全规模化。然而,近四分之三的人表示,他们最先进的一项举措正在达到或超过 ROI 预期。

合在一起,这些发现揭示了“生成式 AI 分裂”(GenAI Divide):实验很普遍,但可衡量的价值却集中在那些成为真实工作流一部分的项目上。


AI 采用并不等同于企业 AI 的投资回报率(ROI)

一名员工使用 AI 来总结会议或准备初稿,是“采用”的证据。但这不一定是“转型”的证据。

当一个系统改变了一个重复发生的流程时,企业 AI 的 ROI 才会出现。它可能缩短合同审查时间,减少支持升级次数,加快报表生成,降低外部服务成本,或让团队在不按比例扩招的情况下处理更多工作。

许多试点之所以失败,是因为评估时使用了错误的信号。团队会在演示期间衡量提示词数量、生成内容,或正面反应。这些指标或许能显示兴趣,但无法证明业务价值。

面向生产的试点必须回答三个问题:

1. AI 能否准确完成这项任务?

2. 员工能否在工作流中可靠地使用它?

3. 改进后的工作流是否会影响成本、收入、风险或产能?


为什么 AI 试点在进入生产前就会失败

ChatGPT Image 2026年7月24日 10_43_18.png


1. 项目从工具开始

较弱的试点通常从一种新的 AI 产品入手,并寻找一个可以使用它的地方。更强的试点则从一个昂贵、缓慢、易出错或受产能限制的流程开始。

在测试 AI 之前,团队应记录这项任务出现的频率、所需时间、由谁完成、延迟通常出现在何处,以及需要多少审阅工作量。同时,还应明确要实现的改进幅度,以证明部署是有必要的。

没有基准(baseline),成功就变得主观。某位相关方看到一个打磨精良的答案,就称其为具有变革性的试点。另一位看到一个错误,就称其不安全。任何一方的反应都无法证明工作流程是否真的得到了改进。

2. AI 就在工作流程旁边

一个模型可以加速某一项任务,同时却让整个过程变得更复杂。

员工可能会从一个平台复制信息,把它粘贴到一个 AI 界面中,查看回复,改写其中一部分,再把它放回到另一个系统。模型确实生成了答案,但组织增加了交接环节。

可扩展的系统需要明确的进入和退出点。输入从哪里来?模型能够访问哪些信息?哪些输出需要审批?当数据缺失时会发生什么?最终的操作记录在哪里?

价值并不只体现在生成的答案本身。它体现在组织接下来能做什么。

3. 系统不理解组织

企业工作依赖于通用型工具并不会自动具备的语境。

一个有用的系统可能需要理解内部术语、已批准的证据、客户历史、定价规则、政策例外、偏好的格式,以及更早的纠正。当用户必须在每个会话中重建这种语境时,这个工具对偶尔的任务仍然有帮助,但对于重复性工作就会令人烦躁。

缺失的一层可能涉及检索、结构化数据、记忆、集成,或反馈。模型的智能很重要,但组织层面的智能往往决定系统是否会变得可靠。

4. 没有人对生产结果负责

创新团队可以推出实验,但生产系统需要永久的负责人。

必须有人为采用(adoption)、数据访问、质量阈值、异常处理、员工培训、供应商表现以及持续改进承担责任。没有这个负责人,试点会在测试期结束时停止,并变成一份昂贵的浏览器书签。

在开发开始之前就应明确分配所有权。负责人还需要具备权限,以调整周围的工作流程。

5. 治理来得太晚

有时安全、法务、合规和风险团队只有在演示完成之后才被邀请。到那时,试点可能依赖受限制的数据、不受支持的集成,或无法解释与审计的输出。

美国国家标准与技术研究院(NIST)《生成式人工智能风险管理框架(生成式人工智能)》中的NIST 生成式人工智能画像建议:在生成式人工智能系统的设计、开发、使用与评估全过程中,纳入可信度(trustworthiness)方面的考量。

团队应在一开始就识别敏感数据、可预见的失效模式、人类复核需求、日志需求以及回滚程序。早期治理会定义通往安全前进道路的路径。治理过晚往往会把项目推回到起点。


如何设计一个能够扩展的 AI 试点

ChatGPT Image 2026年7月24日 10_32_43.png


1. 选择聚焦、重复的工作流程

最强的首个用例往往并不是最雄心勃勃的。它通常是一个边界清晰、需求频繁、且结果可评估的流程。

合适的候选包括文档分类、客户请求路由、定期报告准备、内部知识检索,以及从表单中提取标准信息。

2. 评估整个流程

需要模型准确性,但这并不足以构成完整的商业论证。应从三个层面评估可投入生产的试点。

输出质量:结果是否准确、完整、一致,并且来源恰当?

工作流程性能:该流程是否能减少耗时、返工、交接,或人工审核工作量?

业务影响:改进是否会影响成本、收入、风险、客户体验或运营产能?

模型可以生成更好的内容,但不一定改善工作流程。即使工作流程更快,如果规模仍然太小,也可能不足以支撑部署的合理性。

3. 有意设计人工审查机制

完全自动化并不是唯一成功的结果。

在许多企业级工作流程中,AI 可以处理可预测的案例,而专家对例外情况进行审核。目的并不是不惜一切代价替代人员。目的在于把人的判断放在最能创造价值的地方。

团队应衡量需要介入的频率、还需要进行多少编辑,以及哪些错误会带来有意义的风险。

4. 构建反馈闭环

每一次纠正、拒绝与升级都包含信息。

团队可以利用这些证据改进提示词、检索来源、审批规则、界面以及评估标准。没有反馈闭环,同样的错误会再次出现,而员工的信任也会逐渐减弱。

企业级 AI ROI 往往最先在哪里体现

MIT NANDA 1.png


最显眼的用例不一定最有价值。

面向客户的助手和创意工具更容易吸引注意力,因为它们的输出很容易展示。后台工作流程可能带来更清晰的经济性:因为它们包含重复劳动、处理时间、外部服务成本,并且错误率可被衡量。

早期企业级 AI 的投资回报(ROI)可能来自减少文档处理时间、缩短支持队列、加快合规审查、改进内部报告、降低外包服务成本,或在不按比例增加招聘的情况下提升员工产能。

企业应将个人生产力与企业价值区分开来。节省一名员工二十分钟是有用的。当这种节省能够重复、在目标人群中被广泛采用,并且与可衡量的结果建立联系时,企业级 ROI 才会出现。


将 GenAI 分歧(GenAI Divide)视为一段视觉化的商业叙事

当把采用数据、试点障碍、采购选择和实施模式放进一个结构化的故事中时,GenAI 分歧就更容易理解。

探索 GenAI 分歧:使用 Pi 制作的《2025 年企业 AI 现状》,看看密集的企业级 AI 研究如何被转化为一份清晰的汇报,用于领导层讨论、战略复盘和投资决策。

准备好把你自己的报告、研究或业务文档转化为可用于决策的汇报了吗?

用 Pi 创建演示文稿,并将复杂的来源材料整理成连贯的视觉叙事。

常见问题解答(FAQ)

Q:为什么 AI 试点难以规模化?

A:AI 试点之所以常常无法扩展,是因为它们与真实工作流脱节、缺少可衡量的目标、依赖不完整的组织情境,或没有永久负责人来对生产负责。

Q:企业应如何衡量企业级 AI ROI?

A:企业应将由 AI 支持的流程与有据可查的基线进行对比。有用的衡量指标包括:每项任务所用时间、人工审核投入、错误率、每笔交易成本、采用情况、对营收的影响,以及避免的外部支出。

Q:什么是 GenAI 分歧?

A:GenAI 分歧描述的是:一方面是正在试验生成式 AI 的组织,另一方面是那些能够通过集成式 AI 系统获得持续的运营价值或财务价值的组织之间的差距。

Q:企业应当自建还是采购企业级 AI 系统?

A:选择取决于工作流的独特性、内部专业能力、集成要求、安全性以及长期所有权。更优的方案是与真实流程匹配、能够通过反馈持续改进、并且具备可信的量产路径的方案。