男子买理想i8第六天用智驾被撞车:企业上AI前,先想清楚这三件事

一条热搜,戳中了所有准备上AI的企业的神经

据媒体报道,一位车主在购买理想i8后的第六天,使用车辆的智能辅助驾驶功能时发生碰撞事故。消息发酵后,舆论迅速分成两派:一派认为”智驾不靠谱,宣传过度”,另一派认为”辅助驾驶本就是辅助,驾驶员才是第一责任人”。具体事故原因与责任认定,还有待相关方给出更完整的说明。

但对做企业的人来说,这条热搜真正的价值,不在于围观一场口水战,而在于它把一个所有正在做数字化、准备上AI的企业都迟早要面对的问题,摆到了台面上:

当一项并不完美的智能能力,被交到真实用户手里,边界划在哪里?责任落在哪里?出了事谁兜底?

这个问题的形态,在车企那里叫”辅助驾驶”,在你的公司里,可能叫”AI客服””智能审单””AI生成报价单””自动化风控”。名字不同,本质完全一样。

从”能用”到”敢用”,中间隔着一条工程鸿沟

过去两年,我接触过不少企业主,他们判断要不要上AI的标准,往往是看一场演示:

演示现场,大模型流畅地回答了十几个问题,准确、迅速、还挺有礼貌。老板一拍板:”这个好,我们也要搞一个。”

三个月后项目上线,客服机器人开始答非所问,销售助手把客户的预算金额抄错一位,自动生成的合同条款引用了一份两年前的旧模板。业务部门开始抱怨,项目逐渐无人问津。

问题出在哪儿?不是模型不行,而是演示环境和生产环境,根本是两个世界

演示环境里,问题是被精心挑选过的,数据是干净的,用户是有耐心的。生产环境里,用户会打错字、会问八竿子打不着的问题、会在凌晨两点扔过来一张模糊的照片;数据是脏的、格式是乱的、上下游系统是各说各话的。

车企的智驾系统要面对的是暴雨、逆光、异形车辆、临时施工围挡;你的AI系统要面对的是口音、缩写、行业黑话、以及同事随手粘贴的半截表格。智能能力真正的成本,从来不在”能不能做出来”,而在”能不能在真实世界里稳定地不出大事”。

提醒一:别把”能力上限”当成”日常表现”

几乎所有AI产品在发布时展示的都是最好的一面,这无可厚非。但企业做选型和立项时,如果按”最好的一面”来设计流程、配置人力、承诺客户,风险就埋下了。

理性的做法是:先问”最差会差到什么程度”,再问”最好能好到什么程度”。前者决定你的兜底方案,后者决定你的想象空间。

提醒二:人机协同的边界,要写在流程里,不能只写在说明书里

“辅助驾驶”这四个字已经说明了权责关系,但现实中,用户仍然容易高估系统的能力。这不是用户的问题,是产品设计和流程设计的问题——如果一个环节需要人随时接管,那么流程里就必须明确”什么时候必须人来看”,而不是指望用户凭自觉。

企业内部的AI系统同理。AI生成的报价单要不要人工复核?AI给出的信贷建议在多大金额以上必须双人确认?这些不是技术问题,是流程问题,必须在系统上线前定义清楚,并写进操作规范,而不是贴在产品说明书的角落里。

提醒三:没有可观测性的AI系统,等于闭眼开车

传统软件出问题,通常有明确的报错、日志和堆栈。AI系统出问题,往往表现为”回答得好像也没错,但就是不对”。如果你无法回答”这个结论是怎么来的””上周的准确率是多少””哪类问题最容易出错”,那这套系统就是不可管理的。

事故复盘最怕的不是出错,而是查不清为什么出错

为什么”买个大模型”解决不了问题

很多企业的第一反应是:模型不是现成的吗,接进来不就能用了?

现实是,大模型是原料,不是产品。从原料到能在业务里跑起来的产品,中间至少隔着几层工程工作:

  • 数据治理:企业自己的知识散落在网盘、微信群、老员工的电脑里,格式各异、版本混乱。没有清洗和结构化,模型学到的是噪音。
  • 检索与约束:让模型基于企业真实资料回答,而不是凭训练时的记忆”编”,需要检索增强、权限过滤、引用溯源一整套机制。
  • 评测体系:得有一批”标准题”,每次改动都跑一遍,才知道是进步了还是退步了。没有评测集的AI项目,本质上是凭感觉迭代。
  • 灰度与回滚:先给10个人用,再给100个人用,出问题能一键退回。
  • 监控与告警:准确率突然下降、响应时间突然拉长、某类问题集中出错,要能第一时间发现。

这些工作不性感,也不容易在发布会上讲,但它们决定了你的AI项目是成为业务的基础设施,还是成为一次昂贵的尝试。

微米科技的做法:把AI当成软件工程来做

微米科技(weimi6.cn)在为企业提供软件定制开发与AI应用落地服务的过程中,反复遇到的就是上面这些问题。我们的基本判断是:AI项目的成败,八成取决于工程能力,两成取决于模型选型。

因此在项目推进上,我们通常坚持几件事:

需求阶段:先把边界和兜底谈清楚

在动手写代码之前,先和业务方一起把”哪些事交给AI、哪些事必须人来做、出错了怎么退”这三个问题回答掉。宁可前期多花两周开会,也不要在上线后被业务部门追着改。

开发阶段:评测集先行

把业务专家认可的”标准答案”整理成可重复运行的评测集。每次调整提示词、更换模型、更新知识库,都先跑评测。用数据说话,而不是用”我感觉这次好多了”。

上线阶段:灰度发布 + 人工兜底

小范围试点,逐步放量。关键环节保留人工确认入口,让系统先”帮人干活”,而不是一上来就”替人决策”。

运营阶段:持续迭代而非一次性交付

AI系统不是交付完就结束的项目。业务在变、用户在变、模型也在更新,需要持续的监控、复盘和调优机制。我们更愿意把它看成一个长期运行的系统,而不是一个验收即封存的软件包。

给企业决策者的一份行动清单

如果你正在考虑或已经启动AI项目,不妨用下面五个问题自查:

1. 我们的AI系统,最坏情况下会造成什么后果?这个后果可逆吗?

2. 哪些环节必须有人确认?这条规则写进流程了吗,还是只停留在口头上?

3. 我们有没有一套可重复运行的评测方法,来判断系统是变好了还是变差了?

4. 出问题时,我们能不能在一小时内定位到是哪一环出了问题?

5. 这个项目有没有明确的运营责任人,而不是交付完就归IT部”代管”?

这五个问题都答得上来,再谈规模化推广,会踏实得多。

结语

智能驾驶的热搜会过去,但它提出的问题不会。任何一项智能能力,从实验室走向真实世界,都要经历一次”降级”:能力会被打折,场景会变复杂,用户会超预期地使用它,也会超预期地误解它。

承认这种”降级”,并为它设计好流程、边界和兜底方案,才是企业数字化真正成熟的标志。技术跑得快是好事,但决定一门生意能不能长久的,往往是那些跑得不那么快的部分——测试、监控、复核、回滚,以及那句最朴素的追问:

万一出错了,怎么办?

这个问题,车企要回答,做AI的每一家企业,也都要回答。