上个月我去一家企业交流。对方的汇报材料做得漂亮:大标题写着"AI驱动数据治理全面升级",配图是治理大屏,PPT足足四十页。
我问了三个问题:元数据注释覆盖率多少?对方答,大概百分之二三十。质量检核规则配了多少条?对方答,几十条,还在建。AI在治理流程里跑了几个环节?对方顿了顿说,目前主要是给领导演示用。
你看,PPT里的"全面升级",和车间里的真实水平,隔着一条鸿沟。
今天这篇文章,想撕开包装纸,看看AI数据治理的真实水平到底是什么——不吹不黑,就摆事实。因为只有认清真实水平,才知道下一步该往哪走。
很多人聊"AI数据治理"聊得云里雾里,是因为没分清这其实是两件事。
第一件:为了AI的数据治理。大模型要进企业,得先喂数据。可大模型对数据的要求和传统报表完全是两回事——报表要的是结构化、口径一致的数字,大模型要的是文档、日志、工单这些非结构化数据,还要有语义、有上下文、有知识关联。你原来的那套治理体系,接得住吗?
第二件:用AI做数据治理。把大模型当成治理工具:让它读元数据、生成注释、识别口径冲突、自动做分类分级、写质量检核规则。这件事现在被吹得很神,真实效果后面细说。
两件事,两个真实水平。分开盘,才看得清。
先说第一件。把几个行业共识的数据摆出来,你就知道现在是个什么水位。
毕马威的调研显示,66%的企业把"数据基础薄弱"列为企业落地大模型的首要挑战——不是模型不行,不是算力不够,是数据这口锅底下没柴。MIT 2025年的报告更狠:约95%的生成式AI试点项目没有产生可衡量的回报,而失败原因里排名靠前的,正是数据没准备好。
具体到治理水平,看几个关键指标的真实水位:元数据注释覆盖率,多数企业落在20%到50%之间——也就是说,一半以上的数据表,没人说得清里面装的什么、从哪来、能不能用。
更要命的是非结构化数据。企业数据总量的80%以上是非结构化的——文档、邮件、图纸、工单、会议纪要。而过去二十年,企业的数据治理基本只盯着那不到20%的结构化数据。大模型恰恰最需要的就是那80%。行业里有个判断越来越成为共识:非结构化数据治理正在从"可选题"变成"必作题",但绝大多数企业,这道题还没开始做。
还有一层更隐蔽的短板:语义。大模型进企业后答非所问,十有八九不是模型笨,是它面前没有一张"企业语义地图"——客户在这套系统叫"甲方",在另一套系统叫"合作方",在财务凭证里叫"往来单位",没人告诉模型这些是同一个东西。语义层缺失,是AI数据治理当前最深的坑,也是最难补的课。
再说第二件。用AI做数据治理,不是骗局,确实有几个环节的效率提升是实打实的。
元数据注释。过去靠人肉看表填说明,一张表半小时。现在大模型读表结构、采样数据、结合上下游血缘,自动生成业务含义描述,注释覆盖率从20%-50%提升到90%以上,这在已有实践的数仓项目里已经跑通了。
口径冲突检测。让AI比对多张表、多个指标定义,找出"同名不同义"和"同义不同名",这在动辄几万张表的企业数仓里,人工基本做不动,AI做初筛、人做确认,效率差出一个数量级。
分类分级。安全合规要求每张表、每个字段都要定级。大模型读字段名和采样值,初判敏感等级,人工复核调整,一个过去要做半年的活,压缩到几周。
但是——注意这个但是——这三个环节有个共同点:AI干的都是"识别"和"初筛"的活,判断权和修正权还在人手里。凡是涉及业务口径之争、部门权责之争、历史遗留的数据恩怨,AI一概无能为力。数据治理最难的那部分,从来不是技术活,是组织活。这一点,AI在可见的将来替代不了。
还有个反直觉的事实:用AI做治理,本身需要先有治理基础。AI识别字段含义,前提是血缘链路已经打通;AI生成质量规则,前提是质量框架已经建立。治理基础差的企业,买再多的AI工具,也是巧妇难为无米之炊。这就是为什么同样的AI治理产品,在数据底子好的企业是加速器,在底子差的企业是摆设。
把上面说的两件事综合起来,AI数据治理的真实水平可以分成五级。对照一下,你所在的企业在第几级——不看宣传材料,看实际状态。

行业真实分布是什么样?一句话:绝大多数企业卡在L2,少数领先者到L3,摸到L4的凤毛麟角,L5目前主要是厂商PPT里的概念。如果有人告诉你他已经是L5,你可以问一句:你们非结构化数据纳管率多少?语义层建到什么程度了?大概率就聊不下去了。
为什么"AI数据治理"听起来热火朝天,实际水平却普遍在L2?因为中间隔着三个普遍的错觉。
错觉一:把采购当建设。买了AI治理平台,就觉得自己有AI治理能力了。工具躺在机房里,流程没改、人员没动、考核没变,覆盖率一个百分点都没涨。采购完成的那一刻,建设才刚刚开始——这话反过来说才对:采购完成,不代表建设开始。
错觉二:把演示当能力。供应商的demo永远惊艳——那是在精心准备的数据集上跑的。回到自己企业的数据沼泽里,同样的功能跑出来一地鸡毛。判断真实能力只有一个标准:在你自己的数据上、跑你自己的场景、出你自己的结果。
错觉三:把工具当治理。治理是组织、制度、流程、平台、考核五位一体的系统工程,AI工具只是平台那一环的一小部分。指望一个工具解决治理问题,就像指望一辆好车解决通勤问题——路不通、没驾照、不加油,车再好也是摆设。
认清水平的意义,不是泄气,是找准跑道。从L2往上走,路径其实相当清晰。
第一步,把结构化的存量治理做扎实。别被AI带乱节奏。元数据覆盖率、主数据质量、指标口径统一,这些老三样是AI时代同样要过的关卡,而且现在做,AI还能帮你加速——用AI做元数据注释、口径比对,就是最划算的第一站,投入小、见效快、团队还能练手。
第二步,按AI应用倒推非结构化治理。不要为治理而非结构化,要跟着AI场景走:先上智能客服,就先治客服工单和知识库;先上合同审查,就先治合同库。一个场景一个场景地建,每个场景都让治理投入在业务上兑现成看得见的回报。
第三步,围绕语义层做长期投入。业务对象、业务术语、指标口径的统一定义,是AI能"听懂人话"的地基。这件事没有捷径,靠的是数据团队和业务部门一场一场地对齐。但它也是护城河——语义层建起来的企业,每一个AI应用都比别人快一步。
回到开头那家企业。上次交流后三个月,他们又约了一次。这次没看PPT,直接看平台:元数据注释覆盖率用AI初筛拉到了85%,质量规则从几十条加到四百多条,第一个非结构化场景选了设备检修工单——因为生产部门天天催。
负责人说了句实在话:以前我们把"AI数据治理"当成汇报的词,现在把它当成干活的序。
AI数据治理的真实水平是什么?是大部分企业刚从L2的泥地里拔出脚,是AI在治理的边角环节证明了自己、而治理的主体工程仍要一砖一瓦地砌,是宣传领先实践两年、实践领先报表两个季度。
认清这一点,不丢人。丢人的是用PPT的水平代替真实水平,还信了。
