一个越来越常见的场景:领导问"全市有多少重点项目资金已拨付但长期未开工?"AI 一脸茫然。
是模型不够强吗?不是。是 AI 和数据中台被"分家"了——AI 有大脑,但没有眼睛,没有手,也没有脚。
原生 AI 和"外挂式 AI"的区别,就是一个人和一颗大脑的区别。
一、"分家"是怎么发生的?
AI 时代,很多单位为了突出智能化建设,把"智能体建设"和"数据治理"拆成了两个部门。
表面上看,分工明确——一个管 AI,一个管数据。但实际上,这种拆分在技术架构上制造了一道裂痕:
这道裂痕的直接后果是:AI 有智商,没有知识;能推理,没有素材。 就像一个最强大脑选手被关在一间没有窗户、没有网络、没有书的房间里,你问他什么,他都只能瞎猜。
"分家"的本质,是把 AI 的思考能力和 AI 的行动能力强行拆开。思考留在智能体部门,而行动需要的所有工具——编目、质检、开发、归集、指标——全部锁在数据治理部门。
二、为什么"外挂式 AI"答不上来?
我们用一个真实的提问来还原整个过程。
某市发改委重点办向数据局提了这样一个问题:
"我们管理着全市 500 多个重大项目,数据散落在发改的项目审批系统、财政的资金拨付系统、住建的施工许可系统、统计的固定资产投资报表中。请帮我:
① 分析项目从立项到开工到竣工的平均周期(按投资规模分档);
② 找出'资金已拨付但长期未开工'的问题项目;
③ 按区县和行业输出项目推进进度排名。最终生成全市重点项目推进情况分析报告。"
这个问题复杂吗?复杂。但它恰恰是数据中台应该能回答的那类问题——跨系统、多指标、需要数据治理和开发能力。
现在,分别看"分家"之后和"原生"之下的两种结果。
"外挂式 AI"的路径:每一步都卡住

不是模型不够聪明。是模型被剥夺了所有能用来回答这个问题的工具——它不知道数据在哪、不知道数据干不干净、不知道指标怎么算、不知道跨系统怎么关联。
"原生 AI"的路径:大脑指挥身体,一气呵成

原生 AI 的路径之所以短,不是因为模型更强,而是因为工具都在手上。它不需要"找人帮忙"——编目工具就在系统里,质检工具就在系统里,开发工具就在系统里,查一下、调一下、算一下,全部自动化。
"外挂式 AI"的每一步都在"等人"——等数据部门给表、等技术员写 SQL、等业务部门确认口径。人等 AI 变成 AI 等人。而"原生 AI"不等任何人,因为它和数据平台是一体的。
三、原生 AI 凭什么能做到?——智能中心的"大脑+感官+手脚"架构
原生 AI 的核心,是在数据中台内部构建一个智能中心。它不是外挂的聊天窗口,而是数据中台的"中枢神经系统"——三层结构:

第一层:能力底座——数据的"感官"和"肢体"
智能中心不是空中楼阁。它的每一条 Tools,都直接对应数据中台的一个功能模块:
每一个 Tool 都是"数据中台自身的能力",不是外部 API。 这就是原生和外挂最本质的区别——外挂 AI 需要你手动注册每个工具的接口、配置权限、对接协议。原生 AI 的 Tools 和平台共享同一套权限体系、同一个数据上下文、同一份元数据。
第二层:统一工具接口——AI 的"手脚架"
Tools 本身不思考。它们是 AI 智能体调用底层能力的标准化接口——就像手不会思考,但大脑可以指挥手去做任何事。
标准 Tools 覆盖了数据全生命周期:从探查、编目、归集,到质检、开发、指标,再到安全、可视化、检索。智能体不需要知道底层实现,只需要知道"有什么工具可以用"。
这套接口的设计逻辑,类似于 DIFY 的工具调用体系——但有一个关键区别:原生 Tools 的权限天然继承数据中台的权限。 用户 A 只能看到人力资源部的数据?那 AI 代理用户 A 提问时,调用的资产查询工具也只会返回人力资源部的数据。不存在"AI 绕过权限看到不该看的数据"的问题。
第三层:智能体——能自主完成任务的"数字员工"
智能体是上层的工作者。它们接收用户的自然语言指令,自主拆解任务、调度 Tools、组合结果。
以"智能寻数问数助手"为例。用户问"哪些项目资金已拨付但未开工",它的执行链是:
理解意图:这是一个跨系统关联查询 + 异常检测问题
调用资产查询工具:在已上架的资产目录中匹配"项目审批表""资金拨付表""施工许可表"
调用指标查询工具:确认"开工"的业务口径、"投资规模"的分档规则
调用质量查询工具:检测工期字段格式、金额字段单位是否一致
调用数据库查询工具:自动生成跨系统关联 SQL,执行查询
调用 Echarts 图生成工具:输出可视化图表
返回结果:数据表 + 图表 + SQL + 数据治理建议 + 开发提示词,所有结果附"人工确认"
每一步都有留痕,每一步都附确认环节。 AI 不是取代人做决策,而是帮人把"找数据、查质量、写 SQL、画图表"这些机械劳动全部做完,让人只做最后的判断。
知识库:AI 的"长期记忆"
光有工具还不够。AI 还需要"知道标准"——行业规范是什么、指标口径怎么定、开发脚本怎么写。
原生智能中心内置了一套完整的知识库引擎:
业务标准库:行业数据标准、指标口径定义、编目规范
开发规范库:SQL 模板、数据开发脚本范例、ETL 最佳实践
问答沉淀库:历史问答记录,"提问→应答→沉淀→优化"自闭环
监控指标库:异常检测规则、质量阈值、API 调用基线
知识库自动向量化存储,支持混合检索(关键词 + 语义相似度),Reranker 重排模型二次打分。智能体在回答问题前,会先从知识库中检索最相关的标准和案例,作为推理的上下文。
没有知识库的 AI,是"失忆的大脑"。有知识库的 AI,是"经验丰富的老师傅"。
四、原生 AI 贯穿数据全生命周期
智能中心的能力不是集中在某一个环节,而是贯穿数据中台的整个生命周期。每一个阶段,原生 AI 都在把"人要做的事"变成"AI 自动做的事"。
原生 AI 不只是在数据中台上"加了一个聊天窗口"。它是把数据中台的每一个操作环节,从"手工模式"切换到了"智能模式"。
五、为什么必须是"原生"?
最后,回答那个最根本的问题:为什么 AI 能力必须原生内置于数据中台,而不能是一个独立的智能体平台?
三个理由。
第一,权限一致性。 外挂 AI 平台需要单独对接数据中台的权限体系——谁能看哪些表、谁能查哪些字段、谁能调哪些 API。这是一个巨大的集成工程,而且永远存在"AI 绕过权限"的风险。原生 AI 的 Tools 天然继承中台的权限——用户在数据中台里能看什么,AI 就帮他看什么,多一分都不行。
第二,数据上下文。 外挂 AI 面对的是"裸数据"——一堆表名和字段名,没有业务语义。原生 AI 面对的是"活数据"——已经编目的资产(带中文注释和标签)、已经建模的指标(带口径定义和血缘关系)、已经质检的数据(带质量评分和问题标注)。同样的模型,面对"裸数据"和"活数据",回答质量天差地别。
第三,行动闭环。 外挂 AI 只能"说"——告诉用户答案是什么。原生 AI 能"做"——自动归集数据、自动修复质量问题、自动构建开发模型、自动生成治理脚本。它不只是回答问题,它可以直接在平台上执行操作。问答和建议的终点,是行动的起点。
这就是原生 AI 和外挂 AI 的本质区别:外挂 AI 是"顾问",原生 AI 是"同事"。顾问说完就走了,同事说完还能帮你把事情干了。
六、答案:L1-L5 架构,就是知识图谱最难的"骨架"
前面五节讲了"怎么让 AI 找得到数据"。Tools 体系、资产目录、知识库,解决的是语义匹配——用户说"项目审批表",AI 在资产目录里找到最相似的那张表。
但回到开篇那个真实的提问——"分析项目从立项到开工到竣工的平均周期"——光靠语义匹配不够。AI 找到了"发改_项目审批表""财政_资金拨付表""住建_施工许可表",但它不知道这三张表之间通过什么字段关联、哪些项目编号在审批表里存在但在施工许可表里不存在。
这就是从"找到数据"到"理解关系"的跨越。而这个跨越的答案,不在外部——在我们已有的 L1-L5 业务数据分层架构里。
知识图谱的真相:双层结构,两层都要建
市面上一提到知识图谱,大多数人脑子里浮现的是实体之间连线交错的可视化网络——路口 A 积水、泵站 B 故障、车辆滞留、人员处置。
这是图谱的上半层——「业务实例层」。 很多人认为这层不需要建——"数据在表里,实时 JOIN 查出来就行了"。但实践下来发现,不做实例图谱有两个致命问题:第一,同名字段不一定是真关联(两张表都有"项目编号",但业务上根本不该 JOIN);第二,真关联的字段往往不同名(发改叫"项目编码",住建叫"许可证号"),AI 靠语义猜,准确率不到 70%。不做实例图谱,AI 只能在"猜错"和"漏掉"之间二选一。
图谱还有下半层——「本体模式层」,也就是我们 L1-L5 架构承载的部分。它定义规则:这个世界里有哪些实体类型、每种实体对应哪些物理表、两个字段虽然名字不同但是不是同一个业务含义。
L1-L5 是本体模式层的"骨架",不是全部
实话实说:一个完整的本体(Ontology),按计算机科学的标准,包含六个要素——类定义、层级分类、属性定义、跨实体关系、推理规则、形式化约束。
L1-L5 覆盖了前三个,也是最难、最有价值的三个。 后三个各有各的处理方式:
L1-L5 覆盖了本体论约 50-60% 的核心工作,而且是地基级的——概念定义、层级分类、属性对齐。 市面上大部分数据中台连这 50% 都没有。至于剩下的跨实体关系,不需要建重知识图谱,只需要在 L3 上做一件很轻的事。
关键改造:放开 L3 一对多 L4
以上能力的第一步,是一个关键的架构改造——允许单个 L3 业务对象关联多个 L4 逻辑实体。
原有架构约束是"一个 L3 只能挂一个 L4,一个 L4 只能绑一张物理表"。在跨部门、多系统数据融合场景下,同一个业务概念(如"工程建设项目")分散在发改、住建、财政多张物理表中,原有架构无法将它们统一到一个实体下。
改造方案是最小侵入、完全向下兼容的:
• 保留:单个 L4 逻辑实体只绑定一张物理表(底层旧逻辑不动)
• 放开:单个 L3 业务对象可关联多个 L4 逻辑实体
• 效果:一个业务实体 → 自动覆盖多部门、多来源、多张物理表
实例图谱怎么建?——L3 副本隔离 + 系统自动发现 + 人工轻量确认
实例图谱的建法,决定了它是一笔"值得的投入"还是一堆"冗余的垃圾"。核心设计只有一个原则:每个 L3 业务实体拥有一套独立的图副本,不同 L3 之间的节点物理隔离、永不相通。
举个例子:同一张物理表"项目基本信息表",挂载到 L3"工程建设项目"和 L3"行政执法立案审查"两个实体下。在传统方案里,两张图共享同一个节点,A 场景的关联关系会"串"到 B 场景里,查项目进度却跑出来立案审查的数据。而在副本隔离架构下,这张表生成两个独立的图节点副本,各自在自己的 L3 圈子里建关联——物理上彻底隔离,查什么场景只出什么场景的数据,干干净净。
实例图谱里的关联边,不靠人工一条条手动画。三类关系各有各的建法:
第一类,物理外键。 数据库中已经建好的外键约束——系统自动同步到图里,零人工。
第二类,标准主数据编码。 项目统一编码、企业信用代码这类全局统一的标识——系统自动识别、自动关联。同时内置高危封禁规则:身份证字段涉办案、涉信访、涉风控的,永久禁止自动关联,杜绝"犯罪嫌疑人信息串入学籍数据"这种极端风险。
第三类,异构表等价字段。 这是工作量最大的——发改叫"项目编码"、住建叫"许可证号"、财政叫"项目编号",名字完全不同但业务上是关联键。靠人一条条梳理,几十个部门几百张表的交叉组合,工程量是指数级的。奥腾的做法是系统自动扫描、三维打分——字段注释语义相似度 + 数据类型/长度一致度 + 脱敏样本数据交叉比对——80 分以上的直接推给审核人员确认,50 到 80 分的先经建模人员预审,50 分以下自动丢弃。审核人员不需要精通每个细分业务,看系统给的匹配依据做复核就行。
审核通过后,等价关系录入全局白名单,后续同类字段自动高置信推荐。审核驳回的,录入黑名单永久不再推荐。越用越准,越用越省人工。
实例图谱不是数据表关系的"手抄本"。手抄本会过时、会抄错、维护成本巨高。奥腾的实例图谱是"自动驾驶 + 人工监看"——系统负责 80% 的自动发现和关联,人负责 20% 的确认和纠偏。建完之后,AI 智能w问数优先走图谱、大模型兜底,既保证准确度又兼顾覆盖面。
改造之后:三个本体能力,终结三种"问不准"
回到开篇那个问题。L1-L5 本体化改造完成后,AI 面对同样的提问"哪些项目资金已拨付但未开工",能力发生了质变:
AI 不再靠字段名模糊搜索,而是按业务实体语义精准找数。 数据归集自动覆盖多部门异构表,跨表关联自动生成 JOIN 条件,自然语言提问直接端到端输出分析结果。
语义匹配是"推荐",图谱是"导航"。L1-L5 本体骨架定义了路网结构,实例图谱铺上了实时路况。推荐可能给错,导航不会走错路。
而路网和路况,都在数据中台内部——外挂 AI 拿不到,也建不了。
而且——这里再次回到文章的主题——为什么这些能力必须原生内置于数据中台?
因为 L1-L5 建模体系本身就是数据中台的内部骨架。资产编目的表注释是 AI 推荐 L3→L4 绑定的素材,数据血缘的 JOIN 链路是 AI 发现关联键的依据,指标管理的口径定义是 L3 本体规则的来源。外挂 AI 拿不到这些——就算拿到了今日份的导出快照,明天数据中台新增一张表、变更一个字段、调整一条 ETL 链路,它的"图谱"全过时了。
外挂 AI + 离线快照 = 一张过期地图。原生 AI + L1-L5 本体骨架 + 实例图谱 = 实时导航。
离线地图也能指路,但路况变了它不知道。实时导航知道每条路当前的状况——因为它和路网是一体的。
又是"分家"要付的一笔代价。
结语
回到开篇那个比喻。
把 AI 和数据中台分开,就是把人脑和身体分开——大脑还能思考,但它看不见、摸不着、走不动。它知道要查找"项目审批表",但不知道表在哪、不知道数据干不干净、不知道指标怎么算、不知道 SQL 怎么写。所以它只能沉默,或者瞎编。
原生 AI 是把大脑装回身体里。 每一个 Tools 是一个感官、一条肢体,每一个智能体是一个能自主行动的数字员工,每一个知识库是一段可以被检索和复用的经验。
数据中台的 AI 不需要是最聪明的模型,但它必须是最"懂数据"的模型。因为在数据治理这个世界里——
智商决定上限,但数据和工具决定下限。
外挂的 AI,上限很高,下限很低。
原生的 AI,上限同样高,下限不会低。
因为它手里有工具,眼里有数据,脚下有平台。
把 AI 放到数据中台外面,它只是一个聊天机器人。
把 AI 建在数据中台里面,它才是一个能看、能摸、能动、能干的数字员工。
数据归集、数据编目、数据质检、数据开发、指标构建、寻数问数——从"人做"变成"AI 做",从"人工驱动"变成"智能驱动"。
不是给数据中台加一个 AI 聊天窗口,而是让数据中台本身,变成一个能思考、能行动的智能体。
上海奥腾计算机科技有限公司,让数据同频,与城市共进。
