大模型解决的是"听懂人话",企业语义解决的是"听懂这家公司的话"。
今天的大模型,已经很会说中文了。
你问:"帮我看看华中今年卖得怎么样?"它当然知道什么叫"华中",什么叫"今年",也知道"卖得怎么样"大概率是在问销售表现。
但问题是——它懂中文,不代表它懂你们公司。
"华中"到底包括哪些省份?"今年"按自然年,还是公司财年?"卖得怎么样"看销售额、回款额,还是毛利?如果销售额上涨 20%,毛利率却下降了 8 个百分点,这到底算好,还是不好?
到了这里你会发现:智能问数真正难的,从来不是把一句中文翻译成 SQL,而是怎么把模糊的人话,翻译成企业内部确定的数据语言。
这中间,靠的就是语义。而且至少有三层:指标语义、维度语义、业务术语。少一层,AI 都可能回答得很流畅,但答的根本不是你想问的问题。
这也是现在看智能问数时,一个很容易被忽略的地方:AI 开始分析之前,有没有先把业务问题理解准确。
FineBI Next 的智能分析里,面对比较复杂的任务,可以先通过计划模式确认业务场景、指标口径、分析对象和输出要求,再生成具体的分析步骤;如果只是临时查数,也可以直接进入对话,并基于已有结果继续追问、下钻。
比如同样一句"看看今年华东销售情况",真正进入分析之前,首先要对齐的其实就是:"销售"按什么指标算,"华东"按什么范围算,"今年"按什么时间口径算。
所以智能问数真正需要补上的,并不只是模型理解自然语言的能力。更重要的是:在模型和企业数据之间,建立一层它能够理解、调用,并且遵循的业务语义。
接下来,就从这三层语义拆开看。
一、为什么模型越来越强,智能问数还是会答错?
过去几年,智能问数最常见的路径是 NL2SQL。流程很简单:用户提问,模型理解,生成 SQL,查询数据库,再把结果返回。Demo 看起来很漂亮,但一进真实企业,马上就复杂了。
比如用户问:"今年华东销售额最高的产品是什么?"
数据库里可能同时有:订单金额、合同金额、开票金额、回款金额、含税销售额、不含税销售额。到底哪个才是"销售额"?
再比如"客户数"。是签约客户、下单客户、付费客户,还是去重后的集团客户?数据库可以告诉 AI 字段叫什么,但数据库不会告诉 AI:"公司经营会上讲的客户数,默认指本期产生有效收入、排除内部交易后的独立客户主体。"
这才是企业真正的数据语言。
所以,智能问数有一个非常核心的矛盾:大模型掌握的是语言概率,企业需要的是业务定义确定性。模型可以猜,经营决策不能靠猜。
二、第一层:指标语义——这个数字到底代表什么?
智能问数最容易出错的,首先是指标。
比如:"本月销售额是多少?"听起来只是在查一个数,实际上背后可能涉及:按订单还是收入确认、是否含税、是否包含退货、是否剔除内部交易、汇率按哪个时间点、数据截止到哪一天。
所以,一个真正能被 AI 使用的指标,不能只有一个名字。它至少还要告诉 AI:怎么定义、怎么算、统计谁、什么时候算、从哪里来。
这就是指标语义。它回答的是:"这个数字到底是什么?"
如果没有指标语义,AI 只能在一堆字段中猜哪个更像"销售额"。字段名猜对了,不代表业务口径对了。而企业真正需要的是:无论谁问"销售额",拿到的都是公司已经确认的那个销售额。这才叫可用。
三、第二层:维度语义——这个数字到底在看谁?
只有指标,还不够。因为真实的业务问题,很少只是"销售额是多少?",更常见的是:"华东大客户今年新产品销售额同比怎么样?"
这里除了销售额,还有:华东、大客户、今年、新产品、同比。它们决定的不是"算什么",而是对谁算、在哪算、什么时候算、按什么角度看。
比如"华东"。A 公司可能是上海、江苏、浙江、安徽,B 公司可能还包括福建、江西。甚至同一家公司里,销售体系和供应链体系对"华东"的划分都可能不同。
再比如"消费电子事业部利润怎么样?",背后可能是一整套组织层级:集团、事业群、事业部、产品线、产品。
所以:指标决定数字是什么,维度决定数字属于谁。指标错了,答案错;维度错了,答案一样错。
四、真正难的,不是层级,而是业务关系
维度语义最麻烦的地方,其实不是"省下面有市",而是企业真实的业务关系。
比如用户问:"哪些客户最近有流失风险?"数据库里可能同时存在:CRM 客户、ERP 客户、签约主体、开票客户、集团客户、门店客户。一个集团客户,可能有十几个签约主体。那到底算一个客户,还是十几个?
这不是 SQL 能决定的,这是业务定义。
再比如产品改名、SKU 合并、产品线调整、组织归属变化。今年属于 A 产品线的 SKU,去年可能还属于 B 产品线。如果 AI 不知道这些关系,它仍然能生成一条语法正确的 SQL,图也能画得很好看,但结论可能已经错了。
所以:技术上查询成功,不代表业务上回答正确。这才是企业级智能问数真正难的地方。
五、第三层:业务术语——业务人员根本不会按数据库说话
还有一层更麻烦。真实业务人员,很少会按照指标中心里的标准名称提问。
他们会说:"最近华南几个大 KA 掉得有点厉害,帮我看看。"
这里没有标准字段。"大 KA"是什么意思?"掉得厉害"怎么算?"帮我看看"又要看什么?
但一个熟悉业务的分析师,通常能马上理解。"大 KA"可能是年度采购额超过某个阈值的重点客户;"掉得厉害"可能是最近三个月采购额明显低于过去半年均值;"帮我看看",通常意味着继续拆产品、订单频率、客单价、区域,找到原因。
这就是业务术语。
每家公司都有自己的"黑话"。制造业会说良率、齐套率、呆滞料、OTD;零售会说动销、店效、坪效、爆品、滞销;互联网会说 DAU、留存、GMV、LTV。
更麻烦的是:同一个词,不同公司的定义还不一样。"大客户"是年销售 500 万以上,还是 1000 万以上?"活跃客户"是 30 天有交易,还是 90 天?"爆品"按销量、销售额,还是增长率判断?
这些东西,大模型无法从互联网里学到确定答案。因为问题不是"行业一般怎么定义",而是"你们公司到底怎么定义"。
六、业务术语,也不只是做个同义词词典
很多人一说业务术语,就想到同义词。比如:KA = 重点客户,GMV = 商品交易总额。当然有用,但远远不够。
比如用户问:"哪些店最近卖得不好?""卖得不好"本身就可能是一套规则。有的企业定义为销售额低于区域平均,有的企业看连续三个月同比下降,还有的企业会同时看销售额、毛利率和客流。
所以,业务术语的高级形态,不只是词语映射,而是把企业内部的判断逻辑,也变成 AI 能理解的语义。到了这一步,智能问数才开始从"查一个数",真正走向"理解一个业务问题"。
七、三个语义放在一起,AI 才开始真正懂业务
再看一句很普通的话:"看看华东今年哪些大客户掉得比较厉害。"
对人来说,一句话。对 AI 来说,背后至少要完成三次翻译。
第一,理解业务术语:什么叫"大客户"?什么叫"掉得厉害"?第二,理解维度:"华东"包括哪里?客户按集团主体还是签约主体统计?第三,理解指标:到底比较销售额、订单额还是回款额?同比还是环比?
最后,才能形成一个真正可执行的数据问题。
所以:智能问数真正要补的,不是自然语言和 SQL 之间的距离,而是自然语言和企业业务规则之间的距离。
八、这也是 FineBI NEXT 这类 Data Agent 真正值得看的地方
理解到这里,再看 FineBI NEXT,会发现它真正要解决的,并不是"让大模型更会写 SQL",而是让 Agent 在企业已经治理好的数据环境里工作。
这两条路线差别很大。
如果 AI 直接面对数据库,它看到的是 cust_type = 3,业务人员看到的是重点客户;数据库里是 region_code = E03,业务人员说的是华东大区;数据库里是一个收入字段,业务真正关心的是公司统一口径的营业收入。
所以,企业真正应该交给 AI 的,不是一堆原始表,而是一套已经被解释过的数据世界。
FineBI NEXT 背后本身就有 BI 的数据模型、指标体系、权限和分析能力。Agent 做的,是在这些能力之上理解问题、调用数据、执行分析。这样一来:语义负责让 AI 不理解错,BI 底座负责让 AI 真正做得出来。这比单纯让大模型对着 Schema 猜,要可靠得多。
九、未来智能问数拼的,不是谁更会聊天
今天看智能问数 Demo,很容易比较这些东西:谁回答更快、谁生成的图更漂亮、谁说的话更像真人。
但企业真正应该问的是:同一个"销售额",所有人问出来是不是一个数字?"华东""重点客户""直营网点",AI 能不能理解准确?"大客户掉得厉害""库存有点高"这种业务语言,它听不听得懂?换一个部门提问,还能不能遵守原来的数据权限?AI 给出结论以后,能不能继续追到指标、模型和原始数据?
这些问题,才决定智能问数能不能真正进入生产环境。
所以未来真正拉开差距的,不只是大模型,而是谁能在企业内部建立一套完整、准确、可治理的业务语义体系。模型会越来越趋同,企业语义不会。
十、AI 越强,语义治理反而越重要
过去企业做 BI,指标不统一,最多是几张报表对不上。到了 Agent 时代,这个问题会被迅速放大。
以前"销售额"有三个口径,分析师还能主动找人确认。以后如果没有规则,AI 很可能直接选一个它认为最合理的。人遇到不确定会问,模型遇到不确定往往会猜。
以前一个指标错了,可能错一张报表。以后一个指标错了,所有调用这个指标的 Agent 都可能一起错。
所以,AI 并不会让数据治理变得不重要。恰恰相反,Agent 越往生产环境走,语义越会成为企业数据基础设施。
这也是 FineBI NEXT 这类产品真正有价值的地方。它不是绕过 BI 和数据治理,而是把已经治理好的指标、模型、权限和分析能力,进一步变成 Agent 可以理解和调用的企业语义环境。
结语:大模型懂中文之后,下一步是让它懂"公司话"
智能问数走到今天,一个越来越清楚的事实是:自然语言已经不是最难的部分,真正难的是自然语言背后的企业上下文。
用户说:"华东今年几个大客户掉得有点厉害,帮我看看原因。"
AI 想真正听懂,就必须知道:什么叫华东、什么叫大客户、什么叫掉得厉害、用什么指标判断、客户按什么口径统计、应该和哪个周期比较、数据从哪里来、用户有没有权限看、发现问题以后还应该从哪些维度继续分析。
这就是企业自己的"数据语言"。
指标语义告诉 AI 数字是什么,维度语义告诉 AI 数字属于谁,业务术语告诉 AI 业务人员到底在说什么。三者合在一起,Agent 才真正开始懂业务。
所以,智能问数下一阶段的竞争,表面上看是在卷 Agent,底下真正卷的,可能是一个更基础的问题:谁先把企业的数据和业务,变成 AI 真正能够理解的语言。