大模型懂中文之后,为什么还是听不懂你公司的"人话"?

零门槛、免安装!海量模板方案,点击即可,在线试用!

免费试用

大模型懂中文之后,为什么还是听不懂你公司的"人话"?

阅读人数:120预计阅读时长:8 min

大模型解决的是"听懂人话",企业语义解决的是"听懂这家公司的话"。

今天的大模型,已经很会说中文了。

你问:"帮我看看华中今年卖得怎么样?"它当然知道什么叫"华中",什么叫"今年",也知道"卖得怎么样"大概率是在问销售表现。

但问题是——它懂中文,不代表它懂你们公司。

"华中"到底包括哪些省份?"今年"按自然年,还是公司财年?"卖得怎么样"看销售额、回款额,还是毛利?如果销售额上涨 20%,毛利率却下降了 8 个百分点,这到底算好,还是不好?

到了这里你会发现:智能问数真正难的,从来不是把一句中文翻译成 SQL,而是怎么把模糊的人话,翻译成企业内部确定的数据语言。

免费试用

这中间,靠的就是语义。而且至少有三层:指标语义、维度语义、业务术语。少一层,AI 都可能回答得很流畅,但答的根本不是你想问的问题。

这也是现在看智能问数时,一个很容易被忽略的地方:AI 开始分析之前,有没有先把业务问题理解准确。

FineBI Next 的智能分析里,面对比较复杂的任务,可以先通过计划模式确认业务场景、指标口径、分析对象和输出要求,再生成具体的分析步骤;如果只是临时查数,也可以直接进入对话,并基于已有结果继续追问、下钻。

比如同样一句"看看今年华东销售情况",真正进入分析之前,首先要对齐的其实就是:"销售"按什么指标算,"华东"按什么范围算,"今年"按什么时间口径算。

所以智能问数真正需要补上的,并不只是模型理解自然语言的能力。更重要的是:在模型和企业数据之间,建立一层它能够理解、调用,并且遵循的业务语义。

接下来,就从这三层语义拆开看。

一、为什么模型越来越强,智能问数还是会答错?

过去几年,智能问数最常见的路径是 NL2SQL。流程很简单:用户提问,模型理解,生成 SQL,查询数据库,再把结果返回。Demo 看起来很漂亮,但一进真实企业,马上就复杂了。

比如用户问:"今年华东销售额最高的产品是什么?"

数据库里可能同时有:订单金额、合同金额、开票金额、回款金额、含税销售额、不含税销售额。到底哪个才是"销售额"?

再比如"客户数"。是签约客户、下单客户、付费客户,还是去重后的集团客户?数据库可以告诉 AI 字段叫什么,但数据库不会告诉 AI:"公司经营会上讲的客户数,默认指本期产生有效收入、排除内部交易后的独立客户主体。"

这才是企业真正的数据语言。

所以,智能问数有一个非常核心的矛盾:大模型掌握的是语言概率,企业需要的是业务定义确定性。模型可以猜,经营决策不能靠猜。

二、第一层:指标语义——这个数字到底代表什么?

智能问数最容易出错的,首先是指标。

比如:"本月销售额是多少?"听起来只是在查一个数,实际上背后可能涉及:按订单还是收入确认、是否含税、是否包含退货、是否剔除内部交易、汇率按哪个时间点、数据截止到哪一天。

所以,一个真正能被 AI 使用的指标,不能只有一个名字。它至少还要告诉 AI:怎么定义、怎么算、统计谁、什么时候算、从哪里来。

这就是指标语义。它回答的是:"这个数字到底是什么?"

如果没有指标语义,AI 只能在一堆字段中猜哪个更像"销售额"。字段名猜对了,不代表业务口径对了。而企业真正需要的是:无论谁问"销售额",拿到的都是公司已经确认的那个销售额。这才叫可用。

三、第二层:维度语义——这个数字到底在看谁?

只有指标,还不够。因为真实的业务问题,很少只是"销售额是多少?",更常见的是:"华东大客户今年新产品销售额同比怎么样?"

免费试用

这里除了销售额,还有:华东、大客户、今年、新产品、同比。它们决定的不是"算什么",而是对谁算、在哪算、什么时候算、按什么角度看。

比如"华东"。A 公司可能是上海、江苏、浙江、安徽,B 公司可能还包括福建、江西。甚至同一家公司里,销售体系和供应链体系对"华东"的划分都可能不同。

再比如"消费电子事业部利润怎么样?",背后可能是一整套组织层级:集团、事业群、事业部、产品线、产品。

所以:指标决定数字是什么,维度决定数字属于谁。指标错了,答案错;维度错了,答案一样错。

四、真正难的,不是层级,而是业务关系

维度语义最麻烦的地方,其实不是"省下面有市",而是企业真实的业务关系。

比如用户问:"哪些客户最近有流失风险?"数据库里可能同时存在:CRM 客户、ERP 客户、签约主体、开票客户、集团客户、门店客户。一个集团客户,可能有十几个签约主体。那到底算一个客户,还是十几个?

这不是 SQL 能决定的,这是业务定义。

再比如产品改名、SKU 合并、产品线调整、组织归属变化。今年属于 A 产品线的 SKU,去年可能还属于 B 产品线。如果 AI 不知道这些关系,它仍然能生成一条语法正确的 SQL,图也能画得很好看,但结论可能已经错了。

所以:技术上查询成功,不代表业务上回答正确。这才是企业级智能问数真正难的地方。

五、第三层:业务术语——业务人员根本不会按数据库说话

还有一层更麻烦。真实业务人员,很少会按照指标中心里的标准名称提问。

他们会说:"最近华南几个大 KA 掉得有点厉害,帮我看看。"

这里没有标准字段。"大 KA"是什么意思?"掉得厉害"怎么算?"帮我看看"又要看什么?

但一个熟悉业务的分析师,通常能马上理解。"大 KA"可能是年度采购额超过某个阈值的重点客户;"掉得厉害"可能是最近三个月采购额明显低于过去半年均值;"帮我看看",通常意味着继续拆产品、订单频率、客单价、区域,找到原因。

这就是业务术语。

每家公司都有自己的"黑话"。制造业会说良率、齐套率、呆滞料、OTD;零售会说动销、店效、坪效、爆品、滞销;互联网会说 DAU、留存、GMV、LTV。

更麻烦的是:同一个词,不同公司的定义还不一样。"大客户"是年销售 500 万以上,还是 1000 万以上?"活跃客户"是 30 天有交易,还是 90 天?"爆品"按销量、销售额,还是增长率判断?

这些东西,大模型无法从互联网里学到确定答案。因为问题不是"行业一般怎么定义",而是"你们公司到底怎么定义"。

六、业务术语,也不只是做个同义词词典

很多人一说业务术语,就想到同义词。比如:KA = 重点客户,GMV = 商品交易总额。当然有用,但远远不够。

比如用户问:"哪些店最近卖得不好?""卖得不好"本身就可能是一套规则。有的企业定义为销售额低于区域平均,有的企业看连续三个月同比下降,还有的企业会同时看销售额、毛利率和客流。

所以,业务术语的高级形态,不只是词语映射,而是把企业内部的判断逻辑,也变成 AI 能理解的语义。到了这一步,智能问数才开始从"查一个数",真正走向"理解一个业务问题"。

七、三个语义放在一起,AI 才开始真正懂业务

再看一句很普通的话:"看看华东今年哪些大客户掉得比较厉害。"

对人来说,一句话。对 AI 来说,背后至少要完成三次翻译。

第一,理解业务术语:什么叫"大客户"?什么叫"掉得厉害"?第二,理解维度:"华东"包括哪里?客户按集团主体还是签约主体统计?第三,理解指标:到底比较销售额、订单额还是回款额?同比还是环比?

最后,才能形成一个真正可执行的数据问题。

所以:智能问数真正要补的,不是自然语言和 SQL 之间的距离,而是自然语言和企业业务规则之间的距离。

八、这也是 FineBI NEXT 这类 Data Agent 真正值得看的地方

理解到这里,再看 FineBI NEXT,会发现它真正要解决的,并不是"让大模型更会写 SQL",而是让 Agent 在企业已经治理好的数据环境里工作。

这两条路线差别很大。

如果 AI 直接面对数据库,它看到的是 cust_type = 3,业务人员看到的是重点客户;数据库里是 region_code = E03,业务人员说的是华东大区;数据库里是一个收入字段,业务真正关心的是公司统一口径的营业收入。

所以,企业真正应该交给 AI 的,不是一堆原始表,而是一套已经被解释过的数据世界。

FineBI NEXT 背后本身就有 BI 的数据模型、指标体系、权限和分析能力。Agent 做的,是在这些能力之上理解问题、调用数据、执行分析。这样一来:语义负责让 AI 不理解错,BI 底座负责让 AI 真正做得出来。这比单纯让大模型对着 Schema 猜,要可靠得多。

九、未来智能问数拼的,不是谁更会聊天

今天看智能问数 Demo,很容易比较这些东西:谁回答更快、谁生成的图更漂亮、谁说的话更像真人。

但企业真正应该问的是:同一个"销售额",所有人问出来是不是一个数字?"华东""重点客户""直营网点",AI 能不能理解准确?"大客户掉得厉害""库存有点高"这种业务语言,它听不听得懂?换一个部门提问,还能不能遵守原来的数据权限?AI 给出结论以后,能不能继续追到指标、模型和原始数据?

这些问题,才决定智能问数能不能真正进入生产环境。

所以未来真正拉开差距的,不只是大模型,而是谁能在企业内部建立一套完整、准确、可治理的业务语义体系。模型会越来越趋同,企业语义不会。

十、AI 越强,语义治理反而越重要

过去企业做 BI,指标不统一,最多是几张报表对不上。到了 Agent 时代,这个问题会被迅速放大。

以前"销售额"有三个口径,分析师还能主动找人确认。以后如果没有规则,AI 很可能直接选一个它认为最合理的。人遇到不确定会问,模型遇到不确定往往会猜。

以前一个指标错了,可能错一张报表。以后一个指标错了,所有调用这个指标的 Agent 都可能一起错。

所以,AI 并不会让数据治理变得不重要。恰恰相反,Agent 越往生产环境走,语义越会成为企业数据基础设施。

这也是 FineBI NEXT 这类产品真正有价值的地方。它不是绕过 BI 和数据治理,而是把已经治理好的指标、模型、权限和分析能力,进一步变成 Agent 可以理解和调用的企业语义环境。

结语:大模型懂中文之后,下一步是让它懂"公司话"

智能问数走到今天,一个越来越清楚的事实是:自然语言已经不是最难的部分,真正难的是自然语言背后的企业上下文。

用户说:"华东今年几个大客户掉得有点厉害,帮我看看原因。"

AI 想真正听懂,就必须知道:什么叫华东、什么叫大客户、什么叫掉得厉害、用什么指标判断、客户按什么口径统计、应该和哪个周期比较、数据从哪里来、用户有没有权限看、发现问题以后还应该从哪些维度继续分析。

这就是企业自己的"数据语言"。

指标语义告诉 AI 数字是什么,维度语义告诉 AI 数字属于谁,业务术语告诉 AI 业务人员到底在说什么。三者合在一起,Agent 才真正开始懂业务。

所以,智能问数下一阶段的竞争,表面上看是在卷 Agent,底下真正卷的,可能是一个更基础的问题:谁先把企业的数据和业务,变成 AI 真正能够理解的语言。

【AI声明】本文内容通过大模型匹配关键字智能生成,仅供参考,帆软不对内容的真实、准确或完整作任何形式的承诺。如有任何问题或意见,您可以通过联系blog@fanruan.com进行反馈,帆软收到您的反馈后将及时答复和处理。

若想了解更多关于FineBI的相关信息,您可以访问下方链接,或点击下方组件,快速获得帆软为您提供的企业大数据分析平台建设建议、免费的FineBI试用和同行业自助智能分析标杆案例学习参考。

了解更多Finebi信息:www.finebi.com

帆软FineBI一站式大数据分析平台在线试用!

免费下载

评论区

暂无评论
帆软企业数字化建设产品推荐
报表开发平台免费试用
自助式BI分析免费试用
数据可视化大屏免费试用
数据集成平台免费试用