企业知识库里的Excel,不能简单转成Markdown:一套表格数据治理方法
- 2026-09-22 03:25:08
点击上方蓝字,关注我们
企业知识库里的Excel,不能简单转成Markdown
一套表格数据治理方法 · 先判断角色,再决定怎么入库
表格数据治理 · 系列第3篇
📦 8 PARTS + CONCLUSION
👉 滑动
PART 01
数字都对,答案却错
示例拆解
PART 02
先判断Excel角色
四种类型
PART 03
知识藏在关系里
表头与合并单元格
PART 04
空白≠没有数据
六种含义
PART 05
公式结果≠规则
区分四类内容
PART 06
Markdown不是终点
按问题选通道
PART 07
六步治理方法
从识别到验收
PART 08
入库前10问
验收清单
PART ///
写在最后
四个判断
“Excel只是一个文件容器,不是一种统一的知识类型。企业要先判断它装的是什么,再决定怎么解析、清洗和入库。
前面两篇文章,我们分别聊了文件解析和文本清洗。
到了Excel,很多人会自然沿用同一套思路:先把工作表解析成文本,再转成Markdown表格,之后切分、向量化、入库。
这个流程处理简单的产品参数表、服务对照表,有时确实能用。但一旦遇到合并单元格、多级表头、公式、隐藏行、跨表引用,或者几万行明细数据,问题马上就会出现。
文件明明解析成功了,单元格里的文字和数字也都提取出来了,可知识库回答时,还是会把单位弄错、把区域混淆、把公式结果当成固定规则,甚至从一张已经过期的价格表里找到答案。
原因并不复杂。
Excel里的知识,很多时候并不写在某一个单元格里,而是藏在单元格之间的关系里。
表名是什么,表头分几层,单位写在哪里,空白代表什么,数字是人工输入还是公式计算,当前工作表又引用了哪一张基础数据表——这些信息共同决定了一个数字到底是什么意思。
所以,我对Excel进入企业知识库的第一个判断是:
01 · Excel最容易出现的情况:数字都对,答案却错了
我们先看一个假设示例。
某企业有一张《2026年华东地区新客户价格政策表》,其中一部分内容如下:
表格上方还有三条说明:
单位:人民币元/套
有效期:2026年1月1日至2026年12月31日
适用对象:华东地区首次签约的企业客户
在人眼看来,这张表不难理解。
第二行产品线留空,通常是因为它沿用了上一行的“A系列”;“适用区域”留空,也可能代表继续沿用“华东”;“同上”指的是9折;最低成交价可能来自公式,也可能是审批后的固定值。
但解析工具拿到的,首先只是一个个单元格。
如果系统把每一行直接转成一句话,第二行可能变成:
产品线为空,型号A200,标准价15000,新客户折扣同上,最低成交价13200,适用区域为空,需销售总监审批。
这句话没有乱码,每个值也可能都提取正确,却几乎无法独立使用。
“同上”到底是多少?区域为空代表全国适用,还是继承上一行?15000的单位是什么?价格在哪个时间段有效?它适用于老客户吗?
只要这些条件没有和数据绑定,后面切分得再精细、向量模型再强,也无法稳定还原原表的业务含义。
这也是表格与普通文本最大的差别。
普通文本的含义主要跟随语句展开;表格的含义则同时依赖行、列、表头、标题、注释、格式和计算关系。
解析只把单元格取出来,还不等于把表格读懂了。
02 · 先别急着转Markdown,先判断Excel在业务中扮演什么角色
企业里的Excel看起来都是行和列,实际承担的任务可能完全不同。
我建议在治理前,至少把它们分成四类。
这四类表格的处理方式不能混用。
规则型Excel通常适合整理成知识。比如不同产品对应什么服务标准,什么客户可以申请什么折扣。它们的规模不一定大,主要价值在于解释业务规则。
明细型Excel则不同。几万条订单记录不是几万条“文档知识”。用户问“某客户过去12个月买过哪些产品”,真正需要的是按客户、时间和状态进行精确查询,而不是依靠语义相似度从大量文本片段中猜测。
统计型Excel不能只保留最终数字。比如“华东区续费率为72%”,如果没有统计周期、客户范围、分母定义和数据更新时间,这个数字很快就会失去解释力。
计算型Excel最容易被误处理。报价总额可能只是几个输入项和一套公式在当时条件下生成的结果。把结果转成文字存进知识库,却丢掉公式和输入条件,相当于只保存了计算器屏幕上的数字,没有保存怎么算出来的。
因此,企业看到一个Excel文件时,先不要问“怎么切分”,而要先问:
这张表是在表达规则、保存记录、汇总指标,还是执行计算?
类型判断错了,后面的技术流程越自动化,错误就会复制得越快。
03 · 表格的知识,不只存在于单元格文本里
处理普通文档时,我们经常关注正文、标题、段落和列表。
处理Excel,还要多看几层关系。
01表名和工作表名称,决定数据属于什么场景
“价格表”与“2026年华东区新客户内部最低成交价”看起来都可以当标题,但两者提供的业务边界完全不同。
同一个工作簿里,也可能同时存在“当前政策”“历史政策”“基础参数”“测算结果”几个工作表。只提取单元格内容,不保留工作表身份,很容易让不同用途的数据混在一起。
02多级表头,决定列与列之间如何组合
企业表格经常使用两层甚至三层表头。
比如第一层是“产品版本”,第二层是“标准版、专业版、旗舰版”;另一组第一层是“服务方式”,第二层是“在线、上门、驻场”。
如果解析后只留下第二层表头,“标准版”和“在线”就成了同一层级的孤立词,系统不知道它们分别属于哪个维度。
03合并单元格,往往表示共享条件
合并单元格不只是排版美化。
一个纵向合并的“华东区域”,可能表示下面20行产品都适用华东;一个横向合并的“单位:万元”,可能约束右侧多个金额字段。
简单取消合并而不补全作用范围,会让后续行失去条件;机械地把内容填满所有单元格,又可能把原本只用于展示的标题误当成数据值。
所以“拆合并单元格”只是操作,识别它表达的关系才是治理。
04颜色、批注和隐藏内容,可能承载业务状态
有些企业用红色表示停用,黄色表示待确认,灰色表示历史项;也有人把审批说明写在批注里,把中间计算过程放在隐藏列中。
这些做法不够标准,但它们确实存在。
解析系统如果只读取可见文本,可能漏掉重要信息;如果把所有隐藏内容都当正式知识,又可能把辅助计算、废弃字段和内部备注一起放出来。
正确做法不是默认保留或默认删除,而是先识别这些格式在当前企业中的含义,再把真正有用的状态转换成明确字段。
例如,把红色字体从视觉信号转换为:
状态:已停用
是否允许召回:否
格式适合给人看,字段才适合让系统稳定执行。
04 · 空白单元格,不能一律理解成“没有数据”
文本清洗中,多余空行通常可以直接删除。Excel里的空白单元格要谨慎得多。
它至少可能表示六种情况:
本条记录确实没有数据
该字段不适用于当前对象
录入人员尚未填写
延续上一行或上一组的值
公式暂时返回空字符串
内容被人为清除,但业务状态没有同步更新
这些含义对应的处理方式完全不同。
“不适用”可以作为一个确定状态;“尚未填写”代表数据不完整;“沿用上一行”需要补全上下文;公式返回空值则要检查触发条件。
如果清洗规则把所有空白都替换成0,库存为空可能被理解为库存为零;把所有空白都向下填充,也可能让原本不适用的产品继承了上一行价格。
所以企业需要为关键字段建立空值规则:这个字段允许为空吗,空白分别代表什么,是否可以自动补全,什么情况必须人工复核。
没有业务规则支持的填充,只是在用确定的数字掩盖不确定的数据。
05 · 公式结果,不等于业务规则
Excel中一个显示为“13,200”的单元格,背后可能有三种来源:人工录入、公式计算,或者从其他工作表引用。
这三种来源在人眼看到的结果一样,对知识治理的含义却不同。
假设最低成交价的计算逻辑是:
= 标准价 × 新客户折扣 + 区域调整项
如果知识库只保存最终结果13,200,它无法回答:
标准价调整后,最低成交价是否应该同步变化
华南区域是否也适用这个结果
折扣和区域调整项分别来自哪里
这个数字是政策下限,还是某次报价的计算结果
对计算型Excel,至少要区分四类内容:
输入值:谁提供的原始参数
计算公式:参数之间怎样运算
引用关系:公式依赖哪些工作表或外部数据
显示结果:在当时输入条件下得到什么数字
如果公式本身是一条稳定业务规则,可以把它整理成可解释的知识,同时保留原公式和版本。
如果结果会随着库存、汇率、税率、折扣或客户条件变化,就不适合把某一次结果当成长期有效的知识。更稳妥的方式,是让知识库解释规则,再调用实时数据或计算服务生成答案。
大模型擅长理解用户在问什么,但不应该替代需要精确执行的公式计算。
06 · Markdown很干净,但它并不是所有Excel的终点
Markdown适合表达标题、段落、列表和规模不大的规则表。它结构清晰,也方便后续切分。
但“格式干净”和“业务适用”是两回事。
一张20行的服务权益表,转成Markdown后,人和模型都比较容易理解;一张20万行的订单明细表,转成Markdown只会得到一个巨大的文本文件。
文本越多,不代表知识越完整。对于需要精确筛选、聚合、排序和实时更新的数据,结构化查询往往比向量检索更合适。
可以用一个简单标准来判断:
企业知识库不必把所有信息都塞进向量库。
真正可用的系统,往往会同时使用文档检索、关键词检索、数据库查询和业务接口。用户看到的可能仍然是一个问答入口,背后却应该根据问题类型选择不同的数据通道。
07 · 一套可落地的六步Excel治理方法
前面的判断如果要落到项目里,我建议把Excel入库拆成六步。
01识别表格角色,决定是否进入知识库
先给每个工作簿和工作表分类:规则型、明细型、统计型还是计算型。
同时确认它服务什么业务场景,谁维护,多久更新一次,当前是否有效,是否包含敏感信息。
这一步的结果不是简单的“入库”或“不入库”,而是确定它的处理路线。
规则内容可以进入知识库;大规模明细数据进入数据库查询通道;计算逻辑交给规则或计算服务;统计报表保留口径,并把有长期价值的分析结论整理成知识。
02恢复表格结构,不要急着生成文本
解析后先检查:
工作簿和工作表名称是否保留
表格标题、说明和数据区域是否正确识别
多级表头有没有恢复成完整字段名
合并单元格的作用范围是否明确
单位、币种、时间范围是否与对应字段绑定
隐藏行列、批注和颜色是否包含业务含义
公式、引用和显示值是否分别提取
跨工作表关系是否仍然存在
如果这些关系已经在解析环节丢失,不要直接进入清洗。应该回到原文件重新解析,必要时保留原表坐标和单元格位置,供人工复核。
03把每条记录变成可以独立理解的内容
向量检索召回的通常是局部内容,不会自动把整张表的所有上下文一起带回来。
因此,适合知识化的表格记录,需要补全它所依赖的表头、单位、时间和共享条件。
假设业务负责人已经确认,空白的产品线和适用区域确实沿用上一行,前面的A200记录可以整理成:
2026年1月1日至12月31日,华东地区首次签约的企业客户购买A系列A200型号时,标准价为人民币15,000元/套,新客户折扣为9折,最低成交价为13,200元/套;该条记录标注“需销售总监审批”,审批触发条件待业务部门确认。
注意,这段文字只能根据原表中已经确认的关系生成。
如果“空白代表沿用上一行”没有得到业务确认,就不能靠模型自行补全。无法确定的内容要标记待复核,而不是为了句子完整而猜一个答案。
04清洗并标准化关键字段
完成结构恢复后,再处理数据质量:
去除完全空白的无效区域和重复模板
统一日期、金额、币种和计量单位
统一产品、部门、地区和客户类型的命名
区分0、空值、不适用、待填写和未知
识别重复记录与冲突记录
标记失效、停用、草稿和待审批内容
对金额、日期、型号和公式进行重点复核
标准化的目的,是让同一业务对象拥有稳定表达,不是把不同含义强行改成同一种写法。
例如,“元/套”和“人民币元/套”可以统一;“含税价”和“未税价”不能因为都是价格就合并成一个字段。
05按问题类型选择存储和检索方式
治理后的结果可以进入不同位置:
规则说明进入文档知识库
版本、区域、产品、权限和有效期进入元数据
大规模明细进入数据库或数仓
公式和参数进入计算服务或规则引擎
原始Excel作为证据保留
高风险或无法判断的记录进入人工复核区
同一张Excel也可以被拆成多条路线。
比如报价模板中的“折扣审批规则”进入知识库,“客户名称和本次采购数量”属于业务数据,“报价公式”交给计算服务,最终报价单则作为一次业务记录留档。
这比把整个文件统一转成Markdown更复杂,但它更接近企业真实的数据使用方式。
06建立来源和验收机制
每条关键知识都应该能够回到原始证据,至少保留:
来源文件
工作表名称
表格名称或数据区域
原始行列位置
版本与有效期
责任部门
更新时间
权限等级
处理状态
来源定位不一定都要展示给最终用户,但系统必须保留。
当业务人员质疑一个价格、参数或规则时,团队需要快速确认:它来自哪张表、哪个版本、哪个单元格,清洗过程中做过什么转换。
不能追溯的知识,出了问题就只能重新猜一次。
08 · Excel入库完成,至少要检查这10个问题
系统显示“解析成功”或“生成多少知识片段”,不代表表格已经可以使用。
正式入库前,可以用下面这组问题验收:
01工作簿、工作表和表格标题是否完整保留?
02多级表头是否恢复成了没有歧义的字段名?
03合并单元格表达的共享条件是否正确绑定到相关记录?
04空白单元格是否区分了未知、不适用、待填写和沿用上值?
05金额、单位、币种和时间范围是否与具体数据绑定?
06公式、输入值、引用关系和显示结果是否已经区分?
07隐藏行列、颜色、批注中是否存在尚未处理的业务信息?
08跨工作表引用和版本关系是否仍然可以追溯?
09明细数据、计算任务是否被错误地全部向量化?
10关键答案能否定位到原文件、工作表和原始单元格?
对于普通产品对照表,可以采用规则检查加人工抽样。
对于价格、合同金额、财务指标、库存和对外承诺,验收标准应该更严格。因为系统把一个词理解错,可能只是召回效果下降;把币种、单位或有效期理解错,可能直接变成业务风险。
/// · 写在最后
企业处理Excel时,最容易被“格式统一”带偏。
好像只要把Excel转成Markdown,表格就变成了适合大模型使用的干净文本。可真正决定数据含义的,往往不是格式,而是表头、单位、条件、公式、版本和记录之间的关系。
Markdown可以是规则型表格的一种输出形式,却不应该成为所有Excel的默认终点。
面对一张表,企业更应该先完成四个判断:
它是在表达规则,还是保存明细?
它是在汇总统计,还是执行计算?
哪些内容适合被检索,哪些数据必须精确查询?
哪些结果可以长期保存,哪些必须根据实时条件重新计算?
这些问题弄清楚以后,解析、清洗、切分和入库才有正确的方向。
所以,Excel进入企业知识库的第一步,不是选择转换工具,也不是设置切分长度。
先判断这张表在业务里究竟是什么。
下一篇,我们继续聊图片、图表和流程图。
这类资料比Excel更进一步:很多信息根本没有直接写成文本,而是藏在位置、连线、颜色和图形关系里。OCR可以识别文字,但识别出文字,仍然不等于读懂一张图。
一句话总结
Excel进入企业知识库的第一步,不是选择转换工具,也不是设置切分长度,而是先判断这张表在业务里究竟是什么。
我是 小明,企业AI 落地顾问。不讲技术黑话,只聊 AI 落地的真实路径,欢迎带着你的企业AI落地困扰找我聊🤝