其实我一直都不明白,为什么有人宁愿手敲表格,也不试试图片直接转成Excel?
直到有个粉丝找到我,找我领了一个表格合并工具。这里偷偷告诉你,工具都是用workbuddy写出来的,其实我是觉得写工具很快,只是缺少想法,如果你也愿意把你的想法分享给我,那么请你一定要关注我,我也愿意给你写一些小的工具。
我写的工具可以帮到他我非常的开心,我也希望我的一个小小的举动可以帮到更多的人。如果你也需要这样一个工具,可以去我的网盘自己下载一下,网盘在资料专区可以获取到。
这里我放一个我的资料网盘的卡密:DD05-99A4-01EB-CF52


快速开始
1. 双击 `dist/表格截图转Excel.exe` 启动程序。
2. 在「API 设置」里点击 **「智谱 GLM-4V」** 预设,填入你的 API Key,点击 **保存配置**。
- API Key 来自 https://open.bigmodel.cn → API Key 管理
- 默认模型:`glm-4v-flash`(免费/低价,识别够用;想要更强可改为 `glm-4v-plus`)
3. 点击 选择图片/PDF,上传你的表格截图或 PDF 文件:
图片(png/jpg/jpeg/webp/bmp/gif):直接识别。
PDF:程序按页渲染成图片并逐页调用视觉模型识别,所有页结果合并到同一张 Excel 表,状态栏会显示页数。
4. 点击 **识别表格**,等待模型返回结果。
5. 点击 **导出 Excel**,保存 `.xlsx` 文件。
一句话总结:传统方案 = OCR 抠字 + 规则拼表格;这个方案 = 直接让多模态大模型理解整张图并输出结构化数据,省掉了最难的"表格结构还原"环节,代价是每次识别要走一次 API 请求。



https://open.bigmodel.cn/api/paas/v4glm-4v-flasha782...vNBj)。
这是整个程序的灵魂,也是它和传统 OCR 工具最大的不同:
glm-4v-flash),这类模型本身就能"看"图片、理解里面的结构。{"model": "glm-4v-flash","messages": [{"role":"system","content":"你是一个表格识别助手,请只输出 CSV..."},{"role":"user","content":[{"type":"text","text":"把这张图里的表格转成 CSV"},{"type":"image_url","image_url":{"url":"data:image/png;base64,xxxx"}}]}]}
关键点在于 image_url 字段——这就是"把图直接喂给模型"的方式。DeepSeek 的纯文本 API 没有这个字段,所以当初我们说它不能"看"图,要换成智谱/通义这类视觉模型。
config.json,不联网上传,所以你之前要填智谱 Key 才能用。
这里我也放一个我的资料网盘的卡密:FD42-B90B-4150-2E86
关注我后面我也会经常在公众号文章和留言区赠送卡密
希望卡密可以帮你获取到你想要的资料
如果你在工作和学习中遇到难题,亦或是想借助工具提高一下我们平时的
工作效率,可以把你的想法发给我,也可以在留言区讨论。
指不定我的下一篇公众号文章就是分享你的想法。
行文至此,感谢你认真看完!


我始终只是在路上摸索的学生,不懂便查,不会便学,把所有踩过的坑整理成文分享给你。
如果你也喜欢这份朴素的分享,不妨点个关注,设为星标,不错过每一篇实操干货。
一生只是一名学生,前路漫漫,我们一同求知成长。