一键提取PDF电子发票明细数据导出到EXCEL,本地浏览器单网页识别不上传,速度快准确率高【第二版】
↑↑第一版的提取工具,很多人测试过都反馈很快,也能满足大部分只要汇总数据的需求。但有部分朋友留言希望可以提取里面的明细数据。于是,趁热打铁,根据手上的PDF发票样本并结合第一版的功能,一个网页小白通过AI手搓了第二版提取工具。由于测试的样本文件有限,所以提取的效果可能会有差异,理论上PDF电子版发票应该都可以提取到明细数据。第二版长这样,左侧是文件上传或拖入区域,右侧是识别结果。操作同样简单,文件拖入或上传后,点击开始识别,稍等片刻就能完成。上传的文件建议是PDF电子版发票文件,识别准确率高,速度快。部分清晰的图片扫描件也可以拖入识别,但会有一些的误差。导出后的表格分为两个工作表,一个是汇总表,一个是明细表。汇总表,包括文件名,号码,日期,购销双方信息,以及价税金额等明细表,包括关联的文件名,号码日期等信息,以及最基础的 项目名称、规格型号,数量单价金额,税率税额。这个工具同样只是一个单网页文件,用64位的浏览器打开就能正常操作。这个工具本身与表格、VBA都没有关联。那么,在没有任何JS经验的前提下,为什么会跨界手搓这个工具呢?主要是因为看到一位大神说是用AI制作出来的,于是,在分析了第一版的功能后,也尝试组织了相关的制作提示词,发给了元宝、灵犀等AI工具,由AI生成了基本框架和大部分的提取流程。在一开始时,测试的结果不尽人意,AI给出的很多提取规则都是很理想化的,与实际提取内容相差太远。于是,本着研究的心态,把每一个环节的代码都读了一遍,并逐段代码进行测试。很惭愧,一开始完全不知道怎么调试,也不知道每一步的运行结果,都是通过AI问答和提供的示例不断测试,才摸着点门道。另外,PDFJS的提取结果,看上去都是一堆乱序的文字,提取汇总数据时,还能通过正则式大概提取出来,但明细就完全没有头绪。后来,通过参考其他人对PDFJS的用法,对提取出来的原始文本做了比较大的调整,把看上去比较乱的一堆文字,利用识别出来的坐标数据,进行重新组合和排序,最终实现按一定的规则展现全部内容,并能方便利用正则表达式识别出来。从开始修改到完成全部规则的设定,花费了好几天时间。对于JS高手来说,这些应该不算什么大难题,但对于跨界的我来说,这个确实是一个新的挑战,也看到了AI的强大!记得有一句话是这么说的,原话忘记了,但大概意思是,AI技术平权,很多不可思议的事情都在发生着。我觉得确实是这样。这个版本同样放在 “阅读原文”里,有需要的就测试一下吧,用得上就拿去用,也可以像我一样,按着自己的需求,手搓一个。