当前位置：首页 > 科技 > 软件

使用Python从图像中提取表格

来源：责编：时间：2023-11-15 17:17:17 192观看

导读大约一年前，我被分配任务从文件中提取和结构化数据，主要是包含在表格中的数据。我之前对计算机视觉没有了解，并且很难找到一个合适的“即插即用”的解决方案。当时可选的方案要么是基于最新神经网络（NN）的解决方案，这些解决

大约一年前，我被分配任务从文件中提取和结构化数据，主要是包含在表格中的数据。我之前对计算机视觉没有了解，并且很难找到一个合适的“即插即用”的解决方案。当时可选的方案要么是基于最新神经网络（NN）的解决方案，这些解决方案庞大而繁琐，要么是基于OpenCV的较简单的解决方案，但不够一致。

受现有OpenCV脚本的启发，我开发了一种简单而一致的方法来提取表格，并将其制作成一个开源的Python库：img2table。

链接：https://github.com/xavctn/img2table

我的库有什么作用？

与深度学习解决方案相比，这个轻量级的包不需要训练和最小化参数化。它提供了以下功能：

识别图像和PDF文件中的表格，包括在表格单元级别的边界框。
通过支持OCR服务/工具（Tesseract、PaddleOCR、AWS Textract、Google Vision和Azure OCR目前支持）来提取表格内容。
处理复杂的表格结构，如合并单元格。
实现纠正图像的倾斜和旋转的方法。
提取的表格以一个简单的对象形式返回，包括一个Pandas DataFrame表示。
将提取的表格导出为Excel文件的选项，保留其原始结构。

如何使用它？

您可以通过pip安装该库，然后就可以使用了：

pip install img2table

在文档中识别表格只需调用一个函数：

from img2table.document import Image# Instantiation of the imageimg = Image(src="myimage.jpg")# Table identificationimg_tables = img.extract_tables()# Result of table identificationimg_tables[ExtractedTable(title=None, bbox=(10, 8, 745, 314),shape=(6, 3)), ExtractedTable(title=None, bbox=(936, 9, 1129, 111),shape=(2, 2))]

上述示例中使用的图像

如果我们想提取表格的内容，则需要使用OCR工具，可以按如下方式实现：

from img2table.document import PDFfrom img2table.ocr import TesseractOCR# Instantiation of the pdfpdf = PDF(src="mypdf.pdf")# Instantiation of the OCR, Tesseract, which requires prior installationocr = TesseractOCR(lang="eng")# Table identification and extractionpdf_tables = pdf.extract_tables(ocr=ocr)# We can also create an excel file with the tablespdf.to_xlsx('tables.xlsx',            ocr=ocr)

从PDF中提取的表格示例

最后，在简单的情况下，可以通过设置`borderless_tables`参数来执行“无边框”表格的提取。这允许检测那些单元格不需要完全被边框包围的表格。

“无边框”表格提取示例

这就是全部！实际上，库并没有太多复杂的东西，因为目标是尽可能简化，以避免其他可用解决方案可能带来的复杂性。

有关更详细的文档和示例，请查看项目的GitHub页面：https://github.com/xavctn/img2table

底层实现

所有图像处理都使用OpenCV和opencv-python库完成。然而，这仍然相当基础。

算法的骨架是Hough变换，它能够识别图像中的线条，使我们能够检测图像的水平和垂直线条。

cv2.HoughLinesP(img, rho, theta, threshold, None, minLinLength, maxLineGap)

之后，对线条进行一些处理以从线条中识别单元格，然后从单元格中识别表格。

实现算法的简化表示

大多数计算使用Polars进行，以实现良好的性能和速度。

本文链接：//www.dmpip.com//www.dmpip.com/showinfo-26-25992-0.html使用Python从图像中提取表格

声明：本网页内容旨在传播知识，若有侵权等问题请及时与本网联系，我们将在第一时间删除处理。邮件：2376512515@qq.com

上一篇： C语言结构体用法详解

下一篇：由“点”向“面”！简析新一代WAF的理念与应用

标签：

热门焦点

小米降噪蓝牙耳机Necklace分享：听一首歌读懂一个故事

在今天下午的小米Civi 2新品发布会上，小米还带来了一款新的降噪蓝牙耳机Necklace，我们也在发布结束的第一时间给大家带来这款耳机的简单分享。现在大家能见到最多的蓝牙耳机
Redmi Buds 4开箱简评：才199还有降噪可以无脑入

在上个月举办的Redmi Note11T Pro系列新机发布会上，除了两款手机新品之外，Redmi还带来了两款TWS真无线蓝牙耳机产品，Redmi Buds 4和Redmi Buds 4 Pro，此前我们在Redmi Note11T
掘力计划第 20 期：Flutter 混合开发的混乱之治

在掘力计划系列活动第20场，《Flutter 开发实战详解》作者，掘金优秀作者，Github GSY 系列目负责人恋猫的小郭分享了Flutter 混合开发的混乱之治。Flutter 基于自研的 Skia 引擎
JavaScript学习 -AES加密算法

引言在当今数字化时代，前端应用程序扮演着重要角色，用户的敏感数据经常在前端进行加密和解密操作。然而，这样的操作在网络传输和存储中可能会受到恶意攻击的威胁。为了确保数据
19个 JavaScript 单行代码技巧，让你看起来像个专业人士

今天这篇文章跟大家分享18个JS单行代码，你只需花几分钟时间，即可帮助您了解一些您可能不知道的 JS 知识，如果您已经知道了，就当作复习一下，古人云，温故而知新嘛。现在，我们就开始今
WebRTC.Net库开发进阶，教你实现屏幕共享和多路复用！

WebRTC.Net库：让你的应用更亲民友好，实现视频通话无痛接入！除了基本用法外，还有一些进阶用法可以更好地利用该库。自定义 STUN/TURN 服务器配置WebRTC.Net 默认使用 Google 的
小米MIX Fold 3配置细节曝光：搭载领先版骁龙8 Gen2+罕见5倍长焦

这段时间以来，包括三星、一加、荣耀等等有不少品牌旗下的最新折叠屏旗舰都得到了不少爆料，而小米新一代折叠屏旗舰——小米MIX Fold 3此前也屡屡被传
由于成本持续增加，笔记本产品价格预计将明显上涨

根据知情人士透露，由于材料、物流等成本持续增加，笔记本产品价格预计将在2021年下半年有明显上涨。进入6月下旬以来，全球半导体芯片缺货情况加剧，显卡、处理器
电博会上海尔智家模拟500平大平层，还原生活空间沉浸式体验

电博会为了更好地让参展观众真正感受到智能家居的绝妙之处，海尔智家的程传岭先生同样介绍了展会上海尔智家的模拟500平大平层，还原生活空间沉浸式体验。程传