当前位置：首页 > news >正文

transformers microsoft--table-transformer 表格识别

news 2025/7/3 13:02:58

一、安装包

pip install transformers
pip install torch
pip install SentencePiecepip install timm 
pip install accelerate
pip install pytesseract pillow pandas
pip install tesseract

下载模型：

https://huggingface.co/microsoft/table-transformer-structure-recognition/tree/main

https://huggingface.co/microsoft/table-transformer-detection/tree/main

二、安装tesseract-ocr

我这里用的windows

下载：tesseract-ocr-w64-setup-5.4.0.20240606.exe 安装

https://tesseract-ocr.github.io/tessdoc/Downloads.html
https://digi.bib.uni-mannheim.de/tesseract/ 【tesseract-ocr-w64-setup-5.4.0.20240606.exe】

添加环境变量：

三、准备图片

下载：https://download.csdn.net/download/xiaoxionglove/90063200

四、编写代码

from PIL import Image
from transformers import DetrImageProcessor
from transformers import TableTransformerForObjectDetectionimport torch
import matplotlib.pyplot as plt
import os
import psutil
import time
from transformers import DetrFeatureExtractor
feature_extractor = DetrFeatureExtractor()
import pandas as pdimport pytesseractmodel = TableTransformerForObjectDetection.from_pretrained("microsoft/table-transformer-detection")COLORS = [[0.000, 0.447, 0.741], [0.850, 0.325, 0.098], [0.929, 0.694, 0.125],[0.494, 0.184, 0.556], [0.466, 0.674, 0.188], [0.301, 0.745, 0.933]]def plot_results(pil_img, scores, labels, boxes):plt.figure(figsize=(16,10))plt.imshow(pil_img)ax = plt.gca()colors = COLORS * 100for score, label, (xmin, ymin, xmax, ymax),c  in zip(scores.tolist(), labels.tolist(), boxes.tolist(), colors):ax.add_patch(plt.Rectangle((xmin, ymin), xmax - xmin, ymax - ymin,fill=False, color=c, linewidth=3))text = f'{model.config.id2label[label]}: {score:0.2f}'ax.text(xmin, ymin, text, fontsize=15,bbox=dict(facecolor='yellow', alpha=0.5))plt.axis('off')plt.show()def table_detection(file_path):image = Image.open(file_path).convert("RGB")width, height = image.sizeimage.resize((int(width *0.5), int(height *0.5)))feature_extractor = DetrImageProcessor()encoding = feature_extractor(image, return_tensors="pt")with torch.no_grad():outputs = model(**encoding)width, height = image.sizeresults = feature_extractor.post_process_object_detection(outputs, threshold=0.7, target_sizes=[(height, width)])[0]plot_results(image, results['scores'], results['labels'], results['boxes'])return results['boxes']ram_usage = psutil.Process(os.getpid()).memory_info().rss / 1024 / 1024print(f"ram usage : {ram_usage}")count = 0
root = "Detection_Images_Test/"for file in os.listdir(root):file_path = os.path.join(root, file)start_time = time.time()pred_bbox = table_detection(file_path)count += 1end_time = time.time()time_usage = end_time - start_timeram_usage = psutil.Process(os.getpid()).memory_info().rss / 1024 / 1024print(f"Iteration {count + 1} - RAM Usage: {ram_usage:.2f} MB, Time Usage: {time_usage:.2f} seconds")if count > 2:breakfile = 'img_test/PMC1064078_table_0.jpg.png'
image = Image.open(file).convert("RGB")
imagefrom huggingface_hub import hf_hub_download
from PIL import Imagefrom transformers import TableTransformerForObjectDetectionmodel = TableTransformerForObjectDetection.from_pretrained("microsoft/table-transformer-structure-recognition")def cell_detection(file_path):image = Image.open(file_path).convert("RGB")width, height = image.sizeimage.resize((int(width*0.5), int(height*0.5)))encoding = feature_extractor(image, return_tensors="pt")encoding.keys()with torch.no_grad():outputs = model(**encoding)target_sizes = [image.size[::-1]]results = feature_extractor.post_process_object_detection(outputs, threshold=0.6, target_sizes=target_sizes)[0]plot_results(image, results['scores'], results['labels'], results['boxes'])model.config.id2labelram_usage = psutil.Process(os.getpid()).memory_info().rss / 1024 / 1024print(f"ram usage : {ram_usage}")count = 0
root = "img_test/"
for file in os.listdir(root):file_path = os.path.join(root, file)start_time = time.time()cell_detection(file_path)count += 1end_time = time.time()time_usage = end_time - start_timeram_usage = psutil.Process(os.getpid()).memory_info().rss / 1024 / 1024print(f"Iteration {count + 1} - RAM Usage: {ram_usage:.2f} MB, Time Usage: {time_usage:.2f} seconds")if (count > 2):breakdef plot_results_specific(pil_img, scores, labels, boxes,lab):plt.figure(figsize=(16, 10))plt.imshow(pil_img)ax = plt.gca()colors = COLORS * 100for score, label, (xmin, ymin, xmax, ymax), c in zip(scores.tolist(), labels.tolist(), boxes.tolist(), colors):if label == lab:ax.add_patch(plt.Rectangle((xmin, ymin), xmax - xmin, ymax - ymin,fill=False, color=c, linewidth=3))text = f'{model.config.id2label[label]}: {score:0.2f}'ax.text(xmin, ymin, text, fontsize=15,bbox=dict(facecolor='yellow', alpha=0.5))plt.axis('off')plt.show()def draw_box_specific(image_path,labelnum):image = Image.open(image_path).convert("RGB")width, height = image.sizeencoding = feature_extractor(image, return_tensors="pt")with torch.no_grad():outputs = model(**encoding)results = feature_extractor.post_process_object_detection(outputs, threshold=0.7, target_sizes=[(height, width)])[0]plot_results_specific(image, results['scores'], results['labels'], results['boxes'],labelnum)def compute_boxes(image_path):image = Image.open(image_path).convert("RGB")width, height = image.sizeencoding = feature_extractor(image, return_tensors="pt")with torch.no_grad():outputs = model(**encoding)results = feature_extractor.post_process_object_detection(outputs, threshold=0.7, target_sizes=[(height, width)])[0]boxes = results['boxes'].tolist()labels = results['labels'].tolist()return boxes,labelsdef extract_table(image_path):image = Image.open(image_path).convert("RGB")boxes, labels = compute_boxes(image_path)cell_locations = []for box_row, label_row in zip(boxes, labels):if label_row == 2:for box_col, label_col in zip(boxes, labels):if label_col == 1:cell_box = (box_col[0], box_row[1], box_col[2], box_row[3])cell_locations.append(cell_box)cell_locations.sort(key=lambda x: (x[1], x[0]))num_columns = 0box_old = cell_locations[0]for box in cell_locations[1:]:x1, y1, x2, y2 = boxx1_old, y1_old, x2_old, y2_old = box_oldnum_columns += 1if y1 > y1_old:breakbox_old = boxheaders = []for box in cell_locations[:num_columns]:x1, y1, x2, y2 = boxcell_image = image.crop((x1, y1, x2, y2))new_width = cell_image.width * 4new_height = cell_image.height * 4cell_image = cell_image.resize((new_width, new_height), resample=Image.LANCZOS)cell_text = pytesseract.image_to_string(cell_image)headers.append(cell_text.rstrip())df = pd.DataFrame(columns=headers)row = []for box in cell_locations[num_columns:]:x1, y1, x2, y2 = boxcell_image = image.crop((x1, y1, x2, y2))new_width = cell_image.width * 4new_height = cell_image.height * 4cell_image = cell_image.resize((new_width, new_height), resample=Image.LANCZOS)cell_text = pytesseract.image_to_string(cell_image)if len(cell_text) > num_columns:cell_text = cell_text[:num_columns]row.append(cell_text.rstrip())if len(row) == num_columns:df.loc[len(df)] = rowrow = []return dfimage_path = 'img_test/PMC1112589_table_0.jpg'
draw_box_specific(image_path,1)
df = extract_table(image_path)
df.to_csv('data.csv', index=False)

我们将图片中的表格识别并存到csv中

transformers microsoft--table-transformer 表格识别

一、安装包 pip install transformers pip install torch pip install SentencePiecepip install timm pip install accelerate pip install pytesseract pillow pandas pip install tesseract 下载模型： https://huggingface.co/microsoft/table-transformer-s…...

编程日记 2024/12/1 10:12:49

【Spark源码分析】规则框架-草稿

规则批：规则集合序列，由名称、执行策略、规则列表组成。一个规则批里使用一个执行规则。执行策略 FixedPointOnce 规则： #mermaid-svg-1cvqR4xkYpMuAs77 {font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px…...

编程日记 2024/12/1 10:09:46

迪米特原则的理解和实践

迪米特原则（Law of Demeter，简称LoD），也被称为最少知识原则（Least Knowledge Principle，LKP），是面向对象设计中的一个重要原则。其核心思想是：一个对象应该对其他对象有最…...

编程日记 2024/12/1 10:06:43

jQuery零基础入门速通（中）

大家好，我是小黄。在上一篇文章中，我们初步了解了jQuery的基本概念、环境搭建、选择器、基本的DOM操作以及事件处理。接下来，我们将继续深入探讨jQuery的DOM操作和事件处理，以及一些实用的技巧和高级用法。五、高级DOM操作 5…...

编程日记 2024/12/1 10:05:42

【设计模式系列】中介者模式（十八）

一、什么是中介者模式中介者模式（Mediator Pattern）是一种行为型设计模式，其核心思想是通过一个中介者对象来封装一系列对象之间的交互，使这些对象不需要相互显式引用。中介者模式提供了一个中介层，用以协调各个对象…...

编程日记 2024/12/1 10:03:39

PDF版地形图矢量出现的问题

项目描述：已建风电场道路测绘项目，收集到的数据为PDF版本的地形图，图上标注了项目竣工时期的现状，之后项目对施工区域进行了复垦恢复地貌，现阶段需要准确的知道实际复垦修复之后的道路及其它临时用地的面积解决方法&…...

编程日记 2024/12/1 10:01:36

小迪安全第四十二天笔记简单的mysql注入 mysql的基础知识用户管理数据库模式 mysql 写入与读取跨库查询

前言之前的安全开发我们学习了 php联动数据库的模式 ，这个模式是现在常用的模式这一节来学习如何进行数据库的注入和数据库相关知识 1、了解数据库的结构我们使用 navicate连接数据库之后看一下一共四层结构库》表》字段》数据这个层级关系…...

编程日记 2024/12/1 9:59:34

11.25.2024刷华为OD

文章目录 HJ76 尼科彻斯定理（观察题，不难）HJ77 火车进站（DFS）HJ91 走格子方法，（动态规划，递归，有代表性）HJ93 数组分组（递归）语法知识…...

编程日记 2024/12/1 9:58:31

你真的会用饼图吗？JVS-智能BI饼图组件深度解析

在数据可视化的世界里，饼图是我们常见的一种可视化图形。在JVS-智能BI中提供了数据可视化饼图组件，接下来我通过这篇文章详细介绍，从配色方案到图形配置，从显示数据到提示信息，饼图的每一个细节配置。饼图类图表概述…...

编程日记 2024/12/1 9:57:29

HarmonyOS Next 模拟器安装与探索

HarmonyOS 5 也发布了有一段时间了，不知道大家实际使用的时候有没有发现一些惊喜。当然随着HarmonyOS 5的更新也带来了很多新特性，尤其是 HarmonyOS Next 模拟器。今天，我们就来探索一下这个模拟器，看看它能给我们的开发过程带来什…...

编程日记 2024/12/1 9:56:27

医学机器学习：数据预处理、超参数调优与模型比较的实用分析

摘要本文介绍了医学中的机器学习，重点阐述了数据预处理、超参数调优和模型比较的技术。在数据预处理方面，包括数据收集与整理、处理缺失值、特征工程等内容，以确保数据质量和可用性。超参数调优对模型性能至关重要，介绍了多种调…...

编程日记 2024/12/1 9:55:26

单片机知识总结（完整）

1、单片机概述 1.1. 单片机的定义与分类定义： 单片机（Microcontroller Unit，简称MCU）是一种将微处理器、存储器（包括程序存储器和数据存储器）、输入/输出接口和其他必要的功能模块集成在单个芯片上的微型…...

编程日记 2024/12/1 9:54:25

【C++】auto和decltype类型推导关键字

1.C11关键字 auto和decltype是C11引入的关键字，负责类型的推导。所有不同的是： auto可直接用来定义变量，编译器会自动推导出变量的类型。decltype是推导出一个操作数的类型，然后用这个类型再去定义。 2.两者区别尽管两者都是宏…...

编程日记 2024/12/1 9:52:22

OGRE 3D----3. OGRE绘制自定义模型

在使用OGRE进行开发时，绘制自定义模型是一个常见的需求。本文将介绍如何使用OGRE的ManualObject类来创建和绘制自定义模型。通过ManualObject，开发者可以直接定义顶点、法线、纹理坐标等，从而灵活地构建各种复杂的几何体。 Ogre::ManualObject 是 Ogre3D 引擎中的一个类，用…...

编程日记 2024/12/1 9:50:19

ARM + Linux 开发指南

随想：想写一个系列来讲如何嵌入式开发，然后能形成一个知识体系，帮助那些刚刚做嵌入开发的同学们. 1. ARM Linux从开机到Linux完全启动的流程和代码分析 ARM Linux从开机到完全启动的流程与代码分析 ARM Linux的启动过程主要涉及从设备上电开始，到Linux内核完全启动并进入…...

编程日记 2024/12/1 9:48:15

facebook欧洲户开户条件有哪些又有何优势？

在当今数字营销时代，Facebook广告已成为企业推广产品和服务的重要渠道。而为了更好地利用这一平台，广告主们需要理解不同类型的Facebook广告账户。Facebook广告账户根据其属性可分为多种类型，包括个人广告账户、企业管理（BM&#…...

编程日记 2024/12/1 9:47:14

算法训练（leetcode）二刷第三十一天 | 1049. 最后一块石头的重量 II、494. 目标和、*474. 一和零

刷题记录 1049. 最后一块石头的重量 II*494. 目标和二维数组滚动数组 *474. 一和零 1049. 最后一块石头的重量 II leetcode题目地址本题与416. 分割等和子集类似。依旧是01背包问题，本题尽可能将石头分为相等（相近）的两堆，然后…...

编程日记 2024/12/1 9:46:13

软件测试丨Pytest生命周期与数据驱动

Pytest的生命周期概述 Pytest 是一个强大的测试框架，提供了丰富的特性来简化测试执行。它的生命周期包括多个阶段，涉及从准备测试、执行测试到报告结果的完整流程。因此，理解Pytest的生命周期将帮助我们更好地设计和管理测试用例。开始阶段…...

编程日记 2024/12/1 9:45:12

Figma入门-原型交互

Figma入门-原型交互前言在之前的工作中，大家的原型图都是使用 Axure 制作的，印象中 Figma 一直是个专业设计软件。最近，很多产品朋友告诉我，很多原型图都开始用Figma制作了，并且很多组件都是内置的，对…...

编程日记 2024/12/1 9:42:08

网络安全防范技术

1 实践内容 1.1 安全防范为了保障"信息安全金三角"的CIA属性、即机密性、完整性、可用性，信息安全领域提出了一系列安全模型。其中动态可适应网络安全模型基于闭环控制理论，典型的有PDR和P^2DR模型。 1.1.1 PDR模型信息系统的防御机制能抵抗…...

编程日记 2024/12/1 9:41:06

多云管理“拦路虎”：深入解析网络互联、身份同步与成本可视化的技术复杂度

一、引言：多云环境的技术复杂性本质企业采用多云策略已从技术选型升维至生存刚需。当业务系统分散部署在多个云平台时，基础设施的技术债呈现指数级积累。网络连接、身份认证、成本管理这三大核心挑战相互嵌套：跨云网络构建数据…...

编程新知 2025/7/2 8:36:46

Docker 运行 Kafka 带 SASL 认证教程

Docker 运行 Kafka 带 SASL 认证教程 Docker 运行 Kafka 带 SASL 认证教程一、说明二、环境准备三、编写 Docker Compose 和 jaas文件docker-compose.yml代码说明：server_jaas.conf 四、启动服务五、验证服务六、连接kafka服务七、总结 Docker 运行 Kafka 带 SASL 认…...

编程新知 2025/7/2 13:48:19

DAY 47

三、通道注意力 3.1 通道注意力的定义 # 新增：通道注意力模块（SE模块） class ChannelAttention(nn.Module):"""通道注意力模块(Squeeze-and-Excitation)"""def __init__(self, in_channels, reduction_rat…...

编程新知 2025/7/2 15:38:11

【大模型RAG】Docker 一键部署 Milvus 完整攻略

本文概要 Milvus 2.5 Stand-alone 版可通过 Docker 在几分钟内完成安装；只需暴露 19530（gRPC）与 9091（HTTP/WebUI）两个端口，即可让本地电脑通过 PyMilvus 或浏览器访问远程 Linux 服务器上的 Milvus。下面…...

编程新知 2025/6/26 11:26:24

深入理解JavaScript设计模式之单例模式

目录什么是单例模式为什么需要单例模式常见应用场景包括单例模式实现透明单例模式实现不透明单例模式用代理实现单例模式javaScript中的单例模式使用命名空间使用闭包封装私有变量惰性单例通用的惰性单例结语什么是单例模式单例模式（Singleton Pattern&#…...

编程新知 2025/6/27 20:17:29

基于当前项目通过npm包形式暴露公共组件

1.package.sjon文件配置其中xh-flowable就是暴露出去的npm包名 2.创建tpyes文件夹，并新增内容 3.创建package文件夹...

编程新知 2025/6/26 10:09:35

MVC 数据库

MVC 数据库引言在软件开发领域，Model-View-Controller（MVC）是一种流行的软件架构模式，它将应用程序分为三个核心组件：模型（Model）、视图（View）和控制器（Controller）。这种模式有助于提高代码的可维护性和可扩展性。本文将深入探讨MVC架构与数据库之间的关系，以…...

编程新知 2025/6/27 10:06:34

全志A40i android7.1 调试信息打印串口由uart0改为uart3

一，概述 1. 目的将调试信息打印串口由uart0改为uart3。 2. 版本信息 Uboot版本：2014.07； Kernel版本：Linux-3.10； 二，Uboot 1. sys_config.fex改动使能uart3(TX:PH00 RX:PH01)，并让boo…...

编程新知 2025/6/27 16:42:47

图表类系列各种样式PPT模版分享

图标图表系列PPT模版，柱状图PPT模版，线状图PPT模版，折线图PPT模版，饼状图PPT模版，雷达图PPT模版，树状图PPT模版图表类系列各种样式PPT模版分享：图表系列PPT模板https://pan.quark.cn/s/20d40aa…...

编程新知 2025/6/25 22:47:31

PAN/FPN

import torch import torch.nn as nn import torch.nn.functional as F import mathclass LowResQueryHighResKVAttention(nn.Module):"""方案 1: 低分辨率特征 (Query) 查询高分辨率特征 (Key, Value).输出分辨率与低分辨率输入相同。"""def __…...

编程新知 2025/6/17 23:45:45

相关文章：