当前位置：首页 > news >正文

【文档智能】实践：基于Yolo三行代码极简的训练一个版式分析模型

news 2026/2/8 7:26:36

一、数据集

本文以开源的CDLA数据集做为实验，CDLA是一个中文文档版面分析数据集，面向中文文献类（论文）场景。包含以下10个label：

数据集下载地址：https://github.com/buptlihang/CDLA

数据集是labelme格式的文件，需要自行转化成yolo训练所需要的格式，最后文件放置形式如下：

注意：这个数据集有个问题就是缺乏段落标注，含相关段落标注的开源模型可以查看上篇《【文档智能】包含段落的开源的中文版面分析模型》

二、安装所需要的依赖

pip install ultralytics

三、配置yaml文件

cdla.yaml

#path: ./datasets/  # dataset root dir
train: cdla/images/train
val: cdla/images/dev
test:  # test images (optional)nc: 10   # 数据集类别数量
names: [ # 数据集标签'Text','Title','Figure','Figure caption','Table','Table caption','Header','Footer','Reference','Equation',
]

三、训练代码

from ultralytics import YOLO# model = YOLO('yolov8n.yaml')    # 重新训练模型
model = YOLO('yolov8n.pt')        # 加载预训练模型# Train the model
results = model.train(data='cdla.yaml', epochs=100, imgsz=640, device=0)

四、预测代码

from ultralytics import YOLOimage_path = ''  # 待预测图片路径
model_path = ''  # 权重路径
model = YOLO(model_path)result = model(image_path, save=True, conf=0.5, save_crop=False, line_width=2)
print(result)print(result[0].names)         # 输出id2label map
print(result[0].boxes)         # 输出所有的检测到的bounding box
print(result[0].boxes.xyxy)    # 输出所有的检测到的bounding box的左上和右下坐标
print(result[0].boxes.cls)     # 输出所有的检测到的bounding box类别对应的id
print(result[0].boxes.conf)    # 输出所有的检测到的bounding box的置信度

【文档智能】实践：基于Yolo三行代码极简的训练一个版式分析模型

一、数据集本文以开源的CDLA数据集做为实验，CDLA是一个中文文档版面分析数据集，面向中文文献类（论文）场景。包含以下10个label： 数据集下载地址：https://github.com/buptlihang/CDLA 数据集是labelme格式…...

编程日记 2024/6/16 13:10:45

聚观早报 | 深蓝G318价格发布；比亚迪方程豹豹3官图发布

聚观早报每日整理最值得关注的行业重点事件，帮助大家及时了解最新行业动态，每日读报，就读聚观365资讯简报。整理丨Cutie 6月15日消息深蓝G318价格发布比亚迪方程豹豹3官图发布夸克App升级高考AI搜索 iOS 18卫星通信实测 Redmi K70…...

编程日记 2024/6/16 13:08:41

如何实现内网穿透？快解析-免费内网穿透工具

在现如今的ipv4时代，随着上网电脑及其他智能设备越来越多，公网IP地址出现了枯竭的情况。近几年，内网穿透这个词被不断提及，这也是在无公网IP环境下实现异地访问的一种可行办法，下面我就给大家介绍一下内网穿透的原理。…...

编程日记 2024/6/16 13:07:40

【python-AI篇】人工智能技能树思维导图

大致总结一下得出如下思维导图，如不完善日后迭代更新 1. python基础三方库 1.1 科学计算库 ---- numpy库 1.2 科学计算库 ---- Scipy库 1.3 数据分析处理库 ---- pandas库 1.4 可视化库 ---- matplotlib库 1.5 可视化库 ---- seaborn库 1.6 机器学习和数据挖掘库 …...

编程日记 2024/6/16 13:04:34

Vue的computed大致细节

computed computed具体实现流程computer的执行顺序 computed 具体实现流程 computer内部首先是标准化参数然后调用runner函数进行依赖收集设置dirty为true创建副作用函数，具体如下 const runner effect(getter,{//延迟执行lazy:true,//标记为computed effect 用…...

编程日记 2024/6/16 13:03:32

第5章：模型预测控制（MPC）的代码实现

1. 建立 QP 模型： 1.1 车辆模型： 注：使用车辆横向动力学模型纵向动力学模型（误差模型） 1.2 QP 问题模型： 注：详细推导见笔记100：使用 OSQP-Eigen 对 MPC 进行求解的方法与代码-…...

编程日记 2024/6/16 13:02:31

1.自我反思的检索增强生成（SELF-RAG） 1.文章出处： Chan, C., Xu, C., Yuan, R., Luo, H., Xue, W., Guo, Y., & Fu, J. (2024). RQ-RAG: Learning to Refine Queries for Retrieval Augmented Generation. ArXiv, abs/2404.00610. 2.摘…...

编程日记 2024/6/16 13:01:29

Github入门教程，适合新手学习（非常详细）

前言：本篇博客为手把手教学的 Github 代码管理教程，属于新手入门级别的难度。教程简单易操作，能够基本满足读者朋友日常项目寄托于 Github 平台上进行代码管理的需求。Git 与 Github 是一名合格程序员 coder 必定会接触到的工具与平台&#x…...

编程日记 2024/6/16 13:00:28

C# OpenCvSharp 代数运算-add、scaleAdd、addWeighted、subtract、absdiff、multiply、divide

在C#中使用OpenCvSharp进行图像处理时，理解和合理使用各种图像操作函数可以帮助我们实现许多实际应用中的需求。下面，我将详细介绍每个函数的使用，并给出与实际应用项目相关的示例，包括运算过程和运算结果。 1. add 函数作用将两幅图像进行相加，可以达到图像融合的目的…...

编程日记 2024/6/16 12:58:25

为什么说Python 是胶水语言?

"Python 是胶水语言"这一说法是指它很擅长将不同的程序或代码库连接在一起，能够让来自不同编程语言或框架的组件无缝协作。Python 具有丰富的库和简单的语法，使得它可以轻松调用其他语言编写的程序或使用不同技术栈的模块。以下是几个…...

编程日记 2024/6/16 12:57:24

GitLab教程（二）：快速上手Git

文章目录 1.将远端代码克隆到本地2.修改本地代码并提交到远程仓库3.Git命令总结git clonegit statusgit addgit commitgit pushgit log 首先，我在Gitlab上创建了一个远程仓库，用于演示使用Gitlab进行版本管理的完整流程： 1.将远端代码克隆到本…...

编程日记 2024/6/16 12:56:23

结构体知识点

基本概念结构体是一种自定义变量类型，类似于枚举需要自己定义。它是数据和函数的集合。在结构体中，可以声明各种变量和方法。基本语法 1.结构体一般写在namespace语句块中。 2.结构体关键字struct struct 自定义结构体名 {//第一部分//变量//…...

编程日记 2024/6/16 12:55:22

C# —— 显示转换

显示转换: 通过一些方法可以将其他数据类型转换为我们想要的数据类型 1.括号强转作用: 一般情况下将高精度的类型转换为低精度 // 语法: 变量类型变量名 (转换的变量类型名称) 变量; // 注意: 精度问题范围问题 sbyte sb 1; short s 1; int …...

编程日记 2024/6/16 12:54:20

zip加密txt文件后，暴力破解时会有多个解密密码可以打开的疑问？？

最近在做一个关于zip压缩文件解密的测试，发现通过暴力解密时，会有多个解密密码可以打开，非常疑惑，这里做个问题，希望能有大佬解惑。 1、首先在本地创建一个113449.txt的文件，然后右键txt文件选择压缩&…...

编程日记 2024/6/16 12:53:19

css入门宝典

3.1.4 通配符选择器语法 : *{} 作用 : 让页面中所有的标签执行该样式,通常用来清除间距例子 : *{ margin: 0; //外间距 padding: 0; //内间距 } 一 CSS基本语法 1基础知识 1.1概述 Css (层叠样式表)是种格式化网页的标准方式， 用于控制设置网页的样式&#xff…...

编程日记 2024/6/16 12:51:16

【AI原理解析】— 星火大模型

目录 1. 模型基础架构神经网络结构编码器解码器多层神经网络结构其他自然语言处理技术 2. 训练数据来源规模 3. 自监督学习 Masked Language Model (MLM) 4. 参数量与计算能力大规模参数量深度学习算法 5. 技术特点多模态输入自我学习与迭代 6. 应…...

编程日记 2024/6/16 12:49:13

StarNet实战：使用StarNet实现图像分类任务（一）

文章目录摘要安装包安装timm 数据增强Cutout和MixupEMA项目结构计算mean和std生成数据集摘要 https://arxiv.org/pdf/2403.19967 论文主要集中在介绍和分析一种新兴的学习范式——星操作（Star Operation），这是一种通过元素级乘法融合不同子…...

编程日记 2024/6/16 12:48:12

单链表——AcWing.826单链表

单链表定义单链表是一种常见的数据结构，它由一系列节点组成，每个节点包含一个数据元素和一个指向下一个节点的指针。运用情况用于实现动态的数据存储和管理，例如实现栈、队列等其他数据结构。在需要频繁进行插入和删除操作时非常有用…...

编程日记 2024/6/16 12:47:11

10:Hello, World!的大小

OpenJudge - 10:Hello, World!的大小描述还记得在上一章里，我们曾经输出过的“Hello, World!”吗？ 它虽然不是本章所涉及的基本数据类型的数据，但我们同样可以用sizeof函数获得它所占用的空间大小。请编程求出它的大小，看看跟你…...

编程日记 2024/6/16 12:43:06

【Pandas驯化-03】Pandas中常用统计函数mean、count、std、info使用

【Pandas驯化-03】Pandas中常用统计函数mean、count、std、info使用本次修炼方法请往下查看 🌈 欢迎莅临我的个人主页 👈这里是我工作、学习、实践 IT领域、真诚分享踩坑集合，智慧小天地！ 🎇 相关内容文档获取微…...

编程日记 2024/6/16 12:41:03

KubeSphere 容器平台高可用：环境搭建与可视化操作指南

Linux_k8s篇欢迎来到Linux的世界，看笔记好好学多敲多打，每个人都是大神！ 题目：KubeSphere 容器平台高可用：环境搭建与可视化操作指南版本号: 1.0,0 作者: 老王要学习日期: 2025.06.05 适用环境: Ubuntu22 文档说…...

编程新知 2026/2/7 7:53:36

龙虎榜——20250610

上证指数放量收阴线，个股多数下跌，盘中受消息影响大幅波动。深证指数放量收阴线形成顶分型，指数短线有调整的需求，大概需要一两天。 2025年6月10日龙虎榜行业方向分析 1. 金融科技代表标的：御银股份、雄帝科技驱动…...

编程新知 2026/2/7 5:06:52

树莓派超全系列教程文档--(61)树莓派摄像头高级使用方法

树莓派摄像头高级使用方法配置通过调谐文件来调整相机行为使用多个摄像头安装 libcam 和 rpicam-apps依赖关系开发包文章来源： http://raspberry.dns8844.cn/documentation 原文网址配置大多数用例自动工作，无需更改相机配置。但是，一…...

编程新知 2026/2/5 4:39:03

JavaScript 中的 ES|QL：利用 Apache Arrow 工具

作者：来自 Elastic Jeffrey Rengifo 学习如何将 ES|QL 与 JavaScript 的 Apache Arrow 客户端工具一起使用。想获得 Elastic 认证吗？了解下一期 Elasticsearch Engineer 培训的时间吧！ Elasticsearch 拥有众多新功能，助你为自己…...

编程新知 2026/1/23 7:23:58

前端倒计时误差!

提示：记录工作中遇到的需求及解决办法文章目录前言一、误差从何而来？二、五大解决方案1. 动态校准法（基础版）2. Web Worker 计时3. 服务器时间同步4. Performance API 高精度计时5. 页面可见性API优化三、生产环境最佳实践四、终极解决方案架构前言前几天听说公司某个项…...

编程新知 2025/9/8 23:14:43