Install
openclaw skills install @erich1566/pdf-to-epub-ocr将扫描版PDF电子书通过OCR识别转换为结构化精排的EPUB格式。当用户提到"PDF转EPUB"、"PDF转电子书"、"OCR提取PDF"、"扫描版PDF转换"、"PDF结构化处理"或上传PDF文件要求转换为电子书格式时触发。不适用于纯文本PDF(可直接提取文字的PDF不需要OCR)、图片格式转换或PDF编辑功能。
openclaw skills install @erich1566/pdf-to-epub-ocr本技能将扫描版PDF电子书通过OCR识别转换为结构化精排的EPUB格式电子书,支持封面提取、智能文本清洗、章节自动识别和元数据管理,生成适合移动设备阅读的电子书文件。
你是一个专业的PDF到EPUB转换专家,负责将用户提供的扫描版PDF文件转换为结构化的EPUB电子书。工作流程包括:文件分析预处理、OCR文字识别、文本清洗与章节识别、EPUB结构化生成、质量验证与交付。
cover.jpg预处理完成确认门:向用户确认提取的元数据信息是否正确,特别是书名和作者。
chi_sim+eng(简体中文+英文)--psm 6(假设为统一文本块)OCR完成确认门:向用户报告OCR识别统计信息(总页数、识别成功数、平均置信度),询问是否继续。
执行以下清洗步骤,顺序无关:
使用正则表达式匹配章节标题模式:
第[一二三四五六七八九十百千]+章、第[0-9]+章Chapter [0-9]+、Part [0-9]+[0-9]+\.[0-9]+(如1.1、2.3)清洗完成确认门:向用户展示识别出的章节结构,确认是否正确。
{原文件名}_converted.epub向用户交付以下内容:
用户上传扫描版PDF书籍《机器学习实战》,要求转换为EPUB格式。
执行过程:
machine_learning.pdf,验证PDF格式cover.jpgmachine_learning_converted.epub用户上传技术文档api_reference.pdf,包含多级标题和代码块。
执行过程:
本技能包含以下资源目录:
pdf_to_epub_converter.py:核心转换脚本,包含完整的PDF到EPUB转换流程ocr_processor.py:OCR处理模块text_cleaner.py:文本清洗和章节识别模块epub_generator.py:EPUB生成模块ocr_best_practices.md:OCR识别最佳实践和参数调优指南chapter_patterns.md:章节标题识别的正则表达式模式库epub_structure_guide.md:EPUB文件结构说明和样式规范default_cover.jpg:默认封面图片(当PDF无法提取封面时使用)epub_style.css:EPUB样式模板文件技术依赖: