Install
openclaw skills install @qq435912743/doc-reader本地文档读取技能。从 PDF / DOCX / TXT 抽取纯文本与结构(标题/段落/表格),供摘要、检索、结构化抽取下游使用。内置 doc_extract 脚本(优先本地库,无依赖时回退提示)。适用于合同/简历/报告解析、知识入库、长文预处理。
openclaw skills install @qq435912743/doc-reader把 PDF/DOCX 变成"代码能读的文本",是摘要、检索、结构化抽取的前置环节。
| 格式 | 库 | 安装 |
|---|---|---|
pypdf / PyPDF2 | pip install pypdf | |
| .docx | python-docx | pip install python-docx |
| .txt/.md | 内置 | 无 |
# 抽取全文
python scripts/doc_extract.py 报告.pdf --out 报告.txt
# 抽取并保留结构(标题/段落),输出 JSON
python scripts/doc_extract.py 简历.docx --json --out 简历.json
# 只抽前 N 页/段(大文档预览)
python scripts/doc_extract.py 长篇.pdf --max 5
long-text-summarizer 分块摘要structured-extraction 抽 JSONtranslate-polishpython scripts/learner.py record <技能目录> --capability pdf抽取 --note "pypdf 比 PyPDF2 更稳"
python scripts/learner.py record <技能目录> --capability docx表格 --fail --error 合并单元格 --note "表格含合并单元格需展平"
python scripts/learner.py insight <技能目录>
python scripts/learner.py reflect <技能目录>
记忆落盘 learned_patterns.json。