Install
openclaw skills install @gogoingai/wenqu-library面向中文内容创作的以证据为驱动的素材收集与整理流程,涵盖规划、搜索、下载、索引与可复用 素材库维护,适用于文章、报告、教程、项目介绍和说明材料。当用户要求“收集素材”“整理资料” “建立素材库”“抓取网页”或“收集网页素材”,或使用 "collect research", "build a source library", "save this webpage", "web scraping" 等英文表达时使用。
openclaw skills install @gogoingai/wenqu-library当本技能需要用户确认选择、补充必要信息或授权有副作用的操作时:
AskUserQuestion、request_user_input、clarify、ask_user 或等价能力。文曲创作流程的第一环——博观积累。在动笔写文章之前,先收集和整理素材,让创作有据可依、有米可炊。
文库不是“见什么都存”的素材仓库,而是带着写作意图做收集:当选题、写作目标和大致范围开始清楚后,再去找真正有用的相似文章与相关资料,避免把大量弱相关材料堆进来。
文库不是单篇文章的素材库(那由 wenqu-write 在写作时建立在文章存储 wenqu-skills/{文件名}/references/materials/ 路径下),而是一个跨文章、可长期沉淀的个人知识库:
wenqu-write)提供内容基础| 用户信号 | 流程 |
|---|---|
| "收集素材"、"整理资料"、"建素材库" | 四步收集流程 |
| "沉淀知识"、"积累案例" | 沉淀与分类 |
| "抓取这个网页"、"把这篇公众号存下来" | 下载、整理(流程第 3、4 步) |
两级存储,职责不同:
$HOME/.gogoingai/wenqu-skills/library/,按主题/领域分文件:
{主题}.md —— 每个主题一个文件,内含该主题的素材条目| 编号 | 来源 | 内容 | 标签 |(编号 L1、L2……){项目根目录}/wenqu-skills/{文件名}/references/materials/,由 wenqu-write 在写作流程中建立和使用:
materials/
├── index.md # 素材索引(检索与管理的唯一入口)
├── local/ # 本地素材:源码大段摘录、本地文档导出
├── articles/ # 网页文章:博客、公众号、新闻、教程
├── papers/ # 论文、研究报告
└── docs/ # 官方文档、deep-crawl 整站抓取产物
分类按内容类型分目录;同类文件多时可再按来源站点建二级子目录(如 articles/mp.weixin.qq.com/)。
index.md 索引格式(每条一行):
| 编号 | 摘要 | 来源类型 | 来源 | 检索渠道 | 文件路径 | 用途 | 标签 | 关联章节 | 日期 |
| M1 | xxx 机制源码摘录 | 实现事实 | src/cache.py:42 | 本地文件 | local/cache-lru.md | 事实素材 | 缓存,LRU | 2.1 | 2026-07-25 |
| M2 | 某公众号文章:XX 系统实践 | 外部研究 | https://mp.weixin.qq.com/s/xxx | agent-native、wenqu-cli:sogou | articles/mp.weixin.qq.com/xx.md | 写法参考 | 架构 | 待定 | 2026-07-25 |
登记规则:
path:line;确实没有来源的标「用户口述或粘贴」wenqu-write 的 references/planning/content-provenance.md)agent-native、wenqu-cli:{engine}、wenqu-cli:{engine}:{channel}、用户提供 或 本地文件;同一 URL 被多个渠道发现时合并填写,不丢渠道信息。channel 仅在 CLI 输出不是 direct 时记录,例如 browser 或 delegate:duckduckgo-写法参考(相似文章,不能当事实来源)与 事实素材(支撑正文的机制、数字、案例)index.md 在主索引表之外保留两个专项区(R0 审查要读):
格式见 wenqu-write 的 references/planning/questionnaire.md「写入 materials/index.md」一节。
素材收集分四步:规划 -> 搜索 -> 下载 -> 整理。在 wenqu-write 的规划阶段(Step 1/1.5 完成后)执行;用户单独喊"收集素材"时同样走这四步。
每一步执行细则见 references/collection-playbook.md;Wenqu CLI 的命令、引擎范围、浏览器回退和下载边界见 references/wenqu-cli.md。
根据写作规划产出收集清单:要找哪些相似文章(写法参考)、哪些相关素材(事实素材)、中英文搜索关键词组合、预计抓取数量。清单列给用户确认后开始执行(内容范围的唯一确认点);首次使用 Wenqu CLI 前,agent 主动向用户说明用途并请求一次明确授权,获授权后安装、设置并验证(pipx 隔离安装,流程见 references/wenqu-cli.md);已授权并验证通过的版本在后续任务中直接复用,不在每次任务重复请求授权,也不自动联网升级——如需升级由用户主动发起。授权或安装失败不等同于"可跳过 CLI 抓取",回退规则见 Step 3。
优先用 wenqu library search(多引擎候选,含百度、必应、Brave、搜狗、CSDN、掘金等;CLI 已授权并 ready 时为默认搜索路径,不静默跳过)。CLI 未授权、未安装或整体失败时,再用 agent 自带的联网搜索工具按相同关键词补充候选,检索渠道记为 agent-native。CLI 对百度、必应、Brave 与搜狗的直连失败或空结果自动做一次受限的 Crawl4AI 浏览器回退;完整分流见 references/wenqu-cli.md。合并全部候选、统一去重与分级后才进入下载;用户直接提供 URL 的,保留为 用户提供 渠道且可跳过检索。
用 wenqu library fetch 抓取(默认抓取路径,不是可选增强——Crawl4AI 封装其中,是本技能唯一的受管抓取链路),产物直接写入本篇素材目录对应分类下:
--max-pages 必须显式限制)与微信公众号直达的命令和边界见 references/wenqu-cli.md通读下载产物写摘要,按登记规则写入 index.md;与全局文库去重;把可跨文章复用的条目提炼后回收进全局文库(L 条目,只存条目和链接,原始文件留本篇);收尾向用户一句话汇报成果与失败清单。
当用户已经有明确写作任务,或 wenqu-write 已完成初步规划时,文库按下面顺序工作:
文库对写作流程提供两类输出:
相似文章候选
相关素材清单
path:line),供 wenqu-write 写入本篇 index.mdwenqu-write 在 完成 Step 1 / Step 1.5 的初步规划后,进入 Step 2 素材收集时调用本技能的四步流程,而不是直接开始大范围扫资料。调用时至少带上:
文库收到这些信息后,先查全局文库有没有现成条目(避免重复收集),再执行四步流程,产出并写入本篇 references/materials/(含文件与 index.md 登记),返回两组结果:
全局文库条目标成 L1、L2……;本篇素材目录条目标成 M1、M2……。L 条目是长期资产,M 条目是本篇工作台。
path:line),没有来源的素材不进正文--max-pages 等限量参数显式设置wenqu library(CLI)为优先路径——wenqu library search 多引擎候选为默认搜索、wenqu library fetch(内含 Crawl4AI)为默认抓取,不引入第二套抓取 CLI/MCP。agent 自带的搜索/抓取仅在 CLI 未授权、安装失败或抓取失败时作补充回退,且回退须登记原因;"不阻断收集"指回退不让流程卡死,不等于"可默认不用 CLI",也不等于"原生优先、CLI 补充"references/wenqu-cli.md)、完成必要的浏览器设置和健康验证,已安装则直接使用已验证版本,不在每次任务中自动联网升级,绝不让用户自行执行命令