Install
openclaw skills install @bsk-drs/ssgep-single-sample-expression单样本无重复表达谱技能(SSGEP — Single Sample Gene Expression Profile)。植物/梨属等转录组表达谱分析全流程:原始数据获取→质控定量→差异与GO/KEGG富集→WGCNA共表达→SNP遗传分化→600DPI出图→论文三格式(HTML/DOCX/PPTX)+Shiny交互。**明确支持两种模式**:模式A 单样本无生物学重复(每个条件仅1样本,用固定离散度0.1+折叠变化法);模式B 有生物学重复(标准DESeq2/edgeR离散度估计+设计公式)。当用户要做RNA-seq表达谱、差异基因(DEG)、WGCNA、功能基因挖掘,或要求"出论文三格式/做表
openclaw skills install @bsk-drs/ssgep-single-sample-expression来源 / Source:本技能由 山西大同大学 丁保朋(Ding Baopeng, Shanxi Datong University) 整理并开源,基于梨属 5 品种 × 7 阶段转录组表达谱分析及褪黑素功能基因挖掘研究(Natural-language-driven AI agent for pear gene expression profiling and melatonin functional gene mining)。
⚠ 务必先确认:你的数据属于哪一种?
- 单样本 / 无生物学重复(模式A,本技能核心场景):每个实验条件(如每个品种 × 每个发育阶段)只有 1 个样本,没有生物学重复。常规 DESeq2/edgeR 无法估计基因水平离散度(dispersion),差异分析必须用"固定离散度 + 折叠变化法"近似。本项目(梨属 5 品种 × 7 阶段 = 32 样本,每条件 1 样本)即属此类。
- 有生物学重复(模式B):每个条件 ≥ 2 个(推荐 ≥ 3 个)生物学重复。可正常估计离散度,统计检验可靠。
两种模式下游(富集 / WGCNA / SNP / 出图 / 成稿)完全一致,差异只在"差异表达分析"这一步。下面分模式说明。
即使你拿到一台全新 Windows 电脑(或刚重装系统)、没装任何生信/编程软件,也能跑通本项目。你不需要成为程序员——三条路任选:
ssgep-single-sample-expression 放进 ~/.workbuddy/skills/(或发布/安装到技能市场)。R-4.x.x-win.exe,下一步安装。install_pkgs.R,用 RStudio 打开运行,或右键“用 Rscript 运行”):.libPaths(c('C:/Users/你的用户名/R/rlib', .libPaths())) # 装到用户目录,避免权限问题
install.packages(c('plotly','shiny','bslib','DT','circlize','RColorBrewer','writexl'), type='binary')
if (!require('BiocManager', quietly=TRUE)) install.packages('BiocManager', type='binary')
BiocManager::install(c('DESeq2','edgeR','limma','WGCNA','Rsubread',
'ComplexHeatmap','clusterProfiler','enrichplot','AnnotationDbi','org.Ppasinensa.eg.db'), ask=FALSE)
Windows 会直接拉取预编译二进制,无需编译,几分钟完成。 7. 装 Python 包(命令提示符执行):
pip install python-docx python-pptx matplotlib pandas openpyxl
data/raw/;参考转录本(tx2gene/salmon_index) → data/ref/。Rscript scripts/01_*.R … 10_*.R(路径按项目改)。python scripts/fig4_wgcna.py
python scripts/paper_full.py
python scripts/case_study_gen.py
R/rlib;每次运行分析脚本前,务必在脚本首行加 .libPaths(c('.../rlib', .libPaths())),否则找不到包。safe_save,被 Word 占用会自动写 paper_new.docx,关掉占用重跑即可覆盖回 paper.docx。小结:纯新手选 路线 A(装 WorkBuddy + 本技能,对话驱动);想数据全本地选 路线 B(原生 R+Python);本机带不动选 路线 C(腾讯云)。三条路最终都能产出 paper.html/docx/pptx + Shiny。
median-ratio 法归一化(DESeq2 的 estimateSizeFactors 思路,或 edgeR 的 calcNormFactors)。|log2FC| ≥ 1 且 baseMean ≥ 10 视为差异。|log2FC| ≥ 2 作"强差异"子集;用 Venn / 通路富集交叉验证。median-ratio 归一化 + estimateDisp(edgeR)或 estimateDispersions(DESeq2)。design = ~ condition(多因子用 ~ batch + condition)。WaldTest(两两)或 LRT(多水平);edgeR glmQLFTest / glmFit+glmLRT。padj < 0.05 且 |log2FC| ≥ 1 为 DEG 阈值(不用原始 p,用 BH 校正后的 padj)。自动判别:若每个条件样本数 = 1 → 模式A;若任一组 ≥ 2 → 模式B。在提示词/脚本里先统计
table(sample$condition)再分支。
C:\Program Files\R\R-4.2.1\bin\Rscript.exe(4.2.1,按实际安装位置调整)
C:\Users\你的用户名\R\rlib(脚本首行 .libPaths(c(".../rlib",.libPaths())),路径按实际调整)python(3.12+,确保已在 PATH;或用 WorkBuddy 托管 Python ...\.workbuddy\binaries\python\versions\<ver>\python.exe)(docx/pptx/matplotlib/pandas 已装)fasterq-dump 转 FASTQ| 步骤 | 阶段 | 关键脚本 | 关键产出 |
|---|---|---|---|
| 01 | 原始数据获取与质控 | 01_fastq_qc_clean_reads.py / SRA Toolkit | clean reads 统计 + 样本-表型映射(Table1) |
| 02 | 注释与统计 | 02_annotation_and_tables.py | 注释统计(Table2) |
| 03 | 差异表达与褪黑素基因(R) | 03_de_and_melatonin.R | 模式A:185 DEG + 258 褪黑素通路基因 / 模式B:标准 DEG 列表 |
| 04 | GO/KEGG 富集 | 04_enrichment.py | 富集表+气泡图(可纯Python ORA) |
| 05 | SNP 与遗传分化 | 05_snp_melatonin.py | 每品种 269–606 SNP;pN/pS 0.533–0.788 |
| 06 | 表格汇总 | 06_tables.py / gen_tables.py | Table1–7(真实表格) |
| 07 | 主图(R) | 07_figures_main.R | Fig1–6 基础图 600 DPI |
| 08 | WGCNA 共表达 | 08_wgcna.R | 34 模块(yellow r=0.718, magenta r=-0.857) |
| 09 | 缩略图预览 | 09_make_previews.py | 低分辨率预览 |
| 10 | 论文成稿 | 10_build_paper.py / paper_full.py | paper.html/docx/pptx + Shiny |
$\propto$。paper.html / paper.docx / paper.pptx —— 论文三格式成稿shiny_app/app.R —— 交互式图表应用(本地 http://localhost:7788)tables/Table1.csv … Table7.csv —— 7 个真实数据表figures/ —— Fig1–Fig6(600 DPI PNG+PDF)paper_case.html / paper_case.docx / paper_case.pptx —— 项目案例(含提示词/硬件/云方案/两种重复模式)<项目根目录>\案例文件_梨属5品种7阶段转录组分析.{html,docx,pptx}(即本技能产出的三格式案例,路径按实际项目调整)