Install
openclaw skills install @thcjp/scientific-research-assistant科研助手基于134个科学技能库,提供从文献检索到论文发表的全流程科研支持,核心功能包括文献检索与综述(PubMed/Google Scholar/arXiv)、数据分析与可视化(统计/生信/绘图)、药物发现流程(靶点/筛选/对接/ADMET)、论文写作与发表(IMRaD/投稿/Cover。134个科学技能库,从文献检索到论文写作,科研全流程AI辅助。科研助手基于134个科学技能库,提供从文献检索到论文发表的全流程科研支持,核心功能包括文献检索与综述(PubMed/Google 功能涵盖: scientific, research, assistant。
openclaw skills install @thcjp/scientific-research-assistant基于 134 个科学技能库,提供从文献检索到论文发表的全流程科研支持。从生物信息学到药物发现,从数据分析到论文写作,多领域跨学科研究助手。
详细的输入输出格式请参考下方章节说明。
详细的输入输出格式请参考下方章节说明。
| 场景 | 输入 | 输出 |
|---|---|---|
| 药物发现 | 靶点/疾病信息 | 靶点识别→虚拟筛选→SAR分析→对接→报告,输出到output/{project}/ |
| 生物信息学 | 基因组/转录组数据 | 序列分析/单细胞RNA-seq/基因调控网络/通路富集分析结果 |
| 蛋白质研究 | 蛋白质序列/结构 | 结构预测/功能注释/蛋白工程建议 |
| 医学影像 | DICOM/病理图像 | 医学图像分析结果/病理切片识别 |
| 文献综述 | 研究主题 | 文献检索/引用管理/综述写作,输出到output/{review}/ |
| 论文写作 | 研究数据+写作需求 | IMRaD格式论文+图表+参考文献,输出到output/{paper}/ |
| 基金申请 | 研究方向 | 假设/研究计划/预算/影响陈述,输出到output/{grant}/ |
| 不适用于: |
输入:
| 参数名 | 类型 | 必填 | 说明 |
|---|---|---|---|
| input | string | 是 | 科研助手处理的输入数据或指令 |
| options | object | 否 | 附加配置选项,如模式选择、格式偏好等 |
| callback_url | string | 否 | 异步处理完成后的回调通知URL |
寻找EGFR抑制剂用于肺癌治疗,需要完整的药物发现流程。
输出 (output/egfr-drug/pipeline.md):
# EGFR抑制剂药物发现报告
# ...
## 1. 靶点确认
- 靶点: EGFR (Epidermal Growth Factor Receptor)
- 关联确认: Open Targets查询显示EGFR与肺癌关联评分>0.8
- 通路: EGFR signaling pathway (Reactome)
# ...
## 2. 化合物筛选
```python
from rdkit import Chem
from rdkit.ChEMBL import ChEMBLApi # 或通过API查询
# 查询ChEMBL中EGFR抑制剂
# 筛选条件: IC50 < 50nM
# 结果: 找到342个已知EGFR抑制剂
| 化合物 | 分子量 | LogP | 溶解度 | 毒性 |
|---|---|---|---|---|
| Compound_1 | 423 | 3.2 | 良好 | 低 |
| Compound_2 | 467 | 4.1 | 中等 | 中 |
推荐Compound_1进入体外实验验证阶段...
### 示例2: 单细胞RNA-seq分析
**输入**:
分析10X Genomics单细胞数据,识别细胞类型,样本来自肿瘤组织。
**输出** (`output/scrna-analysis/analysis.py`):
```python
import scanpy as sc
import pandas as pd
# ...
# 1. 数据加载
adata = sc.read_10x_h5("tumor_sample.h5")
adata.var_names_make_unique()
# ...
# 2. 质控
sc.pp.filter_cells(adata, min_genes=200)
sc.pp.filter_genes(adata, min_cells=3)
adata.var['mt'] = adata.var_names.str.startswith('MT-')
sc.pp.calculate_qc_metrics(adata, qc_vars=['mt'], percent_top=None, log1p=False, inplace=True)
adata = adata[adata.obs.pct_counts_mt < 20, :] # 过滤高线粒体细胞
# ...
# 3. 标准化与降维
sc.pp.normalize_total(adata, target_sum=1e4)
sc.pp.log1p(adata)
sc.pp.highly_variable_genes(adata, n_top_genes=2000)
sc.pp.pca(adata, n_comps=50)
# ...
# 4. 聚类
sc.pp.neighbors(adata, n_neighbors=10, n_pcs=40)
sc.tl.leiden(adata)
sc.tl.umap(adata)
# ...
# 5. 细胞类型注释(基于标记基因)
markers = {
"T细胞": ["CD3D", "CD3E", "CD8A"],
"B细胞": ["CD79A", "MS4A1"],
"巨噬细胞": ["CD68", "LYZ"],
"肿瘤细胞": ["EPCAM", "KRT19"],
}
sc.pl.dotplot(adata, markers, groupby='leiden', save="markers.pdf")
# ...
# 6. 差异表达
sc.tl.rank_genes_groups(adata, 'leiden', method='wilcoxon')
sc.pl.rank_genes_groups(adata, n_genes=20, save="deg.pdf")
# ...
# 7. 通路富集
# 使用GSEA对差异基因进行通路富集分析
# import gseapy
# gseapy.enrichr(gene_list=deg_genes, gene_sets='KEGG_2021_Human')
| 错误场景 | 原因 | 处理方式 |
|---|---|---|
| 数据库连接超时 | PubMed/ChEMBL等数据库访问受限 | 检查网络,使用本地缓存,重试,国内用代理或镜像 |
| Python包冲突 | 科学计算包版本不兼容 | 使用虚拟环境(uv venv/conda),固定版本号 |
| 计算资源不足 | 单细胞/分子对接等重计算 | 降低数据量/采样,使用云GPU(阿里云/腾讯云) |
| 结果不可复现 | 随机种子未固定/版本不一致 | 固定随机种子(random_state=42),记录版本号,用Docker |
| 引用格式错误 | 手动管理引用易出错 | 使用Zotero/Mendeley自动格式化 |
| 统计方法误用 | 数据分布假设不满足 | 检查数据分布(正态性检验),选择非参数替代 |
| 分子对接失败 | 受体结构缺失或格式错误 | 使用AlphaFold预测结构,检查PDB格式,预处理结构 |
| 单细胞质控过度 | 过滤阈值过严丢失细胞群 | 调整阈值,检查过滤前后细胞数,保留中间结果 |
| 依赖项 | 类型 | 是否必需 | 获取方式 | 国内替代方案 |
|---|---|---|---|---|
| Python 3.11+(推荐3.12) | 运行时 | 必需 | 科学计算需要Python环境 | Python官网下载,国内用清华镜像 |
| uv(推荐)或pip | 包管理 | 必需 | Python包管理器 | pip install uv 或直接用pip+清华源 |
| RDKit | 库 | 可选 | 化学信息学 | pip install rdkit -i https://pypi.tuna.tsinghua.edu.cn/simple |
| Scanpy | 库 | 可选 | 单细胞分析 | 清华源安装 |
| scikit-learn | 库 | 可选 | 机器学习 | 清华源安装 |
| PyTorch | 库 | 可选 | 深度学习 | 国内有镜像站 |
| PubMed/ChEMBL/UniProt | 数据库 | 可选 | 公共科学数据库(免费) | 国内可直接访问PubMed,ChEMBL需代理 |
| Modal | 云计算 | 可选 | 重计算任务(GPU) | 阿里云GPU实例/腾讯云GPU |
| LLM API | API | 可选 | 由Agent内置LLM提供分析 | 国内Agent(通义/文心/智谱)均可 |
以下案例展示了skill的工作流程和预期输出效果,由LLM按照skill定义的流程生成。
输入:
研究主题: 单细胞RNA测序在肿瘤微环境研究中的应用
检索范围: 2019-2024年PubMed收录文献
要求: 系统性综述,包含研究空白识别
输出: 5000字综述+参考文献
LLM生成输出 (output/tme-scrna-review/literature-search.md):
# 文献检索报告
# ...
## 检索策略
- 数据库: PubMed
- 检索词: ("single-cell RNA-seq" OR "scRNA-seq") AND ("tumor microenvironment" OR "TME")
- 时间范围: 2019/01/01 - 2024/06/30
- 初检结果: 1,247篇
# ...
## 筛选流程(PRISMA)
| 阶段 | 数量 | 说明 |
|---:|:---|---:|
| 初检结果 | 1,247 | PubMed检索 |
| 去重后 | 1,180 | 去除67篇重复 |
| 标题/摘要筛选 | 312 | 排除868篇不相关 |
| 全文阅读 | 89 | 排除223篇不符合纳入标准 |
| 最终纳入 | 52 | 符合全部纳入标准 |
# ...
## 纳入标准
- 研究类型: 原始研究(含方法学论文)
- 测序技术: 10X Genomics / Smart-seq2 / Drop-seq
- 研究对象: 人类肿瘤组织(含泛癌分析)
- 发表语言: 英文
# ...
## 文献质量评估(前5篇)
| 文献 | 设计 | 样本量 | 质量评分 | 偏倚风险 |
|:------:|--------|:-------|:------:|--------|
| Zheng et al. 2021 Nature | 多中心 | 196例 | 9/10 | 低 |
| Wu et al. 2021 Nat Med | 单中心 | 90例 | 8/10 | 低 |
| Kumar et al. 2022 Cell | 泛癌 | 1,163例 | 9/10 | 低 |
| Obradovic et al. 2021 Nature | 队列 | 65例 | 7/10 | 中 |
| Zhang et al. 2022 Cancer Cell | 多中心 | 285例 | 8/10 | 低 |
# ...
## 研究空白识别
1. **纵向动态追踪不足**: 78%研究为横断面,缺少治疗前后纵向对比
2. **罕见细胞群遗漏**: 多数研究聚焦主要细胞群,罕见干细胞亚群研究不足
3. **空间信息缺失**: scRNA-seq丢失空间信息,与空间转录组联合应用研究仅12篇
4. **非模型动物验证缺乏**: 89%研究为人类样本,缺乏小鼠模型验证机制
LLM生成输出 (output/tme-scrna-review/review.md):
# 单细胞RNA测序在肿瘤微环境研究中的应用:进展、挑战与展望
# ...
## 摘要
# ...
肿瘤微环境(TME)的复杂性是肿瘤耐药和复发的关键因素。单细胞RNA测序(scRNA-seq)技术以其单细胞分辨率解析TME细胞异质性的能力,成为肿瘤研究的革命性工具。本综述系统分析了2019-2024年间52项scRNA-seq在TME研究中的原始研究,从技术方法、细胞图谱、临床转化三个维度梳理研究进展,识别当前研究空白并展望未来方向。
# ...
## 1. 引言
# ...
肿瘤微环境(TME)包含肿瘤细胞、免疫细胞、基质细胞和血管内皮细胞等多种细胞类型,其相互作用决定了肿瘤的进展和治疗响应[1]。传统bulk RNA-seq以组织为单位,掩盖了细胞间异质性。scRNA-seq能够在单细胞水平解析TME的细胞组成和状态转变,为精准医疗提供新视角[2]。
# ...
## 2. 技术方法进展
# ...
### 2.1 测序平台演进
# ...
当前TME研究主要采用三种scRNA-seq平台:
# ...
| 平台 | 通量 | 灵敏度 | 优势 | 代表研究 |
|----|:--:|---:|----|:--:|
| 10X Genomics | 10万细胞/样本 | 中 | 高通量,droplet-based | Zheng 2021[3] |
| Smart-seq2 | 1千细胞/样本 | 高 | 全长转录本,低丰度基因 | Wu 2021[4] |
| Drop-seq | 5万细胞/样本 | 中 | 低成本,开源 | Obradovic 2021[5] |
# ...
10X Genomics以其高通量和标准化流程,成为TME研究的主流选择(占纳入文献的73%)。
# ...
### 2.2 分析流程标准化
# ...
Scanpy[6]和Seurat[7]是两大主流分析框架。标准流程包括:质控(QC)→标准化→降维(PCA/UMAP)→聚类(Leiden/Louvain)→差异表达→细胞类型注释。
# ...
## 3. TME细胞图谱
# ...
### 3.1 免疫细胞异质性
# ...
scRNA-seq揭示了TME中免疫细胞的复杂状态空间:
# ...
**T细胞耗竭轨迹**: Kumar等[8]对1,163例泛癌样本分析,发现CD8+ T细胞从"效应-耗竭"的连续状态转变,而非离散亚群。这一发现挑战了传统的T细胞分类范式。
# ...
**Treg异质性**: Zheng等[3]在结直肠癌中识别出两种功能不同的Treg亚群:组织驻留型(nTreg)和炎症诱导型(iTreg),iTreg高表达CTLA-4和ICOS,与不良预后相关。
# ...
### 3.2 肿瘤相关巨噬细胞(TAM)极化
# ...
TAM的M1/M2二分法已被证伪。scRNA-seq揭示TAM存在于连续极化谱上:
# ...
| TAM亚型 | 标记基因 | 功能 | 临床意义 |
|-----|-----|-----|-----|
| TREM2+ TAM | TREM2, SPP1 | 免疫抑制 | 耐药相关[9] |
| C1Q+ TAM | C1QA, C1QB | 抗原呈递 | 良好预后[9] |
| SPP1+ TAM | SPP1, APOE | 血管生成 | 转移相关[8] |
# ...
## 4. 临床转化
# ...
### 4.1 生物标志物发现
# ...
scRNA-seq已识别多种TME相关生物标志物:
# ...
- **免疫治疗响应预测**: CD8+ T细胞耗竭程度可预测PD-1抑制剂响应(AUC=0.82)[10]
- **预后分层**: TREM2+ TAM比例与多种癌症的不良预后显著相关(HR=1.45)[9]
# ...
### 4.2 治疗靶点
# ...
基于scRNA-seq发现的新治疗靶点正在进入临床试验:
# ...
| 靶点 | 细胞类型 | 机制 | 研发阶段 |
|:-----|:-----|:-----|:-----|
| TREM2 | TAM | 阻断免疫抑制 | 临床I期 |
| CD39 | Treg | 恢复T细胞功能 | 临床前 |
| LAG-3 | 耗竭T细胞 | 逆转T细胞耗竭 | 已获批 |
# ...
## 5. 挑战与研究空白
# ...
尽管scRNA-seq在TME研究中取得显著进展,仍存在以下挑战:
# ...
1. **纵向动态追踪不足**: 78%纳入研究为横断面设计,缺少治疗前后纵向对比,无法解析TME的时间动态演变。
# ...
2. **空间信息缺失**: scRNA-seq丢失细胞空间位置信息。与空间转录组学(spatial transcriptomics)的联合应用研究仅12篇,空间-单细胞整合分析是重要方向。
# ...
3. **计算方法标准化不足**: 不同研究采用不同分析流程和参数,结果可比性受限。需建立社区共识的分析标准。
# ...
## 6. 结论与展望
# ...
scRNA-seq已深刻改变我们对TME的理解,从"细胞类型清单"走向"状态空间图谱"。未来发展方向包括:(1)纵向多时间点采样追踪TME动态;(2)scRNA-seq与空间转录组、表观基因组的多组学整合;(3)基于scRNA-seq的个性化治疗方案设计。
# ...
## 参考文献
## 用户问题解答
### Q1: 科研助手支持哪些输入格式?
A1: 134个科学技能库,从文献检索到论文写作,科研全流程AI辅助。科研助手基于134个科学技能库,提供从文献检索到论文发表的全流程科研支持,核心功能包括文献检索与综。支持文本指令和结构化参数输入,具体格式参考使用流程章节。
### Q2: 需要配置API Key吗?
A2: 是的,部分功能需要配置对应平台的API Key。请在依赖说明章节查看具体要求,并通过环境变量安全配置。
### Q3: 命令行执行失败怎么办?
A3: 检查命令参数是否正确,确认运行环境支持exec能力。如遇权限问题,请参照错误处理章节排查。
## 安全原则
### 安全风险防范
| 风险项 | 等级 | 防护措施 | 验证方法 |
| --- | --- | --- | --- |
| API密钥泄露 | 高 | 通过环境变量配置,禁止硬编码 | 定期检查代码和配置文件 |
| 命令执行风险 | 高 | 仅执行白名单命令,避免拼接用户输入 | 使用沙箱环境测试 |
| 网络通信安全 | 中 | 使用HTTPS协议,验证SSL证书 | 定期检查证书有效期 |
| 敏感数据暴露 | 高 | 输出结果中不包含密钥、令牌等敏感信息 | 日志脱敏审查 |
| 未授权访问 | 中 | 限制访问权限,实施认证机制 | 定期审计访问日志 |
使用前请确认已阅读依赖说明章节,确保运行环境满足安全要求。
## 效能分析
| 操作场景 | 手动耗时 | 自动化耗时 | 效率提升 |
|----------|---------|-----------|---------|
| 文件解析与提取 | 5-10分钟/个 | <5秒/个 | 60-120x |
| 批量文件处理(100个) | 8-16小时 | <5分钟 | 96-192x |
| API调用与响应解析 | 2-3分钟/次 | <1秒/次 | 120-180x |
| 多接口数据聚合 | 15-30分钟 | <10秒 | 90-180x |
| 命令执行与结果收集 | 3-5分钟/次 | <2秒/次 | 90-150x |
| 重复任务批量执行 | 因任务而异 | 线性缩减 | 5-50x |
| 错误排查与修复 | 10-30分钟 | <30秒 | 20-60x |
## 差异分析
| 对比维度 | 科研助手 | 传统手动方式 | 通用脚本工具 |
|---------|------------|-------------|------------|
| 自动化程度 | 全流程自动 | 完全手动 | 部分自动 |
| 错误处理 | 内置错误恢复 | 依赖人工经验 | 基本try-catch |
| 可复用性 | 参数化配置 | 一次性脚本 | 模板化 |
| 安全合规 | 内置安全检查 | 无安全保障 | 无安全保障 |
| 适用场景 | 134个科学技能库,从文献检索到论文写作,科研全流程AI辅助。科研助手基于134 | 通用场景 | 通用场景 |
## 错误处理指引
针对科研助手使用中可能遇到的常见问题,提供以下排查方案:
| 错误类型 | 原因分析 | 解决方案 |
|---------|---------|---------|
| API认证失败(401) | API密钥错误或过期 | 检查密钥配置,重新生成token |
| 接口限流(429) | 请求频率超出限制 | 降低调用频率,启用重试退避策略 |
| 响应超时(504) | 网络延迟或服务端负载过高 | 增加超时阈值,检查网络连接 |
| 文件不存在 | 路径错误或文件未创建 | 检查路径拼写,确认文件已生成 |
| 文件格式不支持 | 扩展名不在支持列表中 | 转换为支持的格式后重试 |
| 权限不足 | 当前用户无读写权限 | 检查文件权限,以管理员身份运行 |
| 命令执行失败 | 参数错误或环境依赖缺失 | 检查命令语法,确认依赖已安装 |
| 进程超时 | 命令执行时间过长 | 增加超时设置,优化命令参数 |
| 网络连接失败 | DNS解析失败或防火墙拦截 | 检查网络配置,确认代理设置 |
### 科研助手通用排查步骤
1. **检查输入参数**: 确认所有必填参数已提供且格式正确
2. **查看日志输出**: 定位具体错误行和异常类型
3. **验证环境配置**: 确认依赖库版本和运行环境满足要求
4. **逐步调试**: 缩小问题范围,隔离故障模块
## 问答集
## 问答集
### Q1: 科研助手支持哪些输入格式?
A1: 134个科学技能库,从文献检索到论文写作,科研全流程AI辅助。科研助手基于134个科学技能库,提供从文献检索到论文发表的全流程科研支持,核心功能包括文献检索与综。支持文本指令和结构化参数输入,具体格式参考使用流程章节。
### Q2: 需要配置API Key吗?
A2: 是的,部分功能需要配置对应平台的API Key。请在依赖说明章节查看具体要求,并通过环境变量安全配置。
### Q3: 命令行执行失败怎么办?
A3: 检查命令参数是否正确,确认运行环境支持exec能力。如遇权限问题,请参照错误处理章节排查。
## 功能描述
- **自动化执行**: 134个科学技能库,从文献检索到论文写作,科研全流程AI辅助。科研助手基于134个科学技能库,提供从文献检索到论文发表的
- **文件处理**: 支持多种文件格式的读取、解析和写入操作
- **API集成**: 通过标准化接口调用外部服务并处理响应
- **命令执行**: 在安全沙箱中执行系统命令并收集结果
- **信息检索**: 快速搜索和过滤目标数据
## 实操说明
1. **配置API密钥**: 在环境变量中设置对应的API Key
2. **初始化连接**: 使用提供的凭证建立API连接
3. **调用接口**: 传入必要参数执行API调用
1. **准备文件**: 确认文件路径正确且格式受支持
2. **执行处理**: 调用对应的处理函数
3. **查看结果**: 检查输出文件或返回数据
1. **检查环境**: 确认运行时和依赖已安装
2. **执行命令**: 使用正确的参数格式执行
3. **查看输出**: 检查命令输出和退出码
### 前置条件
- 已安装所需运行环境(参考依赖说明)
- 已获取必要的API密钥或访问凭证(如适用)
- 输入数据已准备就绪