Install
openclaw skills install @thcjp/ollama-toolkit-freeopenclaw skills install @thcjp/ollama-toolkit-free通过命令行驱动AI Agent调用Ollama本地大语言模型,实现无需云端API的私有化AI推理。免费版提供模型管理、基础对话和参数配置功能。
Ollama是一款开源的本地大语言模型运行框架,支持在个人设备上部署和运行LLaMA、Qwen、Gemma等多种开源模型。其核心优势在于数据完全本地化、无需API费用、离线可用。
本Skill封装了Ollama的命令行接口,让AI Agent能够通过自然语言指令管理本地模型和执行推理任务。免费版聚焦模型查询、下载和基础对话能力,适合个人开发者和研究者快速体验本地AI。
| 能力模块 | 免费版支持 | 说明 |
|---|---|---|
| 模型列表 | 支持 | 查看已安装和可用模型 |
| 模型拉取 | 支持 | 从仓库下载模型 |
| 单轮对话 | 支持 | 通过命令行执行推理 |
| 运行状态 | 支持 | 检查Ollama服务状态 |
| 基础参数 | 支持 | 温度、上下文长度等配置 |
| 多轮对话 | 不支持 | 专业版提供会话管理 |
| 自定义模型 | 不支持 | 专业版提供Modelfile创建 |
| 批量推理 | 不支持 | 专业版提供批量处理 |
| API服务 | 不支持 | 专业版提供REST API集成 |
| 性能监控 | 不支持 | 专业版提供资源监控 |
用input_params参数进行配置。
输入: 用户提供核心功能执行所需的指令和必要参数。 处理: 解析核心功能执行的输入参数,完成核心逻辑,返回结构化响应。 输出: 返回核心功能执行的响应数据,包含状态码、结果和日志。
input_params参数,支持创建/查询/导出操作用config_options参数进行配置。
输入: 用户提供参数配置与调用所需的指令和必要参数。 处理: 解析参数配置与调用的输入参数,完成核心逻辑,返回结构化响应。 输出: 返回参数配置与调用的响应数据,包含状态码、结果和日志。
config_options参数,支持修改/重置/导入操作用output_format参数进行配置。
输入: 用户提供结果处理与输出所需的指令和必要参数。 处理: 解析结果处理与输出的输入参数,完成核心逻辑,返回结构化响应。 输出: 返回结果处理与输出的响应数据,包含状态码、结果和日志。
output_format参数,支持导出/保存/转换操作
能力覆盖范围:本skill的核心能力覆盖以下场景关键词:本地运行、Ollama、模型的免费工具、支持模型列表、运行推理与基础对、工具箱免费版是一、款面向本地、模型运行的命令行、Skill、Agent、能够通过、在本地环境运行大、语言模型、实现无需云端、API、的私有化、核心能力、模型列表查询、单轮对话推理、模型拉取下载、运行状态检查、基础参数配置、Use、when、模型调用、智能对话、LLM、应用时使用、不适用于需要、确定性的关键决策等。在网络受限环境下,使用本地模型进行代码审查、生成注释和解答编程问题,无需依赖云端API。
对包含敏感信息的文本(如内部文档、客户数据)进行摘要、分类和分析,数据不出本地环境。
快速下载并测试不同开源模型在特定任务上的表现,为生产环境选型提供依据。
# 检查Ollama版本
ollama --version
# ...
# 检查服务状态
ollama list
# 1. 查看已安装的模型
ollama list
# ...
# 2. 拉取一个轻量模型
ollama pull qwen2.5:0.5b
# ...
# 3. 运行单次推理
ollama run qwen2.5:0.5b "用一句话解释什么是递归"
# ...
# 4. 查看正在运行的模型
ollama ps
# ...
# 5. 查看模型详细信息
ollama show qwen2.5:0.5b
响应解析: 完成完成后,查看输出响应确认任务状态。成功时输出包含解析摘要和响应数据;失败时根据错误信息排查问题,查阅错误解析章节获取恢复步骤。
# 列出所有已安装的模型
ollama list
# ...
# 从仓库拉取模型
ollama pull llama3.2
# ...
# 拉取指定大小的模型
ollama pull qwen2.5:7b
# ...
# 删除已安装的模型
ollama rm qwen2.5:0.5b
# ...
# 查看模型详细信息(架构、参数、量化方式等)
ollama show qwen2.5:7b
# ...
# 查看正在运行的模型实例
ollama ps
# 单次提问(非交互模式)
ollama run qwen2.5:7b "总结以下文本的要点:..."
# ...
# 通过管道传入内容
echo "请解释这段代码的功能" | ollama run qwen2.5:7b
# ...
# 从文件读取内容进行推理
cat 文档.txt | ollama run qwen2.5:7b "提取关键信息"
# ...
# 指定输出格式为JSON
ollama run qwen2.5:7b --format json "列出三种排序算法及其时间复杂度"
# 调整温度参数(值越高输出越随机)
ollama run qwen2.5:7b --temperature 0.3 "生成一个创意标题"
# ...
# 设置上下文窗口大小
ollama run qwen2.5:7b --num-ctx 4096 "分析以下长文..."
# ...
# 已知限制
ollama run qwen2.5:7b --num-predict 100 "简短回答:什么是TCP"
# ...
# 使用低GPU层数运行(节省显存)
ollama run qwen2.5:7b --num-gpu 10 "回答问题"
# 启动Ollama服务
ollama serve
# ...
# 检查服务是否正常运行(通过API)
curl http://localhost:11434/api/tags
# ...
# 设置服务监听地址(允许局域网访问)
OLLAMA_HOST=0.0.0.0:11434 ollama serve
echo或cat管道输入文本,实现批量文本摘要和分类,无需交互操作。--format json让模型输出结构化数据,便于后续程序处理。ollama rm删除不再使用的模型,释放磁盘空间。模型从公开仓库下载,速度受网络环境影响。可尝试在网络空闲时段下载,或先下载较小参数版本的模型试用。
使用--num-gpu参数限制GPU层数,将部分计算转移到CPU。或选择参数更小的模型版本(如用3b替代7b)。
模型在空闲一段时间后会自动卸载。如需立即停止,可重启Ollama服务或设置OLLAMA_KEEP_ALIVE=0环境变量。
部分模型对中文支持有限。建议优先选择对中文优化过的模型(如qwen2.5系列),或在提示词中明确要求使用中文回答。
使用ollama show 模型名命令,会显示模型的架构、参数量、量化方式、上下文长度等详细信息。
| 依赖项 | 类型 | 是否必需 | 获取方式 |
|---|---|---|---|
| Ollama | 运行时 | 必需 | 从Ollama官网下载安装 |
| 开源模型 | 模型文件 | 必需 | 通过ollama pull从仓库下载 |
| LLM API | API | 必需 | 由Agent平台内置LLM提供 |
localhost:11434,无需认证本免费体验版限制以下高级功能:
解锁全部功能请使用专业版:ollama-toolkit-pro
| 错误场景 | 原因 | 处理方式 |
|---|---|---|
| 配置错误 | 参数缺失或格式错误 | 检查依赖说明中的配置要求 |
| 运行时错误 | 运行环境不满足 | 确认运行环境符合依赖说明 |
| 网络错误 | 连接超时或不可达 | 执行ping命令测试网络连通性,检查防火墙和代理设置连接后执行ping命令测试网络连通性,检查防火墙和代理设置连接后重新执行命令,参考国内替代方案 |
{
"success": true,
"data": {
"result": "Ollama工具箱(免费版)处理结果",
"execution_time": "0.5s",
"metadata": {
"version": "1.0",
"processor": "ollamakit"
}
},
"execution_log": ["解析输入参数", "执行核心处理", "格式化输出结果"],
"error": null
}