本地运行Ollama AI模型的免费命令行工具,支持模型管理、单轮推理、运行状态检查及基础参数配置。
---
slug: ollama-toolkit-free
name: ollama-toolkit-free
version: 1.0.0
displayName: Ollama工具箱(免费版)
summary: 本地运行Ollama AI模型的免费工具,支持模型列表、运行推理与基础对话
license: Proprietary
edition: free
description: Ollama工具箱免费版是一款面向本地AI模型运行的命令行辅助Skill,让AI Agent能够通过Ollama在本地环境运行大语言模型,实现无需云端API的私有化AI推理。核心能力:模型列表查询、单轮对话推理、模型拉取下载、运行状态检查、基础参数配置。Use
when 需要AI模型调用、智能对话、Agent编排、LLM应用时使用。不适用于需要100%确定性的关键决策。
tags:
- 本地AI
- 模型推理
- 私有化部署
- 集成工具
tools:
- - read
- exec
homepage: https://skillhub.cn
pricing_tier: "L1-入门级"
pricing_model: per_use
suggested_price: "9.9 CNY/per_use"
tools: ["read", "write", "exec"]
tags: "工具,效率,自动化"
---
# Ollama工具箱(免费版)
通过命令行驱动AI Agent调用Ollama本地大语言模型,实现无需云端API的私有化AI推理。免费版提供模型管理、基础对话和参数配置功能。
## 概述
Ollama是一款开源的本地大语言模型运行框架,支持在个人设备上部署和运行LLaMA、Qwen、Gemma等多种开源模型。其核心优势在于数据完全本地化、无需API费用、离线可用。
本Skill封装了Ollama的命令行接口,让AI Agent能够通过自然语言指令管理本地模型和执行推理任务。免费版聚焦模型查询、下载和基础对话能力,适合个人开发者和研究者快速体验本地AI。
## 核心能力
| 能力模块 | 免费版支持 | 说明 |
|----|-----|---|
| 模型列表 | 支持 | 查看已安装和可用模型 |
| 模型拉取 | 支持 | 从仓库下载模型 |
| 单轮对话 | 支持 | 通过命令行执行推理 |
| 运行状态 | 支持 | 检查Ollama服务状态 |
| 基础参数 | 支持 | 温度、上下文长度等配置 |
| 多轮对话 | 不支持 | 专业版提供会话管理 |
| 自定义模型 | 不支持 | 专业版提供Modelfile创建 |
| 批量推理 | 不支持 | 专业版提供批量处理 |
| API服务 | 不支持 | 专业版提供REST API集成 |
| 性能监控 | 不支持 | 专业版提供资源监控 |
### 核心功能执行
用`input_params`参数进行配置。
**输入**: 用户提供核心功能执行所需的指令和必要参数。
**处理**: 解析核心功能执行的输入参数,完成核心逻辑,返回结构化响应。
**输出**: 返回核心功能执行的响应数据,包含状态码、结果和日志。
- 执行此能力时使用`input_params`参数,支持创建/查询/导出操作
### 参数配置与调用
用`config_options`参数进行配置。
**输入**: 用户提供参数配置与调用所需的指令和必要参数。
**处理**: 解析参数配置与调用的输入参数,完成核心逻辑,返回结构化响应。
**输出**: 返回参数配置与调用的响应数据,包含状态码、结果和日志。
- 执行此能力时使用`config_options`参数,支持修改/重置/导入操作
### 结果处理与输出
用`output_format`参数进行配置。
**输入**: 用户提供结果处理与输出所需的指令和必要参数。
**处理**: 解析结果处理与输出的输入参数,完成核心逻辑,返回结构化响应。
**输出**: 返回结果处理与输出的响应数据,包含状态码、结果和日志。
- 执行此能力时使用`output_format`参数,支持导出/保存/转换操作
**能力覆盖范围**:本skill的核心能力覆盖以下场景关键词:本地运行、Ollama、模型的免费工具、支持模型列表、运行推理与基础对、工具箱免费版是一、款面向本地、模型运行的命令行、Skill、Agent、能够通过、在本地环境运行大、语言模型、实现无需云端、API、的私有化、核心能力、模型列表查询、单轮对话推理、模型拉取下载、运行状态检查、基础参数配置、Use、when、模型调用、智能对话、LLM、应用时使用、不适用于需要、确定性的关键决策等。
## 使用场景
### 场景一:离线代码辅助
在网络受限环境下,使用本地模型进行代码审查、生成注释和解答编程问题,无需依赖云端API。
### 场景二:隐私敏感数据处理
对包含敏感信息的文本(如内部文档、客户数据)进行摘要、分类和分析,数据不出本地环境。
### 场景三:模型能力评估
快速下载并测试不同开源模型在特定任务上的表现,为生产环境选型提供依据。
## 快速开始
### 前置条件
1. 已安装Ollama(从官网下载安装包)
2. Ollama服务正在运行
### 依赖详情
```bash
# 检查Ollama版本
ollama --version
# ...
# 检查服务状态
ollama list
```
### 60秒上手
```bash
# 1. 查看已安装的模型
ollama list
# ...
# 2. 拉取一个轻量模型
ollama pull qwen2.5:0.5b
# ...
# 3. 运行单次推理
ollama run qwen2.5:0.5b "用一句话解释什么是递归"
# ...
# 4. 查看正在运行的模型
ollama ps
# ...
# 5. 查看模型详细信息
ollama show qwen2.5:0.5b
```
**响应解析**: 完成完成后,查看输出响应确认任务状态。成功时输出包含解析摘要和响应数据;失败时根据错误信息排查问题,查阅错误解析章节获取恢复步骤。
## 示例
### 模型管理
```bash
# 列出所有已安装的模型
ollama list
# ...
# 从仓库拉取模型
ollama pull llama3.2
# ...
# 拉取指定大小的模型
ollama pull qwen2.5:7b
# ...
# 删除已安装的模型
ollama rm qwen2.5:0.5b
# ...
# 查看模型详细信息(架构、参数、量化方式等)
ollama show qwen2.5:7b
# ...
# 查看正在运行的模型实例
ollama ps
```
### 基础推理
```bash
# 单次提问(非交互模式)
ollama run qwen2.5:7b "总结以下文本的要点:..."
# ...
# 通过管道传入内容
echo "请解释这段代码的功能" | ollama run qwen2.5:7b
# ...
# 从文件读取内容进行推理
cat 文档.txt | ollama run qwen2.5:7b "提取关键信息"
# ...
# 指定输出格式为JSON
ollama run qwen2.5:7b --format json "列出三种排序算法及其时间复杂度"
```
### 参数配置
```bash
# 调整温度参数(值越高输出越随机)
ollama run qwen2.5:7b --temperature 0.3 "生成一个创意标题"
# ...
# 设置上下文窗口大小
ollama run qwen2.5:7b --num-ctx 4096 "分析以下长文..."
# ...
# 已知限制
ollama run qwen2.5:7b --num-predict 100 "简短回答:什么是TCP"
# ...
# 使用低GPU层数运行(节省显存)
ollama run qwen2.5:7b --num-gpu 10 "回答问题"
```
### 服务管理
```bash
# 启动Ollama服务
ollama serve
# ...
# 检查服务是否正常运行(通过API)
curl http://localhost:11434/api/tags
# ...
# 设置服务监听地址(允许局域网访问)
OLLAMA_HOST=0.0.0.0:11434 ollama serve
```
## 最佳实践
1. **按需选择模型大小**:日常对话使用0.5b-3b参数的小模型,复杂推理任务使用7b以上模型,平衡速度与质量。
2. **利用管道实现批量处理**:通过`echo`或`cat`管道输入文本,实现批量文本摘要和分类,无需交互操作。
3. **JSON格式输出便于解析**:使用`--format json`让模型输出结构化数据,便于后续程序处理。
4. **温度参数按场景调整**:创意写作用高温度(0.8+),事实问答用低温度(0.1-0.3),代码生成用中温度(0.5)。
5. **及时清理不用的模型**:通过`ollama rm`删除不再使用的模型,释放磁盘空间。
## 已知限制
- 本skill的能力范围受限于核心能力章节中定义的功能,不支持超出范围的操作
- 复杂业务场景建议结合人工经验判断
- 执行效率受模型能力与网络环境影响
- 当前为免费版本,如需完整功能请升级到付费版获取全部能力
## 常见问题
### Q1: 拉取模型时速度很慢?
模型从公开仓库下载,速度受网络环境影响。可尝试在网络空闲时段下载,或先下载较小参数版本的模型试用。
### Q2: 运行模型时提示显存不足?
使用`--num-gpu`参数限制GPU层数,将部分计算转移到CPU。或选择参数更小的模型版本(如用3b替代7b)。
### Q3: 如何停止正在运行的模型?
模型在空闲一段时间后会自动卸载。如需立即停止,可重启Ollama服务或设置`OLLAMA_KEEP_ALIVE=0`环境变量。
### Q4: 输出中文质量不好?
部分模型对中文支持有限。建议优先选择对中文优化过的模型(如qwen2.5系列),或在提示词中明确要求使用中文回答。
### Q5: 如何查看模型的架构和参数详情?
使用`ollama show 模型名`命令,会显示模型的架构、参数量、量化方式、上下文长度等详细信息。
## 依赖说明
### 运行环境
- **Agent平台**:支持SKILL.md的任意AI Agent(Claude Code / Cursor / Codex / Gemini CLI等)
- **操作系统**:Windows / macOS / Linux
- **硬件要求**:至少8GB内存(运行3b模型),16GB+内存推荐(运行7b+模型)
### 第三方依赖
| 依赖项 | 类型 | 是否必需 | 获取方式 |
|:-----|:-----|:-----|:-----|
| Ollama | 运行时 | 必需 | 从Ollama官网下载安装 |
| 开源模型 | 模型文件 | 必需 | 通过`ollama pull`从仓库下载 |
| LLM API | API | 必需 | 由Agent平台内置LLM提供 |
### API Key 配置
- 本Skill基于Ollama本地运行,无需任何API Key
- Ollama服务默认监听`localhost:11434`,无需认证
- 如需局域网访问,建议配置防火墙规则限制访问来源
### 可用性分类
- **分类**:MD+EXEC(纯Markdown指令,需要exec命令行执行能力)
- **说明**:基于Markdown的AI Skill,通过自然语言指令驱动Agent执行Ollama命令行操作
## 免费版限制
本免费体验版限制以下高级功能:
- 多轮对话与会话管理(专业版支持上下文保持的连续对话)
- 自定义模型创建(专业版支持通过Modelfile创建定制模型)
- 批量推理处理(专业版支持文件批量处理和结果聚合)
- REST API集成(专业版提供HTTP API调用方式)
- 性能监控与资源分析(专业版提供GPU/CPU/内存监控)
- 模型对比评估(专业版支持多模型横向对比)
- 提示词模板管理(专业版支持预设提示词模板)
解锁全部功能请使用专业版:ollama-toolkit-pro
## 错误处理
| 错误场景 | 原因 | 处理方式 |
|---:|---:|---:|
| 配置错误 | 参数缺失或格式错误 | 检查依赖说明中的配置要求 |
| 运行时错误 | 运行环境不满足 | 确认运行环境符合依赖说明 |
| 网络错误 | 连接超时或不可达 | 执行ping命令测试网络连通性,检查防火墙和代理设置连接后执行ping命令测试网络连通性,检查防火墙和代理设置连接后重新执行命令,参考国内替代方案 |
## 输出格式
```json
{
"success": true,
"data": {
"result": "Ollama工具箱(免费版)处理结果",
"execution_time": "0.5s",
"metadata": {
"version": "1.0",
"processor": "ollamakit"
}
},
"execution_log": ["解析输入参数", "执行核心处理", "格式化输出结果"],
"error": null
}
```
don't have the plugin yet? install it then click "run inline in claude" again.