关于 Ollama
让本地 AI 像运行容器一样简单
Ollama 于 2023 年 9 月发布,是一个采用 MIT 协议的开源工具,目标是让用户像运行 Docker 容器一样,在自己的电脑上简单、快速地部署和运行各种 AI 模型。
它底层基于高性能的 llama.cpp 推理引擎,自动处理模型量化、显存管理与 API 服务,屏蔽了 CUDA、依赖安装等底层细节。启动后默认在 localhost:11434 提供兼容 OpenAI 的 REST API,可被各类客户端与开发框架直接对接。
核心功能一览
六大核心能力,覆盖创作全流程
一行命令运行模型
ollama run qwen3 即可自动下载并启动模型,无需配置 Python 或 CUDA 环境。
丰富模型库
内置数百个开源模型:Llama、Gemma、Qwen、DeepSeek、Mistral、Phi 等,也可拉取自定义 GGUF。
OpenAI 兼容 API
本地 11434 端口提供与 OpenAI 兼容的接口,ChatBox、Dify、Continue 等可无缝接入。
硬件加速
自动利用 Apple Metal、NVIDIA CUDA、AMD ROCm 进行 GPU 加速,无 GPU 时回退 CPU。
Modelfile 自定义
通过简单配置文件固化系统提示词、上下文窗口与温度等默认参数,构建专属模型。
零基础快速上手
4 步完成你的第一件 AI 作品,无需任何设计经验
安装 Ollama
macOS / Linux 终端运行 curl -fsSL https://ollama.com/install.sh | sh;Windows 从 ollama.com/download 下载安装包。
下载并运行模型
执行 ollama run llama3.2(或 qwen3、deepseek-r1)即可自动下载并进入交互对话。
用 API 调用
向 http://localhost:11434/api/generate 发送请求,即可用兼容 OpenAI 的方式在本地推理。
管理与定制
用 ollama list / pull / rm 管理模型,或用 Modelfile 创建自定义模型与系统提示词。

常见问题解答
遇到问题?这里可能有你想要的答案
运行 Ollama 需要 GPU 吗?
不需要。Ollama 默认用 CPU 推理,小模型(1B–7B)在现代 CPU 上即可运行;有 GPU 时自动加速。
数据会离开本机吗?
不会。模型在本地运行与推理,仅首次下载权重时需要联网,之后可完全离线使用。
支持哪些模型?
官方库含数百个开源模型(Llama、Qwen、DeepSeek、Gemma、Mistral 等),也可加载任意自定义 GGUF。
同类对比
和同类工具横向对比,帮你选对工具。
| 对比维度 | Ollama | LM Studio | vLLM |
|---|---|---|---|
| 运行方式 | 命令行 + 本地服务 | 桌面 GUI 应用 | Python 推理服务框架 |
| 上手门槛 | 低(一行命令) | 低(图形界面) | 较高(需 Python 环境) |
| OpenAI 兼容 API | 是(:11434) | 是 | 是 |
| 量化 GGUF | 是 | 是 | 否(原生权重) |
同类推荐工具
发现更多优质 AI 创作工具,找到最适合你的那一款
Cohere
Cohere 是面向企业的 AI 公司,由 Transformer 论文《Attention Is All You Need》的联合作者 Aidan Gomez 于 2019 年在多伦多创立,提供 Command 系列大模型、Embed 与 Rerank 模型以及 Coral 企业助手,支持 AWS / GCP / Azure 与本地私有部署,专注 RAG 与数据安全。
Deepgram
Deepgram 是用于实时与批量语 音转写的开发者优先 STT API,Nova-3 模型实现亚 300ms 流式延迟、50+ 语言支持,并为语音智能体提供原生端点检测。
Dify
Dify 是开源的 LLM 应用开发平台,把可视化工作流编排、RAG 知识库、Agent 框架、模型管理与 LLMOps 观测集成在一个画布里,支持云端与私有化部署。
Groq
Groq 是提供极速 AI 推理的开放平台,自研 LPU 处理器让开源大模型实现亚秒级响应,并通过 OpenAI 兼容 API 让开发者即插即用。