Ollama

Ollama

本地 AI 运行时

Ollama

一条 ollama run 命令即可在 macOS / Windows / Linux 上跑起 Llama、Qwen、DeepSeek 等开源模型,自动利用 GPU 加速,并以 OpenAI 兼容 API 对外提供服务。

2023
首次发布
MIT
开源协议
100+
官方模型库

免费试用 · 无需下载即可在线体验

关于 Ollama

让本地 AI 像运行容器一样简单

Ollama 于 2023 年 9 月发布,是一个采用 MIT 协议的开源工具,目标是让用户像运行 Docker 容器一样,在自己的电脑上简单、快速地部署和运行各种 AI 模型。

它底层基于高性能的 llama.cpp 推理引擎,自动处理模型量化、显存管理与 API 服务,屏蔽了 CUDA、依赖安装等底层细节。启动后默认在 localhost:11434 提供兼容 OpenAI 的 REST API,可被各类客户端与开发框架直接对接。

核心功能一览

六大核心能力,覆盖创作全流程

一行命令运行模型

ollama run qwen3 即可自动下载并启动模型,无需配置 Python 或 CUDA 环境。

📦

丰富模型库

内置数百个开源模型:Llama、Gemma、Qwen、DeepSeek、Mistral、Phi 等,也可拉取自定义 GGUF。

🔌

OpenAI 兼容 API

本地 11434 端口提供与 OpenAI 兼容的接口,ChatBox、Dify、Continue 等可无缝接入。

🚀

硬件加速

自动利用 Apple Metal、NVIDIA CUDA、AMD ROCm 进行 GPU 加速,无 GPU 时回退 CPU。

🛠️

Modelfile 自定义

通过简单配置文件固化系统提示词、上下文窗口与温度等默认参数,构建专属模型。

零基础快速上手

4 步完成你的第一件 AI 作品,无需任何设计经验

1

安装 Ollama

macOS / Linux 终端运行 curl -fsSL https://ollama.com/install.sh | sh;Windows 从 ollama.com/download 下载安装包。

2

下载并运行模型

执行 ollama run llama3.2(或 qwen3、deepseek-r1)即可自动下载并进入交互对话。

3

用 API 调用

向 http://localhost:11434/api/generate 发送请求,即可用兼容 OpenAI 的方式在本地推理。

4

管理与定制

用 ollama list / pull / rm 管理模型,或用 Modelfile 创建自定义模型与系统提示词。

全平台客户端下载

支持网页端、桌面端、移动端及浏览器插件,随时随地开启创作

下载与安装

官网下载
macOS / Windows 安装包与 Linux 脚本
下载
GitHub 仓库
源码、文档与发行版
下载
Docker 镜像
docker run -p 11434:11434 ollama/ollama
下载
SpeedAIAD

常见问题解答

遇到问题?这里可能有你想要的答案

1

运行 Ollama 需要 GPU 吗?

不需要。Ollama 默认用 CPU 推理,小模型(1B–7B)在现代 CPU 上即可运行;有 GPU 时自动加速。

2

数据会离开本机吗?

不会。模型在本地运行与推理,仅首次下载权重时需要联网,之后可完全离线使用。

3

支持哪些模型?

官方库含数百个开源模型(Llama、Qwen、DeepSeek、Gemma、Mistral 等),也可加载任意自定义 GGUF。

同类对比

和同类工具横向对比,帮你选对工具。

对比维度OllamaLM StudiovLLM
运行方式命令行 + 本地服务桌面 GUI 应用Python 推理服务框架
上手门槛低(一行命令)低(图形界面)较高(需 Python 环境)
OpenAI 兼容 API是(:11434)
量化 GGUF否(原生权重)