Groq

Groq

极速 AI 推理

Groq

Groq 自研 LPU 推理引擎,让 Llama、Gemma 等开源模型实现每秒数百 token 的极速输出,并通过 OpenAI 兼容 API 让开发者零改动切换。

3M+
注册开发者
280 tok/s
Llama 3.3 输出速度
<200ms
首 token 延迟

免费试用 · 无需下载即可在线体验

关于 Groq

为速度而生的 AI 推理基础设施

Groq 不是又一家模型公司,而是推理加速基础设施。它自研的 LPU(Language Processing Unit)专用芯片,用确定性架构消除了 GPU 的批处理排队,让大模型输出快到近乎实时。

平台提供 OpenAI 兼容接口,开发者无需改动代码即可把应用从其他云服务迁到 Groq,并免费开放大量开源模型(Llama、Gemma、Mixtral 等)的极速推理。

核心功能一览

六大核心能力,覆盖创作全流程

LPU 推理引擎

自研确定性芯片,输出速度可达每秒数百 token。

🔌

OpenAI 兼容 API

接口与 OpenAI 一致,改个 base_url 即可切换。

📚

开源模型库

托管 Llama、Gemma、Mixtral、Qwen 等主流开源模型。

🎙️

语音与多模态

集成 Whisper 与 Orpheus TTS,支持极速语音转写与合成。

🗄️

提示词缓存

缓存长上下文前缀,降低重复推理成本与延迟。

📦

Batch API

异步批量处理离线任务,成本更低、吞吐更高。

零基础快速上手

4 步完成你的第一件 AI 作品,无需任何设计经验

1

获取密钥

在 console.groq.com 注册并创建 API Key,免费额度即可上手。

2

安装 SDK

pip install groq 或 npm i groq-sdk,与 OpenAI SDK 用法一致。

3

发起推理

用 client.chat.completions.create 调用 Llama 等模型,秒级出字。

4

切换与扩展

把现有 OpenAI 调用只改 base_url,即可享受极速推理。

全平台客户端下载

支持网页端、桌面端、移动端及浏览器插件,随时随地开启创作

使用入口

官网
产品与文档总览
下载
控制台
创建密钥 / 调用
下载
模型列表
可用模型与速率
下载
Python SDK
pip install groq
下载
PyPI
groq Python 包
下载
SpeedAIAD

常见问题解答

遇到问题?这里可能有你想要的答案

1

Groq 有自己的大模型吗?

Groq 不自研基础模型,而是极速推理平台,托管 Llama、Gemma、Mixtral、Qwen 等开源模型。

2

和 GPU 云服务比快在哪?

LPU 用确定性架构避免批处理排队,输出速度可达每秒数百 token,首 token 延迟低于 200ms。

同类对比

和同类工具横向对比,帮你选对工具。

对比维度GroqTogetherFireworksReplicate
自研芯片LPUGPUGPUGPU
OpenAI 兼容部分
免费额度有限有限有限
极速推理是(亚秒级)一般一般