Fireworks

Fireworks

推理云平台4.6

从推理到智能

Fireworks AI 由 PyTorch 原班团队打造,是面向生产的推理云平台,提供 200+ 开源模型的极速推理、微调与规模化部署,API 兼容 OpenAI。

200+
托管模型
15T
日均处理 Token
99.9%
SLA 可用性

免费试用 · 无需下载即可在线体验

由 PyTorch 团队打造的推理云平台

速度、质量与成本兼得

Fireworks AI 自称「From Inference to Intelligence」,核心是为开源模型提供极速、高质量、低成本的推理。其自研 FireAttention 推理引擎采用手写 CUDA 内核与自适应投机解码,在多个模型家族上带来 3–12 倍更低延迟与最高 5.6 倍更高吞吐。

平台提供 Serverless、On-Demand GPU 与 Batch 三种部署形态,覆盖文本、视觉、语音、图像与嵌入五种模态,新开源权重通常在发布 24 小时内上线(Day-0 支持)。

2026 年 8 月 Fireworks 完成 15.05 亿美元 D 轮、估值 175 亿美元,年化收入运行率突破 10 亿美元,日处理 Token 超 40 万亿,客户包括 Uber、Shopify、GitLab、Cursor 等。

核心功能一览

六大核心能力,覆盖创作全流程

极速 Serverless 推理

无冷启动、按 token 计费的自适应扩缩容,配合 FireAttention 在速度与成本间取得平衡,覆盖 4B 以下文本 / 视觉模型低至 $0.10 / 1M tokens。

完整后训练栈

在同一 API 下自助完成 SFT、LoRA、强化微调与 RL,是少数把推理与微调放在同一平面的供应商,可同时上线数百个 LoRA 适配器。

多模态模型库

单一平台托管文本、视觉、语音转写、图像生成与嵌入模型,FLUX 等图像模型按步计费,Whisper 语音按分钟计费。

规模化部署

On-Demand GPU(H100/H200/B200)保证低延迟与合规,Batch 推理以半价处理非实时大批量任务,企业版支持自带云与零数据保留。

零基础快速上手

4 步完成你的第一件 AI 作品,无需任何设计经验

1

注册并获取 API Key

在 fireworks.ai 注册账号(含 $1 试用额度),于控制台创建 API Key 用于鉴权。

2

选择并调用模型

浏览模型库挑选合适模型,使用 OpenAI 兼容端点发起推理请求,仅需替换 base_url 与 key 即可迁移现有代码。

3

微调你的模型

用 FireOptimizer 在私有数据上做 LoRA / 全参 SFT,训练完成后免费托管到 Serverless,无需自建 GPU 基础设施。

4

投入生产

按需切换到 On-Demand GPU 或 Batch 推理,结合遥测与用量限制把负载稳定推向生产。

全平台客户端下载

支持网页端、桌面端、移动端及浏览器插件,随时随地开启创作

开发者入口

官网
平台与定价
下载
文档
API 与微调指南
下载
模型库
在线试跑模型
下载
SpeedAIAD

开源模型推理云对比

和同类工具横向对比,帮你选对工具。

对比维度维度FireworksTogetherGroq
自研推理引擎FireAttentionLPU 硬件
后训练 / 微调同 API 完整栈较弱
模态覆盖文本/视觉/语音/图像/嵌入文本为主文本/视觉
Day-0 开源模型发布 24h 内部分
典型卖点速度 + 微调一体开放权重生态超低延迟