Together AI

Together AI

AI Native Cloud

Together AI

Together AI 提供从推理、微调到预训练的完整生产平台,汇聚 200+ 开源与前沿模型,统一 OpenAI 兼容 API,并以自研推理引擎带来业界领先的性价比与吞吐。

200+
可调用模型
2x
更快推理
OpenAI 兼容
统一 API

免费试用 · 无需下载即可在线体验

关于 Together AI

把开放权重模型的训练、微调与推理放在一个平台

Together AI 是一家专注于开放权重(open-weight)模型的 AI 原生云厂商,提供推理、微调与专属 GPU 集群三类核心能力。其模型库涵盖 Llama、Qwen、DeepSeek、Mistral、Gemma、Kimi、MiniMax、GLM 等 200 多个开源与前沿模型,以及 FLUX、SD 等图像与视频模型,全部通过统一的 OpenAI 兼容 API 调用。

在推理侧,Together 自研 Together Inference Engine 与 ATLAS 投机解码等系统,官方称在 GPT-OSS、Qwen、Kimi、DeepSeek 等模型上相较次快供应商实现最高约 2 倍的服务端推理提速。平台还提供无服务器(Serverless)、保底吞吐(Provisioned)与专属端点(Dedicated)三种部署形态,以及批次推理、函数调用与向量/重排等能力。

除推理外,Together 也提供 LoRA 与全参数微调、专属容器推理,以及由 InfiniBand 互联的 H100/H200/B200/GB200 GPU 集群(Instant Cluster),让训练、微调与大规模批推理可在同一账户内闭环完成。

核心功能一览

六大核心能力,覆盖创作全流程

无服务器推理

一行 API 调用 200+ 开源与前沿模型,按 token 计费、无需管理基础设施,适合原型与弹性流量。

🎯

微调平台

用私有或领域数据对 Llama、Qwen、Mistral 等模型做 LoRA 与全参数微调,一步部署回推理端点。

🖥

专属 GPU 集群

预留 H100/H200/B200/GB200 实例,InfiniBand 互联,面向真实训练与大规模批推理。

🔗

多模态统一 API

文本、图像、视频、代码、语音与嵌入/重排同处一个接口,无需拼接多家供应商。

📊

可观测与灰度

组织级 Prometheus 端点、A/B 与影子流量、金丝雀/蓝绿发布,把模型变更安全地推上生产。

零基础快速上手

4 步完成你的第一件 AI 作品,无需任何设计经验

1

注册并获取密钥

在 together.ai 注册账号,于控制台创建 API Key(TOGETHER_API_KEY)。

2

用 OpenAI SDK 发起调用

将 base_url 指向 https://api.together.xyz/v1,即可像调用 OpenAI 一样调用任意开放模型。

3

选择部署形态

原型用 Serverless、稳定流量用 Provisioned、私密或微调模型用 Dedicated,按场景切换。

4

接入多模态与评估

加入图像/视频生成、函数调用、嵌入与重排,并用可观测端点监控成本与延迟。

全平台客户端下载

支持网页端、桌面端、移动端及浏览器插件,随时随地开启创作

使用入口

Together AI 官网
控制台与模型库
下载
API 文档
快速开始与 SDK
下载
Python SDK (PyPI)
pip install together
下载
模型库浏览
查看全部可用模型
下载
SpeedAIAD

常见问题解答

遇到问题?这里可能有你想要的答案

1

Together AI 真的免费吗?

提供按 token 计费的无服务器推理,新用户有免费额度可用于原型验证;专属端点与 GPU 集群按预留资源计费。

2

和 Replicate、Groq 怎么选?

Together 胜在开放权重模型广度与训练/微调闭环;Replicate 强在社区模型托管;Groq 以 LPU 提供极低延迟,但模型选择相对窄。

同类对比

和同类工具横向对比,帮你选对工具。

对比维度Together AIReplicateFireworksGroq
核心定位开放权重推理云社区模型托管高速开放模型推理LPU 超低延迟
模型范围200+ 文本/图像/视频数千社区模型开放权重多模态开放权重 LLM/语音
训练/微调支持 LoRA/全参支持微调支持微调不主打训练
GPU 集群H100/B200 预留按秒计费的容器有限预留自有 LPU 硬件