关于 Langfuse
把 LLM 应用变得可观测、可评测、可优化
Langfuse 是 MIT 协议开源的 LLM 工程化平台,覆盖从开发到生产的完整链路。它通过 SDK 自动采集每次模型调用的输入、输出、token 与时延,形成可回溯的 trace,让黑盒推理过程透明可见。
平台内置 LLM-as-judge 自动评测、提示词版本管理、数据集与实验对比,并支持完全自托管(Docker / Kubernetes),满足企业对数据合规与隐私的要求。
核心功能一览
六大核心能力,覆盖创作全流程
观测与追踪
端到端 trace 记录每次 LLM 调用链,定位慢请求与高成本节点。
提示词管理
集中管理提示词版本、变量与多模型配置,支持灰度与回滚。
自动化评测
用 LLM-as-judge 与自定义评分器批量打分,把质量变成可量化指标。
实验与对比
在数据集上并行跑多版本,量化准确率、成本与时延差异。
成本与延迟
按模型、用户、会话统计 token 消耗与延迟,定位优化空间。
人工标注
支持团队对输出做人工打分与反馈,沉淀高质量训练数据。
零基础快速上手
4 步完成你的第一件 AI 作品,无需任何设计经验
安装 SDK
pip install langfuse 或 npm i langfuse,几行代码即可接入现有应用。
初始化客户端
用 Langfuse 公钥与密钥创建客户端,配置 base_url 指向你的部署。
采集 trace
用 @observe 装饰器或手动 start_span 包裹 LLM 调用,自动上报链路。
评测与迭代
在控制台创建数据集与评测器,批量跑分并对比不同提示词版本。

常见问题解答
遇到问题?这里可能有你想要的答案
Langfuse 与 Helicone 有何区别?
两者都做 LLM 可观测,Langfuse 额外内置评测、提示管理与实验对比,更偏完整的工程化闭环。
数据是否出域?
可完全自托管,所有 trace 留在你自己的基础设施内,满足数据合规要求。
同类对比
和同类工具横向对比,帮你选对工具。
| 对比维度 | Langfuse | Helicone | Weights & Biases |
|---|---|---|---|
| 开源协议 | MIT | MIT | 闭源/商业 |
| LLM 评测 | 内置 LLM-as-judge | 有限 | 需 W&B Weave |
| 自托管 | 支持 | 支持 | 有限 |
| 提示管理 | 是 | 否 | 部分 |
同类推荐工具
发现更多优质 AI 创作工具,找到最适合你的那一款
剪映 CapCut
CapCut(剪映海外版)是字节跳动出品的免费视频编辑器,融合多轨剪辑与 AI 工具——自动字幕、文生视频、AI 数字人、配音克隆,跨 Web/桌面/移动端云同步。
Bolt.new
Bolt.new 是 StackBlitz 推出的浏览器内 AI 全栈应用生成器,用一句 话提示即可生成、运行并部署包含前端、后端与数据库的真实 Web 应用,无需本地环境。
Adobe Firefly
Adobe Firefly 是 Adobe 旗下的生成式 AI 创意工作室,覆盖图像、视频与音频生成,并聚合 30+ 第三方模型,主打商业可用的版权安全与 Creative Cloud 深度集成。
Canva
Canva 是面向非设计师的一体化设计平台,其 AI 套件 Magic Studio 集成 25+ 个 AI 工具,覆盖 Magic Design 排版生成、Magic Write 文案与 Dream Lab 文生图。