
Langfuse
开源 LLM 可观测平台,Tracing + Prompt 管理 + 评估
开源 LLM 可观测平台的首选,Tracing + Prompt 管理 + 评估三合一且可自托管,适合需要调试和监控 LLM/Agent 应用的团队;纯 API 网关需求选 Portkey/LiteLLM 更轻量。
TL;DR
Langfuse 是开源的 LLM 可观测性平台(MIT 协议),核心做三件事:Tracing 链路追踪(记录 LLM 应用的每一步调用、输入输出、耗时、token 用量)、Prompt 版本管理(把 prompt 当代码管理、A/B 测试、版本回滚)、LLM 评估打分(人工标注 + LLM-as-judge 自动评估)。支持 Cloud SaaS 和 Docker 自托管,Python / JS SDK 一行接入。
适合:开发 LLM 应用 / Agent 需要调试调用链、追踪多步推理过程、管理 prompt 版本、做评估和质量监控的团队。不适合:纯 API 路由 / 成本控制需求(用 Portkey / LiteLLM)、不需要 LLM 层可观测的普通后端(用 OpenTelemetry / Datadog)。
核心能力
- Tracing 链路追踪:记录 LLM 应用的完整调用链——从用户输入到 LLM 调用到工具执行到最终输出,每一步都有 input/output/耗时/token/成本
- 自动 instrument:SDK 自动拦截 OpenAI / Anthropic / LangChain / LlamaIndex 调用,零侵入接入
- Prompt 管理:在 UI 中编辑、版本化、A/B 测试 prompt,代码里
langfuse.get_prompt("v2")拉取,无需重新部署 - LLM 评估(Evals):支持人工标注 + LLM-as-judge 自动评估,自定义评估维度(准确性、相关性、安全等)
- Analytics 仪表盘:token 用量、成本、延迟、错误率、评估分数的实时统计和趋势图
- 多框架集成:LangChain / LlamaIndex / OpenAI SDK / Anthropic SDK / Vercel AI SDK 原生支持
- 自托管:Docker Compose 一键部署,数据完全自主,MIT 协议无商用限制
- 标注队列:团队协作标注数据,支持自定义标注流程和分配
价格
- Hobby(免费):Cloud 版,50K units/月(约 50K observations),适合个人和原型
- Core $29/月:100K units/月,无限用户、90 天数据保留,生产项目入门
- Pro $199/月:100K units/月包含,无限历史/高并发/标注队列/SOC2·ISO27001 报告,适合规模化团队
- Enterprise:联系销售(约 $2499/月起),SSO、审计日志、SLA、无限制
- 自托管:完全免费,MIT 协议,自己出服务器成本(一台 4C8G VPS 即可跑)
体验与评测(资料整理)
说明:本节基于官方文档与公开评测整理,非本站独立实测环境,具体数据请以官方为准。 示例场景:自托管 Docker 部署 + Python SDK,追踪一个 RAG 应用(LangChain)的调用链。
亮点:
@observe()装饰器一行加到函数上,自动追踪整条调用链,从用户 query → embedding → 检索 → LLM 生成全链路可见- 自动拦截 OpenAI 调用,token 用量和成本统计精确到每次调用,月度成本一目了然
- Prompt 管理在 UI 改了直接生效,不用改代码重新部署,A/B 测试两个版本对比效果
- LLM-as-judge 评估自动化:配置 GPT-4o 对每条 trace 打分(1-5 分),评估覆盖率和一致性不错
- UI 直观,调用链树状展开,每步 input/output 都可点开看,调试 Agent 多步推理很方便
- 自托管 4C8G VPS 跑了一个月稳定,PostgreSQL 存数据,查询快
踩坑:
- 自动 instrument 偶尔漏追踪——用 async / 多线程时要注意 SDK 版本,0.x 到 1.x 有 breaking change
- 免费版 50K units 很快用完(一次 Agent 调用可能产生 10+ observations),生产用自托管或付费
- LLM-as-judge 评估有偏差——GPT-4o 自评倾向给自己高分,需要设计好 rubric 和 few-shot 示例
- Prompt 管理的 UI 编辑器不支持 Jinja2 语法高亮,复杂模板调试不方便
- 自托管要配好 PostgreSQL + Redis,数据量大时查询会慢,需要定期清理
上手
- 注册 Cloud 账号(或
docker compose up自托管) - 创建项目,获取
PUBLIC_KEY和SECRET_KEY - 安装 SDK:
pip install langfuse - 初始化 + 装饰器接入:
from langfuse import observe from langfuse.openai import openai # 自动追踪 @observe() def chat(query): return openai.chat.completions.create(model="gpt-4o", messages=[...]) - 打开 Langfuse Dashboard 查看实时 trace
- 进阶:在 UI 创建 Prompt → 代码
langfuse.get_prompt("v2")拉取 → 配置 LLM 评估自动打分
对比
| 维度 | Langfuse | LangSmith | Helicone | Portkey |
|---|---|---|---|---|
| 开源 / 自托管 | ✅ MIT | ❌ | ❌ | 部分 |
| Tracing | ✅ | ✅ | ✅ | ✅ |
| Prompt 管理 | ✅ | ✅ | ❌ | ✅ |
| LLM 评估 | ✅ | ✅ | ❌ | ❌ |
| 免费额度 | 50K units/月 | 5K runs/月 | 100K req/月 | 10K req/月 |
| 多框架集成 | ✅ | LangChain 优先 | OpenAI 优先 | ✅ |
| API 网关 | ❌ | ❌ | ✅ | ✅ |
避坑
- observations 计数要注意:一条 trace 可能包含多个 observations(LLM 调用、工具调用、子函数),免费额度消耗比预期快
- SDK 版本兼容性:1.x 版本 API 有 breaking change,升级前看 changelog,旧代码用
langfuse@0.x - LLM-as-judge 要校准:自动评估有系统性偏差,先用人工标注 50-100 条做 baseline,再调 rubric
- 自托管数据清理:长期运行数据膨胀快,配 retention policy 定期清理旧 trace,否则 PostgreSQL 查询变慢
- 生产环境加采样:高 QPS 场景全量 trace 会有性能开销和成本,用
@observe(enabled=False)或按比例采样 - Prompt 管理不适合复杂逻辑:纯文本模板好用,含复杂分支 / 代码逻辑的 prompt 还是放代码里更可控
适合 / 不适合
- ✅ LLM 应用 / Agent 开发调试(看完整调用链)
- ✅ Prompt 版本管理和 A/B 测试
- ✅ LLM 输出质量监控和评估(人工 + 自动)
- ✅ 需要 self-host 的数据敏感场景(MIT 自托管)
- ✅ 成本和 token 用量监控
- ❌ 纯 API 路由 / 负载均衡 / 多模型 fallback(用 Portkey / LiteLLM)
- ❌ 非 LLM 后端的通用 APM(用 OpenTelemetry / Datadog / Grafana)
- ❌ 需要企业级 SSO / 审计的自托管(Community 版功能有限,需 Enterprise)
FAQ
Q: Langfuse 和 LangSmith 怎么选? A: LangSmith 是 LangChain 官方的,和 LangChain 深度绑定但闭源、无自托管。Langfuse 开源可自托管、框架无关,LangChain / LlamaIndex / 原生 SDK 都支持。数据敏感选 Langfuse 自托管,深度用 LangChain 生态选 LangSmith。
Q: 自托管需要什么配置? A: 最小 4C8G VPS + PostgreSQL + Redis,Docker Compose 一键部署。月成本 $10-20(VPS)。数据量大加磁盘和定期清理。
Q: 和 Helicone 区别? A: Helicone 偏 API 代理 + 成本监控,是 OpenAI API 前面的中间层。Langfuse 更偏应用层可观测,追踪的是业务逻辑调用链(RAG、Agent 多步推理),不只是 API 调用日志。
Q: 性能开销大吗? A: SDK 异步上报,单次 trace 开销 < 5ms。高 QPS(1000+ req/s)建议加采样,否则 Langfuse 服务端和 PostgreSQL 压力大。
相关阅读
AutoGen · CrewAI · AnythingLLM
来源
本文的价格、版本号与性能数据均参考以下官方渠道整理,可能随时间变动,请以官方实时信息为准。