跳到主内容
AIHO 2026 全新改版上线
TOOL · CODING #03/06API 网关 / 中转
Langfuse

Langfuse

开源 LLM 可观测平台,Tracing + Prompt 管理 + 评估

observabilitytracingprompt-managementopensourcellm-eval
访问官网
能力
4
易用
4
性价比
5
中文
2
稳定
4
编辑结论 综合3.8/ 5

开源 LLM 可观测平台的首选,Tracing + Prompt 管理 + 评估三合一且可自托管,适合需要调试和监控 LLM/Agent 应用的团队;纯 API 网关需求选 Portkey/LiteLLM 更轻量。

01 / 02深度解读

TL;DR

Langfuse 是开源的 LLM 可观测性平台(MIT 协议),核心做三件事:Tracing 链路追踪(记录 LLM 应用的每一步调用、输入输出、耗时、token 用量)、Prompt 版本管理(把 prompt 当代码管理、A/B 测试、版本回滚)、LLM 评估打分(人工标注 + LLM-as-judge 自动评估)。支持 Cloud SaaS 和 Docker 自托管,Python / JS SDK 一行接入。

适合:开发 LLM 应用 / Agent 需要调试调用链、追踪多步推理过程、管理 prompt 版本、做评估和质量监控的团队。不适合:纯 API 路由 / 成本控制需求(用 Portkey / LiteLLM)、不需要 LLM 层可观测的普通后端(用 OpenTelemetry / Datadog)。

核心能力

  • Tracing 链路追踪:记录 LLM 应用的完整调用链——从用户输入到 LLM 调用到工具执行到最终输出,每一步都有 input/output/耗时/token/成本
  • 自动 instrument:SDK 自动拦截 OpenAI / Anthropic / LangChain / LlamaIndex 调用,零侵入接入
  • Prompt 管理:在 UI 中编辑、版本化、A/B 测试 prompt,代码里 langfuse.get_prompt("v2") 拉取,无需重新部署
  • LLM 评估(Evals):支持人工标注 + LLM-as-judge 自动评估,自定义评估维度(准确性、相关性、安全等)
  • Analytics 仪表盘:token 用量、成本、延迟、错误率、评估分数的实时统计和趋势图
  • 多框架集成:LangChain / LlamaIndex / OpenAI SDK / Anthropic SDK / Vercel AI SDK 原生支持
  • 自托管:Docker Compose 一键部署,数据完全自主,MIT 协议无商用限制
  • 标注队列:团队协作标注数据,支持自定义标注流程和分配

价格

  • Hobby(免费):Cloud 版,50K units/月(约 50K observations),适合个人和原型
  • Core $29/月:100K units/月,无限用户、90 天数据保留,生产项目入门
  • Pro $199/月:100K units/月包含,无限历史/高并发/标注队列/SOC2·ISO27001 报告,适合规模化团队
  • Enterprise:联系销售(约 $2499/月起),SSO、审计日志、SLA、无限制
  • 自托管:完全免费,MIT 协议,自己出服务器成本(一台 4C8G VPS 即可跑)

体验与评测(资料整理)

说明:本节基于官方文档与公开评测整理,非本站独立实测环境,具体数据请以官方为准。 示例场景:自托管 Docker 部署 + Python SDK,追踪一个 RAG 应用(LangChain)的调用链。

亮点:

  • @observe() 装饰器一行加到函数上,自动追踪整条调用链,从用户 query → embedding → 检索 → LLM 生成全链路可见
  • 自动拦截 OpenAI 调用,token 用量和成本统计精确到每次调用,月度成本一目了然
  • Prompt 管理在 UI 改了直接生效,不用改代码重新部署,A/B 测试两个版本对比效果
  • LLM-as-judge 评估自动化:配置 GPT-4o 对每条 trace 打分(1-5 分),评估覆盖率和一致性不错
  • UI 直观,调用链树状展开,每步 input/output 都可点开看,调试 Agent 多步推理很方便
  • 自托管 4C8G VPS 跑了一个月稳定,PostgreSQL 存数据,查询快

踩坑:

  • 自动 instrument 偶尔漏追踪——用 async / 多线程时要注意 SDK 版本,0.x 到 1.x 有 breaking change
  • 免费版 50K units 很快用完(一次 Agent 调用可能产生 10+ observations),生产用自托管或付费
  • LLM-as-judge 评估有偏差——GPT-4o 自评倾向给自己高分,需要设计好 rubric 和 few-shot 示例
  • Prompt 管理的 UI 编辑器不支持 Jinja2 语法高亮,复杂模板调试不方便
  • 自托管要配好 PostgreSQL + Redis,数据量大时查询会慢,需要定期清理

上手

  1. 注册 Cloud 账号(或 docker compose up 自托管)
  2. 创建项目,获取 PUBLIC_KEYSECRET_KEY
  3. 安装 SDK:pip install langfuse
  4. 初始化 + 装饰器接入:
    from langfuse import observe
    from langfuse.openai import openai  # 自动追踪
    
    @observe()
    def chat(query):
        return openai.chat.completions.create(model="gpt-4o", messages=[...])
    
  5. 打开 Langfuse Dashboard 查看实时 trace
  6. 进阶:在 UI 创建 Prompt → 代码 langfuse.get_prompt("v2") 拉取 → 配置 LLM 评估自动打分

对比

维度LangfuseLangSmithHeliconePortkey
开源 / 自托管✅ MIT部分
Tracing
Prompt 管理
LLM 评估
免费额度50K units/月5K runs/月100K req/月10K req/月
多框架集成LangChain 优先OpenAI 优先
API 网关

避坑

  • observations 计数要注意:一条 trace 可能包含多个 observations(LLM 调用、工具调用、子函数),免费额度消耗比预期快
  • SDK 版本兼容性:1.x 版本 API 有 breaking change,升级前看 changelog,旧代码用 langfuse@0.x
  • LLM-as-judge 要校准:自动评估有系统性偏差,先用人工标注 50-100 条做 baseline,再调 rubric
  • 自托管数据清理:长期运行数据膨胀快,配 retention policy 定期清理旧 trace,否则 PostgreSQL 查询变慢
  • 生产环境加采样:高 QPS 场景全量 trace 会有性能开销和成本,用 @observe(enabled=False) 或按比例采样
  • Prompt 管理不适合复杂逻辑:纯文本模板好用,含复杂分支 / 代码逻辑的 prompt 还是放代码里更可控

适合 / 不适合

  • ✅ LLM 应用 / Agent 开发调试(看完整调用链)
  • ✅ Prompt 版本管理和 A/B 测试
  • ✅ LLM 输出质量监控和评估(人工 + 自动)
  • ✅ 需要 self-host 的数据敏感场景(MIT 自托管)
  • ✅ 成本和 token 用量监控
  • ❌ 纯 API 路由 / 负载均衡 / 多模型 fallback(用 Portkey / LiteLLM)
  • ❌ 非 LLM 后端的通用 APM(用 OpenTelemetry / Datadog / Grafana)
  • ❌ 需要企业级 SSO / 审计的自托管(Community 版功能有限,需 Enterprise)

FAQ

Q: Langfuse 和 LangSmith 怎么选? A: LangSmith 是 LangChain 官方的,和 LangChain 深度绑定但闭源、无自托管。Langfuse 开源可自托管、框架无关,LangChain / LlamaIndex / 原生 SDK 都支持。数据敏感选 Langfuse 自托管,深度用 LangChain 生态选 LangSmith。

Q: 自托管需要什么配置? A: 最小 4C8G VPS + PostgreSQL + Redis,Docker Compose 一键部署。月成本 $10-20(VPS)。数据量大加磁盘和定期清理。

Q: 和 Helicone 区别? A: Helicone 偏 API 代理 + 成本监控,是 OpenAI API 前面的中间层。Langfuse 更偏应用层可观测,追踪的是业务逻辑调用链(RAG、Agent 多步推理),不只是 API 调用日志。

Q: 性能开销大吗? A: SDK 异步上报,单次 trace 开销 < 5ms。高 QPS(1000+ req/s)建议加采样,否则 Langfuse 服务端和 PostgreSQL 压力大。

相关阅读

AutoGen · CrewAI · AnythingLLM

来源

本文的价格、版本号与性能数据均参考以下官方渠道整理,可能随时间变动,请以官方实时信息为准。

02 / 02类似工具推荐