AIエージェントを本番環境で動かし始めると、すぐに直面する問題がある。プロンプトが期待通り動いているか、トークン消費は想定内か、どのチェインでレイテンシが発生しているか——こうした「見えない」部分を可視化するのがオブザーバビリティだ。
2026年現在、LLMアプリケーション向けのオブザーバビリティツールとして主要な選択肢は3つに絞られてきた。オープンソースのLangfuse、LangChainエコシステムに密結合したLangSmith、そしてMLオブザーバビリティからLLM領域へ展開するArize Phoenixだ。
本記事では、この3ツールの公式ドキュメントと公開されている料金・仕様をもとに、トレーシング・評価・コスト分析の各観点から比較する。選定の参考にしてほしい。
比較サマリー:一覧表

| 項目 | Langfuse | LangSmith | Arize Phoenix |
|---|---|---|---|
| ライセンス | MIT(コアはOSS・ee/配下は商用ライセンス) |
プロプライエタリ | Apache 2.0(OSS) |
| セルフホスト | ◎ Docker Compose/K8s | △ Enterpriseプラン | ○ Docker / Python |
| 主要SDK | Python, JS/TS | Python, JS/TS | Python(OpenInference) |
| フレームワーク連携 | LangChain, LlamaIndex, OpenAI, Vercel AI SDK 他 | LangChain, LangGraph, OpenAI | LangChain, LlamaIndex, DSPy, CrewAI 他 |
| トレーシング | 自動インストルメンテーション | 自動(LangChain中心) | OpenTelemetryベース |
| 評価(Eval) | ◎ スコアAPI + LLM-as-judge | ◎ Evalハーネス内蔵 | ○ 組み込みEvalテンプレート |
| プロンプト管理 | ◎ バージョン管理付き | ◎ Hub連携 | △ 外部依存 |
| コスト分析 | ◎ モデル別トークン集計 | ○ 利用量トラッキング | △ 一部対応 |
| 無料枠 | ◎ セルフホスト無制限 | △ フリートライアウト | ◎ セルフホスト無制限 |
Langfuse:OSSファーストの統合プラットフォーム
LangfuseはGitHubスター3万4,000件以上(2026年9月4日時点のGitHub API実測値)のオープンソースAIエンジニアリングプラットフォームだ。トレーシング、プロンプト管理、評価、コスト分析のすべてを単一プラットフォームで提供する。なお2026年1月16日、LangfuseはClickHouseによる買収を発表した。ClickHouseは同発表で「コア機能は既存のMITライセンスのまま100%オープンソースであり、本番規模のセルフホストも継続できる」と明記しており、セルフホスト前提で選定していたチームの前提は変わらない。
2026年6月時点で、LangfuseはMCP(Model Context Protocol)経由の評価管理やScores API v3をリリースしており、開発速度が速い。特に評価機能は、人間によるアノテーションとLLM-as-judgeの両方をサポートし、スコアのドリフト検出まで実装している点が強力だ。
セットアップ:5分で始める
# Docker Composeでローカル起動
git clone https://github.com/langfuse/langfuse.git
cd langfuse
docker compose up -d
# Python SDKでトレース送信
pip install langfuse
from langfuse import Langfuse
langfuse = Langfuse(
public_key="pk-...",
secret_key="sk-...",
host="http://localhost:3000"
)
# OpenAI呼び出しを自動トレース
from langfuse.openai import openai
response = openai.chat.completions.create(
model="gpt-5.6-terra",
messages=[{"role": "user", "content": "AIエージェントの監視について教えて"}]
)
# この呼び出しがLangfuseダッシュボードに自動記録される
モデルIDについて: 本記事のコード例は、OpenAI側のモデルIDを2026年9月4日時点の現行ラインナップに統一している。OpenAI公式の料金ページ(2026年9月4日参照)のフラッグシップ表に載っているのはgpt-6-astra(入力$10/出力$50・100万トークンあたり)、gpt-5.6-sol($4/$20)、gpt-5.6-terra($2/$12)、gpt-5.6-luna($0.20/$1.20)の4本で、旧gpt-4oは同表に掲載がない。トレース検証用の例としては中位のgpt-5.6-terraを使う。
特徴: 公式のセルフホスト手順はDocker Composeでの起動を前提としており、追加のインフラ構築なしに立ち上げられる。Python SDKのデコレータ(@observe())を付けるだけで関数単位のトレースが記録される。プロンプトのバージョン管理とトレース・スコアが同じプラットフォーム上でひも付く点が、Langfuseを選ぶ主な理由になる。
評価(スコアリング)の実装
# カスタム評価をトレースに付与
langfuse.score(
trace_id=trace.id,
name="answer_relevance",
value=0.85,
comment="ユーザー質問に対して適切な回答"
)
Langfuseの強みはプロンプト管理にある。プロンプトテンプレートをバージョン管理し、タグ付けして本番・ステージングを切り替えられる。エンジニアとプロンプトエンジニアが同じプラットフォームで協業できる設計は評価が高い。
LangSmith:LangChainユーザーの第一選択
LangSmithはLangChain社が提供するLLMアプリケーションの開発・監視プラットフォームだ。LangChain/LangGraphとの統合が最も深く、チェインやグラフの可視化に優れる。
トレーシングはLangChainの実行を自動でキャプチャし、各ノードの入出力・レイテンシ・トークン数をダッシュボードで確認できる。特にLangGraphで構築したマルチエージェントシステムのデバッグでは、ノード間の遷移をグラフ表示できる点がLangSmith独自の強みだ。
# LangSmithのトレース設定(環境変数のみ)
import os
os.environ["LANGCHAIN_TRACING_V2"] = "true"
os.environ["LANGCHAIN_API_KEY"] = "ls__..."
os.environ["LANGCHAIN_PROJECT"] = "my-agent"
# あとは通常のLangChainコードで自動トレース
from langchain_openai import ChatOpenAI
from langgraph.graph import StateGraph
# ... エージェント構築コード
評価: LangChain/LangGraphを使っているならLangSmithが第一候補になる。設定は環境変数3行で完了し、コード変更なしで全トレースが記録される。ただしLangChainエコシステム外(素のOpenAI SDKやAnthropic SDK)のトレースは手動設定が必要で、この点はLangfuseの方が柔軟だ。
評価機能(LangSmith Eval)はテストケース管理とデータセット作成を含み、CI/CDパイプラインへの組み込みを想定した設計になっている。有料プランでのみ利用可能な点は予算に注意が必要だ。
Arize Phoenix:OpenTelemetry標準のOSS
Arize PhoenixはArize AI社が開発するオープンソースのLLMオブザーバビリティツールだ。MLモデル監視で実績のあるArizeの知見をLLM領域に展開したプロダクトで、OpenTelemetryプロトコルをベースにしている点が最大の特徴だ。
OpenInferenceと呼ばれる仕様でトレースデータを標準化し、LangChain、LlamaIndex、DSPy、CrewAIなど幅広いフレームワークに対応する。OpenTelemetry Collectorとの統合で、既存の監視スタック(Grafana、Datadog等)にLLMトレースを流し込めるのは、インフラチームがいる組織には大きなメリットだ。
# PhoenixをPythonで埋め込み起動
pip install arize-phoenix
import phoenix as px
session = px.launch_app()
# OpenInferenceでLangChainを自動計装
from openinference.instrumentation.langchain import LangChainInstrumentor
LangChainInstrumentor().instrument()
# 以降のLangChain呼び出しがPhoenixに記録される
評価: OpenTelemetryベースのため、既存の可観測性基盤との親和性が高い。特にGrafanaやPrometheusをすでに運用しているチームには導入障壁が低い。一方でプロンプトのバージョン管理は専用機能として持たないため、LLM開発まわりの作業を一つの画面で完結させたい場合はLangfuseやLangSmithのほうが向く。
ユースケース別おすすめ

スタートアップ・個人開発者 → Langfuse
セルフホストで無制限無料。Docker Composeで5分起動。プロンプト管理から評価までフル機能が揃い、OSSなのでベンダーロックインの心配もない。GitHubスター3万4,000件以上(2026年9月4日時点)のコミュニティが活発で、Issueへの対応も速い。
LangChain/LangGraphヘビーユーザー → LangSmith
LangGraphのノード遷移可視化は他のツールでは代替できない。Hubでのプロンプト共有や、EvalハーネスのCI/CD連携もLangChain社ならではの深い統合がある。予算が確保できるなら最も開発効率が高い選択肢だ。
大規模組織・既存監視基盤あり → Arize Phoenix
OpenTelemetry標準対応により、GrafanaやDatadogとの統合がスムーズ。MLモデル監視からLLM監視まで一貫した運用が可能。セキュリティ要件が厳しい環境でもApache 2.0ライセンスで安心して導入できる。
【要注意】導入時の落とし穴

失敗1:全トレースを無制限に保存する
❌ よくある間違い:本番環境の全リクエストをデフォルト設定でトレースし、数週間でストレージが逼迫
⭕ 正しいアプローチ:サンプリングレートを設定し、エラーまたは高レイテンシのトレースだけを保存する。Langfuseはプロジェクトごとにサンプリング設定が可能、LangSmithはEnvironmentごとに制御できる
なぜ重要か: トレースは1リクエストにつき入出力の全文とメタデータを保存するため、保存量はリクエスト数にほぼ比例して増える。クラウド版は取り込みイベント数に対する従量課金、セルフホストはストレージ、とどちらの形でも跳ね返ってくる。サンプリング率と保持期間は導入初日に決めておく項目だと考えたほうがよい
失敗2:ツールの機能を過信してコード品質を疎かにする
❌ よくある間違い:トレーシングツールを入れればデバッグが楽になると考え、エラーハンドリングやログ設計を後回しにする
⭕ 正しいアプローチ:トレーシングは「補助」であり、構造化ログ・例外処理・リトライロジックはアプリケーション側で実装する
補足: トレースは「何が起きたか」を記録するが、「なぜ起きたか」の分析にはコンテキストログが不可欠。両方を組み合わせて初めて効果的なデバッグが可能になる
失敗3:コスト監視を後回しにする
❌ よくある間違い:開発中はコスト分析をオフにし、本番リリース後に想定外のAPI料金に驚く
⭕ 正しいアプローチ:開発段階からLangfuseのコストダッシュボードを有効化し、モデル別・環境別の利用量を週次で確認する習慣をつける
補足: LLM APIの料金は入力・出力トークン数に比例するため、システムプロンプトへの数百トークンの追加や参照ドキュメントの詰め込みが、そのまま請求額に効く。トレースがないと、どの変更でトークンが増えたのかを後から特定できない
セキュリティと運用ルール
オブザーバビリティツールの導入時には、以下のセキュリティ観点を必ず確認してほしい。
- PIIのマスキング: トレースにユーザーの個人情報が含まれないよう、Langfuseの場合はPIIマスキング設定、PhoenixはOpenTelemetryのプロセッサーでフィルタリングする
- APIキーのローテーション: SDKに埋め込むAPIキーは環境変数で管理し、定期的にローテーションする
- セルフホストのアクセス制御: 社内LAN/VPN内に限定し、外部公開する場合は必ず認証レイヤー(OAuth/SSO)を追加する
- 保持ポリシー: トレースデータの保持期間を設定し、GDPRや個人情報保護法の要件を満たす
導入効果の測定方法
オブザーバビリティツールのROIを評価するなら、以下のKPIを導入前後で比較するのが有効だ。
| KPI | 導入前の計測手段 | 導入後の計測手段 | 判断できるようになること |
|---|---|---|---|
| 障害検知時間(MTTD) | ユーザー報告・エラーログの目視 | トレースのエラー率・失敗スパンのアラート | 失敗が出てから気づくまでの時間 |
| デバッグ時間/件 | ログのgrepと再現待ち | 該当トレースの入出力・中間ステップを直接参照 | 1件の不具合を切り分けるまでの手数 |
| 月間APIコスト | プロバイダの請求総額のみ | モデル別・機能別のトークン集計 | どのチェインがコストを食っているか |
| プロンプト更新頻度 | 更新前後を比べる材料がない | プロンプトのバージョン別スコア比較 | 更新して悪化していないかの判断 |
注記: 上表は「何をどう測れるようになるか」の整理であり、改善幅の実測値ではない。効果の大きさは導入前のログ整備状況・トラフィック規模・エージェントの構成で大きく変わるため、自環境で導入前のベースラインを取ってから比較してほしい。
特にAPIコストについては、ツールを入れただけで下がるものではない。ボトルネックの可視化→プロンプト最適化→モデルルーティングと順に手を入れて初めて動く数字であり、オブザーバビリティは「どこに手を入れるか」を決めるための材料にすぎない、という点は強調しておきたい。
3ツールの将来性とロードマップ
2026年6月時点の各ツールの直近動向から、今後の方向性を読み解く。
Langfuse: MCP(Model Context Protocol)経由の評価管理、Scores API v3と矢継ぎ早にリリースを重ねている。オープンソースでありながらエンタープライズ機能の充実が目立ち、LLM-as-judgeの評価パイプラインはワンストップ化が進んでいる。体制面では2026年1月16日にClickHouseによる買収が発表された。Langfuseはもともと全トレースをClickHouseに書き込む設計だったため、ストレージ層と製品が同じ会社に入った形になる。ClickHouseは発表時点で「Langfuse Cloudはこれまで通り単独のサービスとして提供を続ける」と述べている(ClickHouse公式ブログ・2026年1月16日)。
LangSmith: LangChainエコシステムの中心として、LangGraphの複雑なマルチエージェントフロー可視化に注力。プロンプトHubとの統合で、チーム間のプロンプト共有・再利用のワークフローが強化されている。
Arize Phoenix: OpenInference仕様の標準化を推進し、より多くのフレームワークへの対応を拡大中。OpenTelemetryコミュニティとの連携で、LLMに限らない統一可観測性基盤としての地位を確立しつつある。
3ツールとも急速に進化しており、半年後には比較表が陳腐化している可能性が高い。定期的な再評価をおすすめする。
各ツールの料金体系とコスト比較
オブザーバビリティツールの導入で意外と見落とされがちなのがランニングコストだ。特にLangSmithは従量課金制で、大規模運用時に予想以上のコストが発生するケースがある。
Langfuseの料金
セルフホストなら完全無料。クラウド版(Langfuse Cloud)は無料枠があり、無料のHobbyプランで月間50,000ユニットまで利用でき、それ以上は上位プラン(Core 月$29、Pro 月$199、Enterprise 月$2,499)または超過分の従量課金(10万ユニットあたり$8〜)になる(Langfuse公式料金ページ・2026年9月4日参照)。セルフホストの場合に別途かかるのはサーバー費用だけで、小規模ならVPSや小型インスタンス1台分の月額が目安(試算)になる。
LangSmithの料金
Developerプランは無料枠ありだが制限が厳しく、本格的なチーム利用にはPlusプラン(月$39/シート)以上が必要。Enterpriseは要問い合わせ。含まれるトレース数はDeveloperプランで月5,000、Plusプランで月10,000(いずれもbase traces)までで、超過分と追加の計算・保存量は従量課金になる。従量部分の単位は計算量がLCU(1LCU=$1.50)、保存量がLSU(1LSU=$1.00)で、base tracesの保持期間は14日である(LangSmith公式料金ページ・2026年9月4日参照)。特にLangGraphのノードが多いマルチエージェント構成では、1リクエストで数十トレースが生成されるため注意が必要だ。
Arize Phoenixの料金
オープンソース版は完全無料。Arize Cloudは無料枠から始められ、本格的なML/LLM監視が必要な場合にエンタープライズプランを検討する形になる。Phoenix単体での利用であれば、インフラコストのみで済む。
実装パターン:3ツールのコード比較
同じOpenAI API呼び出しを3ツールでトレースするコードを比較する。記述量とセットアップの手軽さの違いが一目でわかるはずだ。
Langfuseの場合
# 最小構成:デコレータ1行でトレース開始
from langfuse.decorators import observe
from openai import OpenAI
client = OpenAI()
@observe()
def agent_respond(user_message: str) -> str:
response = client.chat.completions.create(
model="gpt-5.6-terra",
messages=[{"role": "user", "content": user_message}]
)
return response.choices[0].message.content
# 呼び出すだけでLangfuseに自動記録
answer = agent_respond("今日の予定を教えて")
LangSmithの場合
# 環境変数3行 + LangChainラッパーが必要
import os
os.environ["LANGCHAIN_TRACING_V2"] = "true"
os.environ["LANGCHAIN_API_KEY"] = "ls__..."
os.environ["LANGCHAIN_PROJECT"] = "agent-monitor"
from langsmith import traceable
@traceable(run_type="chain")
def agent_respond(user_message: str) -> str:
from openai import OpenAI
client = OpenAI()
response = client.chat.completions.create(
model="gpt-5.6-terra",
messages=[{"role": "user", "content": user_message}]
)
return response.choices[0].message.content
Phoenixの場合
# OpenTelemetryベースでやや冗長
import phoenix as px
from opentelemetry import trace
from opentelemetry.sdk.trace import TracerProvider
# Phoenixセッション起動
session = px.launch_app()
# OpenTelemetry設定
trace.set_tracer_provider(TracerProvider())
tracer = trace.get_tracer(__name__)
def agent_respond(user_message: str) -> str:
with tracer.start_as_current_span("agent_respond") as span:
span.set_attribute("user_message", user_message)
from openai import OpenAI
client = OpenAI()
response = client.chat.completions.create(
model="gpt-5.6-terra",
messages=[{"role": "user", "content": user_message}]
)
result = response.choices[0].message.content
span.set_attribute("response_length", len(result))
return result
コード量だけ見ればLangfuseが最も少なく、次いでLangSmith、Phoenixの順になる。ただしPhoenixはOpenTelemetryの標準APIを使っているため、既存の監視スタックとの統合という点では最も柔軟だ。
チーム規模別の導入戦略
1人〜3人の小規模チーム
とにかくLangfuseのセルフホスト一択でよい。Docker Composeで5分起動、学習コストが低く、1人で全機能を使いこなせる。コストもVPS代のみ。まずは@observe()デコレータだけで全関数をトレース対象にして、1週間データを貯めてから本格的な分析に入る流れがスムーズだ。
4人〜15人の中規模チーム
Langfuse Cloud(Hobby/Teamプラン)またはLangSmith Developer/Plusプランが現実的。チーム内でのプロンプト共有、評価結果のレビュー、ダッシュボードの共有が必要になる。LangChainをヘビーに使っているならLangSmith、マルチフレームワークならLangfuseがバランス良い。
16人以上の大規模組織
Arize Phoenix + OpenTelemetry Collector + Grafanaの構成を検討する価値がある。すでにDatadogやNew Relicを導入しているなら、そこにLLMトレースを統合できるPhoenixの優位性が生きる。セキュリティ要件やデータローカライゼーションが必要な場合も、OSSのPhoenixやLangfuseセルフホストが選択肢になる。
移行のしやすさ:ロックインリスクを考える
ツール選定で見落としがちなのが「移行のしやすさ」だ。2年後に別ツールへ乗り換える必要が出たとき、どれだけスムーズに移行できるか。
LangfuseはオープンソースでデータのエクスポートAPIが整備されているため、移行障壁は最も低い。LangSmithはLangChainエコシステムとの結合度が高く、LangGraphの可視化に依存した運用をしていると移行コストが跳ね上がる。PhoenixはOpenTelemetry標準に準拠しているため、OTLP対応の他ツールへの移行は比較的容易だ。
整理: LangfuseとPhoenixはどちらもOpenTelemetry(OTLP)の語彙でトレースを受け取れるため、計装側を変えずに送信先だけ切り替える設計にしやすい。一方、独自形式で保持されたデータを別ツールへ持っていく場合は、エクスポートした上で受け側のスキーマに合わせる変換作業が必要になる。ツール選定時には「出口戦略」も考慮に入れることを強く推奨する。
関連記事・次に読む
- RAGの精度を測る|RAGASと評価指標の実装ガイド
- CrewAI完全ガイド|マルチエージェント設計2026
- マルチエージェント設計パターン完全ガイド – Orchestrator-Worker/Reflection/Swarm/Sequentialの使い分け
- AIエージェントのコスト最適化7原則 – トレースで見つけたボトルネックを実際に削る側の記事
- モデルルーティング設計ガイド2026|タスク複雑度×コスト判断フロー
運営元 Uravation よりAIエージェントを構想から本番運用まで進める順番と、体制・KPIの決め方をまとめた資料を無料で公開しています。 AIエージェント導入ロードマップを受け取る(無料)
参考・出典
- Langfuse Docs – 2026年9月4日確認。OSS AI Engineering Platform
- LangSmith Documentation – 2026年9月4日確認。旧URL
docs.smith.langchain.comは現在このアドレスへ転送される - Arize Phoenix Docs – 2026年9月4日確認。OpenInference Specification。旧URL
docs.arize.com/phoenixは現在このアドレスへ転送される - Langfuse GitHub – スター3万4,000件以上(2026年9月4日時点)。コアはMITライセンス、
ee/配下のみ商用ライセンス - ClickHouse welcomes Langfuse – ClickHouse公式ブログ・2026年1月16日。買収発表とMITライセンス/セルフホスト継続の明記
- OpenAI API Pricing – 2026年9月4日参照。
gpt-6-astra$10/$50、gpt-5.6-sol$4/$20、gpt-5.6-terra$2/$12、gpt-5.6-luna$0.20/$1.20(100万トークンあたり) - OpenTelemetry Documentation – 標準仕様
まとめ:今日から始める3つのアクション
- 今日: まずLangfuseをDocker Composeでローカル起動し、既存のエージェントコードに
@observe()デコレータを1つ追加してトレースを確認する - 今週中: 主要なチェイン3つにトレースを追加し、レイテンシとトークン消費のベースラインを計測する
- 今月中: 評価パイプラインを1つ構築し、人間の評価とLLM-as-judgeを組み合わせた品質モニタリングを自動化する
この記事を読んで導入イメージが固まってきた方へ
UravationではAIエージェント導入の研修・コンサルを行っています。
この記事はAIgent Lab編集部がお届けしました。
