Skip to main content
W&B Weave は、信頼性の高いエージェントと LLM アプリケーションを構築するためのオブザーバビリティおよび評価プラットフォームです。Weave を使うと、AI アプリケーションで何が起きているのかを把握し、パフォーマンスを測定し、継続的かつ体系的に改善できます。 LLM アプリケーションの構築は、従来のソフトウェア開発とは本質的に異なります。LLM の出力は非決定的なため、デバッグは難しくなります。品質は主観的で、コンテキストにも左右されます。プロンプトを少し変えただけでも、予期しない挙動の変化が生じることがあります。従来のテスト手法だけでは十分ではありません。

中核機能

Weaveは、次の中核機能を提供します。
  • エージェントセッションやマルチターン会話、またはアプリケーションコード内の個々の関数呼び出しと出力を可視化
  • 厳選されたテストケースに対してパフォーマンスを測定するための体系的な評価
  • 何が変更されたのかを把握できるようにする、プロンプト、モデル、データのバージョン追跡
  • さまざまなプロンプトやモデルを比較するための実験
  • 人による判断やアノテーションを収集するためのフィードバック収集
  • LLMの安全性と品質を確保するために、ガードレールとScorerを使って本番環境で行うモニタリング

ワークフローを選択する

Weave では、この機能を 2 つの異なるワークフローで提供しています。
  • 自動エージェントトレース
  • アプリケーション内の任意の LLM Call や関数にインストルメンテーションを追加して、それらの入力、出力、コードをトレースする

エージェントをトレースする

Weave は、セッション、LLM Call、ツール実行など、エージェントとの会話のライフサイクル全体にわたるエージェント向けのオブザーバビリティを提供します。 エージェントトレースは OpenTelemetry (OTel)GenAI semantic conventions に基づいています。エージェントがすでに OTel でインストルメントされている場合は、コードを再度インストルメントしなくても、既存のスパンを Weave に送信できます。Weave は任意の OTel スパンを受け入れ、その属性を保存するため、クエリできます。invoke_agentexecute_tool など、GenAI のエージェント規約に従うスパンは、Agents ビューで会話、ターン、ツールコールとして表示されます。独自のエージェントからこれらのスパンを出力する方法については、カスタムエージェントのクイックスタート を参照してください。 エージェントを開発している場合は、組み込みインテグレーションを選択するために エージェントインテグレーションのクイックスタート から始めるか、独自のエージェントを手動で計装するには カスタムエージェントのクイックスタート に従ってください。Weave SDK がエージェントをどのようにモデル化するかについては、エージェントをトレースする を参照してください。 Claude Code や OpenAI Agent SDK などのサポート対象のサードパーティ製エージェントハーネスを使用している場合、Weave は追加のコードなしで自動的に計装します。サポートされているすべてのフレームワークについては、インテグレーション を参照してください。

関数をインストルメントしてトレースする

個々の関数呼び出し、アプリケーションコード、またはカスタムロジックをトレースする場合は、Weave Ops と Call を使用します。任意の関数に 1 行追加するだけで、入力、出力、コスト、トークン数、レイテンシをトラッキングできます。さらに、次のこともできます。
  • データが LLM アプリケーション内をどのようにエンドツーエンドで流れるかをトラッキングします。
  • LLM のフィードバックの生成に使用されたソースドキュメントを確認できます。
  • 特定のプロンプトや、回答がどのように生成されるかを詳しく確認できます。
個々の関数をトレースするには、Weave の Op tracing クイックスタート に従うか、Weave の Ops and Call の使用方法を確認してください。 Weave SDK は、多数のフレームワークや LLM プロバイダに対して自動的にパッチを適用し、コード内の LLM Call からトレースを自動取得します。サポートされるすべてのプロバイダとフレームワークについては、インテグレーション を参照してください。

エージェントトレースを使用する場合とアプリケーションのインストルメンテーションを使用する場合

何を観測したいかに応じて、使用するワークフローを選択してください。
  • エージェントを構築または実行している場合は、エージェントトレースを使用してください。 サポートされているエージェント harness やエージェント SDK を使用している場合、または自分でインストルメントできるカスタム エージェントを構築している場合に適しています。
  • アプリケーションコードをトレースする場合は、アプリケーションのインストルメンテーションを使用してください。 これは、会話ではなく個別の Call を中心に構成されたアプリケーション (RAG パイプライン、要約 endpoint、カスタム業務ロジックなど) に適しています。
それぞれの方法では、UI の異なる場所にトレースが記録されます。エージェントトレースは Agents ページに表示され、weave.op の Call は Traces ページに表示されます。同じ Weave プロジェクトで両方の方法を使用できますが、生成されるトレースは別々です。 どこから始めればよいかわからず、システムにエージェントが含まれている場合は、エージェントインテグレーションのクイックスタート を使用したエージェントトレースから始めてください。それ以外の場合は、Op tracing クイックスタート から始めてください.?

評価

評価を使ってエージェントまたは LLM アプリケーションのパフォーマンスをベンチマークおよび監視し、品質と信頼性を継続的に向上させます。
  • どのモデルやプロンプトのバージョンが、どのようなパフォーマンスにつながったかをトラッキングします。
  • 1 つ以上のスコアリング関数を使って応答を評価するためのメトリクスを定義できます。
  • 複数のメトリクスにわたって、2 つ以上の異なる評価を比較できます。特定のサンプルのパフォーマンスを見比べることもできます。
評価パイプラインを構築する

あらゆるものをバージョン管理

Weave は、プロンプト、データセット、モデルの設定をバージョン管理します。何か問題が起きたときは、何が変わったのかを正確に確認できます。うまくいったときは、その状態を再現できます。 バージョン管理について詳しく見る

プロンプトとモデルを試す

APIキーを用意すれば、Weave Playground でプロンプトをテストし、異なる商用モデルの応答を比較できます。 Weave Playground で試す

フィードバックを収集する

本番環境での利用を通じて、人によるフィードバック、アノテーション、修正を収集します。このデータを使用して、より良いテストケースを作成し、アプリケーションを改善します。 フィードバックを収集する

本番環境を監視する

評価で使用するのと同じscorerで本番トラフィックをスコアリングします。問題がユーザーに届く前に検知できるよう、ガードレールを設定します。 ガードレールとモニターを設定する

Weave を使い始める

Weave は Python と TypeScript 向けの SDK を提供しています。どちらの SDK も、トレース、評価、データセット、および Weave の中核機能をサポートしています。クラスベースの Models や Scorers など、一部の高度な機能は Weave TypeScript SDK では利用できません。 Weave を使い始めるには、次の手順に従います。
  1. https://wandb.ai/site で W&B アカウントを作成し、https://wandb.ai/authorize で APIキーを取得します。
  2. Weave をインストールします:
  1. スクリプトで Weave を import し、プロジェクトを初期化します。<your-team> を W&B チーム名に、<your-project> を W&B のプロジェクト名に置き換えます。
これで Weave を使う準備が整いました。