Get started
- https://wandb.ai にアクセスし、project を選択します。
- サイドバー メニューで Agents を選択し、project に保存されているすべてのエージェントとの会話を表示します。
- タブバーで シグナル を選択します。

主要な用語
- Turn: ユーザーとエージェントの1往復のやり取りです。
- Rating: 一致したスパンに割り当てられる、0.0〜1.0の数値スコアです。
- Tags: 一致したスパンに割り当てられるラベルです。たとえば、“user-frustration” や “nsfw” などがあります。
シグナルの表
時間範囲セレクターと Filter バーを使用して、Scorer、エージェント、スコア範囲、または期間で結果を絞り込みます。Score volume タイムラインには、Weave が評価またはタグ付けしたシグナルの件数が表示されます。これは表に表示されている行を反映しており、タイムライン上でドラッグしてフィルターできます。
Weave によるスコアの正規化の仕組み
Weave はシグナルの結果を保存する前に、Scorer が返したタグ、評価、理由を正規化します。- タグは小文字に変換されます。
0-9、a-z、A-Z、スペース、および. , ; - & ! @ # $ % ?以外の文字は削除されます。連続する空白、アンダースコア、ダッシュは 1 つのダッシュにまとめられます。 - 1 つの結果につき保持されるタグは最大 10 個です。重複するタグは破棄されます。
- 理由からも同じ文字が削除され、256 文字に切り詰められます。
- 36 文字を超えるタグを含む結果、または複数の評価を含む結果は全体が拒否され、Weave はその結果のフィードバックを書き込みません。
新しいシグナルを作成する
- タグ:
user-frustrationやnsfwなど、一致するスパンにラベルを自動的に付与します。タグ を使用すると、スパンを分類したり、望ましくない動作にフラグを付けたりできます。signals UI には少なくとも 1 つのタグに一致したスパンの行だけが表示されるため、出力が表示されなくても、タグ シグナルが正常に実行されている場合があります。 - 評価: 一致するスパンに 0 から 1 のスコアを割り当てます。評価 を使用してエージェントのパフォーマンスを評価し、時間の経過に伴う改善を測定します。