注: 以下の翻訳の正確性は検証されていません。AIPを利用して英語版の原文から機械的に翻訳されたものです。

Pipeline Builder の LLM 評価スイート

Pipeline Builder の大規模言語モデル(LLM)評価スイートでは、LLM のデータ加工とロジックをパイプラインにデプロイする前にテストできます。評価スイートに複数の評価を設定し、分離されたテスト環境で実行して、その動作を確認できます。

評価スイートは、LLM を使用ノードと連携するように設計されています。各評価では、テストデータと1つ以上の評価ツールを使用して LLM を使用ノードを実行し、モデルの出力と期待される結果との比較をレポートします。

このガイドでは、次の内容を説明します。

  • 評価スイートへの移動
  • 新しい評価の作成
  • 評価の設定
  • 評価の実行と結果の確認
  • サポートされている評価ツール

評価スイートに移動する

画面右側のツールバーの一番下にあるアイコンを選択して、評価スイートを開きます。

評価スイートのアイコンは、Pipeline Builder の右側のツールバーの一番下に表示されます。

評価スイートパネルでは、既存の評価を選択するか、新しい評価を作成できます。新しい評価を作成するには、パネル右上の + 新規を選択します。

新しい評価を作成する

グラフ上で評価する LLM を使用ノードを選択し、編集開始を選択します。

グラフ上のプロンプトに、LLM を使用ノードを選択するよう指示が表示され、編集開始の選択肢が提示されます。

新しい評価を開始すると、Pipeline Builder で評価スイートの設定画面が開きます。

評価スイートの設定画面には、テストデータ、出力、評価ツールの項目が表示されます。

評価を設定する

テストデータの追加、評価名の入力、評価ツールの追加、出力データセットの選択を行い、評価を設定します。

テストデータを追加する

テストデータには、LLM を使用ノードへの入力として評価するすべての列を含めてください。また、期待される LLM 出力を必要とする評価ツールを使用する場合は、その出力を含む列も含めてください。

既存の Foundry データセットをインポートするには、テストデータ項目で + 追加を選択するか、入力ノードを選択して選択を選択します。入力データを手動で入力するには、入力ノードを選択して Enter を選択します。

矢印は、テストデータ項目の + 追加の選択肢と、入力ノードの下にある選択の選択肢を示しています。

評価に名前を付け、評価ツールを追加する

パネル右上のテキストボックスに評価名を入力します。次に、評価ツールラベルの横にある + アイコンを選択して、評価ツールを追加します。利用可能な評価ツールのメニューが表示され、1つ以上の評価ツールを選択できます。

評価ツールメニューには、文字列の完全一致など、利用可能な評価ツールが表示されます。

評価ツールを選択すると、Pipeline Builder でその評価ツールの設定ページが開きます。以下の例では、文字列の完全一致評価ツールを使用しています。この評価ツールは、実際の値の列と期待値の列を比較し、合格条件に基づいてブール値の結果を返します。任意のパラメーターであるマッチケースと空白をトリムするも設定できます。設定を適用した後、右上の閉じるを選択してこの画面を終了します。

設定ページには、文字列の完全一致評価ツールのオプションが表示されます。

出力データセットを選択する

評価スイートの出力項目で、評価の出力を格納する既存のデータセットを選択するか、新しいデータセットを作成します。

評価スイートの出力項目には、既存のデータセットを選択するか、新しいデータセットを作成する選択肢が表示されます。

評価を実行して結果を確認する

評価スイートを実行するには、パイプラインの編集権限が必要です。

評価を設定した後、画面右上の評価スイートを実行を選択します。

評価の進行状況を確認するには、画面右上の Build レポートを開くリンクを選択します。

評価スイートパネルには、実行中のステータスと Build レポートを開くリンクが表示されます。

ビルドレポートで、評価の実行状況を監視します。

ビルドレポートには、評価スイートのビルドの進行状況がリアルタイムで表示されます。

評価のビルドが完了したら、画面下部の評価結果タブで結果のプレビューを表示します。

評価結果タブには、評価ツールの出力列と各行の合格結果が表示されます。

サポートされている評価ツール

Pipeline Builder の評価スイートは、次の評価ツールをサポートしています。

  • 文字列の完全一致(設定可能): 実際の文字列が期待される文字列と完全に一致するかを確認します。デフォルト:一致の判定では、大文字と小文字を区別し、空白を含めます。
  • 整数の範囲: 実際の値が期待される値の範囲内にあるかを確認します。整数のみがサポートされています。
  • 数値の完全一致: 2つの数値が完全に等しいかを確認します。Integer、Long、Float、Double、Short のデータ型をサポートしています。
  • 文字列配列の完全一致(設定可能): 2つの文字列配列に同じ要素が含まれているかを確認します。デフォルト:比較は順序に依存し、大文字と小文字を区別し、空白を含めます。
  • 数値配列の完全一致(設定可能): 2つの数値配列に同じ要素が含まれているかを確認します。Integer、Long、Float、Double、Short のデータ型をサポートしています。デフォルト:比較はデフォルトで順序に依存します。
  • 日時の完全一致: 2つの日時値が完全に等しいかを確認します。Date と Timestamp の値をサポートしています。
  • 汎用の完全一致: 実際の値が期待される値と同一かを確認します。数値型は比較のために型変換され(たとえば、整数は同じ値の Double と一致することがあります)、日付型とタイムスタンプ型も同様に型変換されます。オブジェクトとオブジェクトセットは参照で、構造体とマップは順序を問わないキーと値のペアで、リストは順序付きの要素で、モデルは識別子とパラメーターで比較されます。お使いのデータ型に固有の評価ツールが存在する場合は、その評価ツールを使用してください。より詳細な比較オプションと、より高い型安全性が提供されます。
  • 浮動小数点数の範囲: 実際の値が期待される値の範囲内にあるかを確認します。パラメーターとしてすべての数値型がサポートされています。
  • 日時の範囲: 実際の値が期待される値の範囲内にあるかを確認します。Date と Timestamp の値のみがサポートされています。
  • レーベンシュタイン距離: 一方の文字列を他方の文字列に変えるために必要な1文字単位の編集(挿入、削除、置換)の最小回数を計算し、2つの文字列の違いを測定します。
  • 文字列の長さ: 実際の文字列の長さが期待される範囲内にあるかを確認します。
  • キーワードチェッカー: 実際のテキストに特定のキーワードが含まれているかを確認します。
  • 正規表現の一致: 実際の文字列が期待される正規表現に一致するかを確認します。
  • LLM-as-a-judge: LLM を使用して、指定された値に対してユーザー定義の条件が true になるかを評価します。条件が満たされた場合は true、それ以外の場合は false を返します。実際の値として、参照型(オブジェクトロケーター、オブジェクト RID、オブジェクトセット、モデル)を除く任意のデータ型を受け付けます。明確で検証可能な表明として記述された条件パラメーターと、評価に利用可能なモデルが必要です。