分析Contourボードボードの説明

注: 以下の翻訳の正確性は検証されていません。AIPを利用して英語版の原文から機械的に翻訳されたものです。

ボードの説明

Contour での探索と分析は、ボードを順に使って行います。ボードには、チャートの作成や計算を行うものもあれば、絞り込みや列の削除などによってデータセットを操作するものもあります。

この概要テーブルのリンクを使って、このページの各種類のボードに移動できます。

ボード説明可視化行の絞り込み集計列の操作重複の削除
概要テーブルの行数を表示します。はいいいえいいえいいえいいえ
フィルター数値、テキスト、または日時の値でデータセットを絞り込みます。いいえはいいいえいいえはい
式式言語を使って新しい列を導出したり、複雑な絞り込みを行ったりします。いいえはいいいえはいいいえ
テーブル生データの一部を表示し、スキーマを探索し、データカバレッジのメトリクスを計算します。はいいいえいいえいいえいいえ
ヒストグラムデータのヒストグラムを作成し、特定のグループに絞り込みます。はいはいはいはい、ピボットオプションを使用いいえ
分布データの分布図を作成します。はいはいいいえいいえいいえ
時系列X 軸に日時を使用したチャートを作成し、特定のグループに絞り込みます。はいはいいいえいいえいいえ
列の編集列の結合、複製、削除、名前変更、分割を行います。いいえいいえいいえはいいいえ
データの変換データの難読化、値の検索と置換、日付のパースを行います。いいえいいえいいえはいいいえ
チャートカスタマイズ可能な多層チャートを作成します。はいはいはいいいえいいえ
グリッド2列のカテゴリ型データから行列を作成します。セルで絞り込みができ、ヒートマップとして表示されます。はいはいいいえいいえいいえ
ヒートマップ座標データに基づくヒートマップを表示します。はいはいいいえいいえいいえ
ピボットテーブル1つ以上のメトリクスのピボットテーブルを作成します。はいはいはいはい、ピボットオプションを使用いいえ
列エディター新しい列を導出したり、不要な列を削除したりします。いいえいいえいいえはいはい
複数列エディター列の名前変更、削除、並べ替え、またはデータ内の重複行の削除を行います。いいえいいえいいえいいえいいえ
エンリッチ別のデータセットでデータを拡充し、両方のデータセットの列を返します。いいえいいえいいえはいはい
リンク別のデータセットと結合し、そのデータセットの一致するレコードを返します。いいえいいえいいえはいはい
集合演算外部データセットに基づいて、行を保持、追加、削除します。いいえはいいいえいいえいいえ
結合事前に定義された結合を実行します。いいえはいいいえいいえいいえ
エクスポート最終的に絞り込んだ観測の集合を CSV または XLS にエクスポートします。いいえいいえいいえいいえいいえ
列の並べ替えテーブルの列を並べ替えます。いいえいいえいいえいいえいいえ
マクロテンプレート化された変換をパスに適用します。いいえいいえいいえいいえいいえ
並べ替え1列以上の列に基づいてデータの行を並べ替えます。いいえいいえいいえいいえいいえ
計算複数の集計計算を表示します。はいいいえはいいいえいいえ
ピボット解除一部の列を行に変換して、データの形状を変更します。いいえいいえいいえはいいいえ

概要

概要ボードは、パスの現在の場所にあるテーブルの行数と列数を表示します。

データをまったく絞り込んでいない場合、これは開始時の集合の行数です。フィルターを適用している場合(たとえば、ヒストグラムを追加して特定のバーを選択した場合)、これは絞り込み後に残っている行数です。


フィルター

フィルターボードの目的は、カスタマイズ可能なフィルターをデータセットに適用することです。ほかのボード(分布、ヒストグラム)でもフィルターを適用できますが、フィルターボードでは、複数の変数を含むより複雑なフィルターを1か所で作成できます。

フィルターボードでリストを使うことは、SQL の WHERE IN (x,y,z) 句に相当します。Contour は、フィルターボードで数千項目のリストを処理できます。ただし、大きなリストはブラウザーに負荷をかけ、大きすぎるリストはブラウザーの障害を引き起こす可能性が高くなります。この場合、リストを別の集合として Contour にインポートし、リンクボードまたは集合演算ボードを使って絞り込みを実装する必要があります。リンクボードまたは集合演算ボードの使い方をご覧ください。

設定

フィルターを追加をクリックし、絞り込む列を選択してから、ドロップダウンでフィルターの種類を選択します。選択した列に基づいて、Contour が適切なフィルターのカテゴリーを選択します(たとえば、数値の列には数値カテゴリー)。

フィルターの設定

一部のテキストフィルターではワイルドカードと正規表現を使用できます

一部のテキストフィルターでは、ワイルドカードを使用できます。* は複数の文字に、? は1文字に置き換えることができます。

「次に一致:」(正規表現)テキストフィルターでは、正規表現を直接入力できます(引用符や文字列を示す記号は不要です)。

別のフィルターを追加するには、フィルターを追加をもう一度クリックします。すべてまたは1つ以上のフィルターに一致するように選択できます。フィルターを削除するには、そのフィルターの横にあるゴミ箱ボタンをクリックします。 保存をクリックして、フィルターを適用します。

テキストフィルターの詳細

テキストフィルターには現在、次の選択肢があります。

  • **を含む:**検索語のいずれかを含む行を返します。検索語にはテキストのみを含める必要があります。たとえば、語句「hello」は、「hihellohi」を含む行に一致します。
  • **次を含む(ワイルドカード含む):**検索語のいずれかを含む行を返します。検索語には、1文字のワイルドカードを示す ?、または複数文字のワイルドカードを示す * を含めることができます。たとえば、語句 h?l*o は「hi hello hi」または「hi halqqqqqo hi」に一致します。
  • 次に等しい: 検索語のいずれかと等しい行を返します。検索語にはテキストのみを含める必要があります。たとえば、語句 hello は「hello」に一致しますが、「hi hello hi」には一致しません。
  • **次に一致する(ワイルドカード含む):**検索語のいずれかと等しい行を返します。検索語には、1文字のワイルドカードを示す ?、または複数文字のワイルドカードを示す * を含めることができます。たとえば、語句 h?l*o は「hello」または「halqqqqqo」に一致します。
  • 次に一致: 語句のいずれかに一致する行を返します。ここで、語句は正規表現です。この選択肢は、Java Pattern ↗ を使って正規表現を評価します。

式

Contour は、ヒストグラムやチャートなどの視覚的なツールに加え、式ボードも提供しています。このボードでは、Contour の豊富な式言語を使って、データから新しい列を導出したり、複雑な絞り込みや集計を行ったりできます。

  • 式エディターを使う際に、? アイコンをクリックすると、式言語のクイックリファレンスを表示できます。
  • 入力すると、候補となる関数がドロップダウンに表示されます。クリックするか、Enter キーを使って、必要な関数を選択します。

列名は大文字と小文字を区別します。また、列を選択する際は、列名を二重引用符で囲んでも囲まなくてもかまいません。たとえば、year("birthdate_col") は year(birthdate_col) と同等です。一貫性を保つため、このドキュメントでは列名を二重引用符で囲んで記載しています。


テーブル

テーブルボードは、データセットのスナップショットを表形式で表示し、データセットの先頭から limit(デフォルト: 1,000)行のみを表示します。この制限はブラウザーのパフォーマンスの問題を防ぐために設けられており、通常は変更できません。

テーブルボードは、データが想定どおりになっているかを抜き取り確認するのに便利です。テーブルでは、列をドラッグアンドドロップして並べ替えたり、各列のドロップダウンから操作を選択したりできます。こうしたテーブルの書式設定の変更は、基になるデータを変更しません(一部の列のみを表示しても、基になるデータにはすべての列が存在します)。

テーブルの列操作

複数の列を一度に移動するには、Shift キーを押しながら列を選択します。 設定パネルを使って、複数の列を一度に変更することもできます。

テーブルの設定

条件付き書式設定

列のドロップダウンをクリックすると、テーブルボードに条件付き書式設定を追加できます。

条件付き書式設定の操作

次に、ダイアログを使って、対象の列にルールを追加します。条件付き書式設定が適用されたセルは、選択した色の文字と背景で表示されます。日付列ではルールを利用できません。

条件付き書式設定のダイアログ

テーブルボードとテーブルパネルの違い

パス内の任意の位置にテーブルボードを追加して、その時点のデータをすばやくプレビューできます。また、パス表示からテーブルパネルに切り替えることもできます。

テーブルパネルでは、ボードではなくテーブルが中心となるため、ボードを追加するたびにデータがどのように変化するかを確認できます。これは、式を書くときに特に役立ちます。

テーブル表示

右上のテーブルをクリックすると、テーブルパネルに切り替えられます。もう一度ボタンをクリックするか、非表示をクリックすると、パス表示に戻ります。

テーブルパネルは条件付き書式設定に対応していません。


ヒストグラム

ヒストグラムボードは、指定した列の一意の値ごとに集約し、結果を棒グラフとして表示します。

たとえば、次のヒストグラムは、タクシーの乗車が始まったニューヨークの地域ごとに、平均乗車距離を計算しています。

タクシーのヒストグラムの例

上位10本の棒のみが表示されます。さらに棒を表示するには、+ 追加表示をクリックします。一度に最大50個の値を表示できます。値が50個を超える場合は、ドロップダウンを使って範囲のほかの部分に移動します。

SQL での同等の処理

ヒストグラムボードは、SQL の GROUP BY 句を可視化したものです。 上記のヒストグラムの例は、次の SQL クエリと同等です。

Copied!
1 2 3 SELECT start_neighborhood, mean(trip_time_in_secs) FROM <table name> GROUP BY start_neighborhood

設定

  • Y 軸
    • データのグループ化に使う列を選択します。この列の離散値に基づいてデータがグループ化され、その後に集約値が計算されます。
  • X 軸
    • 計算する集約を選択し、集約が件数でない場合は、適用先の列を選択します。
  • 集約
    • 利用可能な集約メトリクスは、件数(レコード数)、ユニークな値の数、最小、最大、合計、平均、近似中央値、標準偏差、分散です。
      • 件数を除き、集約の適用先の列を指定する必要があります。ユニークな値の数では、任意の列を選択できます。
      • 最小、最大、合計、平均、近似中央値、標準偏差、分散は、数値列にのみ適用できます。
      • 集約値は、Y 軸として選択した列の一意の値ごとに計算されます。

近似中央値の集約値は近似値です。Contour は、割合の値を0.5、精度をデフォルト値として percentile_approx ↗ 関数を呼び出します。

ピボット済みデータへの切り替え

ピボット済みデータに切り替えをクリックすると、ヒストグラムの後に追加するボードは、元のデータセットではなく、テーブルで計算された集約済みデータを使います。

新しいデータセットには、元のヒストグラム設定で Y 軸に選択した列と、集約値の列が含まれます。次に例を示します。

ヒストグラムのピボット

並べ替え

ヒストグラムは、デフォルトで集約値の降順に並べ替えられます。非常に大きなヒストグラムでは、集約値の上位1,000個の値を対象に並べ替えが行われます。

ドロップダウンを使って、代わりに Y 軸の列の値で並べ替えるように変更したり、並べ替えの方向を変更したりできます。

絞り込み

ヒストグラム上のデータを選択すると、後続のボードで使うデータセットを絞り込めます。

選択モード:

  • 棒グラフを選択すると、Y 軸として選択した列の1個または複数の一意の値で絞り込めます。

    ヒストグラムの棒の選択

  • 範囲を選択すると、集約値で絞り込めます。たとえば、範囲選択を使って、値が特定のしきい値を超えるカテゴリーのみを選択できます。

    ヒストグラムの範囲選択

    次に、保持を選択すると、選択した値のみに絞り込まれます。外すを選択すると、選択していない値のみが保持されます。

    ヒストグラムの保持と除外


分布

分布ボードは、集約メトリクスについて、数値変数の分布を表示します。

分布ボードはヒストグラムに似ていますが、特定の値ではなく、値の範囲に基づいて集約したデータを表示します。たとえば、次の分布は顧客の年齢に関するデータを表示しています。年齢は10個の範囲(「バケット」)に分割されています。

分布

SQL での同等の処理

分布ボードの計算では、まず X 軸の最小値と最大値を求め、バケットを計算する関数を作成します。分布に相当する SQL は、おおよそ次のようになります。

Copied!
1 2 3 SELECT X_AXIS_BUCKET_FUNCTION([x-axis-column]), <AGGREGATE_METRIC>([aggregate-column]) FROM <PARENT_BOARD> GROUP BY X_AXIS_BUCKET_FUNCTION([x-axis-column])

設定

  • X 軸
    • 数値の列を選択します。この列の値は等幅の範囲にグループ化され(つまり、データが10個、100個、または1000個の「バケット」に均等に分割され)、その後に集約が適用されます。この軸のスケール(線形または対数)も設定できます。
  • Y 軸
    • 各範囲で計算する集約メトリクスを選択します。
      • 利用可能な集約メトリクスは、件数(レコード数)、ユニークな値の数、最小、最大、合計、平均、近似中央値、標準偏差、分散です。件数を除き、集約の適用先の列を指定する必要があります。
    • Y 軸のスケール(線形または対数)も設定できます。

近似中央値の集約値は近似値です。Contour は、割合の値を0.5、精度をデフォルト値として percentile_approx ↗ 関数を呼び出します。

絞り込み

絞り込みに使う範囲を選択するには、チャート上で目的の区間をクリックしてドラッグします。

分布の選択

その後、編集可能なボードのフッターで区間をさらに細かく調整できます。

分布のフッター

選択した区間の値を保持するか、その値を外すことで、選択していない値のみを保持できます。選択をクリアするには、クリアボタン(x)をクリックします。


時系列

時系列ボードでは、時間間隔でデータをグループ化し、そのデータの集約メトリクスを計算できます。

たとえば、顧客の個人情報を含むデータセットがある場合、次の時系列ボードは各年に生まれた人の数を計算します。

時系列

さらに、シリーズとして使用する列を指定できます。上記の例では、性別をシリーズとして使用できます。時系列ボードでは、シリーズ列の値ごとに1本の線が表示されます。この場合は、F(女性)または M(男性)です。

時系列のシリーズ

時系列はデータセット全体を対象に集約を行い、表示時には出力を最初の1000個の値に絞ります。

設定

  • X 軸
    • DateTime 列を選択して、時間でデータをグループ化します。次に、時間単位を選択すると、その長さの間隔でデータがグループ化されます。利用可能な単位は、秒、分、時、日、週、月、年です。
  • 集約
    • 各時間間隔に適用する集約を定義します。
    • 利用可能な集約メトリクスは、件数(レコード数)、ユニークな値の数、最小、最大、合計、平均、標準偏差、分散です。
      • 件数を除き、集約を適用する列を指定する必要があります。ユニークな値の数では、任意の列を選択できます。
      • 最小、最大、合計、平均、近似中央値、標準偏差、分散は、数値列にのみ適用できます。
  • シリーズ
    • データをシリーズに分けるための列を選択します。列の離散値ごとに1つのシリーズ(チャート内の線として表示)が作成されます。

近似中央値の集約は近似計算です。Contour は、パーセンテージ値を0.5、精度をデフォルトとして percentile_approx ↗ 関数を呼び出します。

フィルタリング

時系列で日付範囲を選択すると、後続のボードで使用するデータセットを絞り込めます。範囲を選択をクリックし、目的の期間をクリックしてドラッグします。(編集可能なボードのフッターで、期間をより細かく調整できます。)選択をクリアするには、選択をクリアアイコンをクリックします。

ドロップダウンから保持を選択すると、選択した値のみに絞り込まれます。外すを選択すると、選択していない値のみが保持されます。

時系列の範囲選択


列の編集

Contour では、次のボードを使用して列を編集できます。

  • 2列以上を統合します。
  • 列を複製します(たとえば、元のデータに影響を与えずに、その列に対する操作を試す場合)。
  • テーブルから列を外すことができます。
  • 列の名前を変更します。
  • 区切り文字で列を分割します。

データの変換

次のボードを使用して、列のデータを変換できます。

難読化

  • セルの値のハッシュ(たとえば、名前などの機密データを隠すため)。列内の各値は、SHA-1 ↗ ハッシュ関数を使用して、その値のハッシュ表現に置き換えられます。

SHA-1 ハッシュは復号可能であり、完全に安全とは見なされていません。そのため、データコンプライアンスの目的では使用しないでください。

  • 値の一定数の文字をマスキング(たとえば、電話番号の末尾2桁以外をすべてマスクします)。
  • データ列の k-匿名化。これは、データセットに適用するしきい値(k)を設定し、同じ機密情報の組み合わせを持つレコードが少なくとも k 件存在するようにすることで、再識別のリスクを軽減するプライバシー保護手法です(個人を特定できる情報がない場合も含みます)。この処理は、データの再識別につながる可能性がある特定のフィールドを「抑制」することで行われます。

ユースケースに適した k 値は、コンテキストによって決まります。通常、組織は分析のコンテキストと再識別の統計的リスクに基づいて、k 値の設定に関する独自のポリシーを定めます。ポリシーの例として、米国国立教育統計センター ↗や米国保健福祉省 ↗のものがあります。最低限、k 値は常に1より大きく、データセットの総行数より小さい値にする必要があります。

k-匿名化関数を使用する場合、ボードでは、k-匿名化する列、目標の k 値、抑制の戦略、および抑制後も k 値を満たさない行の処理方法を指定します。

  1. 列:「準識別子」、つまり外部データとリンクすることで個人を一意に特定できる属性を表します。
  2. **k 値:**同じ機密情報の組み合わせを持つレコードが少なくとも k 件存在するようにするしきい値 k を表します。
  3. **戦略:**データをどのように、どの順序で抑制するかを表します。指定した k 値に達するように、操作の順序を設定できます。一覧にある各列について、k 値を満たすためにデータに適用する戦略を次から選択できます。
    • **バケット:**整数を範囲に置き換えます。数値データ型の列を選択した場合にのみ利用可能です。
    • **マスク:**末尾の n 文字を * に置き換えます。
    • **交換する:**値全体を文字列に置き換えます。デフォルトでは置換値として *** が提案されますが、ユーザーが指定した値に変更できます。
    • 列を非表示フラグをオンにした列では、k 値を満たすかどうかにかかわらず、すべての値に戦略が適用されます。この動作は、年齢のバケット化など、すべての値に一貫したバケット化戦略を適用すると便利な場合に特に役立ちます。
  4. **抑制後も k 値を満たさない行:**一部の行が k 値のしきい値を満たさず、抑制しても件数を k より大きくできない場合は、次の選択肢を利用できます。
    • **保持:**データが失われないように行を保持します。これらの行を保持すると、データセットは k-匿名化されません。この手順は、k-匿名化の結果を確認する際に役立つことがよくあります。
    • **ドロップ:**k 値を満たさない行をすべて削除します。ドロップを選択する場合は、削除される行数を把握するために、必ず難読化の前後で行数を計算してください。
    • **編集:**テーブル内のすべての値を *** で難読化します。この選択肢は、行数を同じまま保持したい場合に特に役立ちます。

      k-匿名化の設定に必要な手順を示す番号が付いた難読化インターフェース。

検索と置換

列内のテキストを検索して置換するか、空または null のセルを検索します。このボードは、文字列または数値データ型のプロパティに対応しています。

日付のパース

日付は、ユーザーが指定した日付形式に照らして文字列を1文字ずつ解釈することで、文字列からパースされます。

指定された形式では、引用符で囲まれていない英字は、特定の日付または時刻の構成要素を表すパターンとして扱われます。パターンに一致する文字列内の記号は、次の規則に従って日付または時刻の構成要素として解釈されます。

英字日付または時刻の構成要素例
y年1996; 96
M月July; Jul; 07
d日10
aAM/PM マーカーAM; PM
h午前/午後の時(1~12)12
H1日の時(0~23)13
m分30
s秒55
S秒の小数部978
z一般的なタイムゾーンPacific Standard Time; PST; GMT-08:00
Zタイムゾーンのオフセット-0800; -08:00
  • ほかの英字を含む形式には対応していません。未対応の英字もパターンとして扱われますが、使用すると予期しないパース結果になる場合があります。
  • 必要な形式に対応していない場合は、式ボードを使用します。
  • 文字列に、解釈すべきでない英字が含まれる場合は、単一引用符 ' ' で囲み、パターンではなくプレーンテキストとして扱われるようにします。
  • 英字以外の記号や引用符で囲まれた記号は、プレーンテキストとして扱われます。パース時には、入力文字列内の対応する記号と厳密に一致する必要があります。

日付と時刻の構成要素を照合して解釈した後、その解釈された構成要素に基づいて出力の日付が作成されます。

日付のパース


チャート

Contour のチャートボードでは、データを分析するためのカスタムチャートを作成できます。

設定

メインのチャートレイヤーのグラフの種類を選択し、X 軸と Y 軸を設定します。現在、チャートボードでは次の種類のグラフを利用できます。

棒グラフ

chart-board-bar

水平棒グラフ

chart-board-horizontal-bar

折れ線グラフ

chart-board-line

散布図

chart-board-scatter

ヒートグリッド

chart-board-heat-grid

円グラフ

chart-board-pie

セグメント

ヒートグリッドと円グラフ以外のグラフの種類では、データを系列に分割することもできます。

並べ替え

オプションセクションを展開して、チャートデータの並べ替え方法を変更します。 メインレイヤーの値に基づいてチャートデータを並べ替えられます。

  • X の値
  • Y の値
  • カスタムの列の値。この並べ替えの値には、データセット内の任意の列(チャートに描画されていない列も含む)を使用できます。

次の例では、オリンピックで国が獲得した金メダルの数に基づいて棒グラフを並べ替えています。

chart-board-custom-sort

データは昇順または降順に並べ替えられます。オーバーレイのプロットの値をチャートデータの並べ替えに使用することはできません。

書式設定

書式タブを使用してチャートを設定します。X 軸と Y 軸のタイトル、軸の書式設定、凡例の位置、系列の並べ替え、系列の色を変更できます。

オーバーレイの追加

+ オーバーレイを追加をクリックすると、オーバーレイのプロットを追加できます。たとえば、棒グラフの上に折れ線グラフを重ねられます。

オーバーレイを追加するときは、現在のパスのデータと別のデータセットのデータのどちらをチャートで使用するかを選択できます。

別のデータセットのデータを描画しても、そのデータセットは作業セットに結合されません。データセットを結合するには、結合ボードを使用します。

データパスの一部となるのは、メインのチャートレイヤーのみです。ほかのレイヤーは表示のみを目的としています。つまり、オーバーレイレイヤー上で選択やその他のデータ操作を行っても、パスの下流にあるデータには影響しません。

個々のレイヤーの値に関連がない場合や、データ範囲またはプロットのスケールが大きく異なる場合は、チャートレイヤーを別々の Y 軸に描画できます。

chart-board-separate-y-axis

バケットの選択

Group By 列(たとえば X 軸)とセグメント列を設定するときに、データポイントをバケット化する方法を選択できます。バケット化できるのは、数値、日付、時刻の列のみです。たとえば、棒グラフを作成し、X 軸の Group By 列に日付列を選択して、バケットの種類に年を選択すると、年ごとに棒が表示されるチャートになります。利用可能なバケットの種類は次のとおりです。

数値列のバケットの種類:

  • **正確な値:**データはバケット化されず、正確な値が表示されます。
  • **最適化:**バケット数は、基になるデータ範囲内のポイント数の平方根に等しくなります。データ範囲は、列の最大値と最小値の差です。
  • **最も粒度が高い:**チャートでは、結果の上限に収まる最大数のバケットを使用します。可能な場合は、正確な値が使用されます。
  • **カスタム:**バケット数を手動で選択できます。ただし、バケット数は結果の上限を超えることはできません。

chart-numeric-bucket-selector

日付列と時刻列のバケットの種類:

  • **正確な値:**データはバケット化されず、正確な値が表示されます。
  • ラウンディング:選択に応じて、データは最も近い秒、分、時、日、週、月、または年にバケット化されます。たとえば、年でバケット化する場合、2018年6月15日の日付を持つデータポイントは2018年のバケットに分類されます。
  • **序数:**データは日付の序数に基づいてバケット化されます。たとえば、曜日を選択すると、データは曜日ごとに1つずつ、7個のバケットに分類されます。

chart-date-bucket-selector

選択したバケットが結果の上限に収まらない場合は、データが欠落しないように、上限に収まる最も粒度の高い選択肢が適用されます。詳しくは、結果の上限を参照してください。

結果の上限

Contour は、ブラウザーに表示するデータポイントの数を制限しています。実際には、Contour は画面のピクセル数を超えるデータポイントを表示できません。正確なチャートを作成し、データの欠落を防ぐため、チャートボードは、結果の上限に収まる範囲で最も粒度の高いバケットの選択になるよう、チャート設定を再バケット化します。

結果の上限は Palantir 管理者が設定し、デフォルトは1000ポイントです。再バケット化は、数値、日付、時刻の列で行われます。

再バケット化の動作を示す例を次に示します。

  • 生年月日を含むデータセットにチャートボードを作成します。
  • ボードを棒グラフに設定し、X 軸に生年月日の列を設定します。たとえば、同じ生年月日を持つ人の数を数えるためです。
  • 生年月日の列には秒単位まで日付が指定されているため、バケットの種類として秒を選択します。
  • このデータセットでは、秒単位で一意となる生年月日の数が結果の上限を超えています。
  • そのため、計算時にチャートボードは自動的に、秒ではなく時でデータをバケット化します。このデータセットでは、時が結果の上限に収まる最も粒度の高いバケットサイズであるためです。

chart-rebucket-example

フィルタリング

チャート上のデータを選択して、後続のボードで使用するデータセットを絞り込みます。複数選択するには、Ctrl+クリックまたは Cmd+クリックを使用します。

チャートをパンおよびズームして、データを見やすくできます。また、チャート上の棒やポイントにカーソルを合わせると、表示対象を強調表示するツールチップが表示されます。


グリッド

グリッドボードはヒストグラムに似ていますが、1列ではなく2列でデータを集約し、結果をヒートグリッドチャートで表示します。(3列以上の場合は、ピボットテーブルを使用できます。)たとえば、次のグリッドでは教育水準と年収を比較しています。

グリッド

同等の SQL

グリッドボードは、ヒストグラムボードやピボットテーブルボードと同様に、集約クエリを可視化したものです。 グリッドは、おおむね次の SQL クエリに相当します。

Copied!
1 2 3 SELECT [x-axis-column], [y-axis-column], <AGGREGATE_METRIC>([aggregate-column]) FROM <PARENT_BOARD> GROUP BY [x-axis-column], [y-axis-column]

設定

  • X 軸とY 軸
    • 2列を選択します。これらの列の一意の値の組み合わせごとに、グリッドのセルが形成されます。
  • 集約
    • グリッドの各セルで計算する集約メトリクスを選択します。集約の結果によってセルの色が決まります。
    • 利用可能な集約メトリクスは、件数(レコード数)、ユニークな値の数、最小、最大、合計、平均、近似中央値、標準偏差、分散です。
      • 件数を除き、集約を適用する列を指定する必要があります。ユニークな値の数では、任意の列を選択できます。
      • 最小、最大、合計、平均、近似中央値、標準偏差、分散は、数値列にのみ適用できます。

近似中央値の集約は近似計算です。Contour は、パーセンタイル値を0.5、精度をデフォルト値として percentile_approx ↗ 関数を呼び出します。

絞り込み

グリッド上の1個以上のセルを選択すると、後続のボードで使用するデータセットを絞り込めます。セルをもう一度クリックすると、選択が解除されます。

選択した値のみに絞り込むには保持を選択し、選択していない値のみを保持するには外すを選択します。

グリッドの選択


ヒートマップ

ヒートマップボードは、ジオコーディングされたデータを地図上に表示し、値に応じて色分けします。 ヒートマップ

設定

  • 緯度/経度データを含む列を指定します。
  • 必要に応じて、ジオハッシュ列を指定します。
  • 次に、計算する集約メトリクスを選択します。
    • 利用可能な集約メトリクスは、件数(レコード数)、ユニークな値の数、最小、最大、合計、平均、近似中央値、標準偏差、分散です。
      • 件数を除き、集約を適用する列を指定する必要があります。ユニークな値の数では、任意の列を選択できます。
      • 最小、最大、合計、平均、近似中央値、標準偏差、分散は、数値列にのみ適用できます。

近似中央値の集約は近似計算です。Contour は、パーセンタイル値を0.5、精度をデフォルト値として percentile_approx ↗ 関数を呼び出します。

絞り込み

ヒートマップ上に半径を指定した円を描くと、その半径内にある地理データを含むすべての行を選択できます。

円を描くをクリックし、クリックしてドラッグすると、地図上に円を描けます。

ヒートマップの選択

選択した半径内の値を保持するには保持を選択します。それらの値を除外し、選択していない値のみを保持するには外すを選択します。

選択をクリアしてフィルターを外すには、地図上の円の外側をクリックします。


ピボットテーブル

ピボットテーブルボードでは、複数のディメンションにわたって、データの複数の集約値をすばやく計算できます。この計算の結果はサンプリングされるため、テーブルに表示される内容は完全ではない場合があります。このサンプリングについては、以下で詳しく説明します。

顧客の人口統計情報を含むデータセットに対して、次のピボットテーブルでは、既婚女性、既婚男性、独身女性、独身男性それぞれの顧客数を年齢別に計算しています。

ピボットテーブル

サンプリングに関する重要な注意事項

フロントエンドとバックエンドのパフォーマンス低下を防ぐため、計算する行数には上限があります。ほとんどの環境で上限は1,000行で、通常は変更できません。

ピボットテーブルの例

上のスクリーンショットのように、ピボットテーブルの行の集約に PERIOD と PRACTICE、列の集約に POSTCODE を指定したとします。各組み合わせについて、行数と列 NAME の最大値を取得したいとします。環境の上限がデフォルト値の1,000の場合、計算されるのは1,000行の完全な行のみです。各行が完全であることは保証されますが、一部の行が表示されない場合があります。

ピボットテーブルの列を並べ替えると、データセット全体ではなく、プレビューに対して並べ替えが実行されます。データセット全体を並べ替えるには、並べ替えボードを使用します。詳細については、並べ替えを参照してください。

ピボット済みデータ全体を操作するには、ボードの以下で集計されたデータに切り替えるオプションを使用します。これにより、Contour 分析では、ピボットテーブルボードより下のすべてのボードが、完全に計算されたピボット済みデータに切り替わります。または、ピボットテーブルの上流でデータをさらに絞り込むことで、セル数の上限を回避できる可能性があります。

設定

列の集約値は、大文字と小文字を区別しない場合でも一意である必要があります

列の集約を指定する場合、その列の値は、大文字と小文字を区別しない場合でも一意である必要があります。たとえば、列「Borough」に値「Brooklyn」と「brooklyn」が含まれている場合に、「Borough」を列の集約として指定すると、ピボットテーブルの計算に失敗します。この問題を回避するために、すべての値を大文字または小文字に統一するキャストを検討してください。

  • 列
    • 集約を実行する1列以上を選択します。元のデータセットで選択した列の値の組み合わせごとに、ピボットテーブルの列が形成されます。
  • 行
    • ピボットテーブルの行を定義するために、元のデータセットから1列以上を選択します。元のデータセットで選択した列の値の組み合わせごとに、ピボットテーブルの行が形成されます。
  • 集約
    • 利用可能な集約メトリクスは、件数(レコード数)、ユニークな値の数、最小、最大、合計、平均、近似中央値、標準偏差、分散です。
      • 件数を除き、集約を適用する列を指定する必要があります。ユニークな値の数では、任意の列を選択できます。
      • 最小、最大、合計、平均、近似中央値、標準偏差、分散は、数値列にのみ適用できます。

近似中央値の集約は近似計算です。Contour は、パーセンタイル値を0.5、精度をデフォルト値として percentile_approx ↗ 関数を呼び出します。

列、行、集約の間でドラッグアンドドロップできます。

1個のピボットテーブルに複数の集約を指定できます。選択した行と列の組み合わせごとに、各集約が計算されます。

行、列、またはその両方について、総計を計算することもできます。総計は、データセット全体に対して集約を実行して計算されます(つまり、ユニークな値の数の総計はデータセット全体の一意の値の総数、平均の総計はデータセット全体の平均です)。

ピボット(集約済みデータへの切り替え)

ピボット(集約済みデータへの切り替え)をクリックすると、ヒストグラムの後に追加するボードでは、元のデータセットではなく、テーブルで計算された集約済みデータが使用されます。

新しいデータセットには、元のヒストグラム設定で Y 軸に選択した列と、集約の列が含まれます。たとえば、次のようになります。

ピボットテーブルのピボット


列エディター

列エディターボードでは、データセットから列を簡単に削除したり、新しい列を派生させたりできます。後続のボードは、保持するように選択した列を使用します。

新しい列の追加

データセット内の既存の列に対して二項演算を実行して、新しい派生列を作成できます。また、文字列の列をパースして、数値形式または日付形式の列に変換できます。

SQL での同等の処理

派生列の作成は、SQL または Spark で演算子を使用することに相当します。たとえば、次の処理では1人あたりの収入の列を派生させます。

Copied!
1 2 3 4 5 SELECT [Household Members], [Marital Status], [Income Column] / [Household Members] AS [Income per person] FROM [Table Name]

既存の列

列を削除するには、存在するカラムを表示するを選択し、削除する列の名前を選択します。列をもう一度選択すると、その列を再び追加できます。多数の列を削除する場合は、すべて削除を選択してから、保持する列を選択することもできます。

重複行の削除

列エディターボードの重複した行を除くオプションを使用して、重複行を削除できます。

「重複した行を除く」オプションが選択されています。

SQL での同等の処理

列エディターボードで列を削除することは、SQL で列名を選択することに相当します。たとえば、A~E の5列を持つテーブルに対して、次の処理では列 D と E を削除します。

Copied!
1 2 SELECT columnA, columnB, columnC FROM <tableName>

複数列エディター

複数列エディターボードでは、データの列の並べ替え、名前の変更、削除、および重複行の削除ができます。後続のボードは、保持するように選択した列を使用します。

ボードの左側にはすべてのカラムが表示され、右側にはキープしたカラムが表示されます。キープしたカラムセクションでは、保持する列の名前の変更や並べ替えを行ったり、名前の一括変更機能を使用したりできます。

複数列エディター

SQL での同等の処理

列の並べ替え、名前の変更、削除は、SQL で列名を選択することに相当します。たとえば、A~E の5列を持つテーブルに対して、次のコードでは列 D と E を削除し、A の名前を A_1 に変更します。

Copied!
1 2 SELECT columnA as columnA_1, columnB, columnC FROM <tableName>

エンリッチ

エンリッチボードでは、現在作業中のデータセットを別のデータセットと結合し、一致する結果をデータにマージできます。

エンリッチボードの使用方法をご覧ください。


リンク

リンクボードでは、別のデータセットと結合し、そのデータセットの一致するレコードを返すことができます。集合演算の「一致するデータのみ保持」操作とは異なり、リンクされた(右側の)テーブルの列のみを返します。

リンクボードの使用方法をご覧ください。


集合演算

集合演算ボードでは、別の集合に基づいて現在のデータセットを変更できます。データセットを絞り込んで、別のデータセットに存在するデータのみを保持する(一致するデータのみ保持)、別のデータセットのデータを追加する(追加)、または別のデータセットの結果に基づいてデータを削除する(削除)ことができます。

集合演算ボードの使用方法をご覧ください。。


結合

結合ボードには、Palantir 管理者が選定した推奨の結合テンプレートが表示されます。推奨の結合を追加または変更する場合は、管理者にお問い合わせください。

結合ボードの使用方法をご覧ください。。


エクスポート

エクスポートボードでは、分析対象の集合を CSV または XLS ファイルとしてダウンロードできます。

ドロップダウンから csv または xls を選択し、エクスポートをクリックします。ボードがサーバー上での処理を完了すると、ファイル名をカスタマイズするオプションが表示されます。次に、<#>件のレコードをダウンロードをクリックして、ファイルをダウンロードします。

エクスポートの準備

エクスポートのダウンロード


列の並べ替え

列の並べ替えボードでは、テーブル内の列をドラッグアンドドロップして順序を変更できます。

列の並べ替え


マクロ

マクロボードでは、以前に作成したマクロをパスに適用できます。


並べ替え

並べ替えボードでは、データセット内のすべてのデータを並べ替えられますが、この並べ替えは分析内に限定され、保存されたデータセットには保存されません。下流の集計(たとえば、結合や重複行の削除)によって並べ替えが失われる場合があるため、このような集計は並べ替えの前に行うことを推奨します。


計算

計算ボードでは、データに対する複数の集計計算をカードまたはリストの形式で表示できます。利用可能な集計メトリクスは、ユニークな値の数、最小、最大、合計、平均、中央値、標準偏差、分散です。

計算の概要

計算ボードは、カードまたはリストの形式に設定できます。

カード形式には、横方向または縦方向およびメトリクスのサイズに関する追加の書式設定オプションがあります。

計算の書式

最後に、指定したルール(条件)に基づいて、各計算に条件付き書式設定を適用できます。これにより、条件を満たすかどうかに応じて、フォントの色と背景色を変更できます。

計算の条件付き書式設定


アンピボット

アンピボットボードでは、一部の列を行に変換してデータの形状を変更できます。選択した列は、ヘッダー列(元の列名を含む)と値列(元のデータ値を含む)の2つの新しい列に再構成されます。