コンテンツにスキップ

検索結果のエクスポート

トークン検索の結果を構造化データファイルとしてエクスポートし、言語研究・統計分析・その他の処理に活用できます。

エクスポート方法

  1. トークン検索(通常検索・アドバンスト・サーチ・翻訳検索)を実行する
  2. 結果が表示されたら、結果上部のボタンバーにある TSV または JSON をクリックする
  3. 現在表示中のページ(最大200件)がダウンロードされます
  4. 他のページもエクスポートしたい場合は、Prev/Next ボタンでページを切り替えてから再度エクスポートしてください

エクスポート形式

TSV(ZIPダウンロード)

以下の2ファイルを含むZIPアーカイブがダウンロードされます:

  • data.tsv — タブ区切りテキストファイル(Excel対応のBOM付きUTF-8)。各行が1つの検索ヒットに対応し、全データ項目が列として含まれます。
  • metadata.json — 検索クエリ、総ヒット数、サンプリング方法、ライセンス情報などのメタデータ。

Excel、Googleスプレッドシートなどの表計算アプリケーションで開くのに最適です。

JSON(単一ファイルダウンロード)

メタデータとデータの両方を含む単一のJSONファイルがダウンロードされます:

{
  "metadata": { "export_format_version": 3, "query": "...", "total_hits": 1234, ... },
  "data": [ { "talk_id": 1, "match": "...", ... }, ... ]
}

Python、Rなどのプログラミング言語で処理するのに最適です。

エクスポート形式のバージョンと互換性

JSONの metadata とZIP内の metadata.json には export_format_version が含まれます。バージョン 2 では、検索結果やその順序を変えずに、次の2点を訂正しました。

  • context_before_1 は直前のセグメント、context_before_2 は2つ前のセグメントです。translation_context_before_1 と translation_context_before_2 も同じ順序です。トーク先頭で前方の文脈が存在しない場合は空文字列になります。拡張セグメントモードでは、これらの項目も拡張セグメント単位です。
  • 対訳言語を選択した場合の translation_lang は、JSON・TSVともに "ja" などの言語コードの文字列です。英語のみのエクスポートには翻訳項目を含めません。

バージョン 3 では、ファイルの出どころを示す4つのメタデータオブジェクトが加わります。検索結果とその順序はバージョン2から変わっていません。

オブジェクト 内容
corpus talks(コーパスのトーク数)、updated_at(コーパスのデータが最後に変わった日時・UTC)、updating(データ更新中なら true)
app_version サイトに表示されているアプリケーションのバージョン
conditions 実行された検索の条件: text、advanced、search、if_talk、target、translation_language(言語コードまたは null)、video_types(コードではなく名前)、allow_en_only、randomize、seed、offset、uilang
observation total_hits とその単位 count_unit(アドバンスト・サーチでは match_start、それ以外は segment か sentence)、returned_rows とその単位 row_unit、page、page_size、evaluated_at(UTC)

total_hits は条件ではなく観測値です。アドバンスト・サーチでは一致の開始トークンの異なり数を数え、行はセグメントまたは文の単位で重複を除くため、2つの数値は単位が違います。

export_format_version のないファイルは、バージョン番号のない旧形式です。旧形式では2つの context_before_* の内容が逆になっており、translation_context_before_* も同様でした。また、translation_lang はJSONではオブジェクト、TSVではRubyのハッシュ表現になっていました。新旧のファイルを併用するときは、バージョンを確認してこれらの項目を揃えるか、結果を再度エクスポートしてください。context_after_* と translation_context_after_* の内容は変更していません。

データ項目

エクスポートされる各ヒットには以下の項目が含まれます:

項目 説明
talk_id トークID
talk_title TED Talkのタイトル
speaker スピーカー名
year トークの収録年(収録日から取得)。公開年ではありません。
video_type トークの種類(例:「TED Stage Talk」「TEDx Talk」「TED-Ed Original」)
talk_duration トーク全体の長さ(秒)
talk_url ted.comのトークURL
segment_id ヒットした単位のID。Segment モードではセグメントID、Sentence モードでは文ID(別のテーブル由来)が入ります。フィールド名はどちらも同じで、どちらのモードだったかはメタデータに記録されないため、モードはファイルとは別に控えてください。
match マッチした語句(通常検索では検索語、アドバンスト・サーチでは実際の表層形)
segment_text マッチを含むセグメントの全文
segment_position トーク内の位置(例:「42/187」)
start_time セグメントの開始時間(秒)
duration セグメントの持続時間(秒)
context_before_1 マッチの1つ前のセグメント
context_before_2 マッチの2つ前のセグメント
context_after_1 マッチの1つ後のセグメント
context_after_2 マッチの2つ後のセグメント

アドバンスト・サーチの追加項目

アドバンスト・サーチ使用時は、各ヒットに以下が追加されます:

項目 説明
pos マッチした語の品詞
lemma マッチした語のレンマ(基本形)
dep 依存関係ラベル

翻訳の追加項目

翻訳言語を選択している場合、各ヒットに以下が追加されます:

項目 説明
translation_lang 翻訳言語コードの文字列(例: "ja")
translation_segment マッチしたセグメントの翻訳テキスト
translation_context_before_1 1つ前のセグメントの翻訳
translation_context_before_2 2つ前のセグメントの翻訳
translation_context_after_1 1つ後のセグメントの翻訳
translation_context_after_2 2つ後のセグメントの翻訳

ページネーションとエクスポート範囲

各エクスポートでは現在表示中のページ(最大200件、通常のページネーションサイズと同じ)がダウンロードされます。この設計には以下の利点があります:

  • 再現性: 同じページは常に同じデータを返します(ランダマイズオフの場合)。共同研究者と正確なデータを共有できます。
  • WYSIWYG: 画面で見ているものをそのままエクスポートできます。
  • コーパス全体へのアクセス: クエリの全ヒットを取得するには、Prev/Nextでページを切り替えながら各ページをエクスポートします。メタデータのpageとtotal_pagesで進捗を把握できます。

メタデータには以下が含まれます:

  • total_hits: クエリの総ヒット数
  • exported_count: このページのヒット数(≤ 200)
  • page: 現在のページ番号
  • total_pages: 総ページ数
  • randomized: ランダム順序かどうか(Randomizeチェックボックスがオンの場合true)
  • export_format_version・search_mode・license・exported_at

メタデータに記録されないもの

メタデータには、同じ検索を再実行するのに必要な情報がすべて含まれているわけではありません。以下は記録されません。

  • 検索単位(Segment か Sentence か)
  • 対象にしていた動画タイプ
  • Randomize がオンのときのシード値
  • アプリケーションのバージョンとコーパスのスナップショット日

翻訳言語はメタデータにはありませんが、翻訳言語を選んでいた場合は各ヒットの translation_lang に記録されます。

そのため、設定の異なる2つのエクスポートが同じように見えることがあります。論文や共有に使うエクスポートでは、これらの設定を検索を実行した日付とあわせてファイルに添えて記録してください。バージョンとコーパスの規模は現在のバージョンに記載しています。

誤操作防止のため、連続エクスポートには5秒間の短いクールダウンが適用されます。TSV/JSONボタンにホバーするとカウントダウンが表示され、タイマーが0になると自動的に再び有効になります。

ライセンス

エクスポートされるデータにはTED Talkのトランスクリプトが含まれており、Creative Commons BY-NC-ND 4.0 ライセンスに基づいて使用されています。メタデータファイルにはライセンス表示が含まれます。エクスポートデータは研究・教育目的のみを対象としています。

ヒント

  • 全結果をエクスポートするには、ページを切り替えながら各ページをエクスポートしてください。ファイル名にはページ番号が含まれます(例: tcse_export_20260411_p3.zip)
  • segment_position項目を使って、パターンがトークのどの位置に出現しやすいかを分析できる
  • アドバンスト・サーチのアノテーション(POS、レンマ、dep)とコンテキストを組み合わせて、詳細な談話分析が可能
  • コーパス全体レベルの統計にはエクスポートよりもNグラム・コロケーションタブを活用すること