「VisiP☆Tex」利用マニュアル

特許データをテキストマイニングするWebアプリ「VisiP☆Tex」について、基本的な使い方や辞書の利用方法、分析結果の見方などを説明します。

現在のVisiP☆Texはこちらです。

テキストマイニングとは

テキストマイニングとは、文章などの文字データを単語などに分け、その中から特徴や傾向を見つける分析方法です。

特許情報の場合、「発明の名称」や「要約」には、その発明の内容を示す多くの言葉が含まれています。

VisiP☆Texでは、これらの文章から単語を切り出し、ワードクラウドや共起ネットワークなどを使って内容を可視化します。

単に文章を読むだけでは気付きにくい、頻繁に使われている言葉や、言葉どうしの関係を確認する際に利用できます。

基本的な使い方

VisiP☆Texでは、基本的に次の流れでテキストマイニングを行います。

  1. 特許データを登録する
  2. 必要に応じて辞書を登録する
  3. テキストマイニングを実行する
  4. ワードクラウドや共起ネットワークなどの結果を確認する
  5. 必要に応じてカテゴリを切り替える
  6. 処理後のデータをダウンロードする

手元に特許データがない場合は、サンプルデータを使って結果を確認することもできます。

特許データを登録する

画面の「📂 特許データを登録(必須)📂」から、分析する特許データを登録します。

受付可能なファイル形式は、

  • CSV(.csv)
  • Excel(.xlsx)
  • Excel(.xls)

です。

VisiPが現在対応している特許情報サービスについては、このマニュアルでは個別に列挙していません。最新の対応状況はVisiPポータルでご確認ください。

各特許情報サービスからダウンロードしたデータを利用する場合は、できるだけ元のデータ構造を維持したまま使用することをお勧めします。

アップロード1回あたりの上限は約10MBです。

辞書ファイルも同時に登録する場合は、それらを含めたアップロード全体が上限の対象となります。上限に近い場合は、アップロード時の付加情報によって先に上限へ達することがあります。

必要に応じて辞書を登録する

VisiP☆Texでは、辞書を使ってテキストマイニングの結果を調整できます。辞書は必須ではありません。

画面の「📘 辞書を登録(任意)📘」から、必要に応じて次の3種類を登録できます。

  • 抽出語
  • 除外語
  • 同義語

「抽出語」と「除外語」はテキストファイル(.txt)、「同義語」はCSV(.csv)またはExcel(.xls、.xlsx)を使用します。それぞれの入力欄には、1ファイルを登録できます。辞書の詳しい役割は後述します。

テキストマイニングを実行する

特許データと、必要に応じて辞書を登録したら、テキストマイニングを実行します。

VisiP☆Texでは、処理対象データの「発明の名称」と「要約」に含まれる文字数を合計して処理します。

処理できる上限は400,000文字です。

400,001文字以上の場合は処理できず、「テキスト総文字数は400000文字までです。」と表示されます。データ量が多い場合は、対象件数を減らすなどして文字数を調整してください。

サンプルデータを使う

手元に分析用の特許データがない場合は、サンプルデータを利用できます。初めてVisiP☆Texを使う場合は、サンプルデータでワードクラウド、共起ネットワーク、カテゴリ切替などの動作を確認してから、自分のデータを分析すると操作を理解しやすくなります。

3種類の辞書を使って結果を調整する

テキストマイニングでは、文章を機械的に単語へ分割するため、必ずしも利用者が意図した単語だけが抽出されるとは限りません。

そこでVisiP☆Texでは、「抽出語」「除外語」「同義語」の3種類の辞書を利用できます。

抽出語

分析結果に反映させたい語がうまく単語として抽出されない場合などに利用します。抽出したい語をテキストファイル(.txt)として用意し、「抽出語」に登録します。技術用語、複合語、固有の表現など、通常の単語分割だけでは意図した形になりにくい言葉を扱う場合に利用できます。

除外語

分析結果に表示したくない語を除外するための辞書です。除外したい語をテキストファイル(.txt)として用意し、「除外語」に登録します。多数出現するものの、今回の分析では意味が小さい一般的な言葉などを除くことで、注目したい言葉を見やすくできます。

同義語

意味が同じ、または分析上まとめて扱いたい複数の言葉を統合するために使用します。

例えば、

  • 地図
  • 案内図
  • マップ

のように異なる表現が同じ意味で使われている場合、それらを一つの言葉へまとめて分析することができます。

同義語には、CSV(.csv)またはExcel(.xls、.xlsx)のファイルを使用します。

辞書は、単語を機械的に増減させるためではなく、分析したい目的に合わせてテキストマイニングの結果を整えるためのものと考えると分かりやすいでしょう。

ワードクラウドで特徴的な言葉を見る

テキストマイニングを実行すると、処理した文章に含まれる単語をワードクラウドで確認できます。

ワードクラウドとは、文章から切り出された単語を、出現頻度などに応じて文字の大きさを変えて配置し、視覚的に表現する方法です。

多く使われている言葉や特徴的な言葉を、一覧表とは違った形で直感的に確認できます。

ただし、文字が大きいという理由だけで、その言葉が技術的・事業的に重要とは限りません。元の特許データや個々の公報も確認しながら、分析の入口として利用してください。

共起ネットワークで言葉どうしの関係を見る

VisiP☆Texでは、ワードクラウドとあわせて共起ネットワークも表示します。

共起とは、複数の言葉が同じ文章の中などで一緒に現れることをいいます。

共起ネットワークは、こうした一緒に現れやすい言葉どうしの関係をネットワークとして可視化するものです。

ワードクラウドが「どの言葉が多く使われているか」を見るのに向いているのに対し、共起ネットワークでは、「どの言葉とどの言葉が関連して現れているか」を見ることができます。

例えば、単独では意味を判断しにくいキーワードでも、周囲にどのような言葉が結び付いているかを見ることで、その技術的な文脈やテーマを考える手掛かりになる場合があります。

ただし、共起しているからといって、必ずしも技術的・因果的な関係があるとは限りません。ワードクラウドと同様に、元の特許データや個々の公報と照らし合わせながら、分析の入口として利用してください。

カテゴリを切り替えて結果を見る

結果画面の「カテゴリ:」では、分析結果を見る単位を切り替えることができます。

現在選択できるカテゴリは、

  1. 全体
  2. 出願人別
  3. 出願年別
  4. 公開年別
  5. 特許分類別(翻訳あり)

です。初期状態では「全体」が選択されています。

「全体」では、登録した特許データ全体をまとめてテキストマイニングした結果を確認できます。一方、「出願人別」「出願年別」などへ切り替えると、選択したカテゴリごとの結果を見ることができます。

例えば、出願人別に見ることで企業ごとに使われている言葉の違いを比較したり、出願年別に見ることで使用されるキーワードの変化を確認したりできます。

カテゴリ別表示では「表示件数」を設定できます。

  • 最小:1
  • 最大:10
  • 初期値:3

必要に応じて表示件数を変えながら、比較したい対象を確認してください。

処理したデータをダウンロードする

VisiP☆Texでは、テキストマイニングした結果を2種類のCSVファイルとしてダウンロードできます。

特許データをダウンロード

「特許データをダウンロード」から、processed.csvをダウンロードできます。文字コードはUTF-8-SIGです。

このファイルには、元の特許データに加えて、テキストマイニングによって得られたキーワード情報が含まれます。「発明の名称」と「要約」から抽出されたキーワードは、それぞれ、「発明の名称(キーワード)」「要約(キーワード)」として利用できます。

このデータは、VisiP☆MapやVisiP☆Comで「発明の名称(キーワード)」「要約(キーワード)」を軸として分析する場合にも利用できます。

ワードリストをダウンロード

「ワードリストをダウンロード」から、wordlist.csvをダウンロードできます。文字コードはUTF-8-SIGです。ワードクラウドや共起ネットワークを見るだけでなく、抽出された語をCSVとして確認・整理したい場合に利用できます。

エラーが表示された場合

ファイルやデータの状態、文字数、解析後の経過時間などによって、処理や操作ができない場合があります。まず次の点を確認してください。

  • 対応するファイル形式か
  • ファイルサイズが大きすぎないか
  • 「発明の名称」や「要約」など、分析に必要なデータが含まれているか
  • 「発明の名称」と「要約」の合計文字数が400,000文字を超えていないか
  • 辞書を利用する場合、辞書のファイル形式が正しいか
  • 元の特許データを大きく加工していないか

アップロード上限を超えた場合は、「アップロードファイルが上限を超えています。」と表示されます。ファイルサイズを小さくしてから、再度登録してください。

文字数が上限を超えた場合は、「テキスト総文字数は400000文字までです。」と表示されます。この場合は、分析する特許データを減らすなどしてから再度処理してください。

解析後、時間が経過してから操作できなくなった場合

VisiPでは、アップロードしたデータや解析時に作成した一時データをサーバー上へ長期間保存する仕組みにはしていません。解析後、一定時間が経過すると一時データが自動的に削除されます。

そのため、結果を表示したまましばらく時間を置いた後で、カテゴリを切り替えたり、結果を再操作したりすると、元となるデータがすでに削除されており、エラーになる場合があります。この場合は、特許データと必要な辞書をもう一度登録して、再度テキストマイニングを行ってください。

利用にあたって

VisiP☆Texは、文章から切り出した単語を可視化し、特許情報の特徴や傾向を考えるための支援ツールです。

テキストマイニングの結果だけで技術内容や事業上の意味を判断するのではなく、必要に応じて元の特許公報や検索結果も確認しながら利用してください。

分析の目的によって、どの語を抽出し、除外し、同義語としてまとめるかによっても結果は変わります。そのため、辞書やカテゴリを変更しながら試すことも、テキストマイニングを活用する上で重要です。

また、元の特許データや作成した辞書は、お手元にも保存しておくことをお勧めします。

VisiP☆Texに関するご意見、ご要望、不具合等がありましたら、お問い合わせページからお知らせください。