トップページインストール,運用Windows の種々のソフトウエアのインストールTesseract OCR 5 (文字認識ソフト)のインストールと使用法(Windows 上)

Tesseract OCR 5 (文字認識ソフト)のインストールと使用法(Windows 上)

Windows での,Tesseract OCR 5 のインストールと日本語文書読み取りの手順をスクリーンショット等で説明する.Tesseract OCR は,文字認識ソフトウエアである.

種々の利用法は,別ページにまとめている.

手順については https://github.com/tesseract-ocr/tesseract/wiki/Training-Tesseract-3.03%E2%80%933.05

先人に感謝

Tesseract OCR 5 のダウンロードとインストール

  1. 「Tesseract OCR のバイナリ」の Web ページを開く

    https://github.com/tesseract-ocr/tesseract/wiki

  2. Windows のところの「Tesseract at UB Mannheim」をクリック

  3. 最新のアルファ版を選ぶ

    安定版が欲しいときは,下の「older versions」からダウンロード

  4. .exe ファイルのダウンロードが始まる

  5. ダウンロードした .exe ファイルを実行
  6. ようこそ画面では「Next」をクリック

  7. ライセンス条項の確認
    ライセンス条項に同意する場合のみ続行すること.

  8. ユーザの選択 (Choose Users).既定(デフォルト)のままでよい.「Next」をクリック

  9. コンポーネントの選択 (Choose Components).

    対応言語を追加できる.

  10. インストールディレクトリ(フォルダ)は、既定(デフォルト)のままでよい.「Next」をクリック

  11. スタートメニューフォルダは、既定(デフォルト)のままでよい.「Install」をクリック

  12. インストール終了の確認.「Next」をクリック

  13. インストール終了の確認.「Finish」をクリック

  14. 日本語の文章が書かれた画像を用意する

    次の画像は、Wikipedia「日本国憲法前文」から取得

    URL: https://ja.wikipedia.org/wiki/%E6%97%A5%E6%9C%AC%E5%9B%BD%E6%86%B2%E6%B3%95%E5%89%8D%E6%96%87#%E5%89%8D%E6%96%87

  15. Windows のコマンドプロンプトを開く
  16. 画像から文字を認識してみる

    まず,コマンドプロンプトで,カレントディレクトリを,画像のファイルのあるディレクトリに移動する.

    「-l jpn」のところ: 日本語の横書き文書なら「-l jpn」、 日本語の書き文書なら「-l jpn_vert」、

    "C:\Program Files\Tesseract-OCR\tesseract.exe" <画像ファイル名> outbase -l jpn
    

  17. outbase.txtというファイルができるので,メモ帳で確認
    notepad outbase.txt
    

  18. 今度はサイズが大きい画像(画素数が多い画像)」

    次の画像は、Wikipedia「日本国憲法前文」から取得

    URL: https://ja.wikipedia.org/wiki/%E6%97%A5%E6%9C%AC%E5%9B%BD%E6%86%B2%E6%B3%95%E5%89%8D%E6%96%87#%E5%89%8D%E6%96%87

  19. 画像から文字を認識してみる
    "C:\Program Files\Tesseract-OCR\tesseract.exe" <画像ファイル名> outbase -l jpn
    

  20. outbase.txtというファイルができるので,メモ帳で確認
    解像度が精密なので,精度が向上している.
    notepad outbase.txt