英語OCR

このブラウザ内で処理

ファイル上限: 32 MB

このツールは入力をアップロードしません。

初回はブラウザ内でライブラリをダウンロードする場合があります。

Tesseract は英語(eng)優先です。免許証や日本語の書類向きではありません。初回はこのタブでモデルを取ります。

ファイルをドロップ

ファイルをドロップするか選択してください。

例:活字の写真をドロップして処理。初回にモデルを取得。

eng 寄りの読み取りです。縦書きの日本語や、手書きの書類を期待すると外れます。デジタルPDFのコピーはPDFテキスト抽出の方が先です。

英語のエラー画面をチケットに貼りたい——画像から文字を抜く仕事です。日本語の帳票OCRや、検索可能なPDF化ではありません。

エンジンは英語(eng)優先です。縦書き、はんこ、複写伝票は対象外と考えてください。

向いているとき

  • 英語のダイアログ、ログ、仕様書の写真。
  • テキスト層の無い英語スキャン。
  • クラウドOCRに画面を上げたくない。

すでに文字が選べるPDFならPDFテキスト抽出。iPhone写真が開けないだけならHEICをJPGに変換が先です。

使い方

  1. この端末の画像を選びます。目安は約 32MB
  2. 認識を実行し、テキストをコピーします。
  3. 誤認識は手で直してください。法的な文字起こし証明ではありません。

しないこと

  • 日本語ヘッドの「OCR」を取りにいくこと。
  • マイナンバー、パスポート、保険証の自動入力。
  • レイアウトを保ったWord化。

よくある質問

日本語の書類は読めますか?

英語優先です。漢字やかなが混ざると精度が落ちます。日本語OCRの本命キーワードは追いません。

PDFの文字をコピーしたいです。

テキスト層があるならPDFテキスト抽出です。スキャン画像だけのPDFは、先にPDFを画像にしてから、英語ならこちらを試せます。

身分証を読み取れますか?

用途にしていません。公的書類やマイナンバーは載せないでください。

画像はアップロードされますか?

されません。認識ライブラリはこのタブで動きます。初回にモデルを読むことがあります。

手書きは?

活字の英語向きです。手書きや低解像度は崩れます。

関連ツール