画像・写真・PDFに写っている文字を抽出し、コピーできるテキストにします。複数ファイルをまとめて処理できます。認識処理はすべてブラウザ内で実行され、画像が外部に送信されることはありません。
画像はサーバーに送信されません(初回のみ文字認識エンジン本体を外部サイトから取得します)
使い方
- 文字を抽出したい画像・写真・PDFを選びます(複数選択できます)。
- 写っている文字の言語を選びます。
- 「文字を抽出」を押すと、ファイルの下に結果が表示されます。初回のみ認識エンジンのダウンロードが入ります。
- 結果はコピーするか、テキストファイルとして保存できます。
こんな場面で使えます
- 名刺や書類の写真から文字を抽出してメモに残す
- スクリーンショットに写ったテキストをコピーする
- レシートや請求書の内容を書き写す手間を省く
- スキャンしたPDFから文字を抽出して検索・編集できる形にする
専門的には「OCR(光学文字認識)」と呼ばれる技術で、広く使われているオープンソースの文字認識エンジン(Tesseract)をブラウザの中で直接動かしています。画像をどこにもアップロードせずに文字を取り出せるのが特長です。
認識精度を上げるコツ
| 得意 | 苦手 |
| 印刷された文字(本・書類・スクリーンショット) | 手書きの文字 |
| 正面から撮った、まっすぐな写真 | 大きく傾いた・歪んだ写真 |
| 明るく、文字と背景のコントラストがはっきりした画像 | 暗い・ぼやけた・低解像度の画像 |
PDFの場合、ページを画像として描画してから認識するため、文字ベースのPDF(コピーできるPDF)であれば、そもそもPDFビューアで直接文字をコピーする方が速く正確です。このツールが特に役立つのは、スキャンした紙の書類など、画像としてのPDFです。
よくある質問
画像がアップロードされることはありませんか?
ありません。文字の認識はすべてブラウザ内で実行されます。初回のみ認識エンジン本体と言語データを配布サイトからダウンロードしますが、これは受信のみで、画像や抽出結果が送信されることは一切ありません。
手書きの文字も読み取れますか?
手書き文字は苦手です。このツールが得意なのは印刷・印字された文字で、手書きは崩れ方によって認識精度が大きく下がります。あくまで参考程度にご利用ください。
PDFも読み込めますか?
読み込めます。PDFは各ページを画像として描画してから文字を認識するため、ページ数が多いPDFは時間がかかります。文字を選択・コピーできるタイプのPDFであれば、PDFビューア側で直接コピーする方が正確です。
英語と日本語が混ざった画像は?
「日本語+英語」を選択してください。両方の言語データを読み込むため、単一言語を選ぶ場合よりダウンロードと処理にやや時間がかかります。