PDFビューアーから文章をコピーしようとすると、1ページずつしか選べなかったり、不自然な位置で改行されたり、文書全体をうまく選択できなかったりします。このツールはPDFのテキストレイヤー(ページに埋め込まれた文字情報)を読み取り、全ページの文章を読む順番どおりにまとめて取り出すので、そのまま貼り付けたり.txtファイルとして保存したりできます。
必要なページだけを選べるほか、「--- Nページ ---」の区切りを入れて、どの文章がどのページから来たのかを分かるようにもできます。複数のPDFをまとめて入れると、ファイルごとにテキストファイルが1つずつ作られます。
使い方
- PDFファイルを1つ以上選ぶか、ドラッグ&ドロップします。
- 文書全体なら「ページ」欄は空欄のままにし、一部だけなら「1-3, 5」のようにページを入力します。
- 「--- Nページ ---」の区切りを入れるかどうかを切り替えます。
- 「テキストを抽出」を押し、結果をコピーするか.txtでダウンロードします(複数のPDFは.txtファイルをまとめたZIPになります)。
Deftivoが選ばれる理由
アップロード不要
PDFはお使いのブラウザの中で読み取ります。契約書や明細書、下書きなどのファイルが端末の外に送られることはありません。
読みやすい行
ページ上の文字の位置をもとに1行ずつ組み立て直し、段落の間には空行を入れます。日本語や中国語の文中に余計なスペースが入ることもありません。
どこでも文字化けしにくい
.txtファイルはBOM(文字コードを示す目印)付きのUTF-8で保存します。そのため、Windowsのメモ帳でも日本語や韓国語、アクセント付きの文字が正しく表示されます。
結果が空になるのはなぜ?
スキャンしたPDFは、紙を撮影した画像の集まりです。中にあるのは文字ではなく画素だけなので、取り出せるテキストがありません。文字のないページはツールがお知らせしますが、画像から文字を読み取る機能(OCR)には対応していません。
段組みや表を含むPDFでは、文章の順番が少し入れ替わることがあります。PDFの中に保存されている順にテキストを取り出すためです。文の途中で改行されてしまう場合は、結果を「改行削除・テキスト整形」に貼り付けると1つの文につなげられます。
よくある質問
スキャンしたPDFも読み取れますか?
いいえ、読み取れません。スキャンしたページの中身は文字ではなく画像で、OCRには対応していないためです。文字のないページはメッセージで表示されるので、どのページが該当するか確認できます。
パスワード付きのPDFはどうなりますか?
先にPDFビューアーでパスワードを解除してください。暗号化されたファイルはパスワードなしでは読み取れません。ロックされているファイルがあれば、ツールがファイル名をお知らせします。
一部のページだけ抽出できますか?
はい、できます。「ページ」欄に「2-4, 7」のように入力してください。複数のPDFを入れた場合は、同じ範囲がそれぞれのファイルに適用されます。
メモ帳で開くと日本語が文字化けしませんか?
文字化けしません。.txtファイルはBOM付きのUTF-8で保存され、Windowsのメモ帳がこれを自動で認識します。