deftivo

PDFからテキストを抽出

PDFの文字を取り出して、そのままコピーしたり.txtファイルとして保存したりできます。

ここにPDFファイルをドロップ

または下のボタンから選んでください

PDFを1つ以上 · ファイルは端末の外に出ません

    すべてのPDFはサーバーに送信されず、ブラウザ内ですぐに処理されます。

    文字情報を含むPDF(Word・ブラウザなどから保存したもの)に対応しています。スキャンしたページは文字ではなく画像なので空になります(OCR非対応)。段組みや表は順序が変わることがあります。

    PDFビューアーから文章をコピーしようとすると、1ページずつしか選べなかったり、不自然な位置で改行されたり、文書全体をうまく選択できなかったりします。このツールはPDFのテキストレイヤー(ページに埋め込まれた文字情報)を読み取り、全ページの文章を読む順番どおりにまとめて取り出すので、そのまま貼り付けたり.txtファイルとして保存したりできます。

    必要なページだけを選べるほか、「--- Nページ ---」の区切りを入れて、どの文章がどのページから来たのかを分かるようにもできます。複数のPDFをまとめて入れると、ファイルごとにテキストファイルが1つずつ作られます。

    使い方

    1. PDFファイルを1つ以上選ぶか、ドラッグ&ドロップします。
    2. 文書全体なら「ページ」欄は空欄のままにし、一部だけなら「1-3, 5」のようにページを入力します。
    3. 「--- Nページ ---」の区切りを入れるかどうかを切り替えます。
    4. 「テキストを抽出」を押し、結果をコピーするか.txtでダウンロードします(複数のPDFは.txtファイルをまとめたZIPになります)。

    Deftivoが選ばれる理由

    アップロード不要

    PDFはお使いのブラウザの中で読み取ります。契約書や明細書、下書きなどのファイルが端末の外に送られることはありません。

    読みやすい行

    ページ上の文字の位置をもとに1行ずつ組み立て直し、段落の間には空行を入れます。日本語や中国語の文中に余計なスペースが入ることもありません。

    どこでも文字化けしにくい

    .txtファイルはBOM(文字コードを示す目印)付きのUTF-8で保存します。そのため、Windowsのメモ帳でも日本語や韓国語、アクセント付きの文字が正しく表示されます。

    結果が空になるのはなぜ?

    スキャンしたPDFは、紙を撮影した画像の集まりです。中にあるのは文字ではなく画素だけなので、取り出せるテキストがありません。文字のないページはツールがお知らせしますが、画像から文字を読み取る機能(OCR)には対応していません。

    段組みや表を含むPDFでは、文章の順番が少し入れ替わることがあります。PDFの中に保存されている順にテキストを取り出すためです。文の途中で改行されてしまう場合は、結果を「改行削除・テキスト整形」に貼り付けると1つの文につなげられます。

    よくある質問

    スキャンしたPDFも読み取れますか?

    いいえ、読み取れません。スキャンしたページの中身は文字ではなく画像で、OCRには対応していないためです。文字のないページはメッセージで表示されるので、どのページが該当するか確認できます。

    パスワード付きのPDFはどうなりますか?

    先にPDFビューアーでパスワードを解除してください。暗号化されたファイルはパスワードなしでは読み取れません。ロックされているファイルがあれば、ツールがファイル名をお知らせします。

    一部のページだけ抽出できますか?

    はい、できます。「ページ」欄に「2-4, 7」のように入力してください。複数のPDFを入れた場合は、同じ範囲がそれぞれのファイルに適用されます。

    メモ帳で開くと日本語が文字化けしませんか?

    文字化けしません。.txtファイルはBOM付きのUTF-8で保存され、Windowsのメモ帳がこれを自動で認識します。

    関連ツール