PDFの文字をコピーすると文字化けする
PDFの本文を選択してコピーし、貼り付けると 「ᆅ᪉බඹᅋయ」のような読めない文字列になる。 画面上は正しく表示されているのに、コピーした瞬間に別物になる——という症状です。
原因は、PDFに埋め込まれたフォントに字形と文字コードの対応表(ToUnicode CMap)が入っていないことです。 表示は「この字形を描け」という指示だけで成立するため、対応表が無くても正しく見えます。 しかしコピーは文字コードを必要とするので、そこで対応が失われます。 論文誌・官公庁の資料・古い組版ソフトで作られたPDFに多く見られます。
文字が壊れているわけではありません。ページには読める字形が描かれています。 だから、ページを画像として読み直せば本文を取り出せます。 フォントを変えても、Wordに貼り直しても直らないのは、コピーの時点で情報が失われているためです。
いま試す
お手元のPDFで確認できます
診断はブラウザの中だけで行います。ファイルはどこにも送信されません。登録も不要です。何ページ・いくつの表や図が取り出せるかを、買う前に確認できます。
実例
実際のPDFからコピーした文字列
下は官公庁の資料からコピーした実物です。左が化けたもの、右が復元したものです。左をコピーして、お使いのエディタに貼ってみてください。同じ結果になります。
コピーした結果
ᆅ᪉බඹᅋయ࠾ࡅࡿ᭩㠃つไࠊᢲ༳ࠊᑐ㠃つไࡢぢ┤ࡋࡘ࠸࡚
PDFIntact で取り出した結果
地方公共団体における書面規制、押印、対面規制の見直しについて
お手元の文字列で判定する
コピーした文字列を貼ると、それがこの種類の文字化けかどうかをその場で判定します。PDFを用意しなくても、コピーした結果だけで確かめられます。
判定はこのブラウザの中だけで行っています。入力した文字列はどこにも送信されません。
よくある質問
- PDFをコピーすると文字化けするのはなぜですか
- PDFに埋め込まれたフォントに、字形と文字コードの対応表(ToUnicode CMap)が入っていないためです。画面には正しく表示されますが、コピーすると別の文字に化けます。文字が壊れているのではなく、対応表が欠けているだけなので、ページを画像として読み直せば本文を取り出せます。
- 文字化けしたPDFから正しい文字を取り出せますか
- 取り出せます。PDFIntactはページを画像として読み直し、文字認識で本文を復元します。購入前にブラウザの中だけで診断できるので、実際に復元できるかを先に確認できます。ファイルはどこにも送信されません。
- Wordに貼り付けても直りますか
- 直りません。コピーの時点で文字コードが失われているため、貼り付け先を変えても同じ文字化けが起きます。フォントを変えても直りません。
- 料金はいくらですか
- 1〜10ページ160円、11〜30ページ300円、31〜60ページ550円、61〜100ページ850円、101〜200ページ1,500円の買い切りです。アカウント登録は不要です。診断は無料で、買う前に何が取り出せるかを確認できます。