PDFIntact

Extraire les tableaux et le texte d'un PDF, tels quels

Un PDF sur deux colonnes ressort avec les colonnes entremêlées

Vous sélectionnez le texte d'un article composé sur deux colonnes, vous le copiez, vous le collez dans Word — et une ligne de la colonne de gauche est suivie d'une ligne de celle de droite, encore et encore. Deux propos distincts se retrouvent tressés ensemble, et l'on ne sait plus où une phrase s'arrête.

La cause : un PDF n'enregistre aucune structure de colonne. Son contenu, ce sont des instructions : « trace ce glyphe à ces coordonnées ». Rien dans le fichier n'indique où commence une colonne ni où finit l'autre. La copie et l'extraction de texte parcourent la page de haut en bas, ligne par ligne, selon la position de tracé : deux colonnes situées à la même hauteur sont donc prises en alternance, une ligne à la fois.

Il faut donc relire les colonnes depuis la mise en page. PDFIntact repère les blocs de la page — texte, titres, tableaux, figures — et les remet dans l'ordre de lecture avant d'écrire vers Word, Markdown et JSON. La composition en colonnes n'est pas reproduite : vous obtenez un document sur une seule colonne, dans l'ordre de lecture.

Essayer maintenant

Vérifiez sur votre propre PDF

L'analyse se fait entièrement dans votre navigateur. Votre fichier n'est jamais envoyé et aucun compte n'est requis. Voyez avant de payer combien de pages, de tableaux et de figures peuvent être extraits.

Exemple

行の拾われ方が変わります

左右に並んだ3行ずつの段が、どの順で並ぶかを示した図です。実際の文面ではなく、拾われる順序だけを表しています。

コピーしたとき(描かれた位置の順)

左の段 1行目
右の段 1行目
左の段 2行目
右の段 2行目
左の段 3行目
右の段 3行目

PDFIntact を通したとき(読み順)

左の段 1行目
左の段 2行目
左の段 3行目
右の段 1行目
右の段 2行目
右の段 3行目

形式ごとに、どう入るか

同じ読み順でも、書き出す形式によって入り方が違います。

Word(.docx)

読み順のまま、1段の段落として並びます。段組は再現しません。

Markdown(.md)

同じ範囲を、ページごとの見出しの下に読み順で置きます。

JSON

ブロックの種別・ページ番号・ページ内の座標つきで入るので、どの段のどこから来た文章かを後から辿れます。

Excel(.xlsx)

本文は入りません。Excelに書き出すのは表とグラフだけです。

脚注・キャプション・ページ番号

これらは本文とは別のブロックとして、読み順のその位置に段落で入ります。 2段組の論文では図のキャプションが本文と分けて取れること、 書籍のスキャンでは脚注の区切り線より下が別ブロックになりページ番号が本文に混ざらないことを、 それぞれ確認しています。Wordの脚注機能には入れません。段落として入ります。

Questions fréquentes

Pourquoi les colonnes s'entremêlent-elles quand je copie un PDF sur deux colonnes ?
Parce qu'un PDF n'enregistre pas une colonne en tant que colonne. Le fichier dit seulement « trace ce glyphe à ces coordonnées », sans rien indiquer sur le début d'une colonne ni la fin de l'autre. La copie parcourt la page de haut en bas, ligne par ligne : deux colonnes à la même hauteur sont donc prises en alternance, une ligne à la fois.
Comment l'ordre de lecture est-il rétabli ?
Les blocs de la page — texte, titres, tableaux, figures — sont d'abord repérés, puis remis dans l'ordre de lecture avant toute écriture. La composition sur deux colonnes n'est pas reproduite : Word et Markdown reçoivent un document sur une seule colonne, dans l'ordre de lecture.
Que deviennent les notes de bas de page et les légendes ?
Elles ressortent comme des blocs distincts, sous forme de paragraphes, à leur place dans l'ordre de lecture. Lors de nos essais, les légendes sont restées séparées du texte, tout ce qui se trouvait sous le filet de note formait un bloc à part, et les numéros de page ne se mélangeaient pas au texte. Elles ne deviennent pas des notes Word : elles arrivent en paragraphes.
Vers quels formats le texte peut-il être exporté ?
Word, Markdown et JSON. Le JSON porte en plus le type de bloc, le numéro de page et la position sur la page, ce qui permet de retrouver de quelle colonne et de quel endroit vient un passage. Le texte courant ne va pas dans Excel : un export Excel ne contient que des tableaux et des graphiques.
Si l'ordre de lecture est bon, les caractères le sont-ils aussi ?
Ce sont deux choses différentes. L'ordre de lecture peut tenir alors que la lecture des caractères se dégrade ; nous l'avons observé sur un échantillon. C'est pourquoi chaque bloc porte un indicateur de fiabilité — lu, estimé ou illisible. Comparez toujours le résultat au PDF d'origine.

Tester un PDF sur tous les symptômesCe que contient chaque format