Qu'est-ce qu'un PDF scanné ? Le distinguer d'un PDF natif en 10 secondes
Un PDF scanné est un PDF dont les pages sont des images d'un support papier, capturées par un scanner ou un appareil photo de téléphone, plutôt que du texte et des formes vectorielles saisis sur un ordinateur. Sauf si un OCR a ajouté une couche de texte cachée, vous ne pouvez ni sélectionner, ni rechercher, ni copier ses mots, et un lecteur d'écran ne prononce rien sur la page.
Vous avez reçu un PDF et devez savoir ce qu'il est réellement : un fichier exporté depuis un traitement de texte, un scan de papier, ou un scan au texte reconnu. La réponse détermine si vous pouvez le rechercher, si un tribunal ou une administration l'acceptera, et s'il a besoin d'un OCR.
Cet article explicatif donne une définition précise, un test de 10 secondes, une comparaison des trois types de PDF et un glossaire. Les informations proviennent des recommandations d'accessibilité du W3C, des tribunaux fédéraux américains, de l'USCIS, de la NARA et de la FADGI, de GOV.UK et d'équipes d'accessibilité universitaires, ainsi que de ce que nous savons en concevant un outil à effet scanné.
Qu'est-ce qu'un PDF scanné, exactement ?
Un PDF scanné est un conteneur PDF qui renferme une image matricielle par page, produite en photographiant ou en scannant une feuille physique. Les lettres que vous voyez sont des pixels, pas des caractères. Le logiciel traite chaque page comme une photo, si bien que la recherche de texte, la copie et la mise en page fluide ne fonctionnent pas sans OCR.
Le tribunal fédéral du district nord de Californie, citant les instructions de transfert des Archives nationales, le résume en une phrase : « Un texte scanné est une photographie d'une page imprimée, produite soit par un appareil photo numérique, soit par un scanner » (N.D. Cal., Preparing Your CM/ECF Filing). Le format PDF lui-même ne change pas : un PDF scanné reste un fichier ISO 32000 valide. Ce qui change, c'est ce qui se trouve à l'intérieur de chaque page.
L'équipe accessibilité de James Madison University décrit le résultat du point de vue du lecteur : « Les PDF de documents scannés ne sont souvent que des images de documents, semblables à des photographies numériques, et ne contiennent généralement pas de texte lisible » (JMU Digital Accessibility). Ce seul fait explique presque toutes les différences pratiques abordées plus bas.
Voici la définition découpée en éléments vérifiables, de la même façon qu'un agent des archives ou un auditeur accessibilité examinerait un fichier.
- Contenu de la page
- Une image bitmap par page (compression JPEG, JBIG2, CCITT ou similaire), pas des glyphes de police ni des tracés vectoriels.
- Couche de texte
- Aucune dans un PDF image seule ; une couche OCR invisible dans un PDF scanné interrogeable.
- Source
- Un scanner à plat ou à défilement, un copieur multifonction, ou un appareil photo de téléphone avec une application de scan intégrée au système d'exploitation.
- Résolution typique
- 200 à 400 ppi ; 300 ppi est l'exigence la plus courante pour du texte de bureau.
- Mode couleur
- Bitonal (noir et blanc 1 bit), niveaux de gris (8 bits) ou couleur (24 bits).
- Comportement au zoom
- Les contours se transforment en blocs de pixels visibles à fort grossissement.
- Taille du fichier
- En général plus lourde par page qu'un PDF de texte, surtout en niveaux de gris ou en couleur.
En quoi un PDF scanné diffère-t-il d'un PDF natif ?
Un PDF scanné stocke des images de pages, tandis qu'un PDF natif (nativement numérique) stocke de vrais caractères, polices et graphiques vectoriels exportés depuis un logiciel. Un troisième type, le PDF scanné avec OCR, conserve l'image de la page mais y ajoute un texte machine caché en dessous, ce qui en fait un PDF interrogeable.
Le district du Massachusetts trace la même limite dans ses règles de dépôt électronique : un PDF scanné vient d'un papier passé dans un scanner optique, tandis qu'un PDF « converti électroniquement » est créé depuis un traitement de texte et son texte est interrogeable (D. Mass. CM/ECF Administrative Procedures). Le tableau met les trois types côte à côte.
| Propriété | PDF natif | PDF scanné en image seule | PDF scanné + OCR (interrogeable) |
|---|---|---|---|
| Comment il est créé | Export ou impression en PDF depuis Word, Google Docs, un navigateur ou n'importe quelle application | Scanner, copieur ou appareil photo de téléphone | Scan d'abord, puis un logiciel d'OCR ajoute le texte |
| Ce que contient une page | Caractères, polices intégrées, lignes vectorielles, images | Une seule image matricielle | Une image matricielle plus un texte invisible |
| Sélectionner et copier le texte | Oui, exact | Non | Oui, mais seulement aussi fidèle que l'OCR |
| Recherche Ctrl/Cmd+F | Fonctionne | Ne trouve rien | Fonctionne, peut manquer des mots mal reconnus |
| Lecteurs d'écran | Lisible, idéal si balisé | Muet | Lisible, souvent sans structure |
| Zoom à 400 % | Contours nets à toute taille | Pixelisé | Pixelisé |
| Taille type par page | Quelques dizaines de Ko | Environ 75 Ko (bitonal) à plus de 1 Mo (niveaux de gris ou couleur) | Comme l'image seule plus une petite couche de texte |
| A l'aspect du papier | Non | Oui | Oui |
Les tailles par page du tableau viennent de tests réels de tribunaux, pas d'estimations. Le district nord de Californie a scanné un document de 317 pages : en bitonal à 300 ppi, il pesait 23,86 Mo, soit environ 75 Ko par page, et en niveaux de gris à 400 ppi, il atteignait 374,47 Mo, soit environ 1,2 Mo par page. Le district central de Caroline du Nord note que 2 Mo contiennent environ quarante-cinq pages de texte PDF, soit moins de 50 Ko par page.
Que signifie une copie scannée face à une photocopie ?
Une copie scannée est un fichier image numérique d'un original papier, en général livré sous forme de PDF scanné ou de JPEG. Une photocopie est une seconde feuille de papier imprimée par un copieur. Une copie certifiée conforme est une copie qu'une personne habilitée a vérifiée face à l'original et signée.
Les gens emploient « copie scannée » de façon très large, et les trois termes se mélangent dans les formulaires, les e-mails des RH et les listes de contrôle pour les visas. Les différences comptent, car une demande pour l'un n'est pas satisfaite par les autres.
| Terme | Support | Qui la fait | Ce qu'elle prouve |
|---|---|---|---|
| Copie scannée | Fichier numérique (PDF, JPEG, TIFF) | Toute personne disposant d'un scanner ou d'un téléphone | Qu'une image du document existe ; rien sur l'authenticité |
| Photocopie | Papier | Toute personne disposant d'un copieur | La même chose : c'est une reproduction, pas l'original |
| Copie certifiée (conforme) | Papier, parfois scannée ensuite | Un professionnel ayant vu l'original | Que la copie correspond à l'original, sur la parole de cette personne |
| Original | Papier ou fichier natif numérique | L'émetteur | Le document lui-même |
Le gouvernement britannique explique la certification simplement : « Vous pouvez certifier un document comme copie conforme en le faisant signer et dater par un professionnel, comme un avocat » (GOV.UK, Certifying a document). Une copie scannée de cette page certifiée reste une copie scannée ; la certification vit sur le papier, avec la signature et la date.
Ainsi, quand un propriétaire, un employeur ou une école demande d'« envoyer une copie scannée », il veut presque toujours dire « une image numérique nette du papier, en PDF ». Quand il demande une « copie certifiée conforme », un simple scan ne suffira pas, même s'il a l'air très réaliste.
Comment savoir si un PDF est scanné ?
Pour savoir si un PDF est scanné, essayez de sélectionner un mot sur la page et recherchez un mot que vous voyez. Si rien ne se surligne, le PDF est en image seule. Le zoom, les propriétés du document, la liste des polices et la taille du fichier confirment ensuite si le fichier est scanné, natif, ou scanné avec OCR.
Les deux premières vérifications prennent moins de 10 secondes et fonctionnent dans n'importe quelle visionneuse PDF, y compris celle intégrée à Google Chrome, à Microsoft Edge et à Aperçu sur macOS. Les suivantes prennent une minute et tranchent les cas ambigus.
- Essayez de sélectionner du texte. Faites glisser le curseur le long d'une ligne. Dans un PDF natif ou passé à l'OCR, chaque mot se surligne individuellement. Dans un PDF en image seule, rien ne se surligne, ou certaines visionneuses dessinent un rectangle autour de toute l'image de la page.
- Recherchez avec Ctrl+F ou Cmd+F. Tapez un mot distinctif que vous voyez clairement sur la première page. Zéro résultat pour un mot manifestement présent signifie qu'il n'y a pas de couche de texte. Un résultat signifie du vrai texte ou une couche OCR.
- Zoomez à 400 %. Regardez le contour d'une lettre. Le texte vectoriel reste parfaitement net à n'importe quel zoom. Une page scannée montre des marches de pixels, de légères franges grises, du grain, et parfois des motifs de blocs JPEG autour des lettres.
- Ouvrez les propriétés du document. Dans la visionneuse PDF de Chrome, utilisez le menu à trois points et choisissez Propriétés du document ; dans Aperçu sur macOS, utilisez Outils, puis Afficher l'inspecteur. Le champ producteur ou application nomme souvent un scanner, un modèle de copieur, une fonction de scan de téléphone ou un moteur OCR. Un traitement de texte ou « Imprimer en PDF » suggère un fichier nativement numérique.
- Vérifiez la liste des polices. Les logiciels PDF de bureau affichent un onglet Polices dans leurs propriétés de document. Un PDF natif liste les polices qu'il utilise. Un scan en image seule n'en liste aucune. Un scan passé à l'OCR liste souvent une seule police, utilisée uniquement pour la couche invisible.
- Comparez la taille par page. Divisez la taille du fichier par le nombre de pages. Un PDF de texte reste en général sous 50 Ko par page. Un scan en niveaux de gris ou en couleur fait souvent plusieurs centaines de Ko à plus de 1 Mo par page. Les scans bitonaux sont compacts, donc la taille est l'indice le plus faible.
Le manuel d'accessibilité de Cleveland State University recommande le même test rapide de recherche : « Si le mot se surligne sur la page, alors il possède du texte interrogeable, à l'inverse d'une image scannée de texte » (Heather Caprette, Cleveland State University).
Les métadonnées sont un indice, pas une preuve. Les champs producteur et créateur peuvent être modifiés par de nombreux outils, y compris le nôtre : fiez-vous à ce que fait le contenu de la page à la sélection et au zoom plutôt qu'à ce que dit le panneau des propriétés.
Pourquoi les documents scannés sont-ils difficiles à rechercher et à lire ?
Les documents scannés sont difficiles à rechercher et à lire parce qu'un PDF en image seule ne contient aucun caractère que le logiciel puisse indexer. Moteurs de recherche, recherche sur le poste, copier-coller, outils de traduction et lecteurs d'écran ont tous besoin de texte. Sans couche OCR, le PDF scanné est une image que seuls les lecteurs voyants peuvent utiliser.
La Web Accessibility Initiative du W3C ne prend pas de gants dans la technique PDF7 des WCAG : « Un document composé d'images scannées de texte est intrinsèquement inaccessible, car le contenu du document est constitué d'images, pas de texte interrogeable » (W3C WAI, WCAG Technique PDF7).
La même page du W3C liste ce qui est perdu : « Les technologies d'assistance ne peuvent ni lire ni extraire les mots ; les utilisateurs ne peuvent ni sélectionner, ni modifier, ni redimensionner, ni remettre en page le texte, ni changer les couleurs du texte et du fond ; et les auteurs ne peuvent pas retoucher le PDF pour l'accessibilité. » Son remède est l'OCR, pour qu'un vrai texte existe derrière l'image.
Le bureau accessibilité de Georgetown University ajoute la conséquence pratique pour quiconque dépend d'une technologie d'assistance : « Les PDF scannés sont une compilation d'images, donc illisibles pour la plupart des lecteurs d'écran standards » (Accessibility at Georgetown).
Les organismes publics vont plus loin. Le Government Digital Service britannique affirme que, comparée au HTML, une information publiée en PDF est plus difficile à trouver, à utiliser et à maintenir (GDS blog, GOV.UK). Un PDF scanné en image seule est la version extrême de ce problème : même les mots ne sont pas lisibles par une machine.
| Tâche | Natif | Scan en image seule | Scan + OCR |
|---|---|---|---|
| Lecture par lecteur d'écran | Texte complet | Aucune | Texte, souvent dans le désordre |
| Remise en page sur téléphone | Possible si balisé | Non | Rarement |
| Copier une citation | Exacte | Retaper à la main | Peut contenir des erreurs d'OCR |
| Trouvé par la recherche sur le poste | Oui | Nom du fichier seulement | Oui |
| Traduction automatique | Oui | Besoin d'un OCR d'abord | Oui |
Que fait l'OCR à un PDF scanné ?
L'OCR, la reconnaissance optique de caractères, lit la forme des lettres dans un PDF scanné et écrit le texte machine correspondant dans une couche invisible derrière chaque image de page. La page a exactement le même aspect, mais elle devient un PDF interrogeable : les mots peuvent être trouvés, sélectionnés, copiés et lus à voix haute.
La Federal Agencies Digital Guidelines Initiative la définit précisément : « La reconnaissance optique de caractères (OCR) est le processus qui convertit une image matricielle de texte en texte électronique interrogeable » (FADGI Technical Guidelines, 3e éd., 2023). L'OCR fonctionne sur du texte dactylographié, imprimé et, de façon moins fiable, manuscrit.
Ce que l'OCR corrige dans un document scanné
- La recherche Ctrl/Cmd+F et l'indexation plein texte se mettent à fonctionner.
- Le texte peut être sélectionné, copié et collé dans d'autres documents.
- Les lecteurs d'écran obtiennent des mots à prononcer, ce qui satisfait le remède de base du W3C PDF7.
- Les systèmes judiciaires qui exigent des dépôts au texte interrogeable peuvent accepter le fichier.
Ce que l'OCR ne corrige pas
- La qualité de l'image. La page reste une image, donc le zoom continue de pixeliser. JMU note que pour les personnes qui zooment, « le rendu devient pixelisé et déformé car le eText se trouve sous l'image du texte ».
- La fidélité. Flou, inclinaison, faible résolution et grain provoquent des erreurs de lecture comme « rn » pour « m » ou « 1 » pour « l ». Le texte caché peut être faux alors que l'image paraît correcte.
- La structure. Titres, ordre de lecture, cellules de tableau et texte alternatif des images ont encore besoin d'un balisage manuel pour une accessibilité complète.
- La taille du fichier. Les images de page restent, donc un PDF scanné avec OCR est presque aussi lourd que la version en image seule.
Quand les organismes demandent-ils une copie scannée ?
Les organismes demandent une copie scannée quand l'original existe sur papier et qu'ils ont besoin d'un enregistrement numérique : preuves d'immigration, pièces de tribunal, dossiers d'intégration RH, contrats signés et reçus. Chacun fixe ses propres règles de format, de résolution et de taille de fichier, et certains tribunaux exigent des PDF interrogeables plutôt qu'en image seule.
Preuves d'immigration (USCIS)
Les services d'immigration américains (USCIS) acceptent des preuves scannées ou photographiées pour les dépôts en ligne. Leur instruction est brève : « Utilisez un scanner ou prenez des photos de chaque document », et « Assurez-vous que chaque image jointe est nette et que tout le texte est lisible » (USCIS, Tips for Filing Forms Online). Chaque fichier peut aller jusqu'à 12 Mo, en PDF, JPG ou JPEG, avec TIF ou TIFF accepté pour certains formulaires.
Dépôts devant les tribunaux fédéraux (CM/ECF)
Les systèmes de dépôt électronique fédéraux n'acceptent que le PDF, et de nombreux tribunaux préfèrent les fichiers nativement numériques. Le district sud de Floride indique que « les actes de procédure et documents principaux déposés électroniquement dans CM/ECF doivent être au format PDF interrogeable » (S.D. Fla. CM/ECF FAQ). Les PDF scannés servent surtout pour les pièces jointes et les papiers signés sans original numérique.
Les réglages de scan et les limites de taille varient selon le tribunal. Le district ouest de Washington exige un scan à 300 dpi, en noir et blanc sauf si la couleur fait partie intégrante du document, et plafonne chaque document à 100 Mo (W.D. Wash. technical FAQ). Le district du Minnesota limite chaque pièce à 35 Mo dans ses procédures pénales électroniques.
RH, propriétaires, écoles et banques
Employeurs et bailleurs veulent généralement une copie scannée d'une pièce d'identité, d'un diplôme, d'une lettre d'embauche signée ou d'une page de bail. Ils publient rarement des règles techniques ; la plupart mentionnent une limite de pièce jointe et demandent que chaque mot reste lisible. Quand un portail n'affiche aucune limite, un PDF en niveaux de gris à 300 dpi de moins de 10 Mo est une estimation raisonnable par défaut, pas une règle affichée.
| Demandeur | Format | Règle de taille ou de résolution | Texte interrogeable exigé ? |
|---|---|---|---|
| Dépôt en ligne USCIS | PDF, JPG, JPEG (TIF/TIFF pour certains formulaires) | 12 Mo par fichier | Non ; le texte doit être lisible |
| Tribunal du W.D. Wash. | 300 dpi, noir et blanc ; 100 Mo par document | Selon le type de document | |
| Tribunal du S.D. Fla. | Les limites du tribunal s'appliquent | Oui pour les documents principaux | |
| D. Minn., dépôt pénal électronique | 35 Mo par pièce | Vérifier les règles locales | |
| Employeur ou propriétaire | PDF ou image | Généralement une limite d'e-mail | Rarement |
Un PDF scanné peut-il être archivé au format PDF/A ?
Un PDF scanné peut être enregistré en PDF/A, la version archivistique ISO 19005 du PDF, car PDF/A autorise les images de page. PDF/A ajoute des règles pour une lecture à long terme, comme les polices intégrées et l'absence de chiffrement, mais il ne rend pas une page en image seule interrogeable pour autant. L'OCR est une étape séparée.
PDF/A a été publié pour la première fois le 1er octobre 2005, et il interdit les fonctionnalités qui rendent les fichiers difficiles à ouvrir des décennies plus tard, comme les polices liées et le chiffrement (Wikipédia, PDF/A). Microsoft Office peut exporter directement des fichiers conformes ISO 19005-1 depuis ses options Enregistrer en PDF.
Les tribunaux qui exigent le PDF/A détournent souvent les déposants du scan pur et simple. Le district est de l'Oklahoma conseille que, pour garder des fichiers légers et garantir des fichiers au texte interrogeable, les documents PDF/A soient créés dans un traitement de texte plutôt qu'imprimés puis scannés (E.D. Okla. PDF/A FAQ).
- PDF/A natif
- Le plus léger et entièrement interrogeable ; le meilleur choix quand un original numérique existe.
- PDF/A scanné avec OCR
- Archivable et interrogeable ; le bon choix pour les documents qui n'existent que sur papier.
- PDF/A en image seule
- Valable pour la préservation, mais ni interrogeable ni accessible.
Comment un PDF natif prend-il l'aspect d'un PDF scanné ?
Un PDF natif prend l'aspect d'un PDF scanné quand chaque page est rastérisée en image puis dotée des imperfections d'un vrai scanner : légère rotation, flou, bruit, teinte grise ou papier. Le résultat est un PDF en image seule qui se comporte comme un scan, sans rien imprimer ni posséder de scanner.
C'est exactement ce que fait notre outil à effet scanné gratuit. Il dessine chaque page du PDF dans votre navigateur, applique les effets choisis et réenregistre chaque page comme une image JPEG dans un nouveau PDF. Les fichiers sont traités localement et ne sont pas envoyés à un serveur.
- Rotation
- −10° à 10°, valeur par défaut 1°, plus une variation aléatoire par page allant jusqu'à 10°.
- Flou
- 0 à 1, valeur par défaut 0,3, adoucit les contours vectoriels comme le fait l'optique d'un scanner.
- Bruit
- 0 à 1, valeur par défaut 0,1, ajoute un grain façon capteur.
- Luminosité et contraste
- 0 à 2 chacun, valeur par défaut 1.
- Jaunissement
- 0 à 2, valeur par défaut 0, teinte la page comme un papier vieilli.
- Mode couleur
- Niveaux de gris (par défaut) ou Couleur.
- Résolution
- 1× à 3× ; les pages PDF sont rendues à 72 dpi multiplié par l'échelle, donc 2× vaut environ 144 dpi et 3× environ 216 dpi.
Comme le résultat est en image seule, il hérite de toutes les propriétés décrites plus haut : pas de texte sélectionnable, pas de recherche, fichiers plus lourds, pas de lecture par lecteur d'écran. C'est justement ce qui est recherché par quelqu'un qui veut qu'un document ait l'aspect d'une copie scannée, et un inconvénient pour qui a besoin qu'il reste interrogeable. Conservez le fichier numérique d'origine.
Pour le déroulé complet, y compris les compromis de résolution et de taille de fichier, lisez comment convertir un PDF en PDF scanné. Pour les six méthodes, du print-and-scan aux options intégrées du système, consultez comment faire ressembler un PDF à un scan. Vous partez d'une photo au téléphone ? Le guide pour transformer une image en PDF scanné couvre le JPG et le PNG.
Nous avons conçu notre outil pour ajouter un effet scanné, et la question la plus fréquente qu'on nous pose est en réalité « qu'est-ce que je viens de créer ? ». La réponse honnête est un PDF en image seule. Il a l'aspect du papier, mais les mots sont des pixels. Si un lecteur doit le rechercher ou se le faire lire, gardez l'original numérique à côté, ou faites tourner un OCR ensuite. Nous préférons que les gens le sachent avant de cliquer sur Télécharger.L'équipe Make PDF look scanned — créateurs de l'outil web et de l'extension Chrome
Glossaire du document scanné : quels termes comptent ?
Un document scanné vient avec son propre vocabulaire : dpi et ppi, profondeur de couleur, bitonal, OCR, rastériser, PDF/A et JBIG2. Connaître ces sept termes suffit pour lire n'importe quelle exigence de numérisation d'un tribunal, d'une administration ou d'un employeur, et pour juger un PDF scanné que vous recevez.
- dpi / ppi
- Points ou pixels par pouce : combien d'échantillons d'image couvrent un pouce de papier. La NARA exige au moins 300 ppi pour les documents textuels modernes et 400 ppi pour les photographies et les documents à détails fins. La géométrie des pages PDF utilise 72 points par pouce, ce qui explique qu'un rendu à 1× équivaut à 72 dpi.
- Profondeur de couleur
- Bits stockés par pixel. Le bitonal est en 1 bit, les niveaux de gris en 8 bits (256 nuances), et un scan couleur typique en 24 bits (8 bits pour chacun des trois canaux).
- Bitonal
- La définition de la FADGI : « Des images numériques produites avec seulement deux couleurs, noir et blanc. » Le format le plus léger qui reste lisible pour du texte simple.
- OCR
- Reconnaissance optique de caractères : un logiciel qui transforme la forme des lettres d'une image en texte machine, créant un PDF interrogeable.
- Rastériser
- Convertir du texte et des formes vectorielles en une grille de pixels. Rastériser un PDF natif le transforme en PDF en image seule.
- PDF/A
- ISO 19005, le sous-ensemble archivistique du PDF, publié en 2005 ; il bannit des fonctionnalités comme le chiffrement et les polices liées.
- JBIG2
- Une méthode de compression pour les scans bitonaux qui stocke une seule fois les symboles répétés. La BBC a rapporté en 2013 que certains copieurs de bureau utilisant un mode JBIG2 avec perte modifiaient des chiffres dans les scans, transformant souvent un 6 en 8 ; dans un test, une dimension de pièce de 21,11 m était devenue 14,13 m.
- PDF en image seule
- Un PDF scanné sans aucune couche de texte.
- PDF interrogeable
- Un PDF avec du texte réel ou issu de l'OCR, qui peut être recherché et sélectionné.
L'affaire JBIG2 est l'argument le plus fort pour conserver les originaux. Une copie scannée est une image, et les images peuvent être altérées par la compression sans que personne ne s'en aperçoive (BBC News, 2013). La NARA traite aussi le bruit comme un artefact indésirable « qui ne fait pas partie du document source » (36 CFR 1236 Subpart E).
FAQ sur le PDF scanné : quelles autres questions se pose-t-on ?
Ces questions sur le PDF scanné reviennent le plus souvent chez ceux qui ont reçu un fichier, doivent envoyer une copie scannée, ou doivent respecter une règle de tribunal ou d'administration. Chaque réponse est autonome, pour que vous puissiez sauter directement à celle qui correspond à votre situation et agir.
Qu'est-ce qu'un PDF scanné en termes simples ?
Un PDF scanné est un PDF composé de photos de pages en papier. Le texte que vous voyez fait partie d'une image, donc vous ne pouvez ni le sélectionner ni le rechercher, sauf si un OCR a été appliqué.
Un PDF scanné est-il la même chose qu'une copie scannée ?
Presque. Une copie scannée est n'importe quelle image numérique d'un document papier, et un PDF scanné est le format de fichier le plus courant pour en livrer une. Une copie scannée peut aussi être un JPEG ou un TIFF.
Comment savoir si un PDF est scanné en 10 secondes ?
Essayez de sélectionner un mot, puis appuyez sur Ctrl+F ou Cmd+F et recherchez un mot que vous voyez. Si rien ne se surligne et que la recherche ne trouve rien, le PDF est un scan en image seule. Zoomez à 400 % pour confirmer : un texte scanné paraît pixelisé.
Un PDF scanné peut-il être interrogeable ?
Oui. L'OCR ajoute une couche de texte invisible derrière les images de page, transformant un PDF scanné en PDF interrogeable. La page garde l'aspect d'un scan, et des mots mal reconnus peuvent apparaître dans le texte caché.
Pourquoi ne puis-je pas copier le texte de mon PDF ?
Le PDF est très probablement un scan sans OCR, donc il n'y a aucun caractère à copier. La FAQ du tribunal du district sud de Floride note la même chose : si un PDF n'est pas au texte interrogeable, son texte ne peut pas être copié. Faites tourner un OCR ou demandez l'original numérique.
Les PDF scannés sont-ils accessibles aux lecteurs d'écran ?
Pas sans OCR. Les recommandations du W3C qualifient les scans en image seule d'intrinsèquement inaccessibles. Après OCR, les lecteurs d'écran peuvent prononcer le texte, mais une accessibilité complète demande aussi un balisage des titres, de l'ordre de lecture et des tableaux.
Pourquoi un PDF scanné est-il si lourd ?
Chaque page est une image complète. Une page en niveaux de gris à 400 ppi peut dépasser 1 Mo, alors qu'une page de texte issue d'un traitement de texte fait souvent moins de 50 Ko. Scanner à 300 ppi en niveaux de gris ou en noir et blanc garde la taille basse.
Quelle résolution un document scanné doit-il avoir ?
Pour du texte dactylographié ou imprimé, 300 dpi est l'exigence standard dans les tribunaux fédéraux américains et le minimum de la NARA pour les documents textuels. Les photos et les détails fins demandent 400 ppi.
Une copie scannée est-elle une copie légale ou certifiée conforme ?
Non, une copie scannée à elle seule ne prouve rien sur l'authenticité. Une copie certifiée conforme est signée et datée par un professionnel ayant vu l'original, comme l'explique GOV.UK. Demandez au destinataire quel type il exige.
Puis-je faire ressembler un PDF natif à un PDF scanné ?
Oui. L'outil gratuit Make PDF look scanned rastérise chaque page et ajoute rotation, flou, bruit et teinte du papier dans votre navigateur. Le résultat est un PDF en image seule, donc conservez l'original si vous avez besoin de la recherche.
Un PDF scanné doit-il obligatoirement être en PDF/A ?
Seulement si le destinataire le demande. Certains tribunaux et certaines archives exigent le PDF/A pour la conservation à long terme. Un PDF scanné peut être enregistré en PDF/A, idéalement avec OCR pour qu'il soit aussi interrogeable.
Puis-je scanner plusieurs PDF à la fois ?
Avec notre outil, oui : le scan par lots traite plusieurs fichiers et les télécharge en une seule archive ZIP, avec un PDF scanné par fichier importé.
Quelle est la réponse courte sur les PDF scannés ?
Un PDF scanné est une image de papier enveloppée dans un PDF. Testez-le en sélectionnant et en recherchant du texte, ajoutez un OCR quand vous avez besoin de recherche ou d'accessibilité, envoyez un PDF natif quand un tribunal le préfère, et n'utilisez un effet scanné que quand c'est l'apparence, pas l'authenticité, dont le lecteur a besoin.
Si c'est l'apparence dont vous avez besoin, ouvrez l'outil de scan gratuit, gardez le mode couleur Niveaux de gris et la résolution 2× par défaut, et vérifiez l'aperçu avant de télécharger.
Besoin d'un PDF qui ressemble à une copie scannée ?
Déposez un PDF natif dans l'outil gratuit, réglez l'inclinaison, le bruit et la teinte du papier, puis téléchargez un PDF en images qui a l'air d'un vrai scan. Tout se passe dans votre navigateur.