Wat is een gescande PDF? Zo onderscheid je hem in 10 seconden van een digitale PDF
Een gescande PDF is een PDF waarvan de pagina's foto's van papier zijn, vastgelegd door een scanner of een telefooncamera, in plaats van tekst en vectorvormen die op een computer zijn getypt. Tenzij OCR een verborgen tekstlaag heeft toegevoegd, kun je de woorden niet selecteren, doorzoeken of kopiëren, en een schermlezer hoort niets op de pagina.
Je hebt een PDF ontvangen en wilt weten wat het precies is: een bestand geëxporteerd vanuit een tekstverwerker, een scan van papier, of een scan met herkende tekst. Het antwoord bepaalt of je hem kunt doorzoeken, of een rechtbank of instantie hem accepteert, en of hij OCR nodig heeft.
Deze uitleg geeft een precieze definitie, een test van 10 seconden, een vergelijking van de drie soorten PDF en een verklarende woordenlijst. De feiten komen uit W3C-toegankelijkheidsrichtlijnen, Amerikaanse federale rechtbanken, USCIS, NARA en FADGI-digitaliseringsregels, GOV.UK en toegankelijkheidsteams van universiteiten, plus wat we weten uit het bouwen van een scaneffect-tool.
Wat Is Een Gescande PDF Precies?
Een gescande PDF is een PDF-container met één rasterafbeelding per pagina, gemaakt door een fysiek vel te fotograferen of te scannen. De letters die je ziet zijn pixels, geen tekens. Software behandelt elke pagina als een foto, dus gewoon zoeken naar tekst, kopiëren en herstromen werken niet zonder OCR.
De U.S. District Court for the Northern District of California verwoordt het, met verwijzing naar overdrachtsrichtlijnen van de National Archives, in één zin: "Gescande tekst is een foto van een gedrukte pagina, gemaakt met een digitale camera of een scanner" (N.D. Cal., Preparing Your CM/ECF Filing). Het PDF-formaat zelf verandert niet: een gescande PDF is nog altijd een geldig ISO 32000-bestand. Wat verandert, is wat er in elke pagina zit.
Het toegankelijkheidsteam van James Madison University beschrijft het resultaat vanuit het perspectief van een lezer: "PDF's van gescande documenten zijn vaak niets meer dan afbeeldingen van documenten, vergelijkbaar met digitale foto's, en bevatten doorgaans geen leesbare tekst" (JMU Digital Accessibility). Dat ene feit verklaart bijna elk praktisch verschil dat hieronder aan bod komt.
Hier is de definitie opgesplitst in controleerbare onderdelen, zoals een archiefmedewerker of een toegankelijkheidsauditor naar een bestand zou kijken.
- Paginainhoud
- Eén bitmapafbeelding per pagina (JPEG, JBIG2, CCITT of vergelijkbare compressie), geen lettertypeglyphs en vectorpaden.
- Tekstlaag
- Geen in een PDF met alleen afbeeldingen; een onzichtbare OCR-laag in een doorzoekbare gescande PDF.
- Bron
- Een flatbed- of documentinvoerscanner, een multifunctionele kopieermachine, of een telefooncamera met een scanfunctie die in het besturingssysteem is ingebouwd.
- Typische resolutie
- 200 tot 400 ppi; 300 ppi is de meest voorkomende vereiste voor kantoortekst.
- Kleurmodus
- Bitonaal (1-bit zwart-wit), grijstinten (8-bit) of kleur (24-bit).
- Zoomgedrag
- Randen worden bij sterke vergroting zichtbare pixelblokken.
- Bestandsgrootte
- Meestal groter per pagina dan een tekst-PDF, vooral in grijstinten of kleur.
Hoe Verschilt Een Gescande PDF Van Een Digitale PDF?
Een gescande PDF slaat afbeeldingen van pagina's op, terwijl een digitale (digitaal geboren) PDF echte tekens, lettertypen en vectorafbeeldingen opslaat die vanuit software zijn geëxporteerd. Een derde soort, de gescande PDF met OCR, behoudt de pagina-afbeelding maar voegt daaronder verborgen machineleesbare tekst toe, waardoor het een doorzoekbare PDF wordt.
Het District of Massachusetts trekt in zijn regels voor elektronisch indienen dezelfde grens: een gescande PDF komt van papier dat door een optische scanner is gehaald, terwijl een "elektronisch omgezette" PDF wordt gemaakt vanuit een tekstverwerker en doorzoekbaar is (D. Mass. CM/ECF Administrative Procedures). De tabel zet de drie soorten naast elkaar.
| Eigenschap | Digitaal geboren PDF | Gescande PDF met alleen afbeeldingen | Gescande PDF + OCR (doorzoekbaar) |
|---|---|---|---|
| Hoe wordt hij gemaakt | Exporteren of afdrukken naar PDF vanuit Word, Google Docs, een browser of een andere app | Scanner, kopieerapparaat of telefooncamera | Eerst scannen, dan voegt OCR-software tekst toe |
| Wat een pagina bevat | Tekens, ingesloten lettertypen, vectorlijnen, afbeeldingen | Eén rasterafbeelding | Eén rasterafbeelding plus onzichtbare tekst |
| Tekst selecteren en kopiëren | Ja, exact | Nee | Ja, maar alleen zo nauwkeurig als de OCR |
| Ctrl/Cmd+F zoeken | Werkt | Vindt niets | Werkt, kan verkeerd gelezen woorden missen |
| Schermlezers | Leesbaar, het best als hij getagd is | Stil | Leesbaar, vaak zonder structuur |
| Zoomen naar 400% | Scherpe randen op elke grootte | Gepixeld | Gepixeld |
| Typische grootte per pagina | Tientallen KB | Ongeveer 75 KB (bitonaal) tot meer dan 1 MB (grijstinten of kleur) | Hetzelfde als alleen-afbeelding plus een kleine tekstlaag |
| Ziet eruit als papier | Nee | Ja | Ja |
De groottes per pagina in de tabel komen uit rechtbanktests, niet uit schattingen. Het Northern District of California scande een document van 317 pagina's: bitonaal op 300 ppi kwam uit op 23,86 MB, ongeveer 75 KB per pagina, en grijstinten op 400 ppi kwam uit op 374,47 MB, ongeveer 1,2 MB per pagina. Het Middle District of North Carolina merkt op dat 2 MB ruimte biedt aan ongeveer vijfenveertig pagina's PDF-tekst, onder de 50 KB per pagina.
Wat Betekent Een Gescande Kopie Versus Een Fotokopie?
Een gescande kopie is een digitaal afbeeldingsbestand van een papieren origineel, meestal geleverd als gescande PDF of JPEG. Een fotokopie is een tweede vel papier dat door een kopieerapparaat is geprint. Een gewaarmerkte kopie is elke kopie die door een bevoegd persoon tegen het origineel is gecontroleerd en ondertekend.
Mensen gebruiken "gescande kopie" losjes, en de drie termen raken door elkaar in formulieren, hr-e-mails en visumchecklists. De verschillen doen ertoe, want een verzoek om het ene wordt niet vervuld door het andere.
| Term | Medium | Wie maakt hem | Wat hij bewijst |
|---|---|---|---|
| Gescande kopie | Digitaal bestand (PDF, JPEG, TIFF) | Iedereen met een scanner of telefoon | Dat er een afbeelding van het document bestaat; niets over echtheid |
| Fotokopie | Papier | Iedereen met een kopieerapparaat | Hetzelfde: het is een reproductie, niet het origineel |
| Gewaarmerkte (echte) kopie | Papier, soms achteraf gescand | Een professional die het origineel heeft gezien | Dat de kopie overeenkomt met het origineel, op het woord van die persoon |
| Origineel | Papier of digitaal geboren bestand | De uitgever | Het document zelf |
De Britse overheid legt certificering eenvoudig uit: "Je kunt een document als een ware kopie laten waarmerken door het te laten ondertekenen en dateren door een professional, zoals een advocaat" (GOV.UK, Certifying a document). Een gescande kopie van die gewaarmerkte pagina is nog steeds een gescande kopie; de waarmerking bestaat op het papier, met de handtekening en de datum.
Dus als een verhuurder, werkgever of school om een "gescande kopie" vraagt, bedoelen ze bijna altijd "een duidelijke digitale afbeelding van het papier, als PDF". Als ze "gewaarmerkte kopie" zeggen, volstaat een scan alleen niet, hoe realistisch hij er ook uitziet.
Hoe Zie Je Of Een PDF Gescand Is?
Om te zien of een PDF gescand is, probeer je een woord op de pagina te selecteren en zoek je naar een woord dat je kunt zien. Licht er niets op, dan bestaat de PDF alleen uit afbeeldingen. Inzoomen, documenteigenschappen, de lettertypelijst en de bestandsgrootte bevestigen daarna of het bestand gescand, digitaal of gescand met OCR is.
De eerste twee controles kosten minder dan 10 seconden en werken in elke PDF-viewer, inclusief die ingebouwd in Google Chrome, Microsoft Edge en macOS Voorvertoning. De rest kost een minuut en beslecht de onduidelijke gevallen.
- Probeer tekst te selecteren. Sleep de cursor over een regel. In een digitaal geboren of OCR'de PDF lichten losse woorden op. In een PDF met alleen afbeeldingen licht niets op, of sommige viewers tekenen een rechthoek om de hele pagina-afbeelding.
- Zoek met Ctrl+F of Cmd+F. Typ een opvallend woord dat je duidelijk op pagina één ziet staan. Nul resultaten voor een woord dat er duidelijk staat, betekent dat er geen tekstlaag is. Een treffer betekent echte tekst of een OCR-laag.
- Zoom naar 400%. Bekijk de rand van een letter. Vectortekst blijft messcherp op elke zoomstand. Een gescande pagina toont pixelstapjes, vage grijze randjes, spikkels en soms JPEG-blokpatronen rond de letters.
- Open de documenteigenschappen. Gebruik in de PDF-viewer van Chrome het menu met de drie puntjes en kies Documenteigenschappen; gebruik in macOS Voorvertoning Extra, en dan Toon inspector. Het veld producent of applicatie noemt vaak een scanner, kopieermodel, telefoonscanfunctie of OCR-engine. Een tekstverwerker of "Print to PDF" wijst op een digitaal geboren bestand.
- Controleer de lettertypelijst. PDF-software voor de desktop toont een tabblad Lettertypen in zijn documenteigenschappen. Een digitaal geboren PDF vermeldt de gebruikte lettertypen. Een scan met alleen afbeeldingen vermeldt er geen. Een OCR'de scan vermeldt vaak één lettertype dat alleen voor de onzichtbare laag wordt gebruikt.
- Vergelijk de grootte per pagina. Deel de bestandsgrootte door het aantal pagina's. Een tekst-PDF blijft meestal onder de 50 KB per pagina. Een grijstinten- of kleurenscan komt vaak uit op enkele honderden KB tot meer dan 1 MB per pagina. Bitonale scans zijn compact, dus grootte is hier de zwakste aanwijzing.
Het toegankelijkheidshandboek van Cleveland State University beveelt dezelfde snelle zoektest aan: "Licht het woord op de pagina op, dan heeft ze doorzoekbare tekst in plaats van een gescande afbeelding van tekst te zijn" (Heather Caprette, Cleveland State University).
Metadata is een aanwijzing, geen bewijs. Producent- en makervelden kunnen door veel tools worden bewerkt, ook door de onze, dus vertrouw op wat de pagina-inhoud doet bij selectie en zoomen, meer dan op wat het eigenschappenpaneel zegt.
Waarom Zijn Gescande Documenten Moeilijk Te Doorzoeken En Te Lezen?
Gescande documenten zijn moeilijk te doorzoeken en te lezen omdat een PDF met alleen afbeeldingen geen tekens bevat die software kan indexeren. Zoekmachines, desktopzoekfuncties, kopiëren en plakken, vertaaltools en schermlezers hebben allemaal tekst nodig. Zonder OCR-laag is de gescande PDF een plaatje dat alleen ziende lezers kunnen gebruiken.
Het W3C Web Accessibility Initiative is daar botweg over in techniek PDF7 van de WCAG-richtlijn: "Een document dat bestaat uit gescande afbeeldingen van tekst is inherent ontoegankelijk, omdat de inhoud van het document uit afbeeldingen bestaat, niet uit doorzoekbare tekst" (W3C WAI, WCAG Technique PDF7).
Diezelfde W3C-pagina somt op wat er verloren gaat: "Hulptechnologie kan de woorden niet lezen of extraheren; gebruikers kunnen tekst niet selecteren, bewerken, aanpassen in grootte of laten herstromen, en ook tekst- en achtergrondkleuren niet wijzigen; en auteurs kunnen de PDF niet aanpassen voor toegankelijkheid." De remedie die het voorstelt, is OCR, zodat er echte tekst achter de afbeelding bestaat.
Het toegankelijkheidsbureau van Georgetown University voegt het praktische gevolg toe voor iedereen die op hulptechnologie vertrouwt: "Gescande PDF's zijn een verzameling afbeeldingen en daardoor onleesbaar voor de meeste standaard schermlezers" (Accessibility at Georgetown).
Publieke uitgevers zijn nog verder gegaan. De UK Government Digital Service stelt dat informatie die als PDF wordt gepubliceerd, vergeleken met HTML, moeilijker te vinden, te gebruiken en te onderhouden is (GDS blog, GOV.UK). Een gescande PDF met alleen afbeeldingen is de extreme versie van dat probleem: zelfs de woorden zijn niet machineleesbaar.
| Taak | Digitaal geboren | Scan met alleen afbeeldingen | Scan + OCR |
|---|---|---|---|
| Uitvoer schermlezer | Volledige tekst | Geen | Tekst, vaak in verkeerde volgorde |
| Herstromen op een telefoon | Mogelijk als getagd | Nee | Zelden |
| Een citaat kopiëren | Exact | Met de hand overtypen | Kan OCR-fouten bevatten |
| Gevonden door desktopzoekfunctie | Ja | Alleen bestandsnaam | Ja |
| Machinevertaling | Ja | Heeft eerst OCR nodig | Ja |
Wat Doet OCR Met Een Gescande PDF?
OCR, optische tekenherkenning, leest de lettervormen in een gescande PDF en schrijft bijpassende machinetekst in een onzichtbare laag achter elke pagina-afbeelding. De pagina ziet er precies hetzelfde uit, maar wordt een doorzoekbare PDF: woorden kunnen worden gevonden, geselecteerd, gekopieerd en voorgelezen.
Het Federal Agencies Digital Guidelines Initiative definieert het precies: "Optische tekenherkenning (OCR) is het proces waarbij een rasterafbeelding van tekst wordt omgezet in doorzoekbare elektronische tekst" (FADGI Technical Guidelines, 3rd ed., 2023). OCR werkt op getypte, gedrukte en, minder betrouwbaar, handgeschreven tekst.
Wat OCR oplost in een gescand document
- Ctrl/Cmd+F zoeken en volledige tekstindexering beginnen te werken.
- Tekst kan worden geselecteerd, gekopieerd en in andere documenten geplakt.
- Schermlezers krijgen woorden om uit te spreken, wat voldoet aan de basisoplossing van W3C PDF7.
- Rechtbanksystemen die doorzoekbare indieningen vereisen, kunnen het bestand accepteren.
Wat OCR niet oplost
- Beeldkwaliteit. De pagina blijft een plaatje, dus inzoomen blijft pixels tonen. JMU merkt op dat voor mensen die inzoomen, "de uitvoer gepixeld en vervormd raakt, omdat de eText onder de afbeelding van de tekst zit."
- Nauwkeurigheid. Vervaging, scheefstand, lage resolutie en spikkelruis veroorzaken verkeerde herkenningen zoals "rn" in plaats van "m" of "1" in plaats van "l". De verborgen tekst kan fout zijn terwijl de afbeelding er goed uitziet.
- Structuur. Koppen, leesvolgorde, tabelcellen en alt-tekst voor afbeeldingen hebben nog altijd handmatige tagging nodig voor volledige toegankelijkheid.
- Bestandsgrootte. De pagina-afbeeldingen blijven bestaan, dus een gescande PDF met OCR is bijna even groot als de versie met alleen afbeeldingen.
Wanneer Vragen Organisaties Om Een Gescande Kopie?
Organisaties vragen om een gescande kopie wanneer het origineel op papier bestaat en ze een digitaal document nodig hebben: immigratiebewijs, rechtbankstukken, hr-onboardingdossiers, ondertekende contracten en bonnetjes. Elke organisatie stelt zijn eigen regels op voor formaat, resolutie en bestandsgrootte, en sommige rechtbanken vereisen doorzoekbare PDF's in plaats van PDF's met alleen afbeeldingen.
Immigratiebewijs (USCIS)
U.S. Citizenship and Immigration Services accepteert gescand of gefotografeerd bewijsmateriaal voor online indiening. De instructie is kort: "Gebruik een scanner of maak foto's van elk document," en "Zorg dat elke bijgevoegde afbeelding duidelijk is en dat alle tekst leesbaar is" (USCIS, Tips for Filing Forms Online). Elk bestand mag maximaal 12 MB zijn, als PDF, JPG of JPEG, met TIF of TIFF geaccepteerd voor sommige formulieren.
Federale rechtbankindieningen (CM/ECF)
Federale systemen voor elektronisch indienen accepteren alleen PDF, en veel rechtbanken geven de voorkeur aan digitaal geboren bestanden. Het Southern District of Florida stelt dat "processtukken en hoofddocumenten die elektronisch bij CM/ECF worden ingediend, in een doorzoekbaar PDF-formaat moeten zijn" (S.D. Fla. CM/ECF FAQ). Gescande PDF's zijn vooral bedoeld voor bewijsstukken en ondertekend papier zonder digitaal origineel.
Scaninstellingen en groottelimieten verschillen per rechtbank. Het Western District of Washington vereist scannen op 300 dpi, zwart-wit tenzij kleur essentieel is, en stelt een limiet van 100 MB per document (W.D. Wash. technical FAQ). Het District of Minnesota beperkt elk bewijsstuk tot 35 MB in zijn strafrechtelijke ECF-procedures.
Hr, verhuurders, scholen en banken
Werkgevers en verhuurders willen meestal een gescande kopie van een identiteitsbewijs, een diploma, een ondertekende aanbiedingsbrief of een huurpagina. Ze publiceren zelden technische regels; de meesten noemen een limiet voor e-mailbijlagen en vragen dat elk woord leesbaar is. Vermeldt een portaal geen limieten, dan is een grijstinten-PDF van 300 dpi onder de 10 MB een verstandige inschatting, geen vastgestelde regel.
| Aanvrager | Formaat | Grootte- of resolutieregel | Doorzoekbare tekst vereist? |
|---|---|---|---|
| USCIS online indienen | PDF, JPG, JPEG (TIF/TIFF voor sommige formulieren) | 12 MB per bestand | Nee; tekst moet leesbaar zijn |
| Rechtbank W.D. Wash. | 300 dpi, zwart-wit; 100 MB per document | Hangt af van documenttype | |
| Rechtbank S.D. Fla. | Rechtbanklimieten gelden | Ja voor hoofddocumenten | |
| D. Minn. strafrechtelijke ECF | 35 MB per bewijsstuk | Controleer lokale regels | |
| Werkgever of verhuurder | PDF of afbeelding | Meestal een e-maillimiet | Zelden |
Kan Een Gescande PDF Worden Gearchiveerd Als PDF/A?
Een gescande PDF kan worden opgeslagen als PDF/A, de ISO 19005-archiefversie van PDF, omdat PDF/A pagina-afbeeldingen toestaat. PDF/A voegt regels toe voor langdurig lezen, zoals ingesloten lettertypen en geen versleuteling, maar maakt een pagina met alleen afbeeldingen niet doorzoekbaar. OCR is een aparte stap.
PDF/A werd voor het eerst uitgebracht op 1 oktober 2005, en verbiedt functies die bestanden na tientallen jaren moeilijk te openen maken, zoals lettertypekoppeling en versleuteling (Wikipedia, PDF/A). Microsoft Office kan rechtstreeks ISO 19005-1-conforme bestanden exporteren via zijn opties Opslaan als PDF.
Rechtbanken die PDF/A vereisen, sturen indieners vaak weg van scannen. Het Eastern District of Oklahoma adviseert dat, om bestandsgroottes laag te houden en doorzoekbare bestanden te garanderen, PDF/A-documenten in een tekstverwerker moeten worden gemaakt in plaats van afgedrukt en gescand (E.D. Okla. PDF/A FAQ).
- Digitaal geboren PDF/A
- Kleinst en volledig doorzoekbaar; het beste als er een digitaal origineel bestaat.
- Gescande PDF/A met OCR
- Archiefwaardig en doorzoekbaar; de juiste keuze voor documenten die alleen op papier bestaan.
- PDF/A met alleen afbeeldingen
- Geldig voor bewaring, maar niet doorzoekbaar of toegankelijk.
Hoe Krijgt Een Digitale PDF Een Gescande-PDF-look?
Een digitale PDF krijgt een gescande-PDF-look wanneer elke pagina wordt gerasterd tot een afbeelding en de onvolkomenheden van een echte scanner krijgt: lichte rotatie, vervaging, ruis, een grijze of papiertint. Het resultaat is een PDF met alleen afbeeldingen die zich gedraagt als een scan, zonder dat je iets afdrukt of een scanner bezit.
Dat is precies wat onze gratis scaneffect-tool doet. Hij rendert elke PDF-pagina in je browser, past de effecten toe die je kiest en slaat elke pagina op als JPEG-afbeelding in een nieuwe PDF. Bestanden worden lokaal verwerkt en niet naar een server geüpload.
- Rotatie
- −10° tot 10°, standaard 1°, plus willekeurige variatie per pagina tot 10°.
- Vervaging
- 0 tot 1, standaard 0,3, verzacht vectorranden zoals scanneroptiek dat doet.
- Ruis
- 0 tot 1, standaard 0,1, voegt spikkels toe zoals sensorruis.
- Helderheid en contrast
- 0 tot 2 elk, standaard 1.
- Vergeling
- 0 tot 2, standaard 0, tint de pagina als oud papier.
- Kleurruimte
- Grijs (standaard) of Kleur.
- Resolutie
- 1× tot 3×; PDF-pagina's renderen op 72 dpi maal de schaal, dus 2× is ongeveer 144 dpi en 3× ongeveer 216 dpi.
Omdat de uitvoer alleen afbeeldingen bevat, erft hij elke hierboven beschreven eigenschap: geen selecteerbare tekst, geen zoekfunctie, grotere bestanden, geen output voor schermlezers. Dat is precies de bedoeling voor iemand die een document als gescande kopie wil laten ogen, en een nadeel voor wie het doorzoekbaar nodig heeft. Bewaar het originele digitale bestand.
Lees voor de volledige werkwijze, inclusief de afweging tussen resolutie en bestandsgrootte, hoe je een PDF omzet naar een gescande PDF. Voor alle zes methoden, van afdrukken-en-scannen tot ingebouwde opties van het besturingssysteem, zie hoe je een PDF er gescand uit laat zien. Begin je bij een telefoonfoto in plaats van een PDF? De gids over een afbeelding omzetten naar een gescande PDF behandelt JPG en PNG.
We hebben onze tool gebouwd om een scanlook toe te voegen, en de vraag die we het vaakst krijgen is eigenlijk "wat heb ik nu precies gemaakt?" Het eerlijke antwoord is een PDF met alleen afbeeldingen. Hij ziet eruit als papier, maar de woorden zijn pixels. Moet een lezer hem doorzoeken of laten voorlezen, bewaar dan het digitale origineel ernaast, of voer achteraf OCR uit. We willen liever dat mensen dat weten voordat ze op Downloaden klikken.Het team van Make PDF look scanned — bouwers van de webtool en de Chrome-extensie
Woordenlijst Gescand Document: Welke Termen Doen Ertoe?
Een gescand document komt met zijn eigen vocabulaire: dpi en ppi, kleurendiepte, bitonaal, OCR, rasteren, PDF/A en JBIG2. Deze zeven termen kennen is genoeg om elke scaneis van een rechtbank, instantie of werkgever te begrijpen en een gescande PDF die je ontvangt te beoordelen.
- dpi / ppi
- Punten of pixels per inch: hoeveel beeldsamples één inch papier bedekken. NARA vereist minstens 300 ppi voor moderne tekstdocumenten en 400 ppi voor foto's en documenten met fijne details. PDF-paginageometrie gebruikt 72 punten per inch, en daarom komt een render op 1× overeen met 72 dpi.
- Kleurendiepte
- Bits opgeslagen per pixel. Bitonaal is 1 bit, grijstinten is 8 bits (256 tinten), en een typische kleurenscan is 24 bits (8 bits in elk van drie kanalen).
- Bitonaal
- De definitie van FADGI: "Digitale afbeeldingen die met slechts twee kleuren zijn geproduceerd, zwart en wit." Het kleinste leesbare formaat voor gewone tekst.
- OCR
- Optische tekenherkenning: software die de lettervormen in een afbeelding omzet in machinetekst, waardoor een doorzoekbare PDF ontstaat.
- Rasteren
- Vectortekst en -vormen omzetten in een raster van pixels. Het rasteren van een digitale PDF maakt er een PDF met alleen afbeeldingen van.
- PDF/A
- ISO 19005, de archiefsubset van PDF, uitgebracht in 2005; verbiedt functies zoals versleuteling en lettertypekoppeling.
- JBIG2
- Een compressiemethode voor bitonale scans die herhaalde symbolen één keer opslaat. BBC News meldde in 2013 dat sommige kantoorkopieerapparaten met een lossy JBIG2-modus cijfers in scans wijzigden, waarbij een 6 vaak een 8 werd; in één test werd een kamerafmeting van 21,11 m 14,13 m.
- PDF met alleen afbeeldingen
- Een gescande PDF zonder enige tekstlaag.
- Doorzoekbare PDF
- Een PDF met echte of OCR-tekst die kan worden doorzocht en geselecteerd.
De JBIG2-zaak is het sterkste argument om originelen te bewaren. Een gescande kopie is een plaatje, en plaatjes kunnen door compressie worden gewijzigd zonder dat iemand het merkt (BBC News, 2013). NARA behandelt ruis ook als een ongewenst artefact dat "geen deel uitmaakt van het bronmateriaal" (36 CFR 1236 Subpart E).
Veelgestelde Vragen Over Gescande PDF's
Deze vragen over gescande PDF's komen het vaakst van mensen die een bestand hebben ontvangen, een gescande kopie moeten opsturen, of aan een regel van een rechtbank of instantie moeten voldoen. Elk antwoord staat op zichzelf, zodat je meteen naar het antwoord kunt springen dat bij jouw situatie past en ernaar kunt handelen.
Wat is een gescande PDF in simpele woorden?
Een gescande PDF is een PDF gemaakt van foto's van papieren pagina's. De tekst die je ziet, maakt deel uit van een afbeelding, dus je kunt hem niet selecteren of doorzoeken tenzij er OCR is toegepast.
Is een gescande PDF hetzelfde als een gescande kopie?
Bijna. Een gescande kopie is elke digitale afbeelding van een papieren document, en een gescande PDF is het meest gebruikte bestandsformaat om er een te leveren. Een gescande kopie kan ook een JPEG of TIFF zijn.
Hoe zie ik in 10 seconden of een PDF gescand is?
Probeer een woord te selecteren, druk dan op Ctrl+F of Cmd+F en zoek naar een woord dat je ziet. Licht er niets op en vindt de zoekfunctie niets, dan is de PDF een scan met alleen afbeeldingen. Zoom naar 400% om het te bevestigen: gescande tekst oogt gepixeld.
Kan een gescande PDF doorzoekbaar zijn?
Ja. OCR voegt een onzichtbare tekstlaag toe achter de pagina-afbeeldingen, waardoor een gescande PDF een doorzoekbare PDF wordt. De pagina blijft eruitzien als een scan, en verkeerd gelezen woorden kunnen in de verborgen tekst voorkomen.
Waarom kan ik geen tekst uit mijn PDF kopiëren?
De PDF is waarschijnlijk een scan zonder OCR, dus er zijn geen tekens om te kopiëren. De FAQ van de rechtbank van het Southern District of Florida vermeldt hetzelfde: is een PDF niet doorzoekbaar, dan kan de tekst niet worden gekopieerd. Voer OCR uit of vraag om het digitale origineel.
Zijn gescande PDF's toegankelijk voor schermlezers?
Niet zonder OCR. W3C-richtlijnen noemen scans met alleen afbeeldingen inherent ontoegankelijk. Na OCR kunnen schermlezers de tekst uitspreken, maar volledige toegankelijkheid vereist ook tags voor koppen, leesvolgorde en tabellen.
Waarom is een gescande PDF zo groot?
Elke pagina is een volledige afbeelding. Een grijstintenpagina op 400 ppi kan groter zijn dan 1 MB, terwijl een tekstpagina uit een tekstverwerker vaak onder de 50 KB blijft. Scannen op 300 ppi in grijstinten of zwart-wit houdt de grootte laag.
Welke resolutie moet een gescand document hebben?
Voor getypte of gedrukte tekst is 300 dpi de standaardvereiste bij Amerikaanse federale rechtbanken en het NARA-minimum voor tekstdocumenten. Foto's en fijne details vragen om 400 ppi.
Is een gescande kopie een wettelijke of gewaarmerkte kopie?
Nee, een gescande kopie bewijst op zichzelf niets over echtheid. Een gewaarmerkte kopie is ondertekend en gedateerd door een professional die het origineel heeft gezien, zoals GOV.UK uitlegt. Vraag de aanvrager welk type ze nodig hebben.
Kan ik een digitale PDF laten lijken op een gescande PDF?
Ja. De gratis Make PDF look scanned-tool rastert elke pagina en voegt rotatie, vervaging, ruis en papiertint toe in je browser. De uitvoer is een PDF met alleen afbeeldingen, dus bewaar het origineel als je een zoekfunctie nodig hebt.
Moet een gescande PDF wel PDF/A zijn?
Alleen als de aanvrager dat zegt. Sommige rechtbanken en archieven vereisen PDF/A voor langdurige opslag. Een gescande PDF kan als PDF/A worden opgeslagen, idealiter met OCR zodat hij ook doorzoekbaar is.
Kan ik meerdere PDF's tegelijk scannen?
Met onze tool wel: Bulkscan verwerkt meerdere bestanden en downloadt ze als één ZIP, met één gescande PDF per invoerbestand.
Wat Is Het Korte Antwoord Over Gescande PDF's?
Een gescande PDF is een plaatje van papier verpakt in een PDF. Test hem door tekst te selecteren en te doorzoeken, voeg OCR toe als je zoekfunctie of toegankelijkheid nodig hebt, stuur een digitaal geboren PDF als een rechtbank die verkiest, en gebruik een scanlook alleen als de lezer om uiterlijk vraagt, niet om echtheid.
Is uiterlijk wat je nodig hebt, open dan de gratis scantool, houd de standaard Grijs-kleurruimte en resolutie 2× aan, en bekijk het voorbeeld voordat je downloadt.
Een PDF nodig die eruitziet als een gescande kopie?
Sleep een digitale PDF in de gratis tool, stel kanteling, ruis en papiertint in en download een PDF op basis van afbeeldingen die leest als een echte scan. Alles draait in je browser.