Was ist ein gescanntes PDF? So erkennen Sie es in 10 Sekunden
Ein gescanntes PDF ist ein PDF, dessen Seiten Fotos von Papier sind, aufgenommen von einem Scanner oder einer Handykamera, statt Text und Vektorformen, die am Computer getippt wurden. Solange keine OCR eine unsichtbare Textebene hinzugefügt hat, können Sie die Wörter nicht auswählen, durchsuchen oder kopieren, und ein Screenreader liest auf der Seite nichts vor.
Sie haben ein PDF erhalten und müssen wissen, was es wirklich ist: eine aus einer Textverarbeitung exportierte Datei, ein Scan von Papier, oder ein Scan mit erkanntem Text. Die Antwort entscheidet, ob Sie es durchsuchen können, ob ein Gericht oder eine Behörde es akzeptiert, und ob es OCR braucht.
Dieser Ratgeber liefert eine präzise Definition, einen 10-Sekunden-Test, einen Vergleich der drei PDF-Arten und ein Glossar. Die Fakten stammen aus W3C-Barrierefreiheitsrichtlinien, US-Bundesgerichten, USCIS, NARA und den FADGI-Digitalisierungsregeln, GOV.UK und Barrierefreiheits-Teams von Universitäten, dazu unserem eigenen Wissen aus dem Bau eines Scan-Effekt-Tools.
Was ist ein gescanntes PDF genau?
Ein gescanntes PDF ist ein PDF-Container, der pro Seite ein Rasterbild enthält, entstanden durch das Fotografieren oder Scannen eines physischen Blatts. Die Buchstaben, die Sie sehen, sind Pixel, keine Zeichen. Software behandelt jede Seite wie ein Foto, sodass reine Textsuche, Kopieren und Neuformatieren ohne OCR nicht funktionieren.
Das US-Bezirksgericht für den Nördlichen Bezirk von Kalifornien bringt es unter Berufung auf Hinweise der National Archives in einer Zeile auf den Punkt: „Gescannter Text ist die Fotografie einer gedruckten Seite, aufgenommen entweder mit einer Digitalkamera oder einem Scanner“ (N.D. Cal., Preparing Your CM/ECF Filing). Das PDF-Format selbst ändert sich dabei nicht: Ein gescanntes PDF ist weiterhin eine gültige ISO-32000-Datei. Was sich ändert, ist das, was auf jeder Seite steckt.
Das Barrierefreiheits-Team der James Madison University beschreibt das Ergebnis aus Sicht einer Leserin oder eines Lesers: „PDFs gescannter Dokumente sind oft nur Bilder von Dokumenten, ähnlich digitalen Fotografien, und enthalten in der Regel keinen lesbaren Text“ (JMU Digital Accessibility). Diese eine Tatsache erklärt fast jeden praktischen Unterschied, der im Folgenden behandelt wird.
Hier ist die Definition in ihre prüfbaren Teile zerlegt, so wie es auch eine Aktenverwalterin oder ein Barrierefreiheits-Auditor tun würde.
- Seiteninhalt
- Ein Bitmap-Bild pro Seite (JPEG, JBIG2, CCITT oder ähnliche Kompression), keine Schriftglyphen und Vektorpfade.
- Textebene
- Keine bei einem reinen Bild-PDF; eine unsichtbare OCR-Ebene bei einem durchsuchbaren gescannten PDF.
- Quelle
- Ein Flachbett- oder Einzugsscanner, ein Multifunktionskopierer, oder eine Handykamera mit einer im Betriebssystem eingebauten Scan-App.
- Typische Auflösung
- 200 bis 400 ppi; 300 ppi ist die häufigste Anforderung für Bürotext.
- Farbmodus
- Bitonal (1 Bit Schwarz-Weiß), Graustufen (8 Bit) oder Farbe (24 Bit).
- Zoom-Verhalten
- Kanten werden bei starker Vergrößerung zu sichtbaren Pixelblöcken.
- Dateigröße
- Meist größer pro Seite als ein Text-PDF, besonders in Graustufen oder Farbe.
Wie unterscheidet sich ein gescanntes PDF von einem digitalen PDF?
Ein gescanntes PDF speichert Bilder von Seiten, während ein digitales (digital erstelltes) PDF echte Zeichen, Schriftarten und Vektorgrafiken speichert, exportiert aus Software. Eine dritte Art, das gescannte PDF mit OCR, behält das Seitenbild, fügt aber darunter unsichtbaren, maschinenlesbaren Text hinzu, wodurch es zu einem durchsuchbaren PDF wird.
Der Bezirk Massachusetts zieht in seinen Regeln zur elektronischen Einreichung dieselbe Grenze: Ein gescanntes PDF stammt von Papier, das durch einen optischen Scanner gelaufen ist, während ein „elektronisch umgewandeltes“ PDF aus einer Textverarbeitung erstellt und textdurchsuchbar ist (D. Mass. CM/ECF Administrative Procedures). Die Tabelle stellt die drei Arten nebeneinander.
| Eigenschaft | Digital erstelltes PDF | Reines Bild-PDF (gescannt) | Gescanntes PDF + OCR (durchsuchbar) |
|---|---|---|---|
| Wie es entsteht | Export oder Druck nach PDF aus Word, Google Docs, einem Browser oder einer beliebigen App | Scanner, Kopierer oder Handykamera | Erst scannen, dann fügt OCR-Software Text hinzu |
| Was eine Seite enthält | Zeichen, eingebettete Schriftarten, Vektorlinien, Bilder | Ein Rasterbild | Ein Rasterbild plus unsichtbaren Text |
| Text auswählen und kopieren | Ja, exakt | Nein | Ja, aber nur so genau wie die OCR |
| Strg/Cmd+F-Suche | Funktioniert | Findet nichts | Funktioniert, kann falsch erkannte Wörter übersehen |
| Screenreader | Lesbar, am besten mit Tags | Stumm | Lesbar, oft ohne Struktur |
| Zoom auf 400 % | Scharfe Kanten in jeder Größe | Pixelig | Pixelig |
| Typische Größe pro Seite | Wenige zehn KB | Etwa 75 KB (bitonal) bis über 1 MB (Graustufen oder Farbe) | Wie nur-Bild plus kleine Textebene |
| Wirkt wie Papier | Nein | Ja | Ja |
Die Seitengrößen in der Tabelle stammen aus Gerichtstests, nicht aus Schätzungen. Der Nördliche Bezirk von Kalifornien scannte ein 317-seitiges Dokument: bitonal bei 300 ppi kam auf 23,86 MB, etwa 75 KB pro Seite, und Graustufen bei 400 ppi erreichte 374,47 MB, etwa 1,2 MB pro Seite. Der Mittlere Bezirk von North Carolina merkt an, dass 2 MB etwa fünfundvierzig Seiten PDF-Text fassen, unter 50 KB pro Seite.
Was bedeutet eingescannte Kopie im Vergleich zur Fotokopie?
Eine eingescannte Kopie ist eine digitale Bilddatei eines Papieroriginals, meist als gescanntes PDF oder JPEG geliefert. Eine Fotokopie ist ein zweites Blatt Papier, gedruckt von einem Kopierer. Eine beglaubigte Kopie ist jede Kopie, die eine autorisierte Person mit dem Original verglichen und unterschrieben hat.
Menschen verwenden „eingescannte Kopie“ locker, und die drei Begriffe geraten in Formularen, HR-E-Mails und Visa-Checklisten durcheinander. Die Unterschiede sind wichtig, denn eine Anfrage nach dem einen wird durch die anderen nicht erfüllt.
| Begriff | Medium | Wer erstellt sie | Was sie beweist |
|---|---|---|---|
| Eingescannte Kopie | Digitale Datei (PDF, JPEG, TIFF) | Jeder mit Scanner oder Handy | Dass ein Bild des Dokuments existiert; nichts über Echtheit |
| Fotokopie | Papier | Jeder mit einem Kopierer | Dasselbe: eine Reproduktion, nicht das Original |
| Beglaubigte (echte) Kopie | Papier, manchmal später gescannt | Eine Fachperson, die das Original gesehen hat | Dass die Kopie dem Original entspricht, nach dem Wort dieser Person |
| Original | Papier oder digital erstellte Datei | Der Aussteller | Das Dokument selbst |
Die britische Regierung erklärt die Beglaubigung schlicht: „Sie können ein Dokument als beglaubigte Kopie bestätigen lassen, indem Sie es von einer Fachperson, etwa einem Rechtsanwalt, unterschreiben und datieren lassen“ (GOV.UK, Certifying a document). Eine eingescannte Kopie dieser beglaubigten Seite ist immer noch eine eingescannte Kopie; die Beglaubigung steckt im Papier, mit Unterschrift und Datum.
Wenn also ein Vermieter, Arbeitgeber oder eine Schule „eine eingescannte Kopie senden“ verlangt, meinen sie fast immer „ein klares digitales Bild des Papiers, als PDF“. Wenn sie „beglaubigte Kopie“ sagen, reicht ein Scan allein nicht aus, egal wie echt er aussieht.
Wie erkennen Sie, ob ein PDF gescannt ist?
Um zu erkennen, ob ein PDF gescannt ist, versuchen Sie, ein Wort auf der Seite auszuwählen, und suchen Sie nach einem Wort, das Sie sehen können. Markiert sich nichts, ist das PDF reines Bild. Zoomen, Dokumenteigenschaften, die Schriftliste und die Dateigröße bestätigen dann, ob die Datei gescannt, digital oder gescannt mit OCR ist.
Die ersten beiden Prüfungen dauern unter 10 Sekunden und funktionieren in jedem PDF-Betrachter, einschließlich dem eingebauten in Google Chrome, Microsoft Edge und macOS Vorschau. Der Rest dauert eine Minute und klärt die unklaren Fälle.
- Text auswählen versuchen. Ziehen Sie den Cursor über eine Zeile. In einem digital erstellten oder OCR-behandelten PDF markieren sich einzelne Wörter. In einem reinen Bild-PDF markiert sich nichts, oder manche Betrachter zeichnen ein Rechteck um das gesamte Seitenbild.
- Mit Strg+F oder Cmd+F suchen. Tippen Sie ein markantes Wort, das Sie klar auf Seite eins sehen. Null Treffer bei einem Wort, das offensichtlich da ist, bedeutet, es gibt keine Textebene. Ein Treffer bedeutet echten Text oder eine OCR-Ebene.
- Auf 400 % zoomen. Betrachten Sie die Kante eines Buchstabens. Vektortext bleibt bei jeder Vergrößerung messerscharf. Eine gescannte Seite zeigt Pixelstufen, weiche graue Ränder, Körnung und manchmal JPEG-Blockmuster rund um die Buchstaben.
- Dokumenteigenschaften öffnen. Nutzen Sie im PDF-Betrachter von Chrome das Drei-Punkte-Menü und wählen Sie Dokumenteigenschaften; in macOS Vorschau nutzen Sie Werkzeuge, dann Inspektor einblenden. Das Feld PDF-Erzeuger oder Anwendung nennt oft einen Scanner, ein Kopierer-Modell, eine Handy-Scan-Funktion oder eine OCR-Engine. Eine Textverarbeitung oder „Print to PDF“ deutet auf eine digital erstellte Datei hin.
- Schriftliste prüfen. PDF-Software für den Desktop zeigt in den Dokumenteigenschaften einen Reiter Schriftarten. Ein digital erstelltes PDF listet die verwendeten Schriftarten auf. Ein reiner Bild-Scan listet keine. Ein OCR-behandelter Scan listet oft eine einzelne Schriftart, die nur für die unsichtbare Ebene genutzt wird.
- Größe pro Seite vergleichen. Teilen Sie die Dateigröße durch die Seitenzahl. Ein Text-PDF bleibt meist unter 50 KB pro Seite. Ein Graustufen- oder Farbscan liegt oft bei mehreren hundert KB bis über 1 MB pro Seite. Bitonale Scans sind kompakt, daher ist die Größe der schwächste Hinweis.
Das Barrierefreiheits-Lehrbuch der Cleveland State University empfiehlt denselben schnellen Such-Test: „Wird das Wort auf der Seite markiert, hat sie durchsuchbaren Text und ist kein gescanntes Bild von Text“ (Heather Caprette, Cleveland State University).
Metadaten sind ein Hinweis, kein Beweis. Die Felder PDF-Erzeuger und Anwendung lassen sich mit vielen Tools bearbeiten, auch mit unserem, vertrauen Sie also eher dem, was der Seiteninhalt beim Markieren und Zoomen tut, als dem, was das Eigenschaften-Fenster angibt.
Warum sind gescannte Dokumente schwer zu durchsuchen und zu lesen?
Gescannte Dokumente sind schwer zu durchsuchen und zu lesen, weil ein reines Bild-PDF keine Zeichen enthält, die Software indexieren könnte. Suchmaschinen, Desktop-Suche, Kopieren und Einfügen, Übersetzungstools und Screenreader brauchen alle Text. Ohne OCR-Ebene ist das gescannte PDF ein Bild, das nur sehende Leserinnen und Leser nutzen können.
Die W3C Web Accessibility Initiative sagt es in Technik PDF7 der WCAG-Richtlinie unverblümt: „Ein Dokument aus gescannten Bildern von Text ist von Natur aus nicht barrierefrei, weil sein Inhalt aus Bildern besteht, nicht aus durchsuchbarem Text“ (W3C WAI, WCAG Technique PDF7).
Dieselbe W3C-Seite listet auf, was verloren geht: „Assistive Technologien können die Wörter nicht lesen oder extrahieren; Nutzer können Text nicht auswählen, bearbeiten, in der Größe ändern oder neu fließen lassen, noch Text- und Hintergrundfarben ändern; und Autoren können das PDF nicht für Barrierefreiheit anpassen.“ Die Abhilfe ist OCR, damit echter Text hinter dem Bild existiert.
Das Barrierefreiheits-Büro der Georgetown University fügt die praktische Konsequenz für alle hinzu, die auf assistive Technologie angewiesen sind: „Gescannte PDFs sind eine Sammlung von Bildern und daher für die meisten Standard-Screenreader unlesbar“ (Accessibility at Georgetown).
Öffentliche Herausgeber gehen noch weiter. Der britische Government Digital Service argumentiert, dass in PDF veröffentlichte Informationen im Vergleich zu HTML schwerer zu finden, zu nutzen und zu pflegen sind (GDS-Blog, GOV.UK). Ein reines Bild-PDF ist die extreme Version dieses Problems: nicht einmal die Wörter sind maschinenlesbar.
| Aufgabe | Digital erstellt | Reiner Bild-Scan | Scan + OCR |
|---|---|---|---|
| Screenreader-Ausgabe | Vollständiger Text | Keine | Text, oft in falscher Reihenfolge |
| Neu fließen auf dem Handy | Möglich, wenn getaggt | Nein | Selten |
| Ein Zitat kopieren | Exakt | Von Hand abtippen | Kann OCR-Fehler enthalten |
| Von Desktop-Suche gefunden | Ja | Nur Dateiname | Ja |
| Maschinelle Übersetzung | Ja | Braucht zuerst OCR | Ja |
Was macht OCR mit einem gescannten PDF?
OCR, die optische Zeichenerkennung, liest die Buchstabenformen in einem gescannten PDF und schreibt passenden Maschinentext in eine unsichtbare Ebene hinter jedem Seitenbild. Die Seite sieht genau gleich aus, wird aber zu einem durchsuchbaren PDF: Wörter lassen sich finden, auswählen, kopieren und vorlesen.
Die Federal Agencies Digital Guidelines Initiative definiert es präzise: „Optische Zeichenerkennung (OCR) ist der Prozess, ein Rasterbild von Text in durchsuchbaren elektronischen Text umzuwandeln“ (FADGI Technical Guidelines, 3. Ausgabe, 2023). OCR funktioniert bei getipptem, gedrucktem und, weniger zuverlässig, handgeschriebenem Text.
Was OCR an einem gescannten Dokument behebt
- Strg/Cmd+F-Suche und Volltextindexierung beginnen zu funktionieren.
- Text lässt sich auswählen, kopieren und in andere Dokumente einfügen.
- Screenreader bekommen Wörter zum Vorlesen, was die grundlegende W3C-PDF7-Abhilfe erfüllt.
- Gerichtssysteme, die textdurchsuchbare Einreichungen verlangen, können die Datei akzeptieren.
Was OCR nicht behebt
- Bildqualität. Die Seite bleibt ein Bild, daher pixelt sie beim Zoomen weiterhin. JMU merkt an, dass für Menschen, die hineinzoomen, „die Ausgabe pixelig und verzerrt wird, weil der eText unter dem Bild des Textes liegt“.
- Genauigkeit. Unschärfe, Schräglage, niedrige Auflösung und Rausch-Körnung verursachen Fehllesungen wie „rn“ statt „m“ oder „1“ statt „l“. Der versteckte Text kann falsch sein, während das Bild richtig aussieht.
- Struktur. Überschriften, Lesereihenfolge, Tabellenzellen und Alt-Text für Bilder brauchen für volle Barrierefreiheit weiterhin manuelles Taggen.
- Dateigröße. Die Seitenbilder bleiben, daher ist ein gescanntes PDF mit OCR fast so groß wie die reine Bildversion.
Wann verlangen Organisationen eine eingescannte Kopie?
Organisationen verlangen eine eingescannte Kopie, wenn das Original auf Papier existiert und sie einen digitalen Nachweis brauchen: Einwanderungsbelege, Gerichtsbeweismittel, HR-Onboarding-Akten, unterschriebene Verträge und Quittungen. Jede setzt eigene Regeln für Format, Auflösung und Dateigröße, und manche Gerichte verlangen durchsuchbare PDFs statt reiner Bilder.
Einwanderungsbelege (USCIS)
Die US-Einwanderungsbehörde USCIS akzeptiert gescannte oder fotografierte Belege für Online-Einreichungen. Ihre Anweisung ist kurz: „Nutzen Sie einen Scanner oder fotografieren Sie jedes Dokument“, und „stellen Sie sicher, dass jedes angehängte Bild klar ist und aller Text lesbar ist“ (USCIS, Tips for Filing Forms Online). Jede Datei darf bis zu 12 MB groß sein, als PDF, JPG oder JPEG, mit TIF oder TIFF für manche Formulare akzeptiert.
Bundesgerichts-Einreichungen (CM/ECF)
Föderale Systeme zur elektronischen Einreichung akzeptieren nur PDF, und viele Gerichte bevorzugen digital erstellte Dateien. Der Südliche Bezirk von Florida erklärt, dass „Schriftsätze bzw. Hauptdokumente, die elektronisch bei CM/ECF eingereicht werden, müssen im textdurchsuchbaren PDF-Format vorliegen“ (S.D. Fla. CM/ECF FAQ). Gescannte PDFs sind vor allem für Beweisstücke und unterschriebenes Papier ohne digitales Original gedacht.
Scan-Einstellungen und Größenlimits unterscheiden sich je nach Gericht. Der Westliche Bezirk von Washington verlangt 300 dpi Scan-Auflösung, Schwarz-Weiß außer Farbe ist wesentlich, und begrenzt jedes Dokument auf 100 MB (W.D. Wash. technisches FAQ). Der Bezirk Minnesota begrenzt in seinen Strafverfahrens-ECF-Regeln jedes Beweisstück auf 35 MB.
HR, Vermieter, Schulen und Banken
Arbeitgeber und Vermieter wollen meist eine eingescannte Kopie eines Ausweises, eines Diploms, eines unterschriebenen Angebotsschreibens oder einer Mietvertragsseite. Sie veröffentlichen selten technische Regeln; die meisten nennen nur ein E-Mail-Anhangslimit und verlangen, dass jedes Wort lesbar ist. Nennt ein Portal keine Grenzen, ist ein 300-dpi-Graustufen-PDF unter 10 MB eine sinnvolle Schätzung, keine festgelegte Regel.
| Anforderer | Format | Größen- oder Auflösungsregel | Durchsuchbarer Text nötig? |
|---|---|---|---|
| USCIS-Online-Einreichung | PDF, JPG, JPEG (TIF/TIFF für manche Formulare) | 12 MB pro Datei | Nein; Text muss lesbar sein |
| Gericht W.D. Wash. | 300 dpi, Schwarz-Weiß; 100 MB pro Dokument | Abhängig vom Dokumenttyp | |
| Gericht S.D. Fla. | Gerichtslimits gelten | Ja, für Hauptdokumente | |
| D. Minn. Straf-ECF | 35 MB pro Beweisstück | Örtliche Regeln prüfen | |
| Arbeitgeber oder Vermieter | PDF oder Bild | Meist ein E-Mail-Limit | Selten |
Kann ein gescanntes PDF als PDF/A archiviert werden?
Ein gescanntes PDF kann als PDF/A gespeichert werden, der ISO-19005-Archivversion von PDF, weil PDF/A Seitenbilder erlaubt. PDF/A fügt Regeln für langfristiges Lesen hinzu, etwa eingebettete Schriftarten und keine Verschlüsselung, macht aber eine reine Bildseite nicht durchsuchbar. OCR ist ein separater Schritt.
PDF/A wurde erstmals am 1. Oktober 2005 veröffentlicht und verbietet Funktionen, die Dateien Jahrzehnte später schwer zu öffnen machen, etwa Schriftverknüpfung und Verschlüsselung (Wikipedia, PDF/A). Microsoft Office kann direkt aus seinen „Als PDF speichern“-Optionen ISO-19005-1-konforme Dateien exportieren.
Gerichte, die PDF/A verlangen, lenken Einreicher oft ganz vom Scannen weg. Der Östliche Bezirk von Oklahoma rät, dass PDF/A-Dokumente in einer Textverarbeitung erstellt werden sollten statt ausgedruckt und gescannt zu werden, um die Dateigröße klein zu halten und textdurchsuchbare Dateien sicherzustellen (E.D. Okla. PDF/A FAQ).
- Digital erstelltes PDF/A
- Am kleinsten und vollständig durchsuchbar; am besten, wenn ein digitales Original existiert.
- Gescanntes PDF/A mit OCR
- Archivfähig und durchsuchbar; die richtige Wahl für Unterlagen, die nur auf Papier existieren.
- Reines Bild-PDF/A
- Gültig für die Archivierung, aber nicht durchsuchbar oder barrierefrei.
Wie bekommt ein digitales PDF einen gescannten PDF-Look?
Ein digitales PDF bekommt einen gescannten PDF-Look, wenn jede Seite in ein Bild gerastert und mit den Unregelmäßigkeiten eines echten Scanners versehen wird: leichte Drehung, Unschärfe, Rauschen, Grau- oder Papierton. Das Ergebnis ist ein reines Bild-PDF, das sich wie ein Scan verhält, ohne dass Sie etwas ausdrucken oder einen Scanner besitzen müssen.
Genau das macht unser kostenloses Scan-Effekt-Tool. Es rendert jede PDF-Seite in Ihrem Browser, wendet die von Ihnen gewählten Effekte an und speichert jede Seite als JPEG-Bild in einem neuen PDF. Dateien werden lokal verarbeitet und nicht an einen Server hochgeladen.
- Drehung
- −10° bis 10°, Standard 1°, plus zufällige Drehvarianz pro Seite bis zu 10°.
- Unschärfe
- 0 bis 1, Standard 0,3, weicht Vektorkanten so auf, wie es Scanner-Optik tut.
- Rauschen
- 0 bis 1, Standard 0,1, fügt sensorartige Körnung hinzu.
- Helligkeit und Kontrast
- Je 0 bis 2, Standard 1.
- Vergilbung
- 0 bis 2, Standard 0, tönt die Seite wie altes Papier.
- Farbraum
- Graustufen (Standard) oder Farbe.
- Auflösung
- 1× bis 3×; PDF-Seiten rendern mit 72 dpi mal dem Faktor, sodass 2× etwa 144 dpi und 3× etwa 216 dpi entspricht.
Weil die Ausgabe reines Bild ist, erbt sie jede oben beschriebene Eigenschaft: kein auswählbarer Text, keine Suche, größere Dateien, keine Screenreader-Ausgabe. Das ist genau der Punkt für jemanden, der ein Dokument braucht, das wie eine eingescannte Kopie aussieht, und ein Nachteil für alle, die es durchsuchbar brauchen. Behalten Sie die digitale Originaldatei.
Den vollständigen Ablauf mit Auflösungs- und Dateigrößen-Abwägungen finden Sie in wie Sie ein PDF in ein gescanntes PDF umwandeln. Alle sechs Methoden, vom Ausdrucken und Einscannen bis zu eingebauten Betriebssystem-Optionen, zeigt wie Sie ein PDF wie gescannt aussehen lassen. Starten Sie stattdessen von einem Handyfoto? Die Anleitung zum Umwandeln eines Bildes in ein gescanntes PDF behandelt JPG und PNG.
Wir haben unser Tool gebaut, um einen Scan-Look hinzuzufügen, und die häufigste Frage, die wir bekommen, lautet eigentlich: „Was habe ich gerade erzeugt?“ Die ehrliche Antwort ist ein reines Bild-PDF. Es sieht aus wie Papier, aber die Wörter sind Pixel. Wenn ein Leser es durchsuchen oder vorlesen lassen muss, behalten Sie das digitale Original daneben, oder führen Sie danach OCR aus. Wir möchten lieber, dass Menschen das wissen, bevor sie auf Herunterladen klicken.Das Team von Make PDF look scanned — Entwickler des Web-Tools und der Chrome-Erweiterung
Glossar für gescannte Dokumente: Welche Begriffe zählen?
Ein gescanntes Dokument bringt sein eigenes Vokabular mit: dpi und ppi, Farbtiefe, bitonal, OCR, rastern, PDF/A und JBIG2. Diese sieben Begriffe zu kennen, reicht aus, um jede Scan-Anforderung von einem Gericht, einer Behörde oder einem Arbeitgeber zu lesen und ein erhaltenes gescanntes PDF einzuschätzen.
- dpi / ppi
- Punkte oder Pixel pro Zoll: wie viele Bildproben einen Zoll Papier abdecken. NARA verlangt mindestens 300 ppi für moderne Textdokumente und 400 ppi für Fotografien und Aufnahmen mit feinen Details. Die PDF-Seitengeometrie nutzt 72 Punkte pro Zoll, weshalb ein 1×-Render 72 dpi entspricht.
- Farbtiefe
- Bits pro Pixel. Bitonal ist 1 Bit, Graustufen sind 8 Bit (256 Abstufungen), und ein typischer Farbscan hat 24 Bit (8 Bit in jedem der drei Kanäle).
- Bitonal
- FADGIs Definition: „Digitale Bilder, die nur mit zwei Farben erzeugt werden, Schwarz und Weiß.“ Das kleinste noch lesbare Format für reinen Text.
- OCR
- Optische Zeichenerkennung: Software, die die Buchstabenformen in einem Bild in Maschinentext umwandelt und so ein durchsuchbares PDF erzeugt.
- Rastern
- Vektortext und -formen in ein Pixelraster umwandeln. Ein digitales PDF zu rastern macht daraus ein reines Bild-PDF.
- PDF/A
- ISO 19005, die Archiv-Teilmenge von PDF, veröffentlicht 2005; sie verbietet Funktionen wie Verschlüsselung und Schriftverknüpfung.
- JBIG2
- Eine Kompressionsmethode für bitonale Scans, die wiederholte Symbole nur einmal speichert. BBC News berichtete 2013, dass manche Bürokopierer mit einem verlustbehafteten JBIG2-Modus Ziffern in Scans veränderten, oft eine 6 zu einer 8; in einem Test wurde aus einer Raumbreite von 21,11 m 14,13 m.
- Reines Bild-PDF
- Ein gescanntes PDF ganz ohne Textebene.
- Durchsuchbares PDF
- Ein PDF mit echtem oder OCR-Text, das durchsucht und ausgewählt werden kann.
Der JBIG2-Fall ist das stärkste Argument dafür, Originale zu behalten. Eine eingescannte Kopie ist ein Bild, und Bilder können durch Kompression verändert werden, ohne dass es jemand bemerkt (BBC News, 2013). NARA behandelt Rauschen ebenfalls als unerwünschtes Artefakt, „nicht Teil des Quellmaterials“ (36 CFR 1236 Subpart E).
Gescanntes PDF: Was fragen Menschen sonst noch?
Diese Fragen zu gescannten PDFs kommen am häufigsten von Menschen, die eine Datei erhalten haben, eine eingescannte Kopie senden müssen oder eine Gerichts- oder Behördenregel erfüllen müssen. Jede Antwort steht für sich, sodass Sie direkt zu der springen können, die zu Ihrer Situation passt, und danach handeln.
Was ist ein gescanntes PDF einfach erklärt?
Ein gescanntes PDF ist ein PDF aus Fotos von Papierseiten. Der Text, den Sie sehen, ist Teil eines Bildes, sodass Sie ihn nicht auswählen oder durchsuchen können, außer OCR wurde angewendet.
Ist ein gescanntes PDF dasselbe wie eine eingescannte Kopie?
Fast. Eine eingescannte Kopie ist jedes digitale Bild eines Papierdokuments, und ein gescanntes PDF ist das gängigste Dateiformat, um eine zu liefern. Eine eingescannte Kopie kann auch ein JPEG oder TIFF sein.
Wie erkenne ich in 10 Sekunden, ob ein PDF gescannt ist?
Versuchen Sie, ein Wort auszuwählen, drücken Sie dann Strg+F oder Cmd+F und suchen Sie nach einem Wort, das Sie sehen. Markiert sich nichts und findet die Suche nichts, ist das PDF ein reiner Bild-Scan. Zoomen Sie zur Bestätigung auf 400 %: gescannter Text wirkt pixelig.
Kann ein gescanntes PDF durchsuchbar sein?
Ja. OCR fügt hinter den Seitenbildern eine unsichtbare Textebene hinzu und macht so aus einem gescannten PDF ein durchsuchbares PDF. Die Seite sieht weiterhin wie ein Scan aus, und im versteckten Text können falsch erkannte Wörter auftauchen.
Warum kann ich aus meinem PDF keinen Text kopieren?
Das PDF ist höchstwahrscheinlich ein Scan ohne OCR, es gibt also keine Zeichen zum Kopieren. Das FAQ des Gerichts im Südlichen Bezirk von Florida stellt dasselbe fest: Ist ein PDF nicht textdurchsuchbar, kann sein Text nicht kopiert werden. Führen Sie OCR aus oder fragen Sie nach dem digitalen Original.
Sind gescannte PDFs für Screenreader zugänglich?
Nicht ohne OCR. Die W3C-Richtlinie nennt reine Bild-Scans von Natur aus nicht barrierefrei. Nach OCR können Screenreader den Text vorlesen, aber volle Barrierefreiheit braucht zusätzlich Tags für Überschriften, Lesereihenfolge und Tabellen.
Warum ist ein gescanntes PDF so groß?
Jede Seite ist ein vollständiges Bild. Eine Graustufenseite bei 400 ppi kann über 1 MB liegen, während eine Textseite aus einer Textverarbeitung oft unter 50 KB liegt. Scannen bei 300 ppi in Graustufen oder Schwarz-Weiß hält die Größe niedrig.
Welche Auflösung sollte ein gescanntes Dokument haben?
Für getippten oder gedruckten Text sind 300 dpi die Standardanforderung bei US-Bundesgerichten und das NARA-Minimum für Textdokumente. Fotos und feine Details verlangen 400 ppi.
Ist eine eingescannte Kopie eine rechtsgültige oder beglaubigte Kopie?
Nein, eine eingescannte Kopie allein beweist nichts über Echtheit. Eine beglaubigte Kopie wird von einer Fachperson unterschrieben und datiert, die das Original gesehen hat, wie GOV.UK erklärt. Fragen Sie den Anforderer, welche Art er braucht.
Kann ich ein digitales PDF wie ein gescanntes PDF aussehen lassen?
Ja. Das kostenlose Make PDF look scanned-Tool rastert jede Seite und fügt in Ihrem Browser Drehung, Unschärfe, Rauschen und Papierton hinzu. Die Ausgabe ist ein reines Bild-PDF, behalten Sie also das Original, wenn Sie Suche brauchen.
Muss ein gescanntes PDF ein PDF/A sein?
Nur, wenn der Anforderer es verlangt. Manche Gerichte und Archive verlangen PDF/A für die Langzeitspeicherung. Ein gescanntes PDF kann als PDF/A gespeichert werden, im Idealfall mit OCR, damit es auch durchsuchbar ist.
Kann ich mehrere PDFs auf einmal scannen?
Mit unserem Tool ja: Stapelscan verarbeitet mehrere Dateien und lädt sie als ein ZIP herunter, mit einem gescannten PDF pro Eingabedatei.
Was ist die kurze Antwort zu gescannten PDFs?
Ein gescanntes PDF ist ein Bild von Papier, verpackt in ein PDF. Testen Sie es, indem Sie Text auswählen und suchen, fügen Sie OCR hinzu, wenn Sie Suche oder Barrierefreiheit brauchen, senden Sie ein digital erstelltes PDF, wenn ein Gericht es bevorzugt, und nutzen Sie einen Scan-Look nur, wenn es dem Leser um das Aussehen geht, nicht um die Echtheit.
Wenn es Ihnen um das Aussehen geht, öffnen Sie das kostenlose Scan-Tool, behalten Sie den Standard-Farbraum Graustufen und die Auflösung 2×, und prüfen Sie die Vorschau, bevor Sie herunterladen.
Sie brauchen ein PDF, das wie eine eingescannte Kopie aussieht?
Legen Sie ein digitales PDF im kostenlosen Tool ab, stellen Sie Schräglage, Rauschen und Papierton ein und laden Sie ein bildbasiertes PDF herunter, das wie ein echter Scan wirkt. Alles läuft in Ihrem Browser.