Hva er en skannet PDF? Slik skiller du den fra en digital PDF på 10 sekunder
En skannet PDF er en PDF der sidene er bilder av papir, tatt med en skanner eller et mobilkamera, i stedet for tekst og vektorformer som er skrevet på en datamaskin. Med mindre OCR (optisk tegngjenkjenning) har lagt til et skjult tekstlag, kan du verken merke, søke i eller kopiere ordene, og en skjermleser finner ingenting å lese opp på siden.
Du har fått en PDF og må vite hva den egentlig er: en fil eksportert fra et tekstbehandlingsprogram, en skanning av papir eller en skanning med gjenkjent tekst. Svaret avgjør om du kan søke i den, om en domstol eller etat godtar den, og om den trenger OCR.
Denne forklaringen gir en presis definisjon, en test på 10 sekunder, en sammenligning av de tre typene PDF og en ordliste. Fakta kommer fra W3Cs retningslinjer for tilgjengelighet, amerikanske føderale domstoler, USCIS, digitaliseringsreglene til NARA og FADGI, GOV.UK og tilgjengelighetsteam ved universiteter, i tillegg til det vi har lært av å utvikle et verktøy for skanneeffekt.
Hva er en skannet PDF, helt konkret?
En skannet PDF er en PDF-beholder med ett rasterbilde per side, laget ved å fotografere eller skanne et fysisk ark. Bokstavene du ser, er piksler, ikke tegn. Programvare behandler hver side som et foto, så vanlig tekstsøk, kopiering og tekstflyt (reflow) fungerer ikke uten OCR.
Den amerikanske føderale domstolen for Northern District of California viser til veiledningen fra National Archives om overføring og sier det på én linje: «Skannet tekst er et fotografi av en trykt side, laget enten med et digitalkamera eller en skanner» (N.D. Cal., Preparing Your CM/ECF Filing). Selve PDF-formatet endrer seg ikke: en skannet PDF er fortsatt en gyldig ISO 32000-fil. Det som endrer seg, er hva som ligger inne i hver side.
Tilgjengelighetsteamet ved James Madison University beskriver resultatet fra leserens ståsted: «PDF-er av skannede dokumenter er ofte bare bilder av dokumenter, omtrent som digitale fotografier, og inneholder som regel ikke lesbar tekst» (JMU Digital Accessibility). Dette ene faktumet forklarer nesten alle de praktiske forskjellene som gjennomgås nedenfor.
Her er definisjonen delt opp i deler du kan kontrollere, på samme måte som en arkivansatt eller en tilgjengelighetsrevisor ville vurdert en fil.
- Sideinnhold
- Ett punktgrafikkbilde per side (JPEG-, JBIG2-, CCITT- eller lignende komprimering), ikke skrifttegn (glyfer) og vektorbaner.
- Tekstlag
- Ingen i en PDF med bare bilder; et usynlig OCR-lag i en søkbar skannet PDF.
- Kilde
- En flatbedskanner eller en skanner med dokumentmater, en multifunksjonsmaskin (kopimaskin) eller et mobilkamera med en skannefunksjon som er innebygd i operativsystemet.
- Typisk oppløsning
- 200 til 400 ppi; 300 ppi er det vanligste kravet for kontortekst.
- Fargemodus
- Bitonal (1 bit, svart-hvitt), gråtoner (8 bit) eller farge (24 bit).
- Oppførsel ved zoom
- Kantene blir til synlige pikselblokker ved høy forstørrelse.
- Filstørrelse
- Som regel større per side enn en tekst-PDF, særlig i gråtoner eller farge.
Hvordan skiller en skannet PDF seg fra en digital PDF?
En skannet PDF lagrer bilder av sider, mens en digital (digitalt opprettet) PDF lagrer ekte tegn, skrifttyper og vektorgrafikk eksportert fra et program. En tredje type, den skannede PDF-en med OCR, beholder sidebildet, men legger til skjult maskinlesbar tekst under det og blir dermed en søkbar PDF.
District of Massachusetts trekker den samme grensen i reglene sine for elektronisk innsending: en skannet PDF kommer fra papir som er kjørt gjennom en optisk skanner, mens en «elektronisk konvertert» PDF lages fra et tekstbehandlingsprogram og er tekstsøkbar (D. Mass. CM/ECF Administrative Procedures). Tabellen stiller de tre typene opp side om side.
| Egenskap | Digitalt opprettet PDF | Skannet PDF med bare bilder | Skannet PDF + OCR (søkbar) |
|---|---|---|---|
| Slik lages den | Eksport eller utskrift til PDF fra Word, Google Docs, en nettleser eller et hvilket som helst program | Skanner, kopimaskin eller mobilkamera | Først skanning, deretter legger et OCR-program til tekst |
| Hva en side inneholder | Tegn, innebygde skrifttyper, vektorlinjer, bilder | Ett rasterbilde | Ett rasterbilde pluss usynlig tekst |
| Merke og kopiere tekst | Ja, nøyaktig | Nei | Ja, men bare så nøyaktig som OCR-en |
| Søk med Ctrl/Cmd+F | Fungerer | Finner ingenting | Fungerer, men kan gå glipp av feilleste ord |
| Skjermlesere | Lesbar, best med tagger | Stille | Lesbar, ofte uten struktur |
| Zoom til 400 % | Skarpe kanter i alle størrelser | Pikselert | Pikselert |
| Typisk størrelse per side | Noen titalls kB | Omtrent 75 kB (bitonal) til over 1 MB (gråtoner eller farge) | Som med bare bilder, pluss et lite tekstlag |
| Ser ut som papir | Nei | Ja | Ja |
Størrelsene per side i tabellen bygger på tester gjort av domstoler, ikke på gjetninger. Northern District of California skannet et dokument på 317 sider: bitonalt med 300 ppi ble det 23,86 MB, omtrent 75 kB per side, og i gråtoner med 400 ppi nådde det 374,47 MB, omtrent 1,2 MB per side. Middle District of North Carolina påpeker at 2 MB rommer omtrent førtifem sider med PDF-tekst, altså under 50 kB per side.
Hva er forskjellen på en skannet kopi og en fotokopi?
En skannet kopi er en digital bildefil av en papiroriginal, som regel levert som skannet PDF eller JPEG. En fotokopi er et nytt papirark skrevet ut av en kopimaskin. En bekreftet kopi er en hvilken som helst kopi som en autorisert person har kontrollert mot originalen og signert.
Mange bruker «skannet kopi» litt løst, og de tre begrepene blandes sammen i skjemaer, e-poster fra HR og sjekklister for visum. Forskjellene betyr noe, for en forespørsel om den ene typen oppfylles ikke av de andre.
| Begrep | Medium | Hvem lager den | Hva den beviser |
|---|---|---|---|
| Skannet kopi | Digital fil (PDF, JPEG, TIFF) | Alle med en skanner eller mobil | At det finnes et bilde av dokumentet; ingenting om ekthet |
| Fotokopi | Papir | Alle med en kopimaskin | Det samme: den er en gjengivelse, ikke originalen |
| Bekreftet (rett) kopi | Papir, noen ganger skannet i etterkant | En fagperson som har sett originalen | At kopien stemmer med originalen, på denne personens ord |
| Original | Papir eller opprinnelig digital fil | Utstederen | Selve dokumentet |
Den britiske regjeringen forklarer bekreftelse enkelt: «Du kan bekrefte et dokument som en rett kopi ved å få det signert og datert av en fagperson, for eksempel en advokat» (GOV.UK, Certifying a document). En skannet kopi av den bekreftede siden er fortsatt bare en skannet kopi; bekreftelsen hører til papiret, med signaturen og datoen.
Så når en utleier, arbeidsgiver eller skole sier «send en skannet kopi», mener de nesten alltid «et tydelig digitalt bilde av papiret, som PDF». Når de sier «bekreftet kopi», holder ikke en skanning alene, uansett hvor ekte den ser ut.
Hvordan ser du om en PDF er skannet?
For å se om en PDF er skannet, prøv å merke et ord på siden og søk etter et ord du kan se. Hvis ingenting markeres, er PDF-en bare bilder. Zooming, dokumentegenskaper, listen over skrifttyper og filstørrelsen bekrefter deretter om filen er skannet, digital eller skannet med OCR.
De to første kontrollene tar under 10 sekunder og fungerer i enhver PDF-leser, også den som er innebygd i Google Chrome, Microsoft Edge og macOS Forhåndsvisning. Resten tar et minutt og avgjør de uklare tilfellene.
- Prøv å merke tekst. Dra markøren over en linje. I en digitalt opprettet PDF eller en PDF med OCR markeres enkeltord. I en PDF med bare bilder markeres ingenting, eller noen lesere tegner en firkant rundt hele sidebildet.
- Søk med Ctrl+F eller Cmd+F. Skriv inn et ord du tydelig ser på side én. Null treff på et ord som åpenbart står der, betyr at det ikke finnes noe tekstlag. Et treff betyr ekte tekst eller et OCR-lag.
- Zoom til 400 %. Se på kanten av en bokstav. Vektortekst er knivskarp uansett zoomnivå. En skannet side viser pikseltrinn, myke grå kanter, prikker og noen ganger JPEG-blokkmønstre rundt bokstavene.
- Åpne dokumentegenskapene. I Chromes PDF-leser bruker du menyen med de tre prikkene og velger Dokumentegenskaper; i macOS Forhåndsvisning bruker du Verktøy og deretter Vis inspektør. Feltet for produsent eller program nevner ofte en skanner, en kopimaskinmodell, en skannefunksjon på mobilen eller en OCR-motor. Et tekstbehandlingsprogram eller «Skriv ut til PDF» tyder på en digitalt opprettet fil.
- Sjekk listen over skrifttyper. PDF-program for datamaskin viser som regel en Skrifter-fane i dokumentegenskapene. En digitalt opprettet PDF lister opp skrifttypene den bruker. En skanning med bare bilder lister ingen. En PDF med OCR lister ofte bare én skrift som kun brukes til det usynlige laget.
- Sammenlign størrelse per side. Del filstørrelsen på antall sider. En tekst-PDF holder seg som regel under 50 kB per side. En skanning i gråtoner eller farge ligger ofte på flere hundre kB til over 1 MB per side. Bitonale skanninger er kompakte, så størrelse er det svakeste tegnet.
Læreboken i tilgjengelighet ved Cleveland State University anbefaler den samme raske søketesten: «Hvis ordet blir uthevet på siden, har den søkbar tekst i motsetning til å være et skannet bilde av tekst» (Heather Caprette, Cleveland State University).
Metadata er et tegn, ikke et bevis. Felt for produsent og program kan endres av mange verktøy, også vårt, så stol på hva sideinnholdet gjør ved merking og zoom, mer enn hva egenskapspanelet sier.
Hvorfor er skannede dokumenter vanskelige å søke i og lese?
Skannede dokumenter er vanskelige å søke i og lese fordi en PDF med bare bilder ikke inneholder tegn programvare kan indeksere. Søkemotorer, søk på datamaskinen, kopiering, oversettelsesverktøy og skjermlesere trenger alle tekst. Uten et OCR-lag er den skannede PDF-en et bilde som bare seende lesere kan bruke.
W3Cs Web Accessibility Initiative er rett på sak i teknikk PDF7 i WCAG-retningslinjene: «Et dokument som består av skannede bilder av tekst, er i utgangspunktet utilgjengelig fordi innholdet i dokumentet er bilder, ikke søkbar tekst» (W3C WAI, WCAG-teknikk PDF7).
Den samme W3C-siden lister opp hva som går tapt: «Hjelpemiddelteknologi kan ikke lese eller hente ut ordene; brukere kan ikke merke, redigere, endre størrelse på eller la teksten flyte om (reflow), og de kan heller ikke endre tekst- og bakgrunnsfarger; og forfattere kan ikke tilpasse PDF-en for tilgjengelighet.» Løsningen er OCR, slik at det finnes ekte tekst bak bildet.
Tilgjengelighetskontoret ved Georgetown University legger til den praktiske konsekvensen for alle som er avhengige av hjelpemiddelteknologi: «Skannede PDF-er er en samling bilder, og derfor er de ikke lesbare for de fleste vanlige skjermlesere» (Accessibility at Georgetown).
Offentlige utgivere har gått enda lenger. Den britiske Government Digital Service argumenterer for at informasjon som publiseres som PDF, sammenlignet med HTML, er vanskeligere å finne, bruke og vedlikeholde (GDS-bloggen, GOV.UK). En skannet PDF med bare bilder er den ekstreme utgaven av dette problemet: ikke engang ordene er maskinlesbare.
| Oppgave | Digitalt opprettet | Skanning med bare bilder | Skanning + OCR |
|---|---|---|---|
| Opplesing med skjermleser | Full tekst | Ingen | Tekst, ofte i feil rekkefølge |
| Tekstflyt på mobil | Mulig hvis tagget | Nei | Sjelden |
| Kopiere et sitat | Nøyaktig | Må skrives inn på nytt | Kan inneholde OCR-feil |
| Funnet ved søk på datamaskinen | Ja | Bare filnavnet | Ja |
| Maskinoversettelse | Ja | Trenger OCR først | Ja |
Hva gjør OCR med en skannet PDF?
OCR, optisk tegngjenkjenning, leser bokstavformene i en skannet PDF og skriver tilsvarende maskinlesbar tekst inn i et usynlig lag bak hvert sidebilde. Siden ser nøyaktig lik ut, men blir en søkbar PDF: ord kan finnes, merkes, kopieres og leses opp.
Federal Agencies Digital Guidelines Initiative definerer det presist: «Optisk tegngjenkjenning (OCR) er prosessen med å konvertere et rasterbilde av tekst til søkbar elektronisk tekst» (FADGIs tekniske retningslinjer, 3. utgave, 2023). OCR fungerer på maskinskrevet og trykt tekst, og mindre pålitelig på håndskrift.
Hva OCR fikser i et skannet dokument
- Søk med Ctrl/Cmd+F og full tekstindeksering begynner å fungere.
- Tekst kan merkes, kopieres og limes inn i andre dokumenter.
- Skjermlesere får ord å lese opp, som oppfyller det grunnleggende kravet i W3Cs PDF7.
- Domstoler som krever tekstsøkbare innsendinger, kan godta filen.
Hva OCR ikke fikser
- Bildekvalitet. Siden er fortsatt et bilde, så zooming gir fortsatt piksler. JMU påpeker at for de som zoomer inn, «blir resultatet pikselert og forvrengt fordi den elektroniske teksten ligger under bildet av teksten».
- Nøyaktighet. Uskarphet, skråstilling, lav oppløsning og prikkstøy fører til feillesing, for eksempel «rn» i stedet for «m» eller «1» i stedet for «l». Den skjulte teksten kan være feil selv om bildet ser riktig ut.
- Struktur. Overskrifter, leserekkefølge, tabellceller og alternativ tekst for bilder trenger fortsatt manuell tagging for full tilgjengelighet.
- Filstørrelse. Sidebildene blir liggende, så en skannet PDF med OCR er nesten like stor som versjonen med bare bilder.
Når ber virksomheter og etater om en skannet kopi?
Virksomheter og etater ber om en skannet kopi når originalen finnes på papir og de trenger en digital versjon: dokumentasjon i innvandringssaker, bevis i rettssaker, personalmapper ved ansettelse, signerte kontrakter og kvitteringer. Hver av dem setter sine egne regler for format, oppløsning og filstørrelse, og noen domstoler krever søkbare PDF-er i stedet for skanninger med bare bilder.
Dokumentasjon i innvandringssaker (USCIS)
U.S. Citizenship and Immigration Services godtar skannet eller fotografert dokumentasjon ved elektronisk innsending. Instruksjonen er kort: «Bruk en skanner eller ta bilder av hvert dokument», og «Sørg for at hvert bilde du legger ved, er tydelig, og at all tekst er lesbar» (USCIS, Tips for Filing Forms Online). Hver fil kan være opptil 12 MB, som PDF, JPG eller JPEG, med TIF eller TIFF godtatt for enkelte skjemaer.
Innsending til føderale domstoler (CM/ECF)
Føderale systemer for elektronisk innsending godtar bare PDF, og mange domstoler foretrekker digitalt opprettede filer. Southern District of Florida krever at «innlegg og hoveddokumenter som sendes inn elektronisk i CM/ECF, må være i tekstsøkbart PDF-format» (S.D. Fla. CM/ECF FAQ). Skannede PDF-er er hovedsakelig til bevis og signert papir som ikke har noe digitalt original.
Skanneinnstillinger og størrelsesgrenser varierer fra domstol til domstol. Western District of Washington krever skanning på 300 dpi, svart-hvitt med mindre farge er nødvendig, og setter et tak på 100 MB per dokument (W.D. Wash. technical FAQ). District of Minnesota begrenser hvert bevis til 35 MB i sine prosedyrer for elektronisk straffesaksbehandling.
HR, utleiere, skoler og banker
Arbeidsgivere og utleiere vil som regel ha en skannet kopi av en ID, et vitnemål, et signert tilbudsbrev eller en side fra en leiekontrakt. De publiserer sjelden tekniske regler; de fleste nevner en grense for e-postvedlegg og ber om at hvert ord er lesbart. Når en portal ikke lister opp noen grenser, er en gråtone-PDF på 300 dpi under 10 MB et fornuftig utgangspunkt, ikke en fastsatt regel.
| Hvem som krever det | Format | Regel for størrelse eller oppløsning | Krav om søkbar tekst? |
|---|---|---|---|
| USCIS, elektronisk innsending | PDF, JPG, JPEG (TIF/TIFF for enkelte skjemaer) | 12 MB per fil | Nei; teksten må være lesbar |
| W.D. Wash., domstol | 300 dpi, svart-hvitt; 100 MB per dokument | Avhenger av dokumenttype | |
| S.D. Fla., domstol | Domstolens grenser gjelder | Ja, for hoveddokumenter | |
| D. Minn., straffesaker (ECF) | 35 MB per bevis | Sjekk lokale regler | |
| Arbeidsgiver eller utleier | PDF eller bilde | Vanligvis en e-postgrense | Sjelden |
Kan en skannet PDF arkiveres som PDF/A?
En skannet PDF kan lagres som PDF/A, arkiveringsversjonen av PDF definert i ISO 19005, fordi PDF/A tillater sidebilder. PDF/A legger til regler for lesing på lang sikt, som innebygde skrifttyper og ingen kryptering, men den gjør ikke en side med bare bilder søkbar. OCR er et eget steg.
PDF/A ble første gang utgitt 1. oktober 2005, og den forbyr funksjoner som gjør filer vanskelige å åpne flere tiår senere, som skriftlenking og kryptering (Wikipedia, PDF/A). Microsoft Office kan eksportere ISO 19005-1-kompatible filer direkte fra alternativene for Lagre som PDF.
Domstoler som krever PDF/A, styrer ofte innsendere bort fra skanning i det hele tatt. Eastern District of Oklahoma anbefaler at PDF/A-dokumenter, for å holde filstørrelsen nede og sikre tekstsøkbare filer, bør lages i et tekstbehandlingsprogram i stedet for å skrives ut og skannes (E.D. Okla. PDF/A FAQ).
- Digitalt opprettet PDF/A
- Minst og fullt søkbar; best når det finnes et digitalt original.
- Skannet PDF/A med OCR
- Arkivegnet og søkbar; det rette valget for arkiver som bare finnes på papir.
- PDF/A med bare bilder
- Gyldig for bevaring, men ikke søkbar eller tilgjengelig.
Hvordan får en digital PDF utseendet til en skannet PDF?
En digital PDF får utseendet til en skannet PDF når hver side rasteriseres til et bilde og gis de ufullkommenhetene en ekte skanner etterlater: lett rotasjon, uskarphet, støy, grå eller gulnet papirtone. Resultatet er en PDF med bare bilder som oppfører seg som en skanning, uten at du trenger å skrive ut noe eller eie en skanner.
Det er nøyaktig det vårt gratis verktøy for skanneeffekt gjør. Det gjengir hver PDF-side i nettleseren din, legger på effektene du velger, og lagrer hver side som et JPEG-bilde i en ny PDF. Filene behandles lokalt og lastes ikke opp til en server.
- Rotasjon
- −10° til 10°, standard 1°, pluss tilfeldig variasjon per side på opptil 10°.
- Uskarphet
- 0 til 1, standard 0,3, mykner vektorkanter slik skanneroptikk gjør.
- Støy
- 0 til 1, standard 0,1, legger til prikker i sensorstil.
- Lysstyrke og kontrast
- 0 til 2 hver, standard 1.
- Gultone
- 0 til 2, standard 0, farger siden som gulnet papir.
- Fargerom
- Gråtoner (standard) eller Farge.
- Oppløsning
- 1× til 3×; PDF-sider gjengis ved 72 dpi ganger skalaen, så 2× er omtrent 144 dpi og 3× omtrent 216 dpi.
Fordi resultatet bare består av bilder, arver det alle egenskapene beskrevet over: ingen tekst som kan merkes, ikke noe søk, større filer, ingen opplesing med skjermleser. Det er nettopp poenget for noen som trenger at et dokument ser ut som en skannet kopi, og en ulempe for alle som trenger det søkbart. Behold den digitale originalfilen.
For hele arbeidsflyten, inkludert avveiningene mellom oppløsning og filstørrelse, kan du lese hvordan du konverterer en PDF til en skannet PDF. For alle seks metodene, fra utskrift-og-skanning til innebygde funksjoner i operativsystemet, se slik får du en PDF til å se skannet ut. Starter du i stedet fra et mobilfoto? Guiden om å gjøre et bilde om til en skannet PDF dekker JPG og PNG.
Vi bygde verktøyet vårt for å legge på et skanneutseende, og det vanligste spørsmålet vi får, er egentlig «hva har jeg nå laget?». Det ærlige svaret er en PDF med bare bilder. Den ser ut som papir, men ordene er piksler. Hvis en leser trenger å søke i den eller høre den lest opp, bør du beholde det digitale originalen ved siden av, eller kjøre OCR i etterkant. Vi vil helst at folk vet det før de trykker Last ned.Teamet bak Make PDF look scanned — utviklerne av nettverktøyet og Chrome-utvidelsen
Ordliste for skannede dokumenter: hvilke begreper betyr noe?
Et skannet dokument har sitt eget vokabular: dpi og ppi, bitdybde, bitonal, OCR, rasterisere, PDF/A og JBIG2. Å kjenne disse sju begrepene er nok til å lese ethvert skannekrav fra en domstol, etat eller arbeidsgiver, og til å vurdere en skannet PDF du mottar.
- dpi / ppi
- Punkter eller piksler per tomme: hvor mange bildeprøver som dekker én tomme papir. NARA krever minst 300 ppi for moderne tekstdokumenter og 400 ppi for fotografier og dokumenter med fine detaljer. PDF-sidegeometri bruker 72 punkter per tomme, som er grunnen til at 1×-gjengivelse tilsvarer 72 dpi.
- Bitdybde
- Bits lagret per piksel. Bitonalt er 1 bit, gråtoner er 8 bit (256 nyanser), og en typisk fargeskanning er 24 bit (8 bit i hver av tre kanaler).
- Bitonal
- FADGIs definisjon: «Digitale bilder produsert med bare to farger, svart og hvitt.» Det minste lesbare formatet for vanlig tekst.
- OCR
- Optisk tegngjenkjenning: programvare som gjør om bokstavformene i et bilde til maskinlesbar tekst, og dermed lager en søkbar PDF.
- Rasterisere
- Å gjøre om vektortekst og -former til et rutenett av piksler. Å rasterisere en digital PDF gjør den om til en PDF med bare bilder.
- PDF/A
- ISO 19005, arkiveringsdelmengden av PDF, utgitt i 2005; den forbyr funksjoner som kryptering og skriftlenking.
- JBIG2
- En komprimeringsmetode for bitonale skanninger som lagrer gjentatte tegn bare én gang. BBC News rapporterte i 2013 at enkelte kontorkopimaskiner med en lossy JBIG2-modus endret siffer i skanninger, ofte ved å gjøre en 6 om til en 8; i én test ble et romoppmål på 21,11 m til 14,13 m.
- PDF med bare bilder
- En skannet PDF helt uten tekstlag.
- Søkbar PDF
- En PDF med ekte eller OCR-generert tekst som kan søkes i og merkes.
JBIG2-saken er det sterkeste argumentet for å beholde originaler. En skannet kopi er et bilde, og bilder kan endres av komprimering uten at noen legger merke til det (BBC News, 2013). NARA behandler også støy som en uønsket artefakt «som ikke er en del av kildematerialet» (36 CFR 1236 Subpart E).
Skannet PDF: hvilke spørsmål stilles oftest?
Disse spørsmålene om skannet PDF dukker oftest opp hos folk som har mottatt en fil, må sende en skannet kopi, eller må oppfylle en regel fra en domstol eller etat. Hvert svar står for seg selv, så du kan gå rett til det som passer din situasjon og handle ut fra det.
Hva er en skannet PDF, enkelt forklart?
En skannet PDF er en PDF laget av bilder av papirsider. Teksten du ser, er en del av et bilde, så du kan ikke merke eller søke i den med mindre OCR er brukt.
Er en skannet PDF det samme som en skannet kopi?
Nesten. En skannet kopi er et hvilket som helst digitalt bilde av et papirdokument, og en skannet PDF er det vanligste filformatet for å levere en slik kopi. En skannet kopi kan også være en JPEG- eller TIFF-fil.
Hvordan kan jeg se om en PDF er skannet på 10 sekunder?
Prøv å merke et ord, trykk deretter Ctrl+F eller Cmd+F og søk etter et ord du kan se. Hvis ingenting markeres og søket ikke finner noe, er PDF-en en skanning med bare bilder. Zoom til 400 % for å bekrefte: skannet tekst ser pikselert ut.
Kan en skannet PDF gjøres søkbar?
Ja. OCR legger til et usynlig tekstlag bak sidebildene og gjør en skannet PDF om til en søkbar PDF. Siden ser fortsatt ut som en skanning, og feillest ord kan forekomme i den skjulte teksten.
Hvorfor kan jeg ikke kopiere tekst fra PDF-en min?
PDF-en er mest sannsynlig en skanning uten OCR, så det finnes ingen tegn å kopiere. Southern District of Florida sin FAQ for domstoler påpeker det samme: hvis en PDF ikke er tekstsøkbar, kan teksten ikke kopieres. Kjør OCR, eller be om den digitale originalen.
Er skannede PDF-er tilgjengelige for skjermlesere?
Ikke uten OCR. W3C-retningslinjene kaller skanninger med bare bilder grunnleggende utilgjengelige. Etter OCR kan skjermlesere lese opp teksten, men full tilgjengelighet krever også tagging av overskrifter, leserekkefølge og tabeller.
Hvorfor er en skannet PDF så stor?
Hver side er et fullt bilde. En side i gråtoner ved 400 ppi kan overstige 1 MB, mens en tekstside fra et tekstbehandlingsprogram ofte er under 50 kB. Skanning ved 300 ppi i gråtoner eller svart-hvitt holder størrelsen nede.
Hvilken oppløsning bør et skannet dokument ha?
For maskinskrevet eller trykt tekst er 300 dpi standardkravet i amerikanske føderale domstoler og NARAs minstekrav for tekstdokumenter. Bilder og fine detaljer krever 400 ppi.
Er en skannet kopi en juridisk gyldig eller bekreftet kopi?
Nei, en skannet kopi beviser i seg selv ingenting om ekthet. En bekreftet kopi er signert og datert av en fagperson som har sett originalen, slik GOV.UK forklarer. Spør den som ber om kopien, hvilken type de trenger.
Kan jeg få en digital PDF til å se ut som en skannet PDF?
Ja. Det gratis verktøyet Make PDF look scanned rasteriserer hver side og legger til rotasjon, uskarphet, støy og papirtone i nettleseren din. Resultatet er en PDF med bare bilder, så behold originalen hvis du trenger søk.
Må en skannet PDF være PDF/A?
Bare hvis den som ber om den, sier det. Noen domstoler og arkiver krever PDF/A for langtidslagring. En skannet PDF kan lagres som PDF/A, helst med OCR slik at den også blir søkbar.
Kan jeg skanne flere PDF-er samtidig?
Med verktøyet vårt, ja: masseskanning behandler flere filer og laster dem ned som én ZIP-fil, med én skannet PDF per fil du legger inn.
Hva er det korte svaret om skannede PDF-er?
En skannet PDF er et bilde av papir pakket inn i en PDF. Test den ved å merke og søke i teksten, legg til OCR når du trenger søk eller tilgjengelighet, send en digitalt opprettet PDF når en domstol foretrekker det, og bruk et skanneutseende bare når det er utseendet, ikke ektheten, leseren trenger.
Hvis det er utseendet du trenger, kan du åpne det gratis skanneverktøyet, beholde standardinnstillingen Gråtoner og oppløsning 2×, og sjekke forhåndsvisningen før du laster ned.
Trenger du en PDF som ser ut som en skannet kopi?
Slipp en digital PDF inn i det gratis verktøyet, still inn skråstilling, støy og papirtone, og last ned en bildebasert PDF som ser ut som en ekte skanning. Alt kjører i nettleseren.