スキャンPDFとは?テキストPDFとの違いを10秒で見分ける方法
スキャンPDFとは、パソコンで入力した文字やベクター図形ではなく、スキャナーやスマホのカメラで紙を読み取った画像でページができているPDFのことです。OCRで透明テキストが追加されていない限り、文字を選択・検索・コピーすることはできず、スクリーンリーダーもそのページを読み上げられません。
受け取ったPDFが実際にはどんなファイルなのかを知りたい場面があります。ワープロソフトから書き出したファイルなのか、紙をスキャンしたものなのか、それとも文字認識済みのスキャンなのか。その答えによって、検索できるかどうか、裁判所や行政機関が受け付けてくれるかどうか、OCRが必要かどうかが決まります。
この解説では、正確な定義、10秒でできる見分け方、3種類のPDFの比較、そして用語集を紹介します。内容は、W3Cのアクセシビリティ指針、米国の連邦裁判所、アメリカ合衆国市民権・移民業務局(USCIS)、アメリカ国立公文書記録管理局(NARA)とFADGI(米国連邦政府機関のデジタル化ガイドライン)のデジタル化規則、GOV.UK、大学のアクセシビリティ担当部署の情報に加え、スキャン風加工ツールを開発してきた私たちの知見にもとづいています。
スキャンPDFとは正確には何?
スキャンPDFとは、紙を撮影またはスキャンして作った、1ページにつき1枚のラスター画像を収めたPDFのことです。目に見える文字は文字データではなくピクセルです。ソフトウェアは各ページを写真として扱うため、OCRをかけない限り、通常のテキスト検索、コピー、リフローはできません。
カリフォルニア州北部地区連邦地方裁判所は、NARAの移管ガイダンスを引用して、これを1文で表しています。「スキャンしたテキストとは、デジタルカメラまたはスキャナーで作成された、印刷ページの写真である」(カリフォルニア州北部地区連邦地裁「CM/ECFでの提出書類の準備」)。PDFという形式自体は変わりません。スキャンPDFも、ISO 32000に準拠した正式なPDFファイルです。変わるのは、各ページの中身です。
ジェームズ・マディソン大学のアクセシビリティチームは、その結果を読み手の視点から次のように説明しています。「スキャンした文書のPDFは、多くの場合デジタル写真と同じように文書の画像にすぎず、通常は読み取れるテキストを含んでいない」(ジェームズ・マディソン大学 デジタルアクセシビリティ)。この1つの事実で、以下で取り上げる実用上の違いのほとんどが説明できます。
記録管理の担当者やアクセシビリティの監査担当者がファイルを見るときと同じように、定義を確認できる要素に分けると次のとおりです。
- ページの中身
- 1ページにつき1枚のビットマップ画像(JPEG、JBIG2、CCITTなどの圧縮方式)。フォントのグリフやベクターパスではありません。
- テキストレイヤー
- 画像のみのPDFにはありません。検索可能なスキャンPDFには、OCRによる透明テキストのレイヤーがあります。
- 作成元
- フラットベッドスキャナーやシートフィードスキャナー、複合機、またはOSに組み込まれたスキャン機能付きのスマホのカメラ。
- 一般的な解像度
- 200〜400ppi。オフィスの文字資料では300ppiがもっともよく求められます。
- カラーモード
- 2値(1ビットの白黒)、グレースケール(8ビット)、カラー(24ビット)。
- 拡大したときの見え方
- 高倍率にすると、輪郭がピクセルのブロックとして見えてきます。
- ファイルサイズ
- 1ページあたりのサイズは、通常テキストPDFより大きくなります。グレースケールやカラーではとくに大きくなります。
スキャンPDFとテキストPDFの違いは?
スキャンPDFはページの画像を保存し、テキストPDF(デジタルで作成したPDF)はソフトウェアから書き出した本物の文字、フォント、ベクターグラフィックを保存します。3つ目の種類であるOCR済みのスキャンPDFは、ページの画像を残したまま、その下に機械が読める透明テキストを加えたもので、検索可能なPDFになります。
マサチューセッツ州連邦地方裁判所も、電子提出の規則で同じ線引きをしています。スキャンPDFは紙を光学スキャナーに通して作るもので、「電子的に変換された」PDFはワープロソフトから作成され、テキスト検索ができるものだとしています(マサチューセッツ州連邦地裁「CM/ECF運用手続き」)。3つの種類を並べると、次の表のようになります。
| 項目 | テキストPDF(デジタル作成) | 画像のみのスキャンPDF | スキャンPDF+OCR(検索可能) |
|---|---|---|---|
| 作り方 | Word、Google ドキュメント、ブラウザなど、あらゆるアプリからPDFに書き出す・印刷する | スキャナー、コピー機、スマホのカメラ | 先にスキャンし、OCRソフトでテキストを追加 |
| ページの中身 | 文字、埋め込みフォント、ベクターの線、画像 | ラスター画像1枚 | ラスター画像1枚+透明テキスト |
| テキストの選択・コピー | できる(正確) | できない | できる(ただし精度はOCR次第) |
| Ctrl/Cmd+Fでの検索 | 使える | 何も見つからない | 使える(誤認識した語は見つからないことも) |
| スクリーンリーダー | 読み上げ可能(タグ付きなら最適) | 何も読み上げない | 読み上げ可能(構造がないことが多い) |
| 400%に拡大 | どの倍率でも輪郭はシャープ | ピクセルが目立つ | ピクセルが目立つ |
| 1ページあたりの一般的なサイズ | 数十KB | 約75KB(2値)〜1MB超(グレースケールまたはカラー) | 画像のみの場合と同じ+小さなテキストレイヤー |
| 紙のように見えるか | 見えない | 見える | 見える |
表の1ページあたりのサイズは、推測ではなく裁判所のテストにもとづく数値です。カリフォルニア州北部地区連邦地方裁判所が317ページの書類をスキャンしたところ、300ppiの2値では23.86MB(1ページあたり約75KB)、400ppiのグレースケールでは374.47MB(1ページあたり約1.2MB)になりました。ノースカロライナ州中部地区連邦地方裁判所は、2MBでPDFのテキストが約45ページ分、つまり1ページあたり50KB未満に収まると述べています。
スキャンしたコピーと紙のコピーはどう違う?
スキャンしたコピーとは、紙の原本をデジタル画像にしたファイルのことで、通常はスキャンPDFかJPEGで提出します。紙のコピーは、コピー機で印刷された2枚目の紙です。認証謄本(認証コピー)は、権限のある人が原本と照合し、署名したコピーを指します。
「スキャンしたコピー」という言葉は大まかな意味で使われることが多く、申込書や人事部からのメール、ビザの必要書類リストなどでは、この3つの用語がよく混同されます。どれか1つを求められているときに、ほかのもので代わりにはならないため、違いを押さえておくことが大切です。
| 用語 | 媒体 | 作成する人 | 証明できること |
|---|---|---|---|
| スキャンしたコピー | デジタルファイル(PDF、JPEG、TIFF) | スキャナーかスマホを持っている人なら誰でも | その書類の画像が存在すること。本物かどうかについては何も証明しない |
| 紙のコピー | 紙 | コピー機を使える人なら誰でも | 同じく、原本ではなく複製であること |
| 認証謄本(真正な写し) | 紙(あとでスキャンされることもある) | 原本を確認した専門職の人 | その人の保証のもとで、コピーが原本と一致していること |
| 原本 | 紙、またはもともとのデジタルファイル | 発行者 | 書類そのもの |
イギリス政府は、証明について簡潔に説明しています。「事務弁護士(ソリシター)などの専門職の人に署名と日付を入れてもらうことで、書類を真正な写しとして証明できます」(GOV.UK「書類の証明」)。その証明済みのページをスキャンしたものは、あくまでスキャンしたコピーです。証明の効力は、署名と日付が入った紙のほうにあります。
ですから、大家さんや勤務先、学校が「スキャンしたコピーを送ってください」と言う場合、ほとんどは「紙の書類をはっきり写したデジタル画像をPDFで」という意味です。「認証謄本」と言われた場合は、どれほど本物らしく見えても、スキャンだけでは足りません。
PDFがスキャンPDFかどうか見分けるには?
PDFがスキャンPDFかどうかを見分けるには、ページ上の単語を選択してみて、目に見えている単語を検索します。何もハイライトされなければ、画像のみのPDFです。さらに拡大表示、文書のプロパティ、フォントの一覧、ファイルサイズを確認すれば、スキャンPDFなのか、テキストPDFなのか、OCR済みのスキャンなのかがはっきりします。
最初の2つのチェックは10秒もかからず、Google ChromeやMicrosoft Edgeの内蔵ビューアー、macOSのプレビューを含め、どのPDFビューアーでも行えます。残りのチェックは1分ほどで、判断がつかない場合に決着をつけられます。
- テキストを選択してみる。カーソルで1行をなぞるようにドラッグします。テキストPDFやOCR済みのPDFでは、単語ごとにハイライトされます。画像のみのPDFでは何もハイライトされないか、ビューアーによってはページ画像全体を囲む四角形が表示されます。
- Ctrl+FまたはCmd+Fで検索する。1ページ目にはっきり見えている特徴的な単語を入力します。明らかにそこにある単語が0件なら、テキストレイヤーはありません。見つかれば、本物のテキストかOCRのレイヤーがあるということです。
- 400%に拡大する。文字の輪郭を見てみます。ベクターの文字はどの倍率でもくっきりしたままです。スキャンしたページでは、文字のまわりにピクセルの段差、やわらかいグレーのにじみ、細かな点、ときにはJPEGのブロックノイズが見えます。
- 文書のプロパティを開く。ChromeのPDFビューアーでは、3点メニューから「文書のプロパティ」を選びます。macOSのプレビューでは「ツール」→「インスペクタを表示」を選びます。作成ソフトやアプリケーションの欄には、スキャナーやコピー機の機種名、スマホのスキャン機能、OCRエンジンの名前が入っていることがよくあります。ワープロソフトや「Print to PDF」とあれば、デジタルで作成したファイルと考えられます。
- フォントの一覧を確認する。パソコン用のPDFソフトでは、文書のプロパティに「フォント」タブがあります。テキストPDFには使われている書体が一覧表示されます。画像のみのスキャンには何も表示されません。OCR済みのスキャンでは、透明レイヤーにだけ使われるフォントが1つ表示されることがよくあります。
- 1ページあたりのサイズを比べる。ファイルサイズをページ数で割ります。テキストPDFは通常1ページあたり50KB未満です。グレースケールやカラーのスキャンは、1ページあたり数百KBから1MB超になることがよくあります。ただし2値のスキャンはコンパクトなので、サイズはもっとも弱い手がかりです。
クリーブランド州立大学のアクセシビリティの教科書も、同じ簡単な検索テストを勧めています。「ページ上でその単語がハイライトされれば、文字をスキャンした画像ではなく、検索可能なテキストがあるということです」(ヘザー・カプレット、クリーブランド州立大学)。
メタデータは手がかりであって、証拠ではありません。PDF変換ソフトや作成アプリケーションの欄は、当サイトのツールを含め多くのツールで編集できます。プロパティ欄の表示よりも、選択や拡大をしたときにページの中身がどうふるまうかを信頼してください。
スキャンした書類が検索しにくく読みにくいのはなぜ?
スキャンした書類が検索しにくく読みにくいのは、画像のみのPDFには、ソフトウェアが索引を作るための文字が含まれていないからです。検索エンジン、パソコン内の検索、コピー&ペースト、翻訳ツール、スクリーンリーダーは、どれもテキストを必要とします。OCRのレイヤーがなければ、スキャンPDFは、目で見て読める人にしか役立たない1枚の絵にすぎません。
W3CのWebアクセシビリティ・イニシアチブ(WAI)は、WCAGの達成方法PDF7でこの点をはっきり述べています。「文字をスキャンした画像で構成された文書は、本質的にアクセシブルではない。文書の内容が検索可能なテキストではなく画像だからである」(W3C WAI、WCAG達成方法PDF7)。
同じW3Cのページは、失われるものを次のように挙げています。「支援技術は単語を読み取ることも抽出することもできない。利用者はテキストを選択、編集、拡大縮小、リフローすることも、文字や背景の色を変更することもできない。そして作成者は、アクセシビリティのためにPDFを操作することができない。」その対策として示されているのがOCRで、画像の背後に本物のテキストを用意するというものです。
ジョージタウン大学のアクセシビリティ担当部署は、支援技術に頼る人にとっての実際的な影響を付け加えています。「スキャンしたPDFは画像の集まりであるため、一般的なスクリーンリーダーのほとんどでは読み取れない」(ジョージタウン大学 アクセシビリティ)。
公的機関の発信者はさらに踏み込んでいます。イギリス政府デジタルサービス(GDS)は、PDFで公開された情報はHTMLと比べて、見つけにくく、使いにくく、維持しにくいと主張しています(GDSブログ、GOV.UK)。画像のみのスキャンPDFは、その問題の極端な例です。単語さえ機械で読み取れないのですから。
| 作業 | テキストPDF | 画像のみのスキャン | スキャン+OCR |
|---|---|---|---|
| スクリーンリーダーの読み上げ | 全文 | なし | テキストあり(順番が乱れることが多い) |
| スマホでのリフロー | タグ付きなら可能 | できない | ほとんどできない |
| 引用のコピー | 正確 | 手で打ち直す | OCRの誤りを含むことがある |
| パソコン内の検索で見つかる | 見つかる | ファイル名のみ | 見つかる |
| 機械翻訳 | できる | 先にOCRが必要 | できる |
OCRでスキャンPDFはどう変わる?
OCR(光学文字認識)は、スキャンPDFの文字の形を読み取り、それに対応する機械可読のテキストを、各ページ画像の背後にある透明なレイヤーに書き込みます。ページの見た目はまったく変わりませんが、検索可能なPDFになり、単語を検索、選択、コピーしたり、読み上げたりできるようになります。
FADGI(米国連邦政府機関のデジタル化ガイドライン)は、これを正確に定義しています。「光学文字認識(OCR)とは、文字のラスター画像を検索可能な電子テキストに変換する処理である」(FADGI技術ガイドライン 第3版、2023年)。OCRはタイプ打ちや印刷された文字に使え、手書き文字にも使えますが、精度は下がります。
OCRでスキャン文書の何が改善されるか
- Ctrl/Cmd+Fでの検索や全文検索用の索引作成が使えるようになります。
- テキストを選択・コピーして、ほかの文書に貼り付けられるようになります。
- スクリーンリーダーが読み上げる単語を得られるため、W3CのPDF7が示す基本的な対策を満たせます。
- テキスト検索可能な提出書類を求める裁判所のシステムでも、ファイルを受け付けてもらえるようになります。
OCRでは解決しないこと
- 画質。ページは画像のままなので、拡大すればやはりピクセルが目立ちます。ジェームズ・マディソン大学は、拡大して読む人にとって「電子テキストは文字の画像の下にあるため、表示はピクセルが目立ってゆがんでしまう」と指摘しています。
- 精度。ぼけ、傾き、低い解像度、細かなノイズがあると、「m」を「rn」と、「l」を「1」と読み違えるといった誤認識が起こります。画像は正しく見えていても、透明テキストのほうが間違っていることがあります。
- 構造。完全なアクセシビリティを確保するには、見出し、読み上げ順序、表のセル、画像の代替テキストに、引き続き手作業でタグを付ける必要があります。
- ファイルサイズ。ページ画像はそのまま残るため、OCR済みのスキャンPDFは画像のみの版とほぼ同じ大きさです。
スキャンしたコピーを求められるのはどんなとき?
組織がスキャンしたコピーを求めるのは、原本が紙で存在し、デジタルの記録が必要なときです。移民申請の証拠書類、裁判の証拠物、人事部の入社手続き書類、署名済みの契約書、領収書などが該当します。形式、解像度、ファイルサイズの規則はそれぞれ異なり、画像のみのPDFではなく検索可能なPDFを求める裁判所もあります。
移民申請の証拠書類(USCIS)
アメリカ合衆国市民権・移民業務局(USCIS)は、オンライン申請でスキャンまたは撮影した証拠書類を受け付けています。指示は簡潔で、「スキャナーを使うか、各書類の写真を撮ってください」「添付する画像がそれぞれ鮮明で、すべての文字が読めることを確認してください」というものです(USCIS「オンライン申請のヒント」)。1ファイルあたり最大12MBで、形式はPDF、JPG、JPEGです。一部の申請書ではTIFやTIFFも受け付けています。
連邦裁判所への提出書類(CM/ECF)
米国連邦裁判所の電子ファイリングシステム(CM/ECF)が受け付けるのはPDFのみで、多くの裁判所はデジタルで作成したファイルを好みます。フロリダ州南部地区連邦地方裁判所は、「CM/ECFで電子的に提出する訴答書面・主要書類は、テキスト検索可能なPDF形式でなければならない」と定めています(フロリダ州南部地区連邦地裁 CM/ECFに関するFAQ)。スキャンPDFは主に、証拠物や、デジタルの原本がない署名済みの紙の書類に使われます。
スキャンの設定やサイズの上限は、裁判所によって異なります。ワシントン州西部地区連邦地方裁判所は、300dpiでのスキャン、色が不可欠な場合を除いて白黒とすることを求め、1書類あたりの上限を100MBとしています(ワシントン州西部地区連邦地裁 技術FAQ)。ミネソタ州連邦地方裁判所は、刑事事件のECF手続きで証拠物1件あたりの上限を35MBとしています。
人事部、大家さん、学校、銀行
勤務先や大家さんは、身分証明書、卒業証書、署名済みの内定通知書、賃貸契約書のページなどのスキャンしたコピーを求めるのが一般的です。技術的な規則を公表していることはまれで、たいていはメール添付のサイズ上限に触れ、すべての文字が読めるようにと求める程度です。ポータルに上限が書かれていない場合は、300dpi・グレースケール・10MB未満のPDFが妥当な目安です。ただしこれは推定であり、明示された規則ではありません。
| 提出先 | 形式 | サイズまたは解像度の規則 | 検索可能なテキストが必要か |
|---|---|---|---|
| USCISのオンライン申請 | PDF、JPG、JPEG(一部の申請書はTIF/TIFF) | 1ファイルあたり12MB | 不要。ただし文字が読めること |
| ワシントン州西部地区連邦地裁 | 300dpi、白黒。1書類あたり100MB | 書類の種類による | |
| フロリダ州南部地区連邦地裁 | 裁判所の上限が適用される | 主要書類は必要 | |
| ミネソタ州連邦地裁の刑事ECF | 証拠物1件あたり35MB | 地域の規則を確認 | |
| 勤務先・大家さん | PDFまたは画像 | 通常はメールの容量上限 | ほとんど不要 |
スキャンPDFはPDF/Aとして保存できる?
スキャンPDFは、ISO 19005で定められた長期保存用のPDFであるPDF/Aとして保存できます。PDF/Aはページ画像を認めているからです。PDF/Aには、フォントの埋め込みや暗号化の禁止など、長期にわたって読めるようにするための規則が加わりますが、画像のみのページが検索可能になるわけではありません。OCRは別の工程です。
PDF/Aは2005年10月1日に初めて公開された規格で、フォントのリンクや暗号化など、数十年後にファイルを開きにくくする機能を禁止しています(Wikipedia「PDF/A」)。Microsoft Officeでは、PDFとして保存する際のオプションから、ISO 19005-1に準拠したファイルを直接書き出せます。
PDF/Aを求める裁判所は、そもそもスキャン自体を避けるよう提出者に促すことがよくあります。オクラホマ州東部地区連邦地方裁判所は、ファイルサイズを抑え、テキスト検索可能なファイルにするため、PDF/Aの書類は印刷してスキャンするのではなく、ワープロソフトで作成するよう勧めています(オクラホマ州東部地区連邦地裁 PDF/Aに関するFAQ)。
- テキストPDFのPDF/A
- もっとも小さく、全文を検索できます。デジタルの原本があるなら最適です。
- OCR済みのスキャンPDF/A
- 長期保存に適し、検索もできます。紙しかない記録に最適な選択肢です。
- 画像のみのPDF/A
- 保存用としては有効ですが、検索もできず、アクセシブルでもありません。
テキストPDFをスキャンPDFの見た目にするには?
テキストPDFは、各ページを画像化し、わずかな回転、ぼかし、ノイズ、グレーや紙の色味といった本物のスキャナー特有の不完全さを加えることで、スキャンPDFの見た目になります。できあがるのはスキャンと同じようにふるまう画像のみのPDFで、何かを印刷したりスキャナーを用意したりする必要はありません。
当サイトの無料のスキャン風加工ツールが行うのは、まさにこの処理です。PDFの各ページをブラウザ内でレンダリングし、選んだ効果を加えて、すべてのページをJPEG画像として新しいPDFに保存します。ファイルは端末内で処理され、サーバーにアップロードされることはありません。
- 回転
- −10°〜10°、初期値1°。さらにページごとに最大10°のランダムなばらつきを加えられます。
- ぼかし
- 0〜1、初期値0.3。スキャナーの光学系と同じように、ベクターの輪郭をやわらげます。
- ノイズ
- 0〜1、初期値0.1。センサーのような細かな粒を加えます。
- 明るさとコントラスト
- それぞれ0〜2、初期値1。
- 黄ばみ
- 0〜2、初期値0。古い紙のような色味をページに加えます。
- カラーモード
- 「グレー」(初期値)または「カラー」。
- 解像度
- 1×〜3×。PDFのページは72dpi×倍率でレンダリングされるため、2×は約144dpi、3×は約216dpiです。
出力は画像のみのPDFなので、ここまでに説明した性質をすべて引き継ぎます。テキストは選択できず、検索もできず、ファイルは大きくなり、スクリーンリーダーは読み上げません。スキャンしたコピーのような見た目の書類が必要な人にとってはそれこそが目的ですが、検索できる状態が必要な人にとっては欠点になります。デジタルの元ファイルは必ず残しておいてください。
解像度とファイルサイズのトレードオフを含む全体の手順は、PDFを画像化してスキャンPDFにする方法をお読みください。印刷してスキャンする方法からOS標準の機能まで、6つの方法すべてについてはPDFをスキャンしたように見せる方法をご覧ください。スマホの写真から始めたい場合は、画像をスキャン風PDFに変換する方法のガイドでJPGとPNGについて解説しています。
私たちはスキャン風の見た目を加えるためにこのツールを作りましたが、いちばん多く寄せられる質問は、実のところ「いま自分が作ったものは何なのか?」というものです。正直に答えると、それは画像のみのPDFです。紙のように見えますが、文字はピクセルです。読み手が検索したり読み上げを聞いたりする必要があるなら、デジタルの原本を一緒に保管するか、あとからOCRをかけてください。ダウンロードボタンを押す前に、そのことを知っておいてほしいのです。Make PDF look scanned チーム — WebツールとChrome拡張機能の開発者
スキャン文書の用語集:押さえるべき用語は?
スキャン文書には、dpiとppi、ビット深度、2値、OCR、画像化(ラスタライズ)、PDF/A、JBIG2といった独自の用語があります。この7つを知っておけば、裁判所や行政機関、勤務先が示すスキャンの要件を読み解き、受け取ったスキャンPDFを判断するのに十分です。
- dpi/ppi
- 1インチあたりのドット数またはピクセル数で、紙1インチ分を何個の画像サンプルで表すかを示します。NARAは、現代の文字資料には最低300ppi、写真や細部の多い資料には400ppiを求めています。PDFのページ座標は1インチ=72ポイントなので、1×でレンダリングすると72dpiになります。
- ビット深度
- 1ピクセルあたりに保存されるビット数です。2値は1ビット、グレースケールは8ビット(256階調)、一般的なカラースキャンは24ビット(3つのチャンネルにそれぞれ8ビット)です。
- 2値
- FADGIの定義は「黒と白の2色だけを使って作成されたデジタル画像」です。文字だけの書類で、読みやすさを保てるもっとも小さい形式です。
- OCR
- 光学文字認識。画像内の文字の形を機械可読のテキストに変換し、検索可能なPDFにするソフトウェアです。
- 画像化(ラスタライズ)
- ベクターの文字や図形を、ピクセルの格子に変換することです。テキストPDFを画像化すると、画像のみのPDFになります。
- PDF/A
- ISO 19005。2005年に公開された、長期保存用のPDFのサブセットです。暗号化やフォントのリンクなどの機能を禁止しています。
- JBIG2
- 2値のスキャン向けの圧縮方式で、くり返し出てくる記号を一度だけ保存します。BBCニュースは2013年、非可逆のJBIG2モードを使う一部のオフィス用コピー機が、スキャンした数字を書き換えてしまい、6が8になることが多かったと報じました。あるテストでは、部屋の寸法の21.11mが14.13mになっていました。
- 画像PDF(画像のみのPDF)
- テキストレイヤーがまったくないスキャンPDFです。
- 検索可能なPDF
- 本物のテキストまたはOCRによるテキストがあり、検索や選択ができるPDFです。
JBIG2の事例は、原本を保管しておくべきもっとも強い理由です。スキャンしたコピーは画像であり、画像は誰にも気づかれないまま圧縮によって変わってしまうことがあります(BBCニュース、2013年)。NARAもまた、ノイズを「原資料の一部ではない」望ましくない痕跡として扱っています(米国連邦規則集 第36編 第1236部 サブパートE)。
スキャンPDFのFAQ:ほかによくある質問は?
スキャンPDFについてのこれらの質問は、ファイルを受け取った方、スキャンしたコピーを送る必要がある方、裁判所や行政機関の規則に合わせなければならない方からとくによく寄せられるものです。どの回答もそれだけで完結しているので、ご自身の状況に合う質問に直接進んで、すぐに行動に移せます。
スキャンPDFとは、簡単に言うと?
スキャンPDFとは、紙のページを写した写真でできたPDFのことです。見えている文字は画像の一部なので、OCRをかけていない限り、選択も検索もできません。
スキャンPDFとスキャンしたコピーは同じもの?
ほぼ同じです。スキャンしたコピーは紙の書類をデジタル画像にしたもの全般を指し、スキャンPDFはそれを提出するときにもっともよく使われるファイル形式です。スキャンしたコピーはJPEGやTIFFの場合もあります。
PDFがスキャンかどうかを10秒で見分けるには?
単語を選択してみてから、Ctrl+FまたはCmd+Fを押し、見えている単語を検索します。何もハイライトされず、検索でも何も見つからなければ、画像のみのスキャンPDFです。400%に拡大して確認しましょう。スキャンした文字はピクセルが目立って見えます。
スキャンPDFを検索可能にできる?
はい。OCRでページ画像の背後に透明テキストのレイヤーを加えると、スキャンPDFが検索可能なPDFになります。ページの見た目はスキャンのままで、透明テキストには誤認識された単語が含まれることがあります。
PDFからテキストをコピーできないのはなぜ?
そのPDFは、OCRをかけていないスキャンである可能性が高く、コピーできる文字がありません。フロリダ州南部地区連邦地裁のFAQも、テキスト検索できないPDFからは文字をコピーできないと同じことを述べています。OCRをかけるか、デジタルの原本を依頼してください。
スキャンPDFはスクリーンリーダーで読める?
OCRなしでは読めません。W3Cの指針は、画像のみのスキャンを本質的にアクセシブルではないとしています。OCRをかければスクリーンリーダーが文字を読み上げられますが、完全なアクセシビリティには、見出し、読み上げ順序、表のタグ付けも必要です。
スキャンPDFのサイズが大きいのはなぜ?
各ページが1枚の完全な画像だからです。400ppiのグレースケールのページは1MBを超えることがありますが、ワープロソフトで作った文字だけのページは50KB未満のことがよくあります。300ppiのグレースケールか白黒でスキャンすれば、サイズを抑えられます。
スキャン文書の解像度はどれくらいがよい?
タイプ打ちや印刷された文字なら、米国の連邦裁判所では300dpiが標準的な要件で、NARAの文字資料の最低基準も同じです。写真や細部の多い資料には400ppiが必要です。
スキャンしたコピーは法的に有効な写しや認証謄本になる?
いいえ。スキャンしたコピーだけでは、本物であることは何も証明できません。GOV.UKが説明しているとおり、認証謄本とは、原本を確認した専門職の人が署名と日付を入れたものです。提出先に、どちらが必要か確認してください。
テキストPDFをスキャンPDFのように見せられる?
はい。無料のMake PDF look scannedツールは、ブラウザ内で各ページを画像化し、回転、ぼかし、ノイズ、紙の色味を加えます。出力は画像のみのPDFなので、検索が必要な場合は元のファイルを残しておいてください。
スキャンPDFはPDF/Aでなければならない?
提出先から指定された場合だけです。長期保存のためにPDF/Aを求める裁判所やアーカイブもあります。スキャンPDFはPDF/Aとして保存でき、検索もできるようにOCRをかけておくのが理想です。
複数のPDFをまとめてスキャン風にできる?
当サイトのツールならできます。一括スキャンで複数のファイルを処理し、1つのZIPとしてダウンロードできます。入力したファイル1つにつき、1つのスキャン風PDFができます。
スキャンPDFを一言でまとめると?
スキャンPDFとは、紙の画像をPDFに包んだものです。テキストの選択と検索で見分け、検索やアクセシビリティが必要ならOCRを加え、裁判所が好む場合はテキストPDFを送りましょう。スキャン風の見た目を使うのは、読み手に必要なのが本物であることではなく見た目であるときだけにしてください。
必要なのが見た目なら、無料のスキャンツールを開き、カラーモードは初期値の「グレー」、解像度は2×のままにして、ダウンロードする前にプレビューを確認してください。
スキャンしたコピーのようなPDFが必要ですか?
テキストPDFを無料ツールにドロップし、傾き・ノイズ・紙の色味を設定すれば、本物のスキャンのような画像ベースのPDFをダウンロードできます。処理はすべてブラウザ内で行われます。