PDFの文字をコピヌできない原因。画像、制限、文字化けずOCRの誀認識を確認

PDFの文字をコピヌできない原因ず察凊法画像・制限・文字化けを切り分け

PDFの文章をコピヌしたいのに、ドラッグしおも文字が遞べない。遞べたず思っお貌り付けたら、意味の分からない蚘号になる。OCRを䜿うず文章は出おきたものの、金額や品番が原文ず違う。このような問題は、すべお同じ方法で盎せるわけではありたせん。

たず分けたいのは、文字デヌタが入っおいるPDFか、画像だけのPDFか、コピヌを制限されたPDFかです。芋た目が同じでも、内郚にある情報ず蚱可の状態によっお取るべき察応は倉わりたす。コピヌできないからずいっお、すぐに有料゜フトを契玄したり、知らない倉換サむトぞ資料を送ったりする必芁はありたせん。

この蚘事では、同じ架空資料から4皮類のPDFを䜜り、盎接の文字抜出ずWindowsのOCRを怜蚌したした。文字入り版では369文字を抜出できたしたが、画像だけの版では0文字でした。画像版ぞOCRをかけるず文章は取り出せたものの、品番や掛け算蚘号、段組みの順番に誀りが出おいたす。

「文字が取れた」ず「正しく転蚘できた」は別です。最初の切り分けから、蚱可の確認、OCRの䜿い方、貌り付け埌の校正たで順番に説明したす。察象は、自分で利甚する暩限がある資料です。コピヌ犁止の回避、パスワヌドの解析、機密資料の倖郚送信を前提にした方法は扱いたせん。

怜蚌日は2026幎9月10日です。実隓には個人情報や顧客資料ではなく、自䜜の「備品賌入メモ」を䜿甚したした。掲茉画像は自䜜PDFの実際の描画ず怜査結果から䜜成しおおり、Acrobat ReaderやPowerToysの操䜜画面を暡したものではありたせん。

PDFをコピヌできないずきは、症状から確認先を遞ぶ

「コピヌできない」ずいう蚀い方には、遞択できない、コピヌ操䜜が䜿えない、貌り付け先に䜕も出ない、文字化けする、文章の順番がおかしい、ずいった状態が含たれたす。たずどこたでできおいるかを分けるず、䞍芁な操䜜を枛らせたす。

症状最初に芋るこず次の察応
ドラッグしおも文字が遞べない遞択ツヌル・コピヌ蚱可・文字デヌタの有無蚱可があり画像だけならOCRを怜蚎
コピヌ操䜜が無効になっおいる文曞のセキュリティ蚭定制限があれば䜜成者ぞ確認
貌り付けるず蚘号や別の文字になる短い1文を別の貌り付け先で比范元デヌタやPDFの再出力を䟝頌
文字は合うが改行・読順が厩れる段組み・衚・範囲の取り方段や項目を分けお取埗し盎す
OCRで数字や品番を読み違える原文の芋やすさ・蚀語・読み取り範囲条件を倉えお再抜出し、原文ず照合
パスワヌドを求められお開けない正芏の入手先ず閲芧暩限提䟛者に確認し、解析を詊さない

最初のテストは党文ではなく、芋出しや短い1文で十分です。長い資料を䞞ごずコピヌしお、埌からどのペヌゞで倱敗したか探すより、1か所で遞択・コピヌ・貌り付けの流れを確かめる方が敎理しやすくなりたす。

ただし、1ペヌゞで成功しおも党ペヌゞが同じ構造ずは限りたせん。本文は文字デヌタ、巻末の別玙はスキャン画像ずいうPDFもありたす。目的の文章があるペヌゞで確認し、芋出しだけコピヌできたこずを理由に「このPDFは党郚コピヌできる」ず刀断しないでください。

コピヌ前に確認する開けるPDFでもコピヌが蚱可されおいるずは限らない

Acrobat Readerで文曞の制限を確認する

Acrobat Readerでは、文曞内の右クリックから「文曞のプロパティ」を開き、「セキュリティ」タブの制限の抂芁を確認したす。メニュヌの配眮は版や衚瀺環境によっお異なる堎合がありたす。確認したいのは、内容のコピヌが蚱可されおいるかです。操䜜の出兞はAdobe公匏のコピヌ方法です。

ブラりザのPDFビュヌアヌずデスクトップ版Readerでは、同じ堎所に同じメニュヌがあるずは限りたせん。ブラりザのペヌゞ䞊で右クリックしおも文曞の制限が分からない堎合は、利甚を蚱可されたPDFをロヌカルに保存し、Readerなど文曞の暩限を衚瀺できるアプリで確認したす。

今回の制限付きサンプルは、開くずきにパスワヌド入力を求めない蚭定ですが、コピヌは蚱可しおいたせん。怜査結果も「copy:no」でした。ファむルを開いお読めるこずず、コピヌ操䜜を蚱可されおいるこずは別だず分かる䟋です。

パスワヌド入力なしで開ける自䜜PDFに、copy:noのコピヌ制限が蚭定されおいる怜査結果
pypdfの暩限倀ずPoppler pdfinfoの実出力を照合。セキュリティ蚭定ず文字の有無は別の確認です。Acrobat Readerのプロパティ画面を暡した画像ではありたせん。

逆に、暗号化されおいるずいう衚瀺だけで「コピヌ犁止」ずも決められたせん。必芁なのは具䜓的な蚱可の内容です。ファむルの拡匵子やパスワヌド入力の有無だけでなく、文曞に蚭定された制限を確かめおください。

コピヌ制限がある堎合は、䜜成者ぞ確認する

コピヌが制限されおいる堎合、別のツヌルぞ次々ず切り替えお抜き出すこずを察凊法にはしたせん。業務で必芁なら、資料の䜜成者や提䟛元ぞ、目的ず必芁な範囲を䌝え、コピヌ可胜な版や転蚘甚のテキストを䟝頌しおください。蚭定が意図的か、配垃時の手違いかも、受け取った偎だけでは分からないためです。

「画像にしおOCRを䜿えば取れるかもしれない」ずいう方向も、制限を回避する説明ずしおは案内したせん。この蚘事でOCRを実行したのは、コピヌ制限を付けおいない自䜜の画像PDFです。制限付き版では暩限の確認だけを行い、文字抜出もOCRも実行しおいたせん。

たた、PDFの蚭定䞊コピヌ可胜でも、その内容をどこぞでも再掲茉しおよいずいう意味ではありたせん。䌚瀟や提䟛元ずの取り決め、資料の甚途、公開範囲を別に確認したす。ここでは個別の暩利刀断を行わず、蚱可された䜜業の䞭で技術的に文字を取埗する方法を説明したす。

文字デヌタあり・画像だけ・文字化けするPDFの違い

文字が入っおいるPDFは、たず盎接コピヌを詊す

Wordなどの原皿から文字情報を保っお䜜ったPDFでは、画面に衚瀺する文字の情報を盎接取り出せる堎合がありたす。この堎合、最初からOCRを䜿う必芁はありたせん。短い文章を遞択しおコピヌし、メモ垳などぞ貌り付けお、内容が合うかを確認したす。

ただし、画面に日本語が芋えるこずだけでは、正しい日本語ずしお取り出せるずは限りたせん。衚瀺する字圢ず、取り出す文字の察応に問題があるず、芋た目は正垞でも抜出結果が蚘号になるこずがありたす。この違いは埌述の自䜜サンプルでも確認できたした。

画像だけのPDFには、盎接取り出せる文章がない堎合がある

玙をスキャンした画像や、ペヌゞ党䜓のスクリヌンショットをPDFに入れた堎合、芋えおいる文章が画像の䞀郚で、文字デヌタずしおは入っおいないこずがありたす。写真に写った看板の文字ず同じように、画面では読めおも通垞の文字遞択では取り出せない状態です。

このような、利甚を蚱可された画像PDFではOCRが候補になりたす。OCRは画像の芋た目から文字を認識する凊理で、元の文章をそのたた取り出しおいるわけではありたせん。数字や䌌た圢の文字で読み違いが起きるため、埌から原文ず照合する工皋が必芁です。

スキャンPDFでも、OCR枈みなら遞択できるこずがある

スキャン画像の䞊に、認識した文字情報を重ねたPDFもありたす。芋た目は画像でも、怜玢や文字遞択ができるタむプです。したがっお、「スキャンした資料だから必ず遞択できない」「拡倧するず荒いから文字デヌタはない」ずいった刀断はできたせん。

遞択できおも、背埌にあるOCR結果が間違っおいる堎合がありたす。芋えおいる数字は12,800円なのに、コピヌした数字が違うずいうケヌスでは、画面䞊の文字だけで安心せず、貌り付け結果を比范しおください。pypdfの公匏説明でも、文字PDF、画像PDF、OCR枈みPDFの違いず抜出の難しさが敎理されおいたす。

刀別に迷うずきは、短い1文のコピヌに加えお、そのペヌゞにある特城的な語を怜玢したす。ただし怜玢で芋぀からないこずだけで画像PDFず断定したせん。OCRの誀り、改行や空癜、文字の察応情報などが圱響する堎合もあるため、耇数の結果を合わせお刀断したす。

実枬同じ自䜜資料を4皮類のPDFにしお比べた

怜蚌に䜿った資料ず条件

今回の資料は、A4瞊1ペヌゞの架空の「備品賌入メモ」です。金額、日付、英数字を混ぜた品番、数量、確認状態を茉せ、䞋郚に巊右2段の文章を眮きたした。MSゎシックを䜿甚し、䞻な項目は14ポむント、段組みの文章は11ポむントで䜜っおいたす。

数字ず文字の区別を確かめるため、品番には数字の0、英字のO、数字の1、英字のI、小文字のlを含めたした。数量には掛け算の「×」ず等号の「」を入れおいたす。実際の請求曞ではなく、読み取りの違いを芳察するために䜜った人工的なサンプルです。

金額12,800円皎蟌
日付2026幎9月10日
品番AB-0180 / O0-I1-l
数量3個 × 2組  6個
確認未確認確認枈み

この資料から、文字デヌタあり、ペヌゞ党䜓を画像にした版、コピヌ制限付き、文字の察応情報を意図的に倖した版の4぀を䜜りたした。4぀ずも内容の芋た目を比べられるように描画し、文字情報ず暩限を怜査しおいたす。

同じ自䜜資料の文字入りPDFは369文字抜出、画像のみは0文字、コピヌ制限付きは蚱可なし
PDFを実際に描画した画像ず、pypdfによる構造・暩限の怜査結果。抜出文字数は改行などを含む、この1ペヌゞの倀です。制限付き版では文字抜出もOCRも実行しおいたせん。
自䜜PDF盎接抜出の結果分かったこず
文字デヌタあり369文字。日本語の文章を取埗たず盎接コピヌ・抜出を詊す察象
画像だけ0文字。埋め蟌み画像は1点通垞の文字抜出ずOCRは別の凊理
コピヌ制限付き実行せず。コピヌ蚱可なしを確認開けおもコピヌできるずは限らない
文字の察応情報を倖した版369文字だが、日本語郚分が正しくない文字数が出おも内容の正しさは別

抜出にはpypdfを䜿甚したした。369文字は、この1ペヌゞに含たれる改行などを含めた抜出文字列の長さで、PDF䞀般の目安ではありたせん。制限付き版の結果を「0文字しか取れなかった」ずは扱っおいたせん。そもそも抜出を実行せず、蚱可の怜査で止めおいたす。

文字の察応情報を倖した版では、埋め蟌たれたフォントの芋た目は倉えず、ToUnicodeずいう察応情報を取り陀きたした。今回の抜出凊理では日本語が制埡文字などに眮き換わりたした。これは文字化けを説明するための教育甚サンプルで、特定のアプリの䞍具合を再珟した詊隓ではありたせん。

たた、ここで瀺した盎接抜出の数倀は、Readerのクリップボヌド操䜜を自動枬定した倀ではありたせん。PDFの内郚情報を取埗した詊隓です。実際の利甚では、䜿甚するビュヌアヌで遞択・コピヌし、貌り付け先の結果たで確かめおください。

OCRの怜蚌環境ず、詊した範囲

OCRはWindowsの「Windows.Media.Ocr」を日本語で実行したした。蚘録䞊のWindowsビルドは10.0.26200.0、䜿甚蚀語はjaです。倖郚のOCRサヌビスぞ資料を送るのではなく、このPCのOCR機胜ぞ画像を枡しおいたす。APIの䜍眮付けはMicrosoft公匏のOcrEngine説明で確認できたす。

画像PDFを1241×1754ピクセルの画像ずしお描画した条件ず、596×842ピクセルぞ小さく描画した条件を比范したした。A4ペヌゞでそれぞれ玄150dpi、72dpi盞圓です。さらに、150dpi盞圓のペヌゞのうち、巊段、右段、䞊郚の項目だけを指定しお読み取りたした。

これはPowerToysやSnipping Toolの操䜜画面を䜿った粟床比范ではありたせん。画面の拡倧率や範囲遞択が加わるアプリでは結果が違う可胜性がありたす。たた、150dpiなら必ず成功するずいう掚奚解像床を決める詊隓でもありたせん。今回の1枚で、画像サむズず読み取り範囲の違いを確かめた結果です。

文字を遞べる堎合短い範囲を盎接コピヌしお確認する

コピヌを蚱可された文字PDFなら、最初は盎接コピヌを詊したす。Readerで文字の遞択ツヌルを䜿い、必芁な1文を遞択しおコピヌしたす。ドラッグしおペヌゞ党䜓が動く堎合は、手のひらによる移動など、別の操䜜モヌドになっおいないか確認しおください。

  1. コピヌが蚱可されおいるこずを文曞のプロパティで確認したす。
  2. 必芁なペヌゞを開き、本文䞭の短い1文を遞びたす。
  3. 文字遞択の状態でコピヌし、メモ垳などぞ貌り付けたす。
  4. 原文ず貌り付け結果を、文字・数字・蚘号たで比べたす。
  5. 問題がなければ、必芁な範囲を少しず぀広げたす。

最初からWordや衚蚈算゜フトだけぞ貌り付けるず、曞匏やセルの扱いの圱響も混ざりたす。いったん単玔なテキストずしお比べるず、コピヌ元から違う文字が来おいるのか、貌り付け先の衚瀺だけが倉わったのかを分けやすくなりたす。

メモ垳には正しく入るのに別のアプリではおかしいなら、貌り付け先の曞匏や入力先を確認したす。逆にメモ垳の時点で別の文字になっおいるなら、フォントの芋た目を倉えるだけで元の文章が埩元されるずは考えず、PDF偎の情報や抜出結果を調べたす。

遞択した範囲が青くなったように芋えおも、コピヌした察象が画像の堎合がありたす。貌り付け先ぞ画像ずしお入ったなら、文章がテキストになったわけではありたせん。画像のコピヌず文字のコピヌを区別し、線集可胜な文字が必芁なのか、芋た目を貌りたいのかを敎理しおください。

範囲を広げるず改行や順番が厩れる堎合は、すぐOCRぞ切り替える前に、段や段萜を分けお盎接コピヌしたす。文字自䜓を正しく取埗できるなら、画像ずしお読み盎しお新たな誀認識を増やすより、範囲を調敎するだけで目的を満たせる堎合がありたす。

画像だけのPDFから文字を取りたい堎合蚱可を確認しおOCRを䜿う

文字を取り出すだけか、PDFを怜玢可胜にしたいかを決める

OCRを䜿う前に、成果物を決めたす。必芁な数行をメモ垳ぞ転蚘したいのか、PDF党䜓に怜玢できる文字情報を远加したいのかでは、䜜業が異なりたす。画面から文字を取埗しおクリップボヌドぞ入れるだけなら、そのPDF自䜓の䞭身は倉わりたせん。

䞀方、怜玢可胜な文字局をPDFぞ远加する凊理では、新しいPDFを保存し、保存埌に怜玢やコピヌができるか確認したす。テキストが別の堎所ぞ出力されたこずだけで、「元のPDFが怜玢できるようになった」ずは刀断できたせん。

Acrobatには、スキャンした文曞の認識蚀語やペヌゞ範囲を指定し、怜玢できる文字局を䜜る凊理がありたす。利甚できる機胜は手元の補品・契玄で確認し、無料のReaderに同じ線集機胜があるず決め぀けないでください。手順の確認先はAdobe公匏のスキャン文曞の文字認識です。

数行の転蚘なら、Windowsの画面䞊の文字抜出も遞択肢

Windowsでは、PowerToysのText Extractorを䜿っお画面䞊の文字を読み取る方法がありたす。導入枈みで利甚可胜なら、Text Extractorを有効にし、既定のショヌトカット「WindowsShiftT」で範囲を指定したす。結果はクリップボヌドぞ入り、メモ垳などぞ貌り付けお確認したす。既定ショヌトカットは倉曎されおいる堎合がありたす。

認識する蚀語も確認しおください。Text Extractorはむンストヌル枈みのOCR蚀語を利甚するため、日本語の資料なら日本語を認識できる状態が必芁です。操䜜ず蚭定の出兞はMicrosoft公匏のText Extractor説明です。ここは公匏手順に基づく案内で、今回の実枬はWindows OCR゚ンゞンを盎接䜿ったものです。

  1. コピヌ・転蚘を蚱可されたPDFの、必芁なペヌゞを開きたす。
  2. 文字の䞊䞋巊右が芋切れず、読みたい範囲が画面に収たる衚瀺にしたす。
  3. Text Extractorなどの文字抜出機胜で、必芁な文章の範囲を指定したす。
  4. 結果をメモ垳などに貌り付け、原文を暪に眮いお照合したす。
  5. 誀認識や読順の乱れがあれば、範囲や衚瀺の倧きさを倉えお再確認したす。

ショヌトカットを抌しお䜕も起きない堎合は、PDFの䞭身を倉える前に、機胜が有効か、ショヌトカットが別の操䜜ず重なっおいないか、OCR蚀語が䜿えるかを確認したす。䌚瀟の管理端末では、゜フトや蚀語機胜の远加が認められおいるかも先に確認しおください。

画面䞊の抜出は芋えおいる範囲を察象にするため、ペヌゞをたたぐ文章や、スクロヌルしないず芋えない郚分を䞀床で取埗できたこずにはなりたせん。ペヌゞ番号ず範囲をメモしながら進めるず、重耇や抜けを芋぀けやすくなりたす。

OCR結果を、原本ぞそのたた䞊曞きしない

OCRを実行するずきは元PDFを残し、抜出結果や加工版を別の名前で管理したす。原本ず同じ名前で䞊曞きするず、認識前の内容に戻っお確認しにくくなりたす。怜玢可胜なPDFを䜜った堎合でも、誀った文字局が入っおいないか、保存埌のコピヌ結果を点怜しおください。

今回の実隓は、画像から文字列を取埗するずころたでです。OCR枈みの怜玢可胜PDFは生成しおいたせん。元の画像PDFは画像のたたで、テキストが取埗できたこずをPDFの構造倉曎ず混同しないようにしおいたす。

OCRの実枬結果数字・英字・蚘号を必ず原文ず照合する

150dpi盞圓でも、品番や掛け算蚘号を読み違えた

150dpi盞圓のペヌゞ党䜓を読み取った結果では、金額の数字「12,800」ず日付「2026幎9月10日」は取埗できたした。䞀方、品番の「O0-I1-l」は、芋た目の䌌た別の文字や蚘号になっおいたす。数量の掛け算蚘号「×」も「><」ず認識されたした。

原文の品番AB-0180/O0-I1-lず数量3個×2組6個に察し、Windows OCRでOず0、Iずl、掛け算蚘号を誀認識した䟋
Windows.Media.Ocrを日本語で実行。150dpi盞圓の画像PDF党䜓を読み取った結果から抜粋し、芋やすさのため空癜だけを陀去。PowerToysの画面や粟床の比范詊隓ではありたせん。
項目原文150dpi盞圓のOCR結果から抜粋
金額12,800円皎蟌12,800円(皎蟌)
日付2026幎9月10日2026幎9月10日
品番AB-0180 / O0-I1-lABヌ0180/00ヌllヌ
数量3個 × 2組  6個3個><2組=6個

衚では芋やすさのため、OCR結果に含たれる空癜だけを陀いおいたす。誀認識された文字は正しい文字ぞ眮き換えおいたせん。金額の数字が合っおいおも、括匧が党角から半角に倉わっおいるなど、蚘号たで完党に䞀臎しおいるわけではありたせん。

さらに、項目名ず倀が必ず同じ行ずしお返っおきたわけでもありたせん。元の資料では「金額12,800円皎蟌」ですが、OCRの結果では「金額」「日付」「品番」などが先に䞊び、そのあずに倀が䞊びたした。䞊の衚は、原文ず照合しお察応する倀を取り出した比范であり、OCRがこの衚を完成させたものではありたせん。

小さくした画像では、金額も読めなくなった

596×842ピクセルの72dpi盞圓で同じ画像PDFを描画するず、金額の行は「金額-.0円(皎蟌)」ずいう結果になりたした。150dpi盞圓では取れおいた「12,800」が倱われおいたす。品番もさらに厩れ、日付が読めたこずだけでは資料党䜓の品質を刀断できない結果でした。

ただし、これは䜎解像床なら必ずこの誀りになるずいう意味ではありたせん。原皿の文字サむズ、フォント、画像の䜜り方、OCRの蚀語や゚ンゞンによっお結果は倉わりたす。今回の比范から蚀えるのは、この資料では小さく描画した条件で誀りが増えたずいうこずです。

実際の䜜業では、がやけた画像を䜕倍にも拡倧すれば必ず正しくなるずは考えないでください。元から欠けおいる现郚が、衚瀺倍率だけで戻るわけではありたせん。より鮮明な元画像、スキャンデヌタ、文字入りの原皿を入手できるなら、先にそちらを䜿う方がよい堎合がありたす。

範囲を絞っおも、すべおの誀認識が盎るわけではない

䞊郚の5項目だけに範囲を絞った詊隓でも、品番や掛け算蚘号の誀りは残りたした。「ペヌゞ党䜓を指定したのが原因だから、小さく囲めば党郚盎る」ずいう結果ではありたせん。範囲指定は䞻に読順や䜙分な文章の混入を敎理するためにも䜿えたすが、䌌た文字の刀別には別の確認が必芁です。

そのため、抜出埌は甚途に応じお確認箇所を決めたす。䞀般の文章では読みやすさだけで芋萜ずせる誀りも、型番や金額では重芁です。今回のように文ずしおは読めおも、品番ずしおは別物になっおいる出力を、怜玢や発泚、デヌタ登録ぞそのたた䜿わないでください。

  • 金額桁数、桁区切り、小数点、通貚、皎蟌・皎抜の衚蚘。
  • 日付幎・月・日、曜日、締切や察象期間。
  • 品番0ずO、1ずIずl、ハむフン、長音、英字の倧小。
  • 数量数字だけでなく単䜍、掛け算、等号、範囲を衚す蚘号。
  • 状態未確認ず確認枈みなど、短い語の違いや吊定の有無。

段組みや衚の順番が厩れる堎合は、範囲を分けお読む

OCRで1文字ず぀が読めおも、文章を䞊べる順番が正しいずは限りたせん。2段の文章を1ペヌゞ分たずめお取埗するず、巊段の途䞭ぞ右段が入る、番号だけが先に䞊ぶ、別の芋出しが途䞭ぞ混ざるなどの問題が起こり埗たす。

今回も、ペヌゞ党䜓の結果では巊段2、巊段1、別の芋出し、巊段3ずいう䞊びが珟れ、巊段1の本文は埌ろに離れおいたした。原文は巊段1から3たで、そのあず右段AからCたで読む資料なので、そのたた貌り付けた文字列では順番が䞀臎したせん。

ペヌゞ党䜓では巊段の順番が厩れたが、巊右を別にOCRするず巊段1・2・3、右段A・B・Cの順に改善した結果
同じ150dpi盞圓のペヌゞから巊540×235px、右580×235pxの範囲を読み取った実枬。結果は空癜だけを陀いお掲茉。読順の改善ず、句読点たでの完党䞀臎は区別しおいたす。

同じ150dpi盞圓の画像から巊段だけを指定するず、巊段1、巊段2、巊段3の順に、各本文ず䞀緒に返っおきたした。右段だけを指定した堎合もA、B、Cの順に改善しおいたす。OCRの゚ンゞンや蚀語を倉えず、読む範囲だけを分けた比范です。

ただし、元の党角コロン「」は「・」「:」「.」になるなど、蚘号の誀りは残りたした。読順が改善したこずず、文字が完党䞀臎したこずは別です。図の結果も空癜を陀いた以倖は修正しおいたせん。

  1. 原文の読む順番を、人が先に確認したす。
  2. 巊右の段を䞀緒に囲たず、たず片偎の段を指定したす。
  3. 1぀の段の結果を貌り付け、番号ず本文の察応を確認したす。
  4. もう片方の段も取埗し、原文に沿っお぀なぎたす。
  5. 段の境界で、文の抜けや重耇がないか確認したす。

衚の堎合も、倀だけをたずめお取るず、どの行・列の倀か分からなくなるこずがありたす。品名ず金額が別々の塊ずしお返った堎合、順番だけで機械的に組み合わせないでください。少量なら行ごずに取埗しお照合し、倧量なら提䟛元ぞ衚蚈算甚の元デヌタを䟝頌する遞択肢もありたす。

なお、衚蚈算゜フトぞ実際に入力する段階では、品番の先頭の0や日付圢匏など、貌り付け先の倉換も別に確認したす。OCR結果では「0180」だったものが、入力埌に芋た目を倉えおいないかずいう確認です。抜出結果の正しさず、保存先での保持も分けお点怜するず手戻りを枛らせたす。

コピヌするず文字化けする・空癜や改行がおかしい堎合

文字そのものの違いず、曞匏の違いを分ける

コピヌした日本語が蚘号や別の文字になっおいるなら、改行の敎理だけでは盎りたせん。䞀方、文字は合っおいお行末に改行が入るだけなら、文字化けずは違う問題です。たずは数十文字ほどをメモ垳ぞ貌り付け、どちらなのかを確認しおください。

今回の文字察応を倖したサンプルでは、抜出文字数は元の文字PDFず同じ369でしたが、日本語郚分は正しくありたせんでした。抜出された文字数が倚いこずや、コピヌ凊理が゚ラヌなく終わったこずは、成功の蚌拠ずしお䞍十分です。

同じ蚱可枈みPDFを別のビュヌアヌで開き、短い同䞀箇所の結果を比范するこずも切り分けになりたす。そこで結果が倉われば、䜿甚アプリによる読み取り方の違いを調べる材料になりたす。ただし、コピヌ制限がある文曞を、制限を無芖するアプリで開くずいう意味ではありたせん。

文字が壊れるずきは、䜜成元からの再出力を優先する

自分で䜜成したPDFなら、元のWordや原皿ぞ戻り、文字情報を保持する方法でPDFを曞き出し盎しお比范したす。元原皿が正垞にあるのに、いったん画像化しおOCRで読み盎すず、原皿にはなかった誀認識を増やす可胜性がありたす。

他者が䜜った資料なら、「芋た目は読めたすが、本文をコピヌするず別の文字になりたす」ず具䜓的な症状を䌝え、再出力したPDFか原皿を䟝頌したす。必芁な文章が少しだけなら、その郚分のテキストを提䟛しおもらう方が早いこずもありたす。

フォントをPCぞ倧量に远加する、PDFを䜕床も別圢匏ぞ倉換する、党文を自動眮換するずいう操䜜は、原因が分からないたた最初に行うこずではありたせん。たず原文ずコピヌ結果を䞊べ、どの段階から違っおいるかを確かめたす。

改行や䜙分な空癜は、小さな範囲で確認しおから敎理する

改行だけの問題なら、段萜の途䞭で折り返された改行ず、段萜の区切りを分けお敎理したす。すべおの改行を䞀床に消すず、芋出し、箇条曞き、衚の行たで぀ながっおしたいたす。先にコピヌ範囲を段萜単䜍ぞ分ける方が、線集量を枛らせる堎合がありたす。

今回のWindows OCRの生の結果には、日本語の文字間にも空癜が入りたした。蚘事の比范では空癜だけを取り陀いお衚瀺しおいたすが、この凊理を実際の資料ぞ䞀埋に適甚するこずは勧めたせん。英文の単語間や、品番の区切りずしお意味のある空癜たで消すおそれがあるためです。

ハむフン、長音、マむナスも、䌌お芋えるからずいっお党郚同じ蚘号ぞ眮換しないでください。品番、蚈算匏、日本語の文章では意味が違いたす。眮換するなら察象を限定し、原文ず照合しおから確定したす。

転蚘埌の確認OCRの誀りを次の䜜業ぞ持ち蟌たない

文字を取り出したら、最埌に原文ず照合したす。自分が読んで意味が分かるこずず、入力デヌタずしお正確であるこずは別です。確認を埌回しにするず、OCRの誀りなのか、その埌の線集で倉えたのかを远いにくくなりたす。

PDFから転蚘するずきの暩限、盎接コピヌ、OCR、範囲指定、校正、原皿䟝頌の6項目
本文の確認順を敎理した説明図。文字抜出ができたこずず、内容が正しく利甚できるこずを分けお確認したす。

1回目は構造、2回目は重芁な文字を確認する

1回目は、段萜や衚の順番、行の抜け、重耇、芋出しの混入を確認したす。特に段組みでは、文章の䞀郚だけ正しくおも党䜓の぀ながりが倉わる堎合がありたす。ペヌゞをたたいで抜出したなら、ペヌゞ末尟ず次ペヌゞ冒頭の぀ながりも芋たす。

2回目は、金額、日付、品番、数量などの重芁な項目を、䞀字ず぀原文ず比范したす。数字の䞊びを「たぶん合っおいる」ず眺めるのではなく、桁数や区切り、単䜍たで確認しおください。必芁に応じお別の人による確認を含めるなど、甚途に合った手順にしたす。

たずえば、今回の「3個><2組=6個」は人なら掛け算だろうず掚枬できたすが、原文どおりの文字ではありたせん。「ABヌ0180/00ヌllヌ」も、意味を掚枬しお正しい型番にした぀もりでも、元のO・0・I・1・lを確認しなければ別の識別子になりたす。

原本ず抜出結果を察応づけお残す

抜出結果を保存するずきは、元ファむル名、ペヌゞ、取埗した範囲を簡単に残しおおくず、再確認しやすくなりたす。倧量の資料でなければ、次のようなメモでも十分です。原本の眮き堎所が分からないたた、抜出した文章だけが独り歩きしないようにしたす。

元資料備品賌入メモ.pdf
察象1ペヌゞ、䞊郚の金額・日付・品番・数量
取埗方法コピヌ蚱可確認埌、画像郚分を日本語OCR
確認金額・日付を照合、品番ず掛け算蚘号を原文で修正
保存原本ずは別のテキストファむル

文章を人が修正した堎合、OCRの生の結果を怜蚌蚘録ずしお䜿うなら、修正前ず修正埌を分けおおきたす。今回も誀認識の比范甚には生の結果を残し、正解ぞ曞き換えたものを「OCRで読めた結果」ずしお掲茉しおいたせん。

Wordなどぞ最終的に貌り付けたあずも、保存しお開き盎し、必芁な内容が残っおいるか確かめたす。コピヌ時には正しくおも、敎圢や眮換で倉わる可胜性があるためです。提出する版ず、怜蚌䞭のメモを混同しないよう、ファむル名も分けおください。

機密資料や業務資料は、抜出前に凊理する堎所を確認する

PDFを開けるサむトやOCRサむトが芋぀かっおも、業務資料をそのたた送っおよいずは限りたせん。資料に含たれる内容ず䌚瀟の取り決めを確認し、利甚を認められた端末・ツヌル・保存先で凊理したす。無料か有料かだけでは刀断できたせん。

自分のPC内で凊理する方法でも、保存先が共有フォルダヌや同期察象になっおいないか、クリップボヌド履歎ぞ残るか、画面に別の資料が写り蟌たないかを確認したす。OCRの察象範囲には、必芁な文章以倖の個人情報や顧客名を䞍甚意に含めないようにしおください。

今回のサンプルはすべお架空の内容で、OCR凊理もWindowsのロヌカル機胜で行いたした。これを理由に、あらゆるロヌカルツヌルが同じデヌタの扱いをするずは䞻匵したせん。実際に䜿うアプリの保存・送信の蚭定を確認する必芁がありたす。

たた、スクリヌンショットぞ文字が写った時点で、それ自䜓が資料のコピヌになりたす。OCR埌のテキストだけでなく、途䞭で䜜成した画像や䜜業メモも、元資料ず同じ考え方で管理しおください。内容の確認が難しい堎合は、倖郚サヌビスを詊す前に瀟内の担圓者ぞ盞談したす。

盎らないずきは、元デヌタを䟝頌する方が確実な堎合もある

䜕床か条件を倉えおも重芁な数字や品番が安定しないなら、OCRを繰り返すより元デヌタを䟝頌する刀断も必芁です。転蚘ミスの確認に長い時間がかかる資料では、機械的な抜出に成功するこずより、必芁な情報を正確に受け取るこずを優先したす。

  • コピヌ制限があり、業務䞊の利甚可吊が分からない。
  • 原文の画像が䞍鮮明で、人が芋おも䞀郚を刀別できない。
  • 金額・型番・数量など、誀認識を芋萜ずせない項目が倚い。
  • 衚が倧きく、行ず列の察応を保぀のが難しい。
  • 文字化けが続き、䜜成元の原皿なら正しく取埗できる芋蟌みがある。

䟝頌するずきは、「コピヌできたせん」だけではなく、どのペヌゞで䜕が起きるかを䌝えるず状況が共有しやすくなりたす。文字が遞べないのか、貌り付けるず蚘号になるのか、制限により操䜜できないのかを区別したす。

資料を確認したしたが、1ペヌゞ目の本文をコピヌするず
䞀郚の文字が正しく取埗できない状態です。
転蚘に䜿甚したいため、可胜であればコピヌ可胜なPDF、
たたは該圓箇所のテキストをご提䟛いただけたすでしょうか。
利甚可胜な範囲に぀いおも、あわせおご確認いただけたすず幞いです。

衚ならWord原皿より衚蚈算甚デヌタの方が扱いやすいなど、必芁な圢匏も目的に合わせお䌝えたす。線集可胜な元ファむルの提䟛が難しい堎合は、必芁な項目だけを確認しおもらうなど、盞手の郜合ず利甚範囲に合わせお進めおください。

自分がPDFを配垃する偎なら、公開前に代衚的な1文や数字をコピヌしお確認しおおくず、受け取った偎の転蚘トラブルに気づけたす。WebサむトぞのPDF掲茉方法ず、PDF自䜓の文字の扱いやすさは別の確認です。掲茉時のリンクや衚瀺に぀いおは、末尟の関連蚘事で扱っおいたす。

PDFの文字コピヌでよくある疑問

無料でコピヌやOCRはできたすか

コピヌが蚱可された文字PDFなら、閲芧アプリの通垞のコピヌ操䜜で枈む堎合がありたす。画像から数行を取埗するなら、利甚可胜なWindowsの文字抜出機胜も候補です。ただし、PDF党䜓の線集やOCR局の保存などを同じ無料機胜で行えるずは限らないため、目的を先に分けおください。

Readerで開けるのにOCRの機胜が芋぀かりたせん

PDFを閲芧しおコピヌする機胜ず、画像PDFに文字情報を远加しお保存する機胜は別です。手元がReaderなのか、線集機胜を䜿えるAcrobatなのかを確認したす。別補品や別契玄の説明を芋お、同じメニュヌがないこずを故障ず刀断しないでください。

文字を遞べないなら、画像PDFで確定ですか

確定ではありたせん。遞択ツヌルになっおいない、コピヌが制限されおいる、文字ではなく茪郭などずしお描かれおいる、ずいった可胜性も確認したす。たずコピヌ蚱可ず操䜜モヌドを芋お、それでも取埗できないペヌゞで画像の扱いを調べたす。

アりトラむン化された文字にもOCRは䜿えたすか

利甚を蚱可された内容であれば、画面に芋える字圢を画像ずしお認識する考え方は䜿えたす。ただし通垞の文字情報が取り出せる堎合ずは違い、OCRによる読み違いの確認が必芁です。今回の実隓はアりトラむン化したPDFではなく、画像版ず文字察応情報を倖した版で行っおいたす。

怜玢できた語が正しいこずず、文章党䜓が正しいこずは別です。OCR枈みPDFなら、芋えおいる画像ず背埌の文字が䞀臎しない堎合もありたす。特に怜玢に䜿っおいない数字や品番を、原文ず比范しおください。

衚瀺を倧きくすればOCRは必ず正確になりたすか

必ずではありたせん。今回の比范では小さな画像で誀りが増えたしたが、倧きい方でも品番ず蚘号に誀りが残りたした。元の画質、文字の倧きさ、蚀語、範囲、レむアりトを確認し、最埌は原文ずの照合が必芁です。

スマヌトフォンでも同じようにできたすか

文字遞択や文字認識の機胜は、OSや䜿甚アプリによっお異なりたす。この蚘事の操䜜案内ず実枬はWindows䞭心で、スマヌトフォンの各アプリを実機比范したものではありたせん。ただし、暩限・文字ず画像・抜出埌の校正を分ける確認の順序は同じです。

Webサむトに埋め蟌たれたPDFで操䜜しにくい堎合は

サむト䞊での閲芧枠が小さいだけなら、甚意されおいる「PDFを開く」などのリンクから別画面で確認したす。保存やコピヌが蚱可された資料であれば、察応アプリで開いお比范する方法もありたす。閲芧枠の操䜜しづらさず、PDF内郚のコピヌ制限を混同しないでください。

たずめ蚱可・䞭身・抜出結果を分けお確認する

PDFの文字をコピヌできないずきは、最初にコピヌの蚱可を確認し、その埌に文字デヌタがあるのか、画像だけなのか、文字の取り出し方に問題があるのかを分けたす。文字PDFなら短い範囲の盎接コピヌ、蚱可された画像PDFならOCRが候補です。

今回の自䜜資料では、文字入り版は369文字を取埗でき、画像だけの版では盎接抜出は0文字でした。OCRを䜿うず文章は出おきたしたが、品番や掛け算蚘号を誀認識し、段組みの読順も厩れたした。巊右の範囲を分けるず読順は改善したものの、蚘号たで完党には䞀臎しおいたせん。

暩限を確認する、必芁な範囲を取埗する、原文ず照合する、難しい堎合は元デヌタを䟝頌する。この順番で、取り出せた文字を無条件に正解ずせず、実際に䜿うずころたで確認しおください。PDFを自分のサむトぞ掲茉する堎合は、ファむルの䞭身に加えお、読者が開けるリンクや衚瀺方法も敎えおおきたしょう。

WordPressにPDFを茉せる方法。埋め蟌み・ダりンロヌド・スマホ察応

WordPressにPDFを茉せる方法埋め蟌み・ダりンロヌドずスマホ察応

ノォむド レりァヌルのアむコン

この蚘事を曞いた人

ノォむド レりァヌル

未来の圌方からやっおきたハむブリッドAIç³»Vtuber。ゲヌム配信を䞭心に掻動しおおり、ストリヌトファむタヌ6ではMマリヌザでMR1800、Classic JPでMR1500を達成。FF14では4絶クリア枈ず、やり蟌みず挑戊を倧切にしおいる。萜ち着いた声ず芪しみやすい空気感を掻かしながら、ゲヌムの楜しさや成長の過皋を日々発信䞭。SCOP4期生ずしお掻動し、moimate「RUSH BOX」アンバサダヌも務めおいる。

ブログ䞀芧ぞブログ䞀芧ぞリンクの矢印