AI-OCRとは|帳票の手入力をなくす仕組みと、失敗しない選び方

AI-OCRとは、紙やPDFの帳票に書かれた内容をAIが読み取り、そのまま業務システムに登録できる構造化データとして取り出す技術です。従来のOCRが画像を文字列に変換する「文字起こし」で止まるのに対し、AI-OCRは「どの欄に何が書かれているか」という文書の構造まで理解します。手書きの文字にも対応します。

株式会社ロクシアシステムズは、福岡と東京を拠点に、全国のお客様へAI-OCRの導入支援を提供しているIT企業です。本記事では、AI-OCRの定義・従来OCRとの違い・仕組みから、できること/できないこと、導入効果の測り方、失敗する典型パターン、そして選び方までを解説します。

あらかじめお伝えしておきたいことがあります。AI-OCRの本当の難所は、多くの方が想像する「読み取りの精度」ではありません。難所は「確認・修正の設計」と「基幹システムへの登録」にあります。弊社が実際に構築・運用して分かったこの事実を、本記事の背骨に据えて解説します。都合のよい話だけを並べても、導入の判断材料にはならないためです。

AI-OCRとは

AI-OCRは、OCR(光学式文字認識)に機械学習を組み合わせ、帳票や文書から必要な項目を抽出して構造化データとして出力する技術の総称です。請求書・注文書・申込書・契約書・各社独自の管理帳票などが対象になります。

「AI-OCR」という呼び名は、主に日本のIT市場で定着した呼称です。海外ではIDP(Intelligent Document Processing/インテリジェント文書処理)と呼ばれることが多く、Microsoftも自社サービスを「機械学習ベースのOCRおよびインテリジェント文書処理サービス」と説明しています。呼び方は違っても、指しているものは同じです。

AI-OCRが注目される理由ははっきりしています。取引先から届くFAX・紙・PDFをやめさせることは、自社の努力だけではできないからです。EDI(電子データ交換)への移行は取引先の協力が前提となり、中小企業の現場では頓挫しがちです。一方でAI-OCRは、届いた紙をそのまま受け入れて自社側で自動化できます。取引先にお願いすることなく、受け取る側の判断だけで完結する点が、他の手段にはない強みです。

従来のOCRとの違い

従来型OCRとAI-OCRの違いは、精度の高さよりも「何をするものか」という考え方そのものにあります。

観点従来型OCRAI-OCR
基本の考え方画像を文字列に変換する文書の構造として理解する
読み取る対象指定した座標の文字表・チェックボックス・キーと値の対応関係
様式のばらつき座標がずれると破綻する学習により様式の揺れを吸収できる
手書き苦手対応する(条件により精度は変動)
出力テキスト型が付いた構造化データ(JSON等)
導入の作り込み座標定義を人手で維持自社帳票を学習させて専用モデルを作る

この違いは実務に直結します。従来型OCRは「請求書の右上から40mm下、左から120mmの位置にある文字を読む」という座標指定で動くため、取引先が様式をわずかに変えただけで破綻します。AI-OCRは「金額とはどのようなものか」を学習して探し出すため、位置が動いても追従できます。さらに抽出した値を日付・通貨・電話番号などの型として返すため、システム登録に必要な正規化まで済んだ状態で受け取れます。

AI-OCRの仕組み|4つの工程

帳票が業務システムに登録されるまでは、次の4工程に整理できます。この図が本記事の主張そのものです。

  1. 取り込み
    FAX・スキャナー・メール添付・スマートフォンでの撮影など、届いた経路を問わず帳票を取り込みます。
  2. 読み取り(AI)
    AIが帳票を解析し、あらかじめ定義した項目(取引先名・日付・品番・数量・金額・チェック欄など)を抽出します。
  3. 確認・修正
    抽出結果を人が画面上で検証し、必要に応じて直して確定させます。
  4. 基幹システムへ登録
    確定したデータを販売管理システム・基幹システム・Excel/CSVなどへ引き渡します。

ここで押さえていただきたいのは、市場で「AI-OCR」として売られている製品の多くは、②の読み取りを提供するものだということです。①③④は導入する企業側で用意する必要があります。この認識のずれが、後述する失敗パターンのほとんどを生んでいます。

なお、AI-OCRを実際に動かす技術基盤にはいくつかの選択肢があります。弊社が中核に据えているのはMicrosoftの Azure AI Document Intelligence です。モデルの種類・学習方式・API仕様といった技術的な詳細は、こちらの解説記事で扱っています。

AI-OCRにできること・できないこと

できること

  • 自社独自の帳票を読み取る
    取引先ごとに様式が違う注文書や、自社だけで使う管理シートも、学習させれば専用モデルとして読み取れます。
  • 手書き文字を読み取る
    日本語の手書きに対応します。Azure AI Document Intelligence の最新版では、日本語を含む12言語の手書きに対応しています。
  • スマートフォンで撮影した写真を扱う
    iPhoneの標準保存形式であるHEIFにも対応するため、現場で撮った写真を変換せずそのまま読み取れます。専用スキャナーを現場に置く必要がありません。
  • チェックボックスや表を認識する
    選択マーク(チェック欄・ラジオボタン)や表の行・列構造を認識できます。
  • そのまま登録できる形で出力する
    単なる文字列ではなく、型が付いた構造化データとして返すため、後続のシステム連携に直結します。

できないこと・苦手なこと

  • 精度100%は実現できない
    これは製品の優劣ではなく、技術の性質です。100%を前提にした業務設計は必ず破綻します。
  • 手書きは活字ほど安定しない
    対応言語であっても、書き手の癖・かすれ・枠からのはみ出しで誤認が発生します。
  • 撮影・スキャンの質が悪いと精度が落ちる
    公式にも「1文書につき1枚の鮮明な写真または高品質なスキャン」が推奨されています。傾き・影・低解像度は直接精度に響きます。
  • 量が少ない・様式が毎回変わる帳票では投資に見合わない
    効果が出るのは「量が多く、様式が安定している帳票」です。
  • 導入しただけでは業務は楽にならない
    読み取った後の確認・修正と基幹登録まで繋いで、初めて効果が出ます。

弊社の実測でわかったこと

弊社が構築した、手書き帳票をスマートフォンで撮影して読み取るシステムでは、印字されたヘッダー項目は全サンプルで完全に抽出できました。一方で手書きの氏名・金額には、「6000」を「8000」と誤読する、1つの値が複数の断片に分割されるといった事象が確認されています。手書きを扱う以上、確認・修正の工程は省略できません。

本当の難所は「読み取り」ではない

AI-OCRの検討は、ほぼ例外なく「精度は何%ですか」から始まります。しかし弊社が実際に構築・運用して得た結論は違います。プロジェクトの成否を決めるのは、読み取りの後ろにある2つの工程です。

難所① 確認・修正の設計

精度100%がありえない以上、誤りを人が見つけて直す工程は必ず必要です。問題は「どうやって誤りを見つけるか」です。ここで多くの方が「AIが返す信頼度スコアが低い項目だけ確認すればよい」と考えます。弊社もそう設計しようとしました。しかし、実測の結果は違いました。

弊社の実測でわかったこと

Azure AI Document Intelligence のカスタムモデル(テンプレート方式)は、フィールド単位の信頼度(confidence)を返しません。SDK・REST API(2024-11-30)の双方で実測したところ、返るのは文書全体の信頼度のみで、個々の項目の信頼度はすべて未定義でした。

つまり「この項目は信頼度が低いから人が確認する」という品質ゲートは、信頼度スコアでは作れません。

では、どう品質を担保するのか。答えは業務ドメインの構造的整合性で検証することです。その業務でしか成り立たないルールを、検証ロジックとして組み込みます。たとえば「明細1行に選択肢が2つ以上ある=誤読」「記入があるのにチェックが付いていない=取りこぼし」「小計の合計が総計と一致しない=どこかが誤り」といった具合です。

これは汎用のAI-OCR製品では作り込めません。提供元はお客様の業務ルールを知らないからです。ここが、実務で使えるAI-OCRと使えないAI-OCRの分かれ目になります。

難所② 基幹システムへの登録

もう一つの難所は出口です。読み取ったデータがCSVで出てくるだけなら、担当者の仕事は「手入力」から「CSVを取り込んで確認する」に変わっただけで、削減効果は限定的です。

本当に効果が出るのは、確定したデータが販売管理システムや基幹システムへそのまま登録されるところまで繋がったときです。ここには品番のマスタ照合、単位の変換、取引先コードの紐付けといった、業務ごとに異なる作り込みが必要になります。読み取り精度の議論に時間を使い、この設計を後回しにしたプロジェクトは、動いても現場が楽になりません。

AI-OCRの検討にあたっては、「何%読めるか」と同じ熱量で、「誤りをどう見つけるか」「どこへ登録するか」を最初に決めてください。ここが決まっていれば、プロジェクトはほぼ成功します。

導入効果の測り方

「AI-OCRを入れて効率化する」だけでは投資判断ができません。効果は次の指標で測ります。導入前に実測しておくことが重要です。

指標測り方なぜ重要か
対象枚数その帳票が月に何枚届くか効果の総量を決める。少なければ投資に見合わない
1枚あたりの入力時間受け取ってから登録完了までの実測(秒)削減できる工数の単価になる
確認・修正の残時間導入後、1枚あたり何秒の確認が残るか削減率を決める最大の変数。ここを見落とすと効果を過大評価する
誤り率と手戻り登録後に発覚した誤りの件数と対応時間目に見えにくいが、実は最も痛いコスト
属人化の解消その業務を担当できる人数金額に出ないが、BCPの観点で経営リスクを下げる

効果の見積りで最も多い誤りは、「入力時間がゼロになる」と計算してしまうことです。実際には確認・修正の時間が残ります。導入後に残る時間まで含めて試算して、はじめて意味のある投資判断ができます。弊社が無料PoCの段階で実帳票をお預かりして試算をお出ししているのは、この数字を机上ではなく実測で出すためです。

AI-OCR導入で失敗する典型パターン

弊社が見てきた範囲で、つまずき方には型があります。5つに整理しました。

1. 対象帳票を選び違える

月に数十枚しか来ない帳票や、毎回レイアウトが変わる帳票から始めてしまう例です。AI-OCRが効くのは「量が多く、様式が安定している帳票」です。最初の1本の選定が、成果の9割を決めます。

2.「5枚で始められる」を「5枚で実用になる」と読む

Azure AI Document Intelligence の公式ドキュメントには「同じ様式の文書が5つあれば学習を開始できる」とあります。ただし同じ公式に「画質が低い場合は10〜15枚を使うこと」とも明記されています。弊社が5枚でベースラインモデルを構築した際も実用に届かず、10〜20枚での再学習が必要という結論に至りました。「開始できる」と「実用になる」は別の話です。

3. 確認・修正の画面を作らない

「精度が高いから確認は不要」という前提で進め、運用開始後に誤りが下流へ流れて発覚する例です。前述のとおり、信頼度スコアに頼った品質ゲートは設計できません。確認・修正は最初から工程に組み込むべきものです。

4. 基幹システムへの登録を後回しにする

「まず読み取りだけ導入して、連携は後で」と進めた結果、CSVを人が取り込む運用が定着し、効果が出ないまま終わる例です。出口を決めずに入口だけ作ると、途中で止まります。

5. データの行き先を確認しないまま進める

導入直前になって情報システム部門や取引先から「帳票データが社外のクラウドに送られるのか」と指摘され、白紙に戻る例です。取引先名・単価・個人情報を含む帳票では、これは十分に起こりえます。データがどこで処理されるかは、精度と同じく最初に確認すべき要件です。

AI-OCRの選び方|共有SaaS と 顧客専用構築

AI-OCRの提供形態は、大きく2つに分かれます。どちらが優れているという話ではなく、何を優先するかで選ぶべきものが変わります。

観点共有SaaS型(一般的なAI-OCRサービス)顧客専用構築型(弊社のAI-OCRプライベート)
導入の速さ契約すればすぐ使い始められる専用環境の構築が必要(弊社はIaC自動化で短期化)
データの置き場所提供元のクラウドへ送信される自社のAzure環境内に留まる
自社帳票への適合提供元の設定範囲に依存自社帳票を学習させ専用モデルを作れる
確認・修正の作り込み提供される画面の範囲まで業務ルールに沿った検証を組み込める
基幹連携用意された連携方式の範囲自由に設計できる
費用構造月額(枚数課金が中心)従量課金+初期構築費
向いているケース汎用的な様式・小規模・すぐ試したい独自様式・機密性の高い帳票・基幹連携が前提

選定の分かれ目は、多くの場合データの行き先です。共有SaaSは手軽ですが、帳票データは提供元のクラウドへ送信されます。取引先の情報・価格・個人情報を含む帳票を扱う企業にとって、この一点が導入の障壁になることは珍しくありません。顧客専用構築は、この制約を構造的に解消します。

逆に、汎用的な様式の帳票を少量だけ処理したい場合や、まず手軽に試したい場合は、共有SaaSが合理的です。弊社はどちらでも良い場面で無理に専用構築を勧めることはしません。

共有SaaSと顧客専用構築の違いは、判断フローチャート・10の比較軸・料金構造の考え方まで、別記事「AI-OCRサービスの比較」で詳しく解説しています。あわせてご覧ください。

弊社の支援|AI-OCRプライベート

弊社は、Azure AI Document Intelligence を中核とした顧客専用のAI-OCR環境「AI-OCRプライベート(PRiV OCR)」を提供しています。

  • 顧客専用環境で完結
    お客様のAzureテナント内に構築します。帳票データを外部のSaaS事業者へ預ける必要がありません。
  • 国内リージョンで処理
    東日本(Japan East)リージョンで処理し、データは国内に留まります。
  • 手書き・スマホ撮影に対応
    手書き帳票も、現場でスマートフォンから撮影した写真も、そのまま取り込めます。
  • 難所の2工程まで設計する
    本記事で述べた確認・修正の検証ロジックと、基幹システムへの登録までを設計・構築します。読み取って終わりにしません。
  • まず無料で試せる(プルーフファースト)
    実際の帳票で動くプロトタイプを無料でご用意します。精度をご自身の目で確かめてから、導入をご判断いただけます。

よくあるご質問

こちらをクリックして「よくある質問」を表示

AI-OCRとは何ですか?

紙やPDFの帳票に書かれた内容をAIが読み取り、そのまま業務システムに登録できる構造化データとして取り出す技術です。OCRに機械学習を組み合わせたもので、海外ではIDP(インテリジェント文書処理)と呼ばれることが多くあります。

従来のOCRと何が違うのですか?

従来型OCRは画像を文字列に変換する「文字起こし」までを担います。AI-OCRは表・チェックボックス・キーと値の対応関係といった文書の構造を理解し、型が付いた構造化データとして返します。そのため様式が多少変わっても追従でき、システム登録まで直結します。

手書きの帳票も読み取れますか?

読み取れます。Azure AI Document Intelligence の最新版(v4.0)は、日本語を含む12言語の手書きに対応しています。ただし活字と比べると誤認が発生しやすく、確認・修正の工程を前提に設計する必要があります。

スマートフォンで撮影した写真でも使えますか?

使えます。JPEG・PNGに加え、iPhoneの標準形式であるHEIFにも対応しているため、撮った写真を変換せずそのまま読み取り対象にできます。精度を保つため、傾き・影・解像度に配慮した撮影運用の設計をおすすめします。

精度は何%ですか?100%になりますか?

100%にはなりません。活字は高精度に読み取れますが、手書きは書き手の癖や撮影の質で変動します。精度だけを追うのではなく、誤りを確実に見つける確認・修正の設計と組み合わせることで、実務で使える品質を担保します。実際の精度は帳票を拝見しないと申し上げられないため、弊社では無料PoCで実帳票を読ませてご確認いただいています。

帳票のサンプルは何枚必要ですか?

学習の開始には同じ様式が5枚あれば可能です。ただし実運用の精度を狙うなら10〜20枚をおすすめします。公式にも「画質が低い場合は10〜15枚」と記載されており、弊社の実測でも5枚では実用に届きませんでした。

読み取ったデータが外部に送信されることはありませんか?

一般的な共有SaaS型のAI-OCRでは、帳票データは提供元のクラウドへ送信されます。弊社のAI-OCRプライベートでは、帳票データはお客様のAzureテナント内で処理され、外部のSaaS事業者へ渡ることはありません。処理は東日本(Japan East)リージョンで行い、データは国内に留まります。

既存の販売管理システムに登録するところまでできますか?

可能です。CSV/API連携など、既存システムに合わせて弊社が設計・構築します。読み取るだけでなく基幹システムへの登録まで自動化して、はじめて業務が楽になります。弊社はここを支援の中心に置いています。

費用はどれくらいかかりますか?

顧客専用構築型では、AIの利用料(解析したページ数に応じた従量課金)に初期構築費と月額の運用費が加わる二階建てになります。共有SaaSの枚数課金とは費用構造が異なります。実際の総額は帳票の枚数と業務要件により変わるため、無料PoCの段階で想定枚数から試算をお出ししています。

導入のご相談・お見積り・無料トライアルのご希望は、お問い合わせよりお気軽にご連絡ください。対象帳票の選び方からご相談いただけます。

まずは資料で検討したいという方は、AI-OCRプライベートのサービス資料(無料ダウンロード)をご用意しています。導入イメージ・システム構成・進め方をまとめています。

関連サービス

まずは無料トライアルで、効果をご確認ください

「AIプライベート」は短期・低コストで試せます。帳票入力(AI-OCR)や電話受注(AI-Voice)の自動化、Azure/Microsoft 365・DXのご相談まで、お気軽にどうぞ。