株式会社エクスブリッジ

AIでできること / OCR・書類の読み取り

Tesseractとは?
OCR・書類の読み取りに使えるオープンソース

Tesseractは、OCR・書類の読み取りに使えるオープンソースです。紙やPDFの入力を手でやっている——その課題に対して、Tesseractを土台にした仕組みを作ります。ソフト自体は無料で、ゼロから作るより早く、月額のユーザー課金もありません。

Tesseractとは?

Tesseractとは、長く使われているオープンソースのOCRエンジン。日本語を含む多言語に対応し、他の道具の内部でも広く使われています。商用可のApache-2.0です。OCR・書類の読み取りの用途に使えるオープンソースで、ソースコードが公開されているため自社のサーバーに置いて動かせます。ソフト自体の費用はかかりません

GitHubでの公開は2014年8月、主な開発言語はC++、GitHubスターは76,338、最終更新は2026年9月です(当社がGitHubの公開情報から確認した値、2026年09月05日時点)。

Tesseractの日本語対応は当社が実際に立てて確かめました。日本語ファイルなし(読み取り対象として日本語に対応)

OCR・書類の読み取りとは?

OCR・書類の読み取りとは、紙やPDFの入力を手でやっているという状態を、仕組みで解消することです。Tesseractは、この用途に使えるオープンソースのひとつです。

  • 文字の読み取り(他の仕組みへの組み込み)
  • スキャン書類の文字化
  • 枯れたOCRが必要な場面

Tesseractを使うと何が変わるのか

Tesseract(Apache-2.0・GitHubスター約76,300)は、Googleが公開して以来、多くのソフトの内部で使われてきたOCRエンジンです。日本語を含む100以上の言語に対応します。単体では文字を読むだけで、帳票のレイアウト解析や項目の対応づけは別に作る必要があります。OCRmyPDFなど多くの道具がこれを内部で使っています。

すでに世界で使われている完成品を土台にするので、同じものをゼロから作るより短い期間で済みます。当社は、この土台に対して日本語化、画面や項目の変更、権限、帳票、既存システムとの連携を加えて、御社の業務に合う状態にします。

Tesseractの日本語対応(実測)

Tesseractの日本語対応は当社が実際に立てて確かめました。日本語ファイルなし(読み取り対象として日本語に対応)

ライセンスApache-2.0
主な言語C++
GitHubスター76,338
日本語ロケール日本語ファイルなし(読み取り対象として日本語に対応)
公開開始2014年8月
最終更新2026年9月

GitHubの公開ファイル一覧から日本語ロケールの実ファイルを数えた結果です。配布用のビルド成果物は除いています。技術的な詳細はTesseractのOSS情報にまとめています。

進め方は?

進め方とは、現場を見て対象を決め、動くものを見ていただきながら作り、御社の環境へ導入するまでの流れのことです。書類で仕様を固めてから作る進め方はしません。

1日目(無料)

現場に伺い、いまのやり方を見せていただきます。OCR・書類の読み取りのどこから手を付けるかを決めます。

2〜4日目

Tesseractを土台に、御社のPCで目の前で開発します。動くものを見ながらその場で直します。

5日目

御社の環境へ導入し、ソースコードと開発ノウハウをお渡しします。以後は自社で改造できます。

その後

追加の作り込みが必要なら、範囲を決めてあらためてお見積もりします。延長を前提にした進め方はしません。

この方法が向かないのは?

向かないのは、基幹システムの全面刷新や、複数部門にまたがる大規模な仕組みのことです。15時間という枠では作り切れません。また、決まった手順を正確に繰り返すだけの処理は、AIを使わないほうが速く確実です。当社ではその部分は普通のプログラムとして作ります。

OCR・書類の読み取りを、まず15時間で試す

名古屋市内なら、1日3時間×5日間の計15時間・税別15万円で試せます。初日3時間のヒアリングと提案は無料です。御社のPCと御社名義のAIエージェントで目の前で開発するので、作り方ごと社内に残ります。成果物とソースコードはお客様のものです。

AI導入お試し実験を見る 動くデモを先に見る(110,000円〜) Tesseractについて相談する

OCR・書類の読み取りに使える他のオープンソース

同じ用途に使える土台は他にもあります。ライセンス、日本語対応、規模を比べて選べます。

名前できること日本語デモ
PaddleOCR帳票や書類の画像・PDFから、文字と表を構造化データとして取り出すOCRの基盤。商用利用が自由なApache-2.0で、日本語を含む多言語に対応します。日本語ファイルなし(読み取り対象として日本語に対応)
papermergeスキャンした書類をデジタルアーカイブ化するためのオープンソース文書管理システムです。日本語ファイルなし
Docspellスキャンした書類・メール添付・PDFを自動で取り込み、OCRと全文検索で整理する書類管理OSS。メールボックスの定期取り込みと、複数担当者で書庫を共有する設計が特徴です。本家は英独仏のみで日本語なし。当社が1,056語を訳しElm 158モジュールにjaを生成、ビルド検証済み。docspell-jp(github.com/katsushi2441/docspell-jp)で公開・本家へPR提案中。
OCRmyPDFスキャンしたPDFに文字層を追加して、検索・コピーできるPDFに変換します。紙で溜まった書類を検索できる形にする定番の道具です。日本語ファイルなし(読み取り対象として日本語に対応)
YomiToku日本語の文書画像に特化したAI解析エンジン。手書き・縦書き・表の構造まで読み取れますが、ライセンスは非商用で、商用利用には別途の契約が必要です。日本語で開発・提供(日本語文書に特化)

OCR・書類の読み取りに使えるOSSの一覧を見る

よくあるご質問

Tesseractは無料で使えますか?

ソフト自体は無料です。TesseractはライセンスApache-2.0のオープンソースとして公開されていて、条件を守れば費用をかけずに自社のサーバーに置いて使えます。かかるのはサーバー代と、日本語化や自社向けの変更にかかる費用です。ユーザー数に応じた月額課金はありません。

Tesseractは日本語で使えますか?

Tesseractの日本語対応は当社が実際に立てて確かめました。日本語ファイルなし(読み取り対象として日本語に対応)判定は、GitHubの公開ファイル一覧から日本語ロケールの実ファイルを数えた結果です(配布用のビルド成果物は除外)。日本語化が必要な場合は、当社がその作業を含めて導入します。

OCR・書類の読み取りはTesseractで本当にできますか?

長く使われているオープンソースのOCRエンジン。日本語を含む多言語に対応し、他の道具の内部でも広く使われています。商用可のApache-2.0です。 この用途に使えるオープンソースとして公開されており、当社ではこれを土台に日本語化と自社向けの変更を行って導入します。

費用はどのくらいかかりますか?

名古屋市内であれば、1日3時間×5日間の計15時間・税別15万円のお試し導入があります。初日3時間のヒアリングと提案は無料で、進めるとお決めいただいた場合のみ費用が発生します。

作ったものは自社のものになりますか?

なります。ソースコード一式をお渡しします。以後は自社で改造しても、他社に依頼しても構いません。当社に縛られる契約にはしません。

社内にIT担当者がいなくても導入できますか?

できます。いまの紙やExcelのやり方をそのまま見せていただければ、こちらで形にします。専門用語で話を進めることはしません。

Kurage.AIKurage.AI に相談AIが何でも答えます