OCRmyPDFとは?
OCRmyPDFとは、スキャンしたPDFに文字層を追加して、検索・コピーできるPDFに変換します。紙で溜まった書類を検索できる形にする定番の道具です。PDFの生成・編集の用途に使えるオープンソースで、ソースコードが公開されているため自社のサーバーに置いて動かせます。ソフト自体の費用はかかりません。
GitHubでの公開は2013年12月、主な開発言語はPython、GitHubスターは34,668、最終更新は2026年9月です(当社がGitHubの公開情報から確認した値、2026年09月06日時点)。
OCRmyPDFの日本語対応は当社が実際に立てて確かめました。日本語ファイルなし(読み取り対象として日本語に対応)
PDFの生成・編集とは?
PDFの生成・編集とは、PDFの加工に手間がかかるという状態を、仕組みで解消することです。OCRmyPDFは、この用途に使えるオープンソースのひとつです。
- スキャンした書類を検索できるPDFにする
- 紙の書類の全文検索への取込
- 電子保存する書類の下処理
OCRmyPDFを使うと何が変わるのか
OCRmyPDF(MPL-2.0・GitHubスター約34,700)は、画像だけのスキャンPDFにOCRを掛けて、見た目はそのままに文字層だけを追加する道具です。元のページ画像は保持されるため、体裁を崩さずに検索・コピー・全文検索の対象にできます。全文検索や文書管理の前段として使われます。日本語にも対応します。
すでに世界で使われている完成品を土台にするので、同じものをゼロから作るより短い期間で済みます。当社は、この土台に対して日本語化、画面や項目の変更、権限、帳票、既存システムとの連携を加えて、御社の業務に合う状態にします。
OCRmyPDFの日本語対応(実測)
OCRmyPDFの日本語対応は当社が実際に立てて確かめました。日本語ファイルなし(読み取り対象として日本語に対応)
| ライセンス | MPL-2.0 |
|---|---|
| 主な言語 | Python |
| GitHubスター | 34,668 |
| 日本語ロケール | 日本語ファイルなし(読み取り対象として日本語に対応) |
| 公開開始 | 2013年12月 |
| 最終更新 | 2026年9月 |
GitHubの公開ファイル一覧から日本語ロケールの実ファイルを数えた結果です。配布用のビルド成果物は除いています。技術的な詳細はOCRmyPDFのOSS情報にまとめています。
進め方は?
進め方とは、現場を見て対象を決め、動くものを見ていただきながら作り、御社の環境へ導入するまでの流れのことです。書類で仕様を固めてから作る進め方はしません。
1日目(無料)
現場に伺い、いまのやり方を見せていただきます。PDFの生成・編集のどこから手を付けるかを決めます。
2〜4日目
OCRmyPDFを土台に、御社のPCで目の前で開発します。動くものを見ながらその場で直します。
5日目
御社の環境へ導入し、ソースコードと開発ノウハウをお渡しします。以後は自社で改造できます。
その後
追加の作り込みが必要なら、範囲を決めてあらためてお見積もりします。延長を前提にした進め方はしません。
この方法が向かないのは?
向かないのは、基幹システムの全面刷新や、複数部門にまたがる大規模な仕組みのことです。15時間という枠では作り切れません。また、決まった手順を正確に繰り返すだけの処理は、AIを使わないほうが速く確実です。当社ではその部分は普通のプログラムとして作ります。
PDFの生成・編集を、まず15時間で試す
名古屋市内なら、1日3時間×5日間の計15時間・税別15万円で試せます。初日3時間のヒアリングと提案は無料です。御社のPCと御社名義のAIエージェントで目の前で開発するので、作り方ごと社内に残ります。成果物とソースコードはお客様のものです。
AI導入お試し実験を見る 動くデモを先に見る(110,000円〜) OCRmyPDFについて相談するPDFの生成・編集に使える他のオープンソース
同じ用途に使える土台は他にもあります。ライセンス、日本語対応、規模を比べて選べます。
| 名前 | できること | 日本語 | デモ |
|---|---|---|---|
| PdfDing | マルチデバイスで利用可能なセルフホスト型のPDF管理・閲覧・編集ツールです。 | 日本語ファイルなし | — |
| PDFMathTranslate | 英語のPDFを、レイアウト・数式・図表を保ったまま日本語にするオープンソース。翻訳エンジンを自社サーバーのローカルLLMや完全オフラインに切り替えられるので、文書を社外に出さずに翻訳できます。 | 日本語ファイルなし(UIは英語・中国語。翻訳先として日本語に対応) | — |
| MinerU | PDFやOffice文書を、レイアウト・表・数式を保ったまま機械が読める形(Markdown・JSON)に変換します。AIに書類を読ませる前処理に使われます。 | 日本語ファイルなし(処理対象として日本語に対応) | — |
| invoice_printer | コマンドラインからシンプルなPDF請求書を生成するツールです。 | 日本語ファイルなし | — |
| marker | PDFを高い精度でMarkdownやJSONに変換します。表・数式・箇条書きの構造を保つので、書類をAIに読ませる前処理に向きます。商用可のApache-2.0です。 | 日本語ファイルなし(処理対象として日本語に対応) | — |