動画OCRで動画から無料でテキストを抽出する方法(2026年版)
On this page
30分間のソフトウェアデモを録画しました。すべてのメニュー項目、コードスニペット、警告メッセージが画面上に表示されています。しかし、動画ファイルの中に閉じ込められているため、検索したり、コピーしたり、編集したりすることはできません。
このガイドでは、動画OCRの仕組み、ScreenAppの動画OCRツールを使った最速の方法、そして8つのツールの正直な比較と実際の料金について説明します。ドキュメント作成、調査、アクセシビリティのために動画からテキストを抽出する必要がある場合でも、ここで適切なオプションが見つかるでしょう。
クイックピック
非技術系ユーザーに最適: ScreenApp、無料プラン、Proは年間請求で月額$19/月。ワンクリックで動画OCR、Word/PDF/PPTエクスポートに対応。
最高の無料ブラウザ拡張機能: Copyfish、100%無料でオープンソース。YouTubeやあらゆるブラウザ動画で動作します。
最高の無料オープンソースライブラリ: Tesseract OCR、無料。Pythonコーディングと手動でのフレーム抽出が必要です。
大規模開発者向け: Google Cloud Vision API、無料枠後1,000画像あたり1.50ドル。業界標準の精度。
AIチャットボットがこれをできない理由
「ChatGPTに動画からテキストを抽出してもらうことはできないのか?」と疑問に思うかもしれません。実際にはできません。ChatGPT、Gemini、その他のAIチャットボットは、アップロードした個々の画像を分析することはできますが、動画ファイル全体をフレームごとに処理することはできません。すべてのフレームを手動でスクリーンショットを撮り、1つずつアップロードする必要があり、それでは目的が果たせません。
専用の動画OCRツールは、動画をフレームに分割し、各画像を前処理して精度を高め、すべてのフレームでOCRを実行し、重複するテキストを削除し、すべてを1つのクリーンなドキュメントに統合するという、パイプライン全体を自動化します。これにより、一度に1つのスクリーンショットを処理するのではなく、数百または数千のフレームが自動的に処理されます。
ツール比較
| ツール | タイプ | 無料枠 | 有料価格 | 最適な用途 |
|---|---|---|---|---|
| ScreenApp | オンラインプラットフォーム | 2回の文字起こし、3回のアップロード | Pro 月額$19ドル(年間)、月額$30ドル(月間) | 非技術系ユーザー、スクリーンレコーディング |
| Copyfish | ブラウザ拡張機能 | 完全無料 | 0ドル(オープンソース) | YouTubeやあらゆるブラウザ動画でのクイックOCR |
| Selectext | Chrome拡張機能 | 約20回無料 | クレジットベース | YouTubeの一時停止フレームからテキストをコピー |
| Tesseract OCR | オープンソースライブラリ | 完全無料 | 0ドル | パイプライン全体を制御したい開発者 |
| Google Cloud Vision | 開発者API | 1,000画像/月 | 1,000画像あたり1.50ドル | 高精度なバッチ処理 |
| Azure Video Indexer | エンタープライズAPI | 10時間(ウェブ)、40時間(API) | 分単位の料金 | 大規模なエンタープライズ動画分析 |
| Twelve Labs | 動画AI API | 600分無料 | 1分あたり0.033ドル | マルチモーダル動画理解 |
| EdenAI | APIアグリゲーター | サインアップ時に無料クレジット | 秒単位の料金 | 1つのAPIで複数のOCRプロバイダーをテスト |
Sources, checked 2026-09-23: ScreenApp pricing
動画OCRの仕組み
プロセスを理解することで、適切なツールを選ぶのに役立ちます。動画OCRを実行する際に内部で何が起こるかを見てみましょう。
ステップ1:フレーム抽出
動画は個々の画像(フレーム)に分割されます。一般的な設定では、1~3秒ごとに1フレームをキャプチャします。30分の動画では、分析のために600~1,800枚のスクリーンショットが生成される可能性があります。
ステップ2:画像の前処理
ステップ3:テキスト検出
AIは各フレームをスキャンしてテキストが表示されている場所を特定し、すべての単語または行の周りにバウンディングボックスを描画します。この検出フェーズでは、テキストを読み取る前にテキスト領域を識別します。
ステップ4:文字認識
分離されたテキスト領域はOCRエンジンを通過します。Tesseractのようなオープンソースツールはパターンマッチングを使用しますが、Google Cloud VisionやAmazon TextractのようなクラウドAPIは、コンテキストを理解し、乱雑な背景を処理するディープラーニングモデルを使用します。
ステップ5:統合
すべてのフレームからのテキストが結合され、重複が削除され、出力はタイムスタンプ付きの単一のドキュメントにフォーマットされます。これにより、何千もの断片的なテキストスニペットが1つのまとまったファイルに変換されます。
開発者向け: カスタムの動画OCR Pythonパイプラインを構築するには、GitHubのpytesseract、PaddleOCR、EasyOCRをチェックしてください。それぞれがPython、OpenCV、OCRを組み合わせて、すぐに使えるパイプラインになっています。特にPaddleOCRは、多くの言語の精度ベンチマークで商用APIに追いついています。
ScreenAppでテキストを抽出
ここでは、ワンクリックで5つのステップすべてを完了する方法を紹介します。ScreenAppの動画からドキュメントへのパイプラインは、プロセス全体を自動化します。
- 動画をアップロード
- OCRオプションを選択
- AIに質問
- ダウンロード
1. 動画をアップロード
動画ファイルをドラッグ&ドロップするか、リンク(YouTube、Google Driveなど)を貼り付けるか、「アップロード」をクリックします。ScreenAppはMP4、MOV、AVI、WebM、YouTubeリンク、Google Driveファイルに対応しています。
ScreenAppダッシュボードにログインして開始してください。
2. 動画OCRを有効にする
アップロード後、「動画分析(OCR)」を選択して視覚的なテキスト認識を有効にします。これにより、AIはすべてのフレームから画面上のすべてのテキストを読み取ります。
音声と画面上のテキストの両方を含む動画の場合、OCRと音声文字起こしを同時に有効にして、すべてをキャプチャします。
3. プロンプトでAIをガイドする
「この動画からすべてのテキストを抽出し、箇条書きの要約を作成してください」のようなプロンプトを入力します。必要な形式(会議メモ、SOP、スライドアウトライン、コードドキュメントなど)を記述します。プロンプトが具体的であるほど、AIは出力をより適切に構造化します。
抽出が完了したら、ScreenAppのAIツールを使用して、表現を整理したり、コンテンツを翻訳したり、レポート、チェックリスト、またはレッスン計画に再フォーマットしたりできます。
処理には通常、動画の長さによって2~5分かかります。
4. ドキュメントをダウンロード
抽出されたテキストの準備ができました。必要な形式でダウンロードしてください。動画からテキストへの変換について詳しくはこちらをご覧ください。
- Word (.docx): 完全に編集可能なテキスト
- PDF: 検索可能なテキストと書式設定の保持
- PowerPoint (.pptx): スライドに整理されたテキスト
- プレーンテキスト (.txt): 簡単なコピー&ペースト
エクスポートされたドキュメントには、各テキストが元の動画に表示された時刻を示すタイムスタンプが含まれています。
動画OCRツールのレビュー
各ツールについて詳しく見ていきましょう。料金は2026年2月に確認済みです。
1. ScreenApp
ScreenAppは、コーディングなしで動画OCRを処理するブラウザベースのプラットフォームです。動画をアップロードし、OCRボックスをチェックするだけで、数分で編集可能なドキュメントを入手できます。特にサイレントスクリーンレコーディング、ソフトウェアデモ、プレゼンテーションキャプチャに最適です。
タイプ: オンラインプラットフォーム(ブラウザベース)
料金: 無料プランでは、最大45分の録音の文字起こしが2回、生涯アップロードが3回、さらに月額10回のAIチャットが含まれます。Proは月額$19ドル(年間)または月額$30ドル(月間)。Maxは月額$34ドル(年間)または月額$69ドル(月間)で、無制限のAIチャットとより長い録画が可能です。
長所: コーディング不要、OCRと音声文字起こしを組み合わせ、Word/PDF/PPTにエクスポート、サイレント動画に対応、カスタム出力形式のためのAIプロンプトシステム
短所: インターネット接続が必要、無料プランは2回の文字起こしに制限、処理速度は動画の長さに依存
最適な用途: コーディングやAPI管理なしで動画OCRを利用したいすべての人
2. Copyfish
Copyfishは、ブラウザで直接画像、動画、PDFからテキストをOCRできる無料のオープンソースブラウザ拡張機能です。Chrome、Edge、Firefoxで再生中の動画を一時停止し、領域を選択すると、Copyfishがテキストを即座に読み取ります。これは完全な動画処理パイプラインではなく、一度に1フレームをキャプチャしますが、数行のテキストをすばやく取得するための最速の無料オプションです。
タイプ: ブラウザ拡張機能(Chrome、Edge、Firefox)
料金: 100%無料でオープンソース。有料プランなし。
長所: 完全無料、あらゆるブラウザ動画(YouTube、Vimeoなど)で動作、25以上の言語をサポート、アカウント不要、画像やPDFでも動作
短所: 手動でのフレームごとのキャプチャ(一時停止、選択、コピー)、バッチ動画処理なし、自動タイムスタンプマッピングなし、精度は動画解像度に依存
最適な用途: ドキュメント全体が必要ない場合の、動画からのクイックなテキスト取得
3. Selectext
Selectextは、20万人以上のユーザーを持つChrome拡張機能で、動画を一時停止して、ウェブページ上のテキストをハイライトするのと同じように、テキストを直接選択できます。選択したテキストはクリップボードにコピーされます。AIコンピュータビジョンを使用して検出を行います。
タイプ: Chrome拡張機能
料金: フリーミアム。約20回無料で使用でき、その後はクレジットベースの料金。
長所: 直感的な選択インターフェース(クリック&ドラッグでテキストを選択)、高速、YouTubeや他のサイトで動作、4.3つ星評価
短所: 支払いが必要になる前に無料使用回数に制限あり、Chromeのみ、手動での1フレームごとの処理、低解像度動画(480p未満)では苦戦
最適な用途: 動画から特定のテキストを時々コピーする必要があるユーザー
4. Google Cloud Vision API
Google Cloud Vision APIは、利用可能なOCRサービスの中で最も正確なものの1つです。Google Cloud Video Intelligenceと組み合わせることで、タイムスタンプとバウンディングボックス付きで動画内のテキストを検出できます。使用するにはコーディング経験が必要です。
タイプ: 開発者API(クラウドベース)
料金: 最初の1,000画像/月は無料。その後、OCRは1,000画像あたり1.50ドル。新規アカウントには300ドルの無料クレジット。Video Intelligence APIには別途分単位の料金設定があります。
短所: コーディングとAPI統合が必要、画像OCRと動画OCRで料金が異なる、大量になるとコストがかさむ
最適な用途: 大規模で信頼性の高いテキスト抽出が必要なアプリケーションを構築する開発者
5. Tesseract OCR (Python)
Tesseract OCRは、最も広く使用されているオープンソースOCRエンジンです。開発者はPythonとOpenCVを組み合わせて動画OCR Pythonプロジェクトに使用します。フレームを抽出し、前処理し、Tesseractに供給するためのコードを記述します。
タイプ: オープンソースライブラリ(ローカルで実行)
料金: 完全無料かつオープンソース
長所: コストなし、パイプラインを完全に制御、オフラインで実行、活発なコミュニティ、100以上の言語をサポート、豊富なドキュメント
短所: Pythonプログラミングが必要、複雑な背景ではクラウドAPIよりも精度が低い、すべてを自分で構築・保守する必要がある、GUIなし
最適な用途: 完全な制御を望み、パイプラインをゼロから構築することをいとわない開発者
6. Snagit
TechSmithのSnagitは、スクリーンショットからテキストを抽出するためのOCR機能を内蔵したスクリーンキャプチャツールです。動画ファイル全体ではなく、画像で動作します。動画から手動でスクリーンショットをキャプチャし、それぞれにOCRを実行する必要があります。
タイプ: デスクトップアプリケーション(Windows/Mac)
料金: 年間39ドルのサブスクリプション。無料トライアルあり。
長所: シンプルなインターフェース、クイックなスクリーンショットOCRに最適、TechSmithの他のツールと統合、オフラインで動作
短所: 動画向けに設計されていない、画像のみ、手動でのフレームキャプチャが必要、バッチ処理なし、タイムスタンプマッピングなし
最適な用途: 動画全体を処理するのではなく、数枚のスクリーンショットからテキストが必要なユーザー
7. Azure Video Indexer
Azure Video Indexerは、音声文字起こし、顔検出、OCRを1つのエンタープライズプラットフォームに統合しています。動画ファイル全体を処理し、複数の種類のメタデータを一度に抽出します。
タイプ: エンタープライズクラウドAPI
料金: 無料トライアル:10時間(ウェブ)または40時間(API)。有料プラン:Basic、Standard、Advancedがあり、分単位の料金。Azureサブスクリプションが必要。
長所: 完全な動画分析(OCR + 音声 + 顔 + オブジェクト)、エンタープライズの信頼性、Microsoftエコシステムとの統合、動画ファイルを直接処理
短所: Azureアカウントと技術的なセットアップが必要、複雑な料金体系、単純なテキスト抽出には過剰、学習曲線が急
最適な用途: 他の動画インテリジェンス機能と合わせてOCRが必要な、何千もの動画を処理する大規模組織
8. Twelve Labs
Twelve Labsは、従来のOCRを超えるマルチモーダル動画AIプラットフォームです。GPT-4oが画像を処理するのと同様に、テキストが視覚的に何が起こっているかに関連する方法を理解し、動画タイムライン全体に適用して、動画フレームをコンテキストで分析します。
タイプ: 動画AI API
料金: 600分の動画が無料。開発者プランはインデックス作成に1分あたり0.033ドルから。
長所: フレーム間のコンテキスト認識分析、マルチモーダル理解(テキスト + 視覚 + 音声)、寛大な無料枠、モダンなAPI設計
短所: コミュニティが小さい新しいプラットフォーム、API統合が必要、長い動画ではコストがかさむ
最適な用途: より大規模なシステムの一部としてOCRが必要な動画検索または分析機能を構築する開発者
動画OCRが必要な人
動画OCRは、さまざまな業界や役割で実用的な問題を解決します。
人事・研修チーム
ソフトウェアチュートリアルのサイレントスクリーンレコーディングを、書面によるSOPに変換します。画面を録画し、動画OCRを実行するだけで、手動でのドキュメント作成なしに完全なステップバイステップガイドを入手できます。
学生・教育者
講義のプレゼンテーションスライドから、手作業でコピーすることなくすべてのテキストを抽出します。オンライン動画OCRを使用して、すべてのスライドコンテンツを数分でノートに取り込みます。
開発者・QAチーム
バグレポート動画からエラーメッセージ、ログ出力、UIテキストを抽出します。スクリーンレコーディングにOCRを実行して、手動で動画をスクラブする代わりに検索可能なテキストを入手します。
ScreenApp動画OCRを試す
動画を一時停止して画面上のテキストを手動で再入力することにうんざりしているなら、ScreenAppを試してみてください。無料プランでは、自分のファイルで動画OCRをテストできます。動画をアップロードし、OCRオプションを有効にするだけで、数分でフォーマットされたドキュメントを入手できます。動画に音声と視覚コンテンツの両方がある場合は、OCRと音声文字起こしを組み合わせることも、完全な書面記録のために動画からドキュメントへの変換を使用することもできます。
関連ガイド
- ScreenApp動画OCR機能、動画OCR機能の概要
- 動画からドキュメントへの変換、あらゆる動画をWord、PDF、PPTに変換
- 動画からテキストへの変換ツール、動画ファイルまたはURLからテキストを抽出
- 動画からPowerPointへ、動画コンテンツをスライドプレゼンテーションに変換
- AIで動画からSOPを作成、スクリーンレコーディングを標準作業手順書に変換
- 最高のAI字幕ジェネレーター、字幕の生成と抽出のためのツール
FAQ
スマートフォンで動画からテキストを抽出できますか?
はい、部分的に可能です。iOSにはLive Text、AndroidにはGoogle Lensがあります。どちらもカメラや写真からテキストを読み取ることができますが、動画ファイル全体を自動的に処理するものではありません。これらは単一の画像またはライブカメラフィードで動作します。動画OCR(動画ファイル内のすべてのフレーム)を完全に実行するには、ファイル全体を処理し、テキストを統合するScreenAppのようなツールが必要です。
Google OCRは無料ですか?
Google Lensは、写真やライブカメラでの個人利用は無料です。Google Cloud Vision APIは、開発者向けに月間1,000枚の無料画像分析を提供し、その後は1,000枚あたり1.50ドルを請求します。新規アカウントには300ドルの無料クレジットが付与されます。特に動画OCRの場合、Video Intelligence APIには別途分単位の料金設定があります。
ChatGPTは動画からテキストを抽出できますか?
自動的にはできません。ChatGPT(GPT-4o搭載)は個々の画像を分析し、そこからテキストを読み取ることはできますが、動画全体をアップロードしてすべてのフレームを処理させることはできません。各フレームを手動でスクリーンショットを撮り、画像を1つずつアップロードし、その後自分でテキストをまとめる必要があります。専用の動画OCRツールは、すべてのフレームを自動的に処理し、1つの統合されたドキュメントを生成するため、短い動画でも何時間もの手作業を省くことができます。
文字起こしと動画OCRの違いは何ですか?
音声文字起こしは、話された言葉(音声トラック)をテキストに変換します。動画OCRは、目に見えるテキスト(画面上のピクセル)を読み取り、それをテキストに変換します。誰かが話している場合は文字起こしを使用し、画面にテキスト(メニュー、コード、スライド、字幕など)が表示されている場合はOCRを使用します。ScreenAppは、両方を同じ動画で同時に実行してすべてをキャプチャできます。
動画OCRはハードコードされた字幕を抽出できますか?
はい。動画OCRは、焼き付けられた(ハードコードされた)字幕を、他の画面上のテキストと同じように読み取ります。AIは各フレームを処理し、字幕テキストを自動的に認識します。これは、字幕を翻訳したり、会話を検索したり、字幕が別の.srtファイルにない動画からコンテンツを再利用したりする場合に役立ちます。字幕に特化した抽出については、AI字幕ジェネレーターに関するガイドもご覧ください。
無料の動画OCRツールはありますか?
いくつかあります。Copyfishは、一時停止した動画フレームでOCRを実行する完全に無料のオープンソースブラウザ拡張機能です。Tesseract OCRは無料ですが、Pythonコーディングが必要です。ScreenAppには、1回の録画と2回の文字起こしをカバーする無料プランがあります。WindowsのMicrosoft PowerToys Text Extractorも、一時停止した動画を含む画面上のあらゆるものからテキストを抽出できます。
動画OCRで動作する動画形式は何ですか?
ほとんどの動画OCRツールは、MP4、MOV、AVI、WebM、MKVなどの一般的な形式に対応しています。ScreenAppはYouTubeリンクやGoogle Driveファイルも直接受け入れるため、最初に動画をダウンロードする必要はありません。Tesseractのような開発者ツールの場合、形式のサポートはフレーム抽出ライブラリに依存します(OpenCVはほぼすべての形式をサポートしています)。