何ができるか
音声ファイル(MP3、WAV、M4A、FLAC)をアップロードするか、ブラウザで録音を開始します。話者ラベル付け、要点の抽出、タイムスタンプが付与された構造化されたノートが得られます。これは生データの文字起こしではありません。
ChatGPTは音声を処理できません。Geminiは最大100MBの音声アップロードを受け付けますが、話者を識別せず、30分を超える場合は分割を強制します。このツールは、文字起こし、話者ダイアリゼーション、ノート整理を一度に行います。
ブラウザで動作し、インストールは不要、通話にボットが参加することもありません。動画ファイルやYouTubeリンクの場合は、動画をノートに変換するツールを使用してください。
ノートの内容:
- 話者ラベル付きセクション(最大10人の音声)
- 生データの文字起こしではなく、要点とアクションアイテム
- 音声にリンクするタイムスタンプ
- 99言語、自動検出
単語誤り率は、クリアな音声で約2~3%、ノイズの多い複数話者録音で8~12%です(完全なベンチマーク)。60分の録音は数分で完了します。ファイルは暗号化され、モデルのトレーニングには決して使用されません(SOC 2 Type II)。
仕組み
- アップロードまたは録音: MP3、WAV、M4A、FLAC、OGG、またはブラウザで録音をタップします。
- AIが文字起こしとラベル付け: 話者ダイアリゼーションが自動的に実行されます。要点とアクションアイテムが抽出されます。
- 確認とエクスポート: PDF、Word、プレーンテキスト、またはMarkdown。タイムスタンプはクリック可能なままです。
長時間の録音でも文脈が維持されるため、2時間のインタビューでも誰が話しているのかが途切れることなく一貫性が保たれます。
会議プラットフォームごとの音声ノート設定
主要な各会議プラットフォームは、録音をわずかに異なる場所と形式で保存します。以下の手順は、2026年5月時点でのものです。
Zoom
通話終了後、Zoomは録音を数分間処理し、.m4a音声ファイル(および.mp4動画)をZoomクラウドまたはローカルのDocuments/Zoom/<meeting>/フォルダにドロップします。M4Aを直接アップロードしてください:「各参加者ごとに個別の音声ファイルを録音」が有効な状態でローカル録音する場合、Zoomは各参加者を独自のオーディオトラックに分離するため、Zoomの音声では話者ダイアリゼーションが最も効果的に機能します。出力は、参加者ごとのアクションアイテムを含む構造化されたノートです。
Google Meet
Google Meetの録音は、ホストのGoogleドライブにMP4として保存されます。音声は動画に多重化されているため、MP4を直接アップロードするか、まず音声抽出ツールを使用してください。無料のMeetティアにはクラウド録画が含まれないため、電話またはノートパソコンのマイクキャプチャが代替手段となります。出力は、録音内の特定の瞬間にリンクするタイムスタンプ付きのトピック別ノートです。
Microsoft Teams
Teamsの録音は、OneDrive(1対1通話)またはチャネルのSharePointサイト(チャネル会議)にMP4として保存されます。Teamsからのライブ文字起こしはVTTとしてダウンロードすることもでき、これを貼り付けることで再文字起こしをスキップして高速に処理できます。音声と一緒にVTT文字起こしが提供された場合、出力はTeamsの話者ラベルを尊重します。
対面での録音
電話の音声メモ(iPhoneはM4A、ほとんどのAndroidフォンはM4AまたはAACで録音)、USBラペルマイク、または専用のハンドヘルドレコーダーのすべてが機能します。ファイルをドロップしてください。複数人での対面録音の場合、360度マイク(Logitech BCC950やJabra Speakなど)を使用すると、各音声が異なる部屋の特性を持って届くため、ダイアリゼーションが著しく向上します。出力は、リモートプラットフォームで使用されるものと同じ構造化ノート形式です。
内蔵音声レコーダー
ブラウザレコーダーは、別のアプリなしで音声をキャプチャします。散歩中にスマートフォンで、講義中にノートパソコンで、またはポッドキャストのインタビュー用にデスクトップで録音ボタンを押してください。停止すると、AIが自動的に処理します。
- どのデバイスでもブラウザで録音
- 複数話者検出
- 検索可能なタイムスタンプ
- クラウド同期によるモバイル録音
- 背景ノイズと重なる発言を処理
32分間の音声録音からの実際のノートを見る
以下は、音声を入力とした場合のScreenAppのノートがどのように見えるかを示す実際の例です。ソースは32分間のポッドキャスト録音でした。ノート作成ツールは9つの異なるトピックを検出し、それぞれを2〜3の箇条書きの要点に分解し、賢いアシスタントが書いたような3ページのドキュメントを作成しました。文字起こしの壁もなく、重要な瞬間を探すために15ページもの逐語的テキストを読み込む必要もありません。
ノートは、ノート作成者が実際に使用する宛先へエクスポートされます。NotionやObsidian用のMarkdown、SlackやHubSpot用のプレーンテキスト、ワークフローがOfficeを経由する場合はWord用のDOCX、またはアーカイブ用のPDFです。音声メモ、会議録音、講義音声、ポッドキャストファイルはすべてこの形式でノートを生成します。
音声からノート作成 vs 他のアプリ
| 機能 | ScreenApp | Otter.ai | NoteGPT | meetergo |
|---|---|---|---|---|
| 無料プラン | 300分/月 | AIアクション15回/月 無料 | 150分/月 | |
| 有料 (年間) | カスタム | $8.33/月 | $9/月 | $11/月 |
| 最大長さ (無料) | 無制限 | 30分/セッション | 無制限 | 無制限 |
| ファイルインポート (無料) | 無制限 | 生涯3回 | 無制限 | 無制限 |
| ダウンロード不要 | はい | いいえ | はい | いいえ |
| 会議ボット不要 | はい | いいえ | はい | はい |
| 構造化されたノート | はい | 限定的 | いいえ | いいえ |
| 話者識別 | はい | はい (基本) | はい (基本) | はい (基本) |
| ブラウザレコーダー | はい | はい | いいえ | いいえ |
| 99言語 | はい | はい | はい | 限定的 |
- Otter.ai はより大きな無料プランを提供しますが、会議にボットが必要で、無料ファイルインポートは生涯3回に制限されます。
- NoteGPT は生の書き起こしを提供し、トピックのグループ化や抽出されたアクションアイテムはありません。
- meetergo はデスクトップへのインストールが必要で、無料プランは最も小さいです。
誰が使うのか
学生 は携帯電話で講義を録音し、授業後にトピック別・タイムスタンプ付きの学習準備完了ノートを入手します。
ビジネスプロフェッショナル は録音された通話やボイスメモをアップロードします。ライブのZoom、Teams、Meet通話では、ボット不要のAI会議議事録作成ツールをご利用ください。
研究者 はインタビューの録音をこれに通します。話者ラベルと引用可能なタイムスタンプにより、引用の検索が高速になります。
コンテンツクリエーターやポッドキャスター はエピソードを番組ノート、ブログ記事、引用文に再利用します。ボイスメモやフィールドレコーディングにも適しています。完全なノートではなく要約のみが必要な場合は、音声要約ツールはトリミングされたエピソードダイジェスト用の単体要約ツールであり、音声要約APIはバックカタログ全体でのプログラムによる要約を処理します。
ジャーナリスト はインタビューや記者会見を記録し、キーワードで録音を検索します。
発言が重なる録音からのノート
どんなノート作成ツールにとっても最も難しい音声は、人々がお互いの発言に割り込むような通話であり、期待値を設定しておく価値があります。2つの声が重なると、トランスクリプトは優勢な声を捉え、もう一方をぼかすため、白熱したグループディスカッションからのノートは、一人ずつ話す会議からのノートよりも信頼性が低くなります。これはオーディオの限界であり、モデルの限界ではありません。真の同時発話をきれいに分離できるツールはありません。
役立つのは話者ラベルです。これには、各人が少なくとも一度は単独で何かを発言し、システムが音声フィンガープリントを関連付けられるようにする必要があります。最初に全員が名前を言う一巡は、録音全体にわたって効果を発揮します。パネルディスカッションや討論の場合、いくつかの発言の帰属を手動で修正することを覚悟してください。人々が順番に話す通常の会議では、ほとんどの場合、ラベルは正しく付与されます。
FAQ
無料ですか?
はい。無料アカウントでも全機能が利用できます:話者ラベル、構造化ノート、タイムスタンプ、エクスポート。
どのようなファイル形式に対応していますか?
MP3、WAV、M4A、FLAC、OGG、AAC、その他ほとんどの一般的なオーディオ形式に対応しています。ビデオファイルからオーディオを抽出したり、ビデオからノート作成コンバーターを直接使用することもできます。
どのくらい正確ですか?
クリアな録音では約2〜3%の単語誤り率ですが、ノイズの多い複数話者のオーディオでは約8〜12%に上昇します。話者ダイアライゼーションは複数の声、アクセント、専門用語に対応し、信頼度の低いセクションにはフラグが立てられます。言語別および条件別の詳細なベンチマークは、精度ページで確認できます。
どれくらい時間がかかりますか?
60分の録音で数分です。クリアな音声ほど速く処理が終わります。
異なる話者を識別しますか?
はい。最大10人の異なる話者を自動的にラベル付けし、インタビュー、ポッドキャスト、複数人での会議に役立ちます。
ChatGPTやGeminiでもできますか?
ChatGPTは音声ファイルを受け付けません。Geminiは最大100MBのアップロードに対応していますが、話者を識別せず、30分を超える録音は分割する必要があります。どちらも生のトランスクリプトのみを生成し、構造化されたノートは生成しません。このツールはこれらすべてを1ステップで処理します。
どのような言語に対応していますか?
スペイン語、フランス語、ドイツ語、北京語、日本語、ポルトガル語、アラビア語を含む99言語に対応しています。言語は自動検出されるか、手動で設定することもできます。
安全ですか?
SOC 2 Type II準拠で、AES-256暗号化が施されています。ファイルはAIモデルのトレーニングには決して使用されません。30日後に自動削除されるか、いつでも手動で削除できます。会議ボットはなく、何をアップロードするかはユーザーが選択します。
ノートをエクスポートできますか?
PDF、Word、プレーンテキスト、またはMarkdown形式でエクスポートできます。クリップボードへのコピーも可能です。リンクをサポートする形式では、タイムスタンプはクリック可能なままです。
ポッドキャストで使えますか?
はい。ダウンロードしたポッドキャストの音声ファイルをアップロードするか、URLを貼り付けてください。話者ラベルにより、ホスト/ゲストの追跡が自動化されます。
ボイスメモを録音して変換できますか?
はい。携帯電話からボイスメモファイルをアップロードするか、ブラウザ内レコーダーを使用して直接ボイスメモをキャプチャできます。どちらの方法でも、構造化されたノートが返されます。
これは音声からのAIノート作成ツールですか?
はい。音声ファイルを与えるか、ブラウザで直接録音するだけで、音声から構造化されたノート(主要なポイント、アクションアイテム、要約)を作成します。これは、会議の録音、ボイスメモ、講義など、音声のために構築されたAIノート作成ツールであり、単なるテキスト入力用ではありません。