何ができるか
音声ファイル(MP3、WAV、M4A、FLAC)をアップロードするか、ブラウザで録音を開始します。話者ラベル付け、要点の抽出、タイムスタンプが付与された構造化されたノートが得られます。これは生データの文字起こしではありません。
ブラウザで動作し、インストールは不要、通話にボットが参加することもありません。動画ファイルやYouTubeリンクの場合は、動画をノートに変換するツールを使用してください。
ノートの内容:
- 話者ラベル付きセクション(最大10人の音声)
- 生データの文字起こしではなく、要点とアクションアイテム
- 音声にリンクするタイムスタンプ
- 99言語、自動検出
単語誤り率は、クリアな音声で約2~3%、ノイズの多い複数話者録音で8~12%です(完全なベンチマーク)。60分の録音は数分で完了します。ファイルは暗号化され、モデルのトレーニングには決して使用されません(SOC 2 Type II)。
仕組み
- アップロードまたは録音: MP3、WAV、M4A、FLAC、OGG、またはブラウザで録音をタップします。
- AIが文字起こしとラベル付け: 話者ダイアリゼーションが自動的に実行されます。要点とアクションアイテムが抽出されます。
- 確認とエクスポート: PDF、Word、プレーンテキスト、またはMarkdown。タイムスタンプはクリック可能なままです。
長時間の録音でも文脈が維持されるため、2時間のインタビューでも誰が話しているのかが途切れることなく一貫性が保たれます。
会議プラットフォームごとの音声ノート設定
主要な各会議プラットフォームは、録音をわずかに異なる場所と形式で保存します。以下の手順は、2026年5月時点でのものです。
Zoom
通話終了後、Zoomは録音を数分間処理し、.m4a音声ファイル(および.mp4動画)をZoomクラウドまたはローカルのDocuments/Zoom/<meeting>/フォルダにドロップします。M4Aを直接アップロードしてください:「各参加者ごとに個別の音声ファイルを録音」が有効な状態でローカル録音する場合、Zoomは各参加者を独自のオーディオトラックに分離するため、Zoomの音声では話者ダイアリゼーションが最も効果的に機能します。出力は、参加者ごとのアクションアイテムを含む構造化されたノートです。
Google Meet
Google Meetの録音は、ホストのGoogleドライブにMP4として保存されます。音声は動画に多重化されているため、MP4を直接アップロードするか、まず音声抽出ツールを使用してください。無料のMeetティアにはクラウド録画が含まれないため、電話またはノートパソコンのマイクキャプチャが代替手段となります。出力は、録音内の特定の瞬間にリンクするタイムスタンプ付きのトピック別ノートです。
Microsoft Teams
Teamsの録音は、OneDrive(1対1通話)またはチャネルのSharePointサイト(チャネル会議)にMP4として保存されます。Teamsからのライブ文字起こしはVTTとしてダウンロードすることもでき、これを貼り付けることで再文字起こしをスキップして高速に処理できます。音声と一緒にVTT文字起こしが提供された場合、出力はTeamsの話者ラベルを尊重します。
対面での録音
電話の音声メモ(iPhoneはM4A、ほとんどのAndroidフォンはM4AまたはAACで録音)、USBラペルマイク、または専用のハンドヘルドレコーダーのすべてが機能します。ファイルをドロップしてください。複数人での対面録音の場合、360度マイク(Logitech BCC950やJabra Speakなど)を使用すると、各音声が異なる部屋の特性を持って届くため、ダイアリゼーションが著しく向上します。出力は、リモートプラットフォームで使用されるものと同じ構造化ノート形式です。
内蔵音声レコーダー
ブラウザレコーダーは、別のアプリなしで音声をキャプチャします。散歩中にスマートフォンで、講義中にノートパソコンで、またはポッドキャストのインタビュー用にデスクトップで録音ボタンを押してください。停止すると、AIが自動的に処理します。
- どのデバイスでもブラウザで録音
- 複数話者検出
- 検索可能なタイムスタンプ
- クラウド同期によるモバイル録音
- 背景ノイズと重なる発言を処理
32分間の音声録音からの実際のノートを見る
以下は、音声を入力とした場合のScreenAppのノートがどのように見えるかを示す実際の例です。ソースは32分間のポッドキャスト録音でした。ノート作成ツールは9つの異なるトピックを検出し、それぞれを2〜3の箇条書きの要点に分解し、賢いアシスタントが書いたような3ページのドキュメントを作成しました。文字起こしの壁もなく、重要な瞬間を探すために15ページもの逐語的テキストを読み込む必要もありません。
ノートは、ノート作成者が実際に使用する宛先へエクスポートされます。NotionやObsidian用のMarkdown、SlackやHubSpot用のプレーンテキスト、ワークフローがOfficeを経由する場合はWord用のDOCX、またはアーカイブ用のPDFです。音声メモ、会議録音、講義音声、ポッドキャストファイルはすべてこの形式でノートを生成します。
音声からノート作成 vs 他のアプリ
- Otter.ai はより大きな無料プランを提供しますが、会議にボットが必要で、無料ファイルインポートは生涯3回に制限されます。
- NoteGPT は生の書き起こしを提供し、トピックのグループ化や抽出されたアクションアイテムはありません。
- meetergo はデスクトップへのインストールが必要で、無料プランは最も小さいです。
誰が使うのか
学生 は携帯電話で講義を録音し、授業後にトピック別・タイムスタンプ付きの学習準備完了ノートを入手します。
ビジネスプロフェッショナル は録音された通話やボイスメモをアップロードします。ライブのZoom、Teams、Meet通話では、ボット不要のAI会議議事録作成ツールをご利用ください。
研究者 はインタビューの録音をこれに通します。話者ラベルと引用可能なタイムスタンプにより、引用の検索が高速になります。
コンテンツクリエーターやポッドキャスター はエピソードを番組ノート、ブログ記事、引用文に再利用します。ボイスメモやフィールドレコーディングにも適しています。完全なノートではなく要約のみが必要な場合は、音声要約ツールはトリミングされたエピソードダイジェスト用の単体要約ツールであり、音声要約APIはバックカタログ全体でのプログラムによる要約を処理します。
ジャーナリスト はインタビューや記者会見を記録し、キーワードで録音を検索します。
発言が重なる録音からのノート
どんなノート作成ツールにとっても最も難しい音声は、人々がお互いの発言に割り込むような通話であり、期待値を設定しておく価値があります。2つの声が重なると、トランスクリプトは優勢な声を捉え、もう一方をぼかすため、白熱したグループディスカッションからのノートは、一人ずつ話す会議からのノートよりも信頼性が低くなります。これはオーディオの限界であり、モデルの限界ではありません。真の同時発話をきれいに分離できるツールはありません。
役立つのは話者ラベルです。これには、各人が少なくとも一度は単独で何かを発言し、システムが音声フィンガープリントを関連付けられるようにする必要があります。最初に全員が名前を言う一巡は、録音全体にわたって効果を発揮します。パネルディスカッションや討論の場合、いくつかの発言の帰属を手動で修正することを覚悟してください。人々が順番に話す通常の会議では、ほとんどの場合、ラベルは正しく付与されます。


