Cosa fa
Carica un file audio (MP3, WAV, M4A, FLAC) o avvia la registrazione nel browser. Otterrai note strutturate: relatori etichettati, punti chiave estratti, timestamp ovunque. Non una trascrizione grezza.
Funziona nel browser, niente da installare, nessun bot che si unisce a una chiamata. Per i file video o i link di YouTube, usa il convertitore video in note.
Cosa c’è nelle note:
- Sezioni etichettate per relatore (fino a 10 voci)
- Punti chiave e azioni da intraprendere, non una trascrizione grezza
- Timestamp che rimandano all’audio
- 99 lingue, rilevate automaticamente
Il tasso di errore delle parole è di circa il 2-3% su audio pulito e dell’8-12% su registrazioni rumorose e con più relatori (benchmark completi). Una registrazione di 60 minuti termina in pochi minuti. I file sono crittografati e mai usati per addestrare modelli (SOC 2 Tipo II).
Come funziona
- Carica o registra: MP3, WAV, M4A, FLAC, OGG, o tocca registra nel browser.
- L’AI trascrive ed etichetta: La diarizzazione dei relatori viene eseguita automaticamente. Vengono estratti punti chiave e azioni da intraprendere.
- Rivedi ed esporta: PDF, Word, testo semplice o Markdown. I timestamp rimangono cliccabili.
Il contesto viene mantenuto anche in registrazioni lunghe, quindi un’intervista di 2 ore rimane coerente invece di perdere il filo di chi sta parlando.
Configurazione delle note audio per piattaforma di riunione
Ogni principale piattaforma di riunione memorizza le registrazioni in un luogo e formato leggermente diversi. La procedura descritta di seguito è quella che funziona a maggio 2026.
Zoom
Dopo la fine della chiamata, Zoom elabora la registrazione per alcuni minuti, quindi rilascia un file audio .m4a (più il video .mp4) nel tuo cloud Zoom o nella cartella locale Documents/Zoom/<meeting>/. Carica direttamente l’M4A: la diarizzazione dei relatori funziona meglio sull’audio di Zoom perché Zoom separa ogni partecipante nella propria traccia audio quando si registra localmente con l’opzione “Registra un file audio separato per ogni partecipante” abilitata. L’output sono note strutturate con elementi d’azione per partecipante.
Google Meet
Le registrazioni di Google Meet vengono salvate sul Google Drive dell’host come MP4. L’audio è multiplexato nel video, quindi o carichi direttamente l’MP4 o usi prima l’estrattore audio. Il livello gratuito di Meet non include la registrazione su cloud, quindi l’acquisizione tramite microfono del telefono o del laptop è l’alternativa. L’output è una nota raggruppata per argomento con timestamp che rimandano al momento nella registrazione.
Microsoft Teams
Le registrazioni di Teams finiscono in OneDrive (chiamate 1:1) o nel sito SharePoint del canale (riunioni di canale) come MP4. Le trascrizioni in tempo reale di Teams possono anche essere scaricate come VTT, che puoi incollare per un passaggio più veloce che salta la ritrascrizione. L’output rispetta le etichette dei relatori di Teams quando una trascrizione VTT viene fornita insieme all’audio.
Registrazione di persona
Memo vocali del telefono (iPhone registra M4A, la maggior parte dei telefoni Android registra M4A o AAC), microfoni lavalier USB o un registratore portatile dedicato funzionano tutti. Carica il file. Per registrazioni di persona con più persone, un microfono a 360 gradi (come il Logitech BCC950 o un Jabra Speak) migliora notevolmente la diarizzazione perché ogni voce arriva con una diversa “firma” della stanza. L’output è lo stesso formato di note strutturate utilizzato per le piattaforme remote.
Registratore vocale integrato
Il registratore del browser acquisisce l’audio senza un’app separata. Premi registra sul tuo telefono durante una passeggiata, su un laptop durante una lezione o su un desktop per un’intervista podcast. Quando smetti, l’AI lo elabora automaticamente.
- Registra nel browser su qualsiasi dispositivo
- Rilevamento di più relatori
- Timestamp ricercabili
- Registrazione mobile con sincronizzazione cloud
- Gestisce il rumore di fondo e il parlato sovrapposto
Guarda note reali da una registrazione audio di 32 minuti
Di seguito è riportato un esempio reale di come appaiono le note di ScreenApp quando l’input è audio. La fonte era una registrazione podcast di 32 minuti. Il sistema di presa appunti ha rilevato nove argomenti distinti, ha suddiviso ciascuno in 2-3 punti chiave con elenco puntato e ha prodotto un documento di 3 pagine che si legge come note che scriverebbe un assistente intelligente. Nessun muro di trascrizioni, nessuna necessità di cercare tra 15 pagine di testo verbatim per i momenti che contano.
Le note vengono esportate nelle destinazioni che gli utenti di note effettivamente utilizzano: Markdown per Notion o Obsidian, testo semplice per Slack o HubSpot, DOCX per Word se il tuo flusso di lavoro passa per Office, o PDF per l’archiviazione. Memo vocali, registrazioni di conferenze, audio di lezioni e file podcast producono tutti note in questo formato.
Audio a note vs altre app
- Otter.ai ha un livello gratuito più grande ma richiede un bot nelle tue riunioni e limita le importazioni gratuite di file a 3 a vita.
- NoteGPT fornisce trascrizioni grezze - nessuna raggruppamento per argomento o elementi d’azione estratti.
- meetergo richiede un’installazione desktop e ha il livello gratuito più piccolo.
Chi lo usa
Gli studenti registrano le lezioni sul telefono e ottengono appunti pronti per lo studio dopo la lezione, raggruppati per argomento con timestamp.
I professionisti aziendali caricano chiamate registrate e memo vocali. Per chiamate Zoom, Teams o Meet in diretta, usa il prendi appunti AI per riunioni, nessun bot richiesto.
I ricercatori elaborano registrazioni di interviste. Le etichette dei relatori e i timestamp citabili rendono il recupero delle citazioni veloce.
I creatori di contenuti e i podcaster riutilizzano gli episodi in note dello show, post di blog e citazioni. Ottimo anche per memo vocali e registrazioni sul campo. Se hai bisogno solo di un riepilogo e non di note complete, il riepilogatore audio è il riepilogatore autonomo per digest di episodi ridotti, e l’API di riepilogo audio AI gestisce la riepilogazione programmatica attraverso un catalogo arretrato.
I giornalisti documentano interviste e conferenze stampa, quindi cercano tra le registrazioni per parola chiave.
Note da una registrazione con relatori sovrapposti
L’audio più difficile per qualsiasi prendi appunti è una chiamata in cui le persone parlano l’una sull’altra, ed è opportuno fissare le aspettative. Quando due voci si sovrappongono, la trascrizione cattura quella dominante e sfuma l’altra, quindi le note di una discussione di gruppo accesa sono meno affidabili delle note di una riunione uno-alla-volta. Questo è un limite dell’audio, non del modello, nessuno strumento separa chiaramente il vero parlato incrociato.
Ciò che aiuta sono le etichette dei relatori, che richiedono che ogni persona abbia detto qualcosa da sola almeno una volta affinché il sistema abbia un’impronta vocale da associare. Un giro di nomi all’inizio ripaga per l’intera registrazione. Per un panel o un dibattito, aspettati di correggere alcune attribuzioni a mano; per una riunione normale in cui le persone si alternano, le etichette sono corrette la maggior parte del tempo.


