작동 방식
오디오 파일(MP3, WAV, M4A, FLAC)을 업로드하거나 브라우저에서 녹음을 시작하세요. 화자 식별, 핵심 요점 추출, 전체 타임스탬프가 포함된 구조화된 노트를 받을 수 있습니다. 원시 스크립트가 아닙니다.
ChatGPT는 오디오를 지원하지 않습니다. Gemini는 최대 100MB의 오디오 업로드를 허용하지만 화자를 식별하지 못하며 30분 이상인 파일은 분할해야 합니다. 이 도구는 한 번에 전사, 화자 분리 및 노트 정리를 수행합니다.
브라우저에서 실행되며, 설치할 필요 없고 통화에 봇이 참여하지 않습니다. 동영상 파일이나 YouTube 링크의 경우 동영상을 노트로 변환하는 도구를 사용하세요.
노트 내용:
- 화자 식별 섹션 (최대 10명)
- 핵심 요점 및 실행 항목 (원시 스크립트 아님)
- 오디오로 연결되는 타임스탬프
- 99개 언어, 자동 감지
단어 오류율은 깨끗한 오디오에서 약 2-3%, 시끄러운 다중 화자 녹음에서 8-12%입니다 (전체 벤치마크). 60분 녹음은 몇 분 안에 완료됩니다. 파일은 암호화되며 모델 학습에 사용되지 않습니다 (SOC 2 Type II).
작동 방식
- 업로드 또는 녹음: MP3, WAV, M4A, FLAC, OGG 파일을 업로드하거나 브라우저에서 녹음 버튼을 누르세요.
- AI 전사 및 라벨링: 화자 분리가 자동으로 실행됩니다. 핵심 요점과 실행 항목이 추출됩니다.
- 검토 및 내보내기: PDF, Word, 일반 텍스트 또는 Markdown 형식으로 내보낼 수 있습니다. 타임스탬프는 계속 클릭 가능합니다.
긴 녹음에서도 맥락이 유지되므로, 2시간짜리 인터뷰에서도 누가 말하는지 놓치지 않고 일관성을 유지합니다.
회의 플랫폼별 오디오 노트 설정
각 주요 회의 플랫폼은 녹음 파일을 약간 다른 위치와 형식으로 저장합니다. 아래 안내는 2026년 5월 기준으로 작동하는 내용입니다.
Zoom
통화가 끝나면 Zoom은 몇 분 동안 녹음을 처리한 다음 .m4a 오디오 파일(및 .mp4 비디오)을 Zoom 클라우드 또는 로컬 Documents/Zoom/<meeting>/ 폴더에 저장합니다. M4A를 직접 업로드하세요. Zoom 오디오에서 화자 분리 기능이 가장 잘 작동하는 이유는 Zoom이 “참가자별로 별도의 오디오 파일 녹음” 옵션을 활성화하여 로컬에서 녹음할 때 각 참가자를 고유한 오디오 트랙으로 분리하기 때문입니다. 결과물은 참가자별 실행 항목이 포함된 구조화된 노트입니다.
Google Meet
Google Meet 녹음 파일은 호스트의 Google Drive에 MP4 형식으로 저장됩니다. 오디오는 비디오에 다중화되어 있으므로 MP4를 직접 업로드하거나 먼저 오디오 추출기를 사용하세요. 무료 Meet 등급에는 클라우드 녹음 기능이 포함되어 있지 않으므로 전화 또는 노트북 마이크 녹음이 대안입니다. 결과물은 녹음의 특정 시점으로 연결되는 타임스탬프가 포함된 주제별 그룹화된 노트입니다.
Microsoft Teams
Teams 녹음 파일은 OneDrive(1:1 통화) 또는 채널 SharePoint 사이트(채널 회의)에 MP4 형식으로 저장됩니다. Teams의 실시간 스크립트는 VTT로 다운로드할 수도 있으며, 이를 붙여넣어 재전사를 건너뛰고 더 빠르게 처리할 수 있습니다. 오디오와 함께 VTT 스크립트가 제공될 경우, 결과물은 Teams 화자 라벨을 존중합니다.
대면 녹음
전화 음성 메모(iPhone은 M4A, 대부분의 Android 전화는 M4A 또는 AAC로 녹음), USB 라펠 마이크 또는 전용 휴대용 녹음기 모두 작동합니다. 파일을 드롭하기만 하면 됩니다. 여러 사람이 참여하는 대면 녹음의 경우, 360도 마이크(Logitech BCC950 또는 Jabra Speak 등)는 각 음성이 다른 공간 특성을 가지고 도달하기 때문에 화자 분리 성능을 현저히 향상시킵니다. 결과물은 원격 플랫폼에서 사용되는 것과 동일한 구조화된 노트 형식입니다.
내장 음성 녹음기
브라우저 녹음기는 별도의 앱 없이 오디오를 캡처합니다. 산책 중 휴대폰으로, 강의 중 노트북으로, 팟캐스트 인터뷰 중 데스크탑으로 녹음 버튼을 누르세요. 중지하면 AI가 자동으로 처리합니다.
- 모든 장치에서 브라우저 내 녹음
- 다중 화자 감지
- 검색 가능한 타임스탬프
- 클라우드 동기화를 통한 모바일 녹음
- 배경 소음 및 겹치는 말 처리
32분 오디오 녹음의 실제 노트 보기
아래는 오디오를 입력했을 때 ScreenApp의 노트가 어떻게 보이는지 보여주는 실제 예시입니다. 원본은 32분짜리 팟캐스트 녹음이었습니다. 노트 생성기는 9가지의 뚜렷한 주제를 감지하고, 각 주제를 2-3개의 핵심 요점으로 나누어 스마트 비서가 작성한 것과 같은 3페이지 분량의 문서를 생성했습니다. 스크립트 장벽도 없고, 중요한 순간을 찾기 위해 15페이지에 달하는 원문 텍스트를 뒤질 필요도 없습니다.
노트는 노트 작성자가 실제로 사용하는 대상으로 내보낼 수 있습니다. Notion 또는 Obsidian용 Markdown, Slack 또는 HubSpot용 일반 텍스트, 워크플로가 Office를 통해 실행되는 경우 Word용 DOCX, 또는 보관용 PDF입니다. 음성 메모, 회의 녹음, 강의 오디오 및 팟캐스트 파일은 모두 이 형식의 노트를 생성합니다.
오디오를 노트로 vs 다른 앱
| 기능 | ScreenApp | Otter.ai | NoteGPT | meetergo |
|---|---|---|---|---|
| 무료 티어 | 300분/월 | 무료 AI 작업 15회/월 | 150분/월 | |
| 유료 (연간) | 맞춤 | $8.33/월 | $9/월 | $11/월 |
| 최대 길이 (무료) | 무제한 | 세션당 30분 | 무제한 | 무제한 |
| 파일 가져오기 (무료) | 무제한 | 평생 3회 | 무제한 | 무제한 |
| 다운로드 없음 | 예 | 아니오 | 예 | 아니오 |
| 미팅 봇 없음 | 예 | 아니오 | 예 | 예 |
| 구조화된 노트 | 예 | 제한적 | 아니오 | 아니오 |
| 화자 식별 | 예 | 예 (기본) | 예 (기본) | 예 (기본) |
| 브라우저 녹음기 | 예 | 예 | 아니오 | 아니오 |
| 99개 언어 | 예 | 예 | 예 | 제한적 |
- Otter.ai는 더 큰 무료 티어를 제공하지만 회의에 봇이 필요하며 무료 파일 가져오기는 평생 3회로 제한됩니다.
- NoteGPT는 원본 전사본을 제공하며, 주제별 그룹화나 추출된 실행 항목은 없습니다.
- meetergo는 데스크톱 설치가 필요하며 가장 작은 무료 티어를 제공합니다.
누가 사용하나요
학생들은 휴대폰으로 강의를 녹음하고 수업 후 주제별로 타임스탬프와 함께 학습 준비가 된 노트를 받습니다.
비즈니스 전문가는 녹음된 통화 및 음성 메모를 업로드합니다. 라이브 Zoom, Teams 또는 Meet 통화의 경우 AI 회의 노트 작성기를 사용하며 봇은 필요하지 않습니다.
연구원은 인터뷰 녹음 파일을 통해 이를 실행합니다. 화자 레이블과 인용 가능한 타임스탬프는 인용문 검색을 빠르게 합니다.
콘텐츠 제작자 및 팟캐스터는 에피소드를 쇼 노트, 블로그 게시물, 인용문으로 재활용합니다. 음성 메모 및 현장 녹음에도 적합합니다. 전체 노트가 아닌 요약만 필요한 경우, 오디오 요약 도구는 잘라낸 에피소드 요약을 위한 독립형 요약 도구이며, 오디오 요약 API는 이전 카탈로그 전반의 프로그래밍 방식 요약을 처리합니다.
언론인은 인터뷰 및 기자 회견을 기록한 다음 키워드로 녹음 파일을 검색합니다.
화자 중복이 있는 녹음 파일에서 노트 작성
어떤 노트 작성기에게도 가장 어려운 오디오는 사람들이 서로 말을 겹쳐 하는 통화이며, 기대치를 설정할 가치가 있습니다. 두 목소리가 겹칠 때, 전사본은 지배적인 목소리를 잡고 다른 목소리는 흐리게 처리하므로, 격렬한 그룹 토론에서 나온 노트는 한 번에 한 명씩 진행되는 회의에서 나온 노트보다 신뢰성이 떨어집니다. 이는 모델의 한계가 아니라 오디오의 한계이며, 어떤 도구도 진정한 교차 대화를 깨끗하게 분리하지 못합니다.
도움이 되는 것은 화자 레이블인데, 시스템이 부착할 음성 지문을 가질 수 있도록 각 사람이 적어도 한 번은 혼자서 무언가를 말해야 합니다. 시작할 때 이름을 한 번씩 말하는 것이 전체 녹음 파일에 걸쳐 효과가 있습니다. 패널이나 토론의 경우, 몇 가지 귀속을 수동으로 수정해야 할 것으로 예상되지만, 사람들이 차례로 말하는 일반적인 회의의 경우, 레이블은 대부분 올바르게 지정됩니다.
자주 묻는 질문
무료인가요?
네. 무료 계정은 전체 기능 세트를 이용할 수 있습니다: 화자 레이블, 구조화된 노트, 타임스탬프, 내보내기.
어떤 파일 형식이 지원되나요?
MP3, WAV, M4A, FLAC, OGG, AAC 및 대부분의 일반적인 오디오 형식. 비디오 파일에서 오디오를 추출하거나 비디오-노트 변환기를 직접 사용할 수도 있습니다.
얼마나 정확한가요?
깨끗한 녹음에서는 약 2-3%의 단어 오류율을 보이며, 노이즈가 많고 다중 화자 오디오에서는 약 8-12%로 증가합니다. 화자 분리 기술은 여러 목소리, 악센트, 전문 용어를 처리하며, 낮은 신뢰도 구간은 플래그가 지정됩니다. 언어별 및 조건별 전체 벤치마크는 정확도 페이지에서 확인할 수 있습니다.
얼마나 걸리나요?
60분 녹음 파일의 경우 몇 분. 더 선명한 오디오는 더 빨리 완료됩니다.
다른 화자를 식별하나요?
네. 최대 10명의 다른 화자를 자동으로 레이블링하여 인터뷰, 팟캐스트, 다자 회의에 유용합니다.
ChatGPT 또는 Gemini도 이걸 할 수 있나요?
ChatGPT는 오디오 파일을 받지 않습니다. Gemini는 최대 100MB까지 업로드할 수 있지만 화자를 식별하지 않으며 30분 이상의 녹음 파일은 분할해야 합니다. 둘 다 구조화된 노트를 생성하지 않고 원본 전사본만 제공합니다. 이 도구는 이 모든 것을 한 번에 처리합니다.
어떤 언어를 지원하나요?
스페인어, 프랑스어, 독일어, 중국어, 일본어, 포르투갈어, 아랍어를 포함한 99개 언어. 언어는 자동 감지되거나 수동으로 설정할 수 있습니다.
안전한가요?
AES-256 암호화를 사용하며 SOC 2 Type II를 준수합니다. 파일은 AI 모델 학습에 사용되지 않습니다. 30일 후 자동 삭제되거나 언제든지 수동으로 삭제할 수 있습니다. 회의 봇은 없으며, 업로드할 항목을 직접 선택합니다.
노트를 내보낼 수 있나요?
PDF, Word, 일반 텍스트 또는 마크다운. 클립보드 복사도 가능합니다. 타임스탬프는 링크를 지원하는 형식에서 클릭 가능하게 유지됩니다.
팟캐스트와도 작동하나요?
네. 팟캐스트 오디오 파일을 업로드하거나 다운로드한 경우 URL을 붙여넣을 수 있습니다. 화자 레이블은 호스트/게스트 추적을 자동으로 수행합니다.
음성 메모를 녹음하고 변환할 수 있나요?
네. 휴대폰에서 음성 메모 파일을 업로드하거나, 브라우저 내 녹음기를 사용하여 음성 메모를 직접 캡처할 수 있습니다. 어떤 방법이든 구조화된 노트를 받을 수 있습니다.
이것은 오디오 기반 AI 노트 작성기인가요?
네. 오디오 파일을 주거나 브라우저에서 직접 녹음하면, 오디오에서 주요 요점, 실행 항목 및 요약과 같은 구조화된 노트를 작성합니다. 이것은 단순히 입력된 텍스트가 아닌 소리, 회의 녹음, 음성 메모, 강의를 위해 만들어진 AI 노트 작성기입니다.