작동 방식
오디오 파일(MP3, WAV, M4A, FLAC)을 업로드하거나 브라우저에서 녹음을 시작하세요. 화자 식별, 핵심 요점 추출, 전체 타임스탬프가 포함된 구조화된 노트를 받을 수 있습니다. 원시 스크립트가 아닙니다.
브라우저에서 실행되며, 설치할 필요 없고 통화에 봇이 참여하지 않습니다. 동영상 파일이나 YouTube 링크의 경우 동영상을 노트로 변환하는 도구를 사용하세요.
노트 내용:
- 화자 식별 섹션 (최대 10명)
- 핵심 요점 및 실행 항목 (원시 스크립트 아님)
- 오디오로 연결되는 타임스탬프
- 99개 언어, 자동 감지
단어 오류율은 깨끗한 오디오에서 약 2-3%, 시끄러운 다중 화자 녹음에서 8-12%입니다 (전체 벤치마크). 60분 녹음은 몇 분 안에 완료됩니다. 파일은 암호화되며 모델 학습에 사용되지 않습니다 (SOC 2 Type II).
작동 방식
- 업로드 또는 녹음: MP3, WAV, M4A, FLAC, OGG 파일을 업로드하거나 브라우저에서 녹음 버튼을 누르세요.
- AI 전사 및 라벨링: 화자 분리가 자동으로 실행됩니다. 핵심 요점과 실행 항목이 추출됩니다.
- 검토 및 내보내기: PDF, Word, 일반 텍스트 또는 Markdown 형식으로 내보낼 수 있습니다. 타임스탬프는 계속 클릭 가능합니다.
긴 녹음에서도 맥락이 유지되므로, 2시간짜리 인터뷰에서도 누가 말하는지 놓치지 않고 일관성을 유지합니다.
회의 플랫폼별 오디오 노트 설정
각 주요 회의 플랫폼은 녹음 파일을 약간 다른 위치와 형식으로 저장합니다. 아래 안내는 2026년 5월 기준으로 작동하는 내용입니다.
Zoom
통화가 끝나면 Zoom은 몇 분 동안 녹음을 처리한 다음 .m4a 오디오 파일(및 .mp4 비디오)을 Zoom 클라우드 또는 로컬 Documents/Zoom/<meeting>/ 폴더에 저장합니다. M4A를 직접 업로드하세요. Zoom 오디오에서 화자 분리 기능이 가장 잘 작동하는 이유는 Zoom이 “참가자별로 별도의 오디오 파일 녹음” 옵션을 활성화하여 로컬에서 녹음할 때 각 참가자를 고유한 오디오 트랙으로 분리하기 때문입니다. 결과물은 참가자별 실행 항목이 포함된 구조화된 노트입니다.
Google Meet
Google Meet 녹음 파일은 호스트의 Google Drive에 MP4 형식으로 저장됩니다. 오디오는 비디오에 다중화되어 있으므로 MP4를 직접 업로드하거나 먼저 오디오 추출기를 사용하세요. 무료 Meet 등급에는 클라우드 녹음 기능이 포함되어 있지 않으므로 전화 또는 노트북 마이크 녹음이 대안입니다. 결과물은 녹음의 특정 시점으로 연결되는 타임스탬프가 포함된 주제별 그룹화된 노트입니다.
Microsoft Teams
Teams 녹음 파일은 OneDrive(1:1 통화) 또는 채널 SharePoint 사이트(채널 회의)에 MP4 형식으로 저장됩니다. Teams의 실시간 스크립트는 VTT로 다운로드할 수도 있으며, 이를 붙여넣어 재전사를 건너뛰고 더 빠르게 처리할 수 있습니다. 오디오와 함께 VTT 스크립트가 제공될 경우, 결과물은 Teams 화자 라벨을 존중합니다.
대면 녹음
전화 음성 메모(iPhone은 M4A, 대부분의 Android 전화는 M4A 또는 AAC로 녹음), USB 라펠 마이크 또는 전용 휴대용 녹음기 모두 작동합니다. 파일을 드롭하기만 하면 됩니다. 여러 사람이 참여하는 대면 녹음의 경우, 360도 마이크(Logitech BCC950 또는 Jabra Speak 등)는 각 음성이 다른 공간 특성을 가지고 도달하기 때문에 화자 분리 성능을 현저히 향상시킵니다. 결과물은 원격 플랫폼에서 사용되는 것과 동일한 구조화된 노트 형식입니다.
내장 음성 녹음기
브라우저 녹음기는 별도의 앱 없이 오디오를 캡처합니다. 산책 중 휴대폰으로, 강의 중 노트북으로, 팟캐스트 인터뷰 중 데스크탑으로 녹음 버튼을 누르세요. 중지하면 AI가 자동으로 처리합니다.
- 모든 장치에서 브라우저 내 녹음
- 다중 화자 감지
- 검색 가능한 타임스탬프
- 클라우드 동기화를 통한 모바일 녹음
- 배경 소음 및 겹치는 말 처리
32분 오디오 녹음의 실제 노트 보기
아래는 오디오를 입력했을 때 ScreenApp의 노트가 어떻게 보이는지 보여주는 실제 예시입니다. 원본은 32분짜리 팟캐스트 녹음이었습니다. 노트 생성기는 9가지의 뚜렷한 주제를 감지하고, 각 주제를 2-3개의 핵심 요점으로 나누어 스마트 비서가 작성한 것과 같은 3페이지 분량의 문서를 생성했습니다. 스크립트 장벽도 없고, 중요한 순간을 찾기 위해 15페이지에 달하는 원문 텍스트를 뒤질 필요도 없습니다.
노트는 노트 작성자가 실제로 사용하는 대상으로 내보낼 수 있습니다. Notion 또는 Obsidian용 Markdown, Slack 또는 HubSpot용 일반 텍스트, 워크플로가 Office를 통해 실행되는 경우 Word용 DOCX, 또는 보관용 PDF입니다. 음성 메모, 회의 녹음, 강의 오디오 및 팟캐스트 파일은 모두 이 형식의 노트를 생성합니다.
오디오를 노트로 vs 다른 앱
- Otter.ai는 더 큰 무료 티어를 제공하지만 회의에 봇이 필요하며 무료 파일 가져오기는 평생 3회로 제한됩니다.
- NoteGPT는 원본 전사본을 제공하며, 주제별 그룹화나 추출된 실행 항목은 없습니다.
- meetergo는 데스크톱 설치가 필요하며 가장 작은 무료 티어를 제공합니다.
누가 사용하나요
학생들은 휴대폰으로 강의를 녹음하고 수업 후 주제별로 타임스탬프와 함께 학습 준비가 된 노트를 받습니다.
비즈니스 전문가는 녹음된 통화 및 음성 메모를 업로드합니다. 라이브 Zoom, Teams 또는 Meet 통화의 경우 AI 회의 노트 작성기를 사용하며 봇은 필요하지 않습니다.
연구원은 인터뷰 녹음 파일을 통해 이를 실행합니다. 화자 레이블과 인용 가능한 타임스탬프는 인용문 검색을 빠르게 합니다.
콘텐츠 제작자 및 팟캐스터는 에피소드를 쇼 노트, 블로그 게시물, 인용문으로 재활용합니다. 음성 메모 및 현장 녹음에도 적합합니다. 전체 노트가 아닌 요약만 필요한 경우, 오디오 요약 도구는 잘라낸 에피소드 요약을 위한 독립형 요약 도구이며, 오디오 요약 API는 이전 카탈로그 전반의 프로그래밍 방식 요약을 처리합니다.
언론인은 인터뷰 및 기자 회견을 기록한 다음 키워드로 녹음 파일을 검색합니다.
화자 중복이 있는 녹음 파일에서 노트 작성
어떤 노트 작성기에게도 가장 어려운 오디오는 사람들이 서로 말을 겹쳐 하는 통화이며, 기대치를 설정할 가치가 있습니다. 두 목소리가 겹칠 때, 전사본은 지배적인 목소리를 잡고 다른 목소리는 흐리게 처리하므로, 격렬한 그룹 토론에서 나온 노트는 한 번에 한 명씩 진행되는 회의에서 나온 노트보다 신뢰성이 떨어집니다. 이는 모델의 한계가 아니라 오디오의 한계이며, 어떤 도구도 진정한 교차 대화를 깨끗하게 분리하지 못합니다.
도움이 되는 것은 화자 레이블인데, 시스템이 부착할 음성 지문을 가질 수 있도록 각 사람이 적어도 한 번은 혼자서 무언가를 말해야 합니다. 시작할 때 이름을 한 번씩 말하는 것이 전체 녹음 파일에 걸쳐 효과가 있습니다. 패널이나 토론의 경우, 몇 가지 귀속을 수동으로 수정해야 할 것으로 예상되지만, 사람들이 차례로 말하는 일반적인 회의의 경우, 레이블은 대부분 올바르게 지정됩니다.


