Tính năng
Tải lên tệp âm thanh MP3, WAV, M4A, FLAC hoặc nhấn ghi trong trình duyệt. Bạn sẽ nhận được các ghi chú có cấu trúc: người nói được gắn nhãn, các điểm chính được trích xuất, có dấu thời gian xuyên suốt. Không phải một bản ghi thô.
Chạy trong trình duyệt, không cần cài đặt, không có bot tham gia cuộc gọi. Đối với các tệp video hoặc liên kết YouTube, hãy sử dụng công cụ chuyển đổi video sang ghi chú.
Có gì trong ghi chú:
- Các phần được gắn nhãn người nói (tối đa 10 giọng)
- Các điểm chính và mục hành động, không phải bản ghi thô
- Dấu thời gian liên kết trở lại âm thanh
- 99 ngôn ngữ, tự động phát hiện
Tỷ lệ lỗi từ khoảng 2-3% trên âm thanh rõ ràng và 8-12% trên các bản ghi ồn ào, nhiều người nói (điểm chuẩn đầy đủ). Một bản ghi 60 phút hoàn thành trong vài phút. Các tệp được mã hóa và không bao giờ được sử dụng để đào tạo mô hình (SOC 2 Type II).
Cách hoạt động
- Tải lên hoặc ghi âm: MP3, WAV, M4A, FLAC, OGG hoặc nhấn ghi trong trình duyệt.
- AI phiên âm và gắn nhãn: Phân tách người nói chạy tự động. Các điểm chính và mục hành động được trích xuất.
- Xem xét và xuất: PDF, Word, văn bản thuần túy hoặc Markdown. Dấu thời gian vẫn có thể nhấp được.
Ngữ cảnh được duy trì xuyên suốt các bản ghi dài, do đó một cuộc phỏng vấn 2 giờ vẫn mạch lạc thay vì mất dấu ai đang nói.
Thiết lập ghi chú âm thanh theo nền tảng họp
Mỗi nền tảng họp lớn lưu trữ bản ghi ở một vị trí và định dạng hơi khác nhau. Hướng dẫn dưới đây là những gì hoạt động vào tháng 5 năm 2026.
Zoom
Sau khi cuộc gọi kết thúc, Zoom xử lý bản ghi trong vài phút, sau đó thả tệp âm thanh .m4a (cùng với video .mp4) vào đám mây Zoom hoặc thư mục Documents/Zoom/<meeting>/ cục bộ của bạn. Tải trực tiếp tệp M4A lên: phân tách người nói hoạt động tốt nhất trên âm thanh Zoom vì Zoom tách từng người tham gia thành một bản âm thanh riêng khi ghi cục bộ với tùy chọn “Ghi tệp âm thanh riêng cho mỗi người tham gia” được bật. Đầu ra là ghi chú có cấu trúc với các mục hành động cho từng người tham dự.
Google Meet
Các bản ghi Google Meet lưu vào Google Drive của chủ nhà dưới dạng MP4. Âm thanh được ghép vào video, vì vậy bạn có thể tải trực tiếp tệp MP4 lên hoặc sử dụng công cụ trích xuất âm thanh trước. Gói Meet miễn phí không bao gồm ghi âm trên đám mây, vì vậy việc ghi âm bằng micrô điện thoại hoặc máy tính xách tay là giải pháp thay thế. Đầu ra là một ghi chú được nhóm theo chủ đề với các dấu thời gian liên kết trở lại thời điểm trong bản ghi.
Microsoft Teams
Các bản ghi của Teams lưu vào OneDrive (cuộc gọi 1:1) hoặc trang SharePoint của kênh (cuộc họp kênh) dưới dạng MP4. Bản ghi trực tiếp từ Teams cũng có thể được tải xuống dưới dạng VTT, bạn có thể dán vào để có một lượt xử lý nhanh hơn mà không cần phiên âm lại. Đầu ra tôn trọng các nhãn người nói của Teams khi một bản ghi VTT được cung cấp cùng với âm thanh.
Ghi âm trực tiếp
Ghi âm giọng nói trên điện thoại (iPhone ghi M4A, hầu hết điện thoại Android ghi M4A hoặc AAC), micrô cài áo USB hoặc máy ghi âm cầm tay chuyên dụng đều hoạt động. Chỉ cần thả tệp vào. Đối với các bản ghi trực tiếp nhiều người, micrô 360 độ (như Logitech BCC950 hoặc Jabra Speak) cải thiện đáng kể khả năng phân tách người nói vì mỗi giọng nói đều có một dấu hiệu phòng khác nhau. Đầu ra là cùng định dạng ghi chú có cấu trúc được sử dụng cho các nền tảng từ xa.
Trình ghi âm giọng nói tích hợp
Trình ghi âm trong trình duyệt ghi lại âm thanh mà không cần ứng dụng riêng. Nhấn ghi trên điện thoại khi đi dạo, trên máy tính xách tay khi nghe giảng, hoặc trên máy tính để bàn cho một cuộc phỏng vấn podcast. Khi bạn dừng lại, AI sẽ xử lý tự động.
- Ghi âm trong trình duyệt trên mọi thiết bị
- Phát hiện nhiều người nói
- Dấu thời gian có thể tìm kiếm
- Ghi âm trên thiết bị di động với đồng bộ hóa đám mây
- Xử lý tiếng ồn nền và lời nói chồng chéo
Xem ghi chú thực tế từ một bản ghi âm dài 32 phút
Dưới đây là một ví dụ thực tế về ghi chú của ScreenApp trông như thế nào khi đầu vào là âm thanh. Nguồn là một bản ghi podcast dài 32 phút. Công cụ ghi chú đã phát hiện chín chủ đề riêng biệt, chia mỗi chủ đề thành 2-3 điểm chính có dấu đầu dòng và tạo ra một tài liệu dài 3 trang đọc như ghi chú mà một trợ lý thông minh sẽ viết. Không có tường bản ghi, không cần phải tìm kiếm qua 15 trang văn bản nguyên văn để tìm những khoảnh khắc quan trọng.
Ghi chú xuất sang các đích mà người ghi chú thực sự sử dụng: Markdown cho Notion hoặc Obsidian, văn bản thuần túy cho Slack hoặc HubSpot, DOCX cho Word nếu quy trình làm việc của bạn chạy qua Office, hoặc PDF để lưu trữ. Ghi âm giọng nói, bản ghi hội nghị, âm thanh bài giảng và tệp podcast đều tạo ra ghi chú ở định dạng này.
Chuyển đổi âm thanh thành ghi chú so với các ứng dụng khác
- Otter.ai có gói miễn phí lớn hơn nhưng yêu cầu bot trong các cuộc họp của bạn và giới hạn nhập tệp miễn phí ở mức 3 lần trọn đời.
- NoteGPT cung cấp bản ghi thô - không có nhóm chủ đề hoặc các mục hành động được trích xuất.
- meetergo cần cài đặt trên máy tính để bàn và có gói miễn phí nhỏ nhất.
Ai sử dụng nó
Học sinh, sinh viên ghi âm bài giảng trên điện thoại và nhận được ghi chú sẵn sàng cho việc học sau giờ học, được nhóm theo chủ đề với dấu thời gian.
Các chuyên gia kinh doanh tải lên các cuộc gọi đã ghi âm và bản ghi nhớ giọng nói. Đối với các cuộc gọi Zoom, Teams hoặc Meet trực tiếp, hãy sử dụng công cụ ghi chú cuộc họp AI, không yêu cầu bot.
Các nhà nghiên cứu chạy các bản ghi phỏng vấn qua nó. Nhãn người nói và dấu thời gian có thể trích dẫn giúp việc tìm kiếm trích dẫn nhanh chóng.
Người sáng tạo nội dung và nhà sản xuất podcast sử dụng lại các tập thành ghi chú chương trình, bài đăng blog và các câu trích dẫn. Cũng phù hợp với các bản ghi nhớ giọng nói và ghi âm thực địa. Nếu bạn chỉ cần tóm tắt chứ không phải ghi chú đầy đủ, công cụ tóm tắt âm thanh là công cụ tóm tắt độc lập cho các bản tóm tắt tập được cắt ngắn và API tóm tắt âm thanh xử lý việc tóm tắt theo chương trình trên một danh mục cũ.
Các nhà báo ghi lại các cuộc phỏng vấn và họp báo, sau đó tìm kiếm trong các bản ghi theo từ khóa.
Ghi chú từ bản ghi có nhiều người nói chồng chéo
Âm thanh khó nhất đối với bất kỳ người ghi chú nào là một cuộc gọi mà mọi người nói chồng chéo lên nhau, và điều đáng để đặt ra kỳ vọng. Khi hai giọng nói chồng chéo, bản ghi sẽ bắt được giọng nói nổi bật và làm mờ giọng nói kia, vì vậy ghi chú từ một cuộc thảo luận nhóm sôi nổi sẽ ít đáng tin cậy hơn ghi chú từ một cuộc họp từng người một. Đó là giới hạn của âm thanh, không phải của mô hình, không có công cụ nào tách biệt tiếng nói chồng chéo thực sự một cách sạch sẽ.
Điều hữu ích là nhãn người nói, điều này yêu cầu mỗi người phải tự nói một điều gì đó ít nhất một lần để hệ thống có dấu vân giọng để gắn vào. Một vòng gọi tên ở đầu sẽ mang lại hiệu quả trên toàn bộ bản ghi. Đối với một hội thảo hoặc một cuộc tranh luận, hãy chuẩn bị sửa một vài sự phân bổ bằng tay, đối với một cuộc họp bình thường mà mọi người thay phiên nhau, các nhãn sẽ đúng hầu hết thời gian.


