Tính năng
Tải lên tệp âm thanh MP3, WAV, M4A, FLAC hoặc nhấn ghi trong trình duyệt. Bạn sẽ nhận được các ghi chú có cấu trúc: người nói được gắn nhãn, các điểm chính được trích xuất, có dấu thời gian xuyên suốt. Không phải một bản ghi thô.
ChatGPT không chấp nhận âm thanh. Gemini chấp nhận tải lên âm thanh lên tới 100MB nhưng không xác định người nói và buộc bạn phải chia nhỏ bất cứ thứ gì quá 30 phút. Công cụ này thực hiện chuyển đổi giọng nói thành văn bản, phân tách người nói và tổ chức ghi chú chỉ trong một lần.
Chạy trong trình duyệt, không cần cài đặt, không có bot tham gia cuộc gọi. Đối với các tệp video hoặc liên kết YouTube, hãy sử dụng công cụ chuyển đổi video sang ghi chú.
Có gì trong ghi chú:
- Các phần được gắn nhãn người nói (tối đa 10 giọng)
- Các điểm chính và mục hành động, không phải bản ghi thô
- Dấu thời gian liên kết trở lại âm thanh
- 99 ngôn ngữ, tự động phát hiện
Tỷ lệ lỗi từ khoảng 2-3% trên âm thanh rõ ràng và 8-12% trên các bản ghi ồn ào, nhiều người nói (điểm chuẩn đầy đủ). Một bản ghi 60 phút hoàn thành trong vài phút. Các tệp được mã hóa và không bao giờ được sử dụng để đào tạo mô hình (SOC 2 Type II).
Cách hoạt động
- Tải lên hoặc ghi âm: MP3, WAV, M4A, FLAC, OGG hoặc nhấn ghi trong trình duyệt.
- AI phiên âm và gắn nhãn: Phân tách người nói chạy tự động. Các điểm chính và mục hành động được trích xuất.
- Xem xét và xuất: PDF, Word, văn bản thuần túy hoặc Markdown. Dấu thời gian vẫn có thể nhấp được.
Ngữ cảnh được duy trì xuyên suốt các bản ghi dài, do đó một cuộc phỏng vấn 2 giờ vẫn mạch lạc thay vì mất dấu ai đang nói.
Thiết lập ghi chú âm thanh theo nền tảng họp
Mỗi nền tảng họp lớn lưu trữ bản ghi ở một vị trí và định dạng hơi khác nhau. Hướng dẫn dưới đây là những gì hoạt động vào tháng 5 năm 2026.
Zoom
Sau khi cuộc gọi kết thúc, Zoom xử lý bản ghi trong vài phút, sau đó thả tệp âm thanh .m4a (cùng với video .mp4) vào đám mây Zoom hoặc thư mục Documents/Zoom/<meeting>/ cục bộ của bạn. Tải trực tiếp tệp M4A lên: phân tách người nói hoạt động tốt nhất trên âm thanh Zoom vì Zoom tách từng người tham gia thành một bản âm thanh riêng khi ghi cục bộ với tùy chọn “Ghi tệp âm thanh riêng cho mỗi người tham gia” được bật. Đầu ra là ghi chú có cấu trúc với các mục hành động cho từng người tham dự.
Google Meet
Các bản ghi Google Meet lưu vào Google Drive của chủ nhà dưới dạng MP4. Âm thanh được ghép vào video, vì vậy bạn có thể tải trực tiếp tệp MP4 lên hoặc sử dụng công cụ trích xuất âm thanh trước. Gói Meet miễn phí không bao gồm ghi âm trên đám mây, vì vậy việc ghi âm bằng micrô điện thoại hoặc máy tính xách tay là giải pháp thay thế. Đầu ra là một ghi chú được nhóm theo chủ đề với các dấu thời gian liên kết trở lại thời điểm trong bản ghi.
Microsoft Teams
Các bản ghi của Teams lưu vào OneDrive (cuộc gọi 1:1) hoặc trang SharePoint của kênh (cuộc họp kênh) dưới dạng MP4. Bản ghi trực tiếp từ Teams cũng có thể được tải xuống dưới dạng VTT, bạn có thể dán vào để có một lượt xử lý nhanh hơn mà không cần phiên âm lại. Đầu ra tôn trọng các nhãn người nói của Teams khi một bản ghi VTT được cung cấp cùng với âm thanh.
Ghi âm trực tiếp
Ghi âm giọng nói trên điện thoại (iPhone ghi M4A, hầu hết điện thoại Android ghi M4A hoặc AAC), micrô cài áo USB hoặc máy ghi âm cầm tay chuyên dụng đều hoạt động. Chỉ cần thả tệp vào. Đối với các bản ghi trực tiếp nhiều người, micrô 360 độ (như Logitech BCC950 hoặc Jabra Speak) cải thiện đáng kể khả năng phân tách người nói vì mỗi giọng nói đều có một dấu hiệu phòng khác nhau. Đầu ra là cùng định dạng ghi chú có cấu trúc được sử dụng cho các nền tảng từ xa.
Trình ghi âm giọng nói tích hợp
Trình ghi âm trong trình duyệt ghi lại âm thanh mà không cần ứng dụng riêng. Nhấn ghi trên điện thoại khi đi dạo, trên máy tính xách tay khi nghe giảng, hoặc trên máy tính để bàn cho một cuộc phỏng vấn podcast. Khi bạn dừng lại, AI sẽ xử lý tự động.
- Ghi âm trong trình duyệt trên mọi thiết bị
- Phát hiện nhiều người nói
- Dấu thời gian có thể tìm kiếm
- Ghi âm trên thiết bị di động với đồng bộ hóa đám mây
- Xử lý tiếng ồn nền và lời nói chồng chéo
Xem ghi chú thực tế từ một bản ghi âm dài 32 phút
Dưới đây là một ví dụ thực tế về ghi chú của ScreenApp trông như thế nào khi đầu vào là âm thanh. Nguồn là một bản ghi podcast dài 32 phút. Công cụ ghi chú đã phát hiện chín chủ đề riêng biệt, chia mỗi chủ đề thành 2-3 điểm chính có dấu đầu dòng và tạo ra một tài liệu dài 3 trang đọc như ghi chú mà một trợ lý thông minh sẽ viết. Không có tường bản ghi, không cần phải tìm kiếm qua 15 trang văn bản nguyên văn để tìm những khoảnh khắc quan trọng.
Ghi chú xuất sang các đích mà người ghi chú thực sự sử dụng: Markdown cho Notion hoặc Obsidian, văn bản thuần túy cho Slack hoặc HubSpot, DOCX cho Word nếu quy trình làm việc của bạn chạy qua Office, hoặc PDF để lưu trữ. Ghi âm giọng nói, bản ghi hội nghị, âm thanh bài giảng và tệp podcast đều tạo ra ghi chú ở định dạng này.
Chuyển đổi âm thanh thành ghi chú so với các ứng dụng khác
| Tính năng | ScreenApp | Otter.ai | NoteGPT | meetergo |
|---|---|---|---|---|
| Gói miễn phí | 300 phút/tháng | 15 hành động AI/tháng miễn phí | 150 phút/tháng | |
| Trả phí (hàng năm) | Tùy chỉnh | 8,33 USD/tháng | 9 USD/tháng | 11 USD/tháng |
| Độ dài tối đa (miễn phí) | Không giới hạn | 30 phút/phiên | Không giới hạn | Không giới hạn |
| Nhập tệp (miễn phí) | Không giới hạn | 3 lần trọn đời | Không giới hạn | Không giới hạn |
| Không cần tải xuống | Có | Không | Có | Không |
| Không cần bot cuộc họp | Có | Không | Có | Có |
| Ghi chú có cấu trúc | Có | Hạn chế | Không | Không |
| Nhận dạng người nói | Có | Có (cơ bản) | Có (cơ bản) | Có (cơ bản) |
| Ghi âm trên trình duyệt | Có | Có | Không | Không |
| 99 ngôn ngữ | Có | Có | Có | Hạn chế |
- Otter.ai có gói miễn phí lớn hơn nhưng yêu cầu bot trong các cuộc họp của bạn và giới hạn nhập tệp miễn phí ở mức 3 lần trọn đời.
- NoteGPT cung cấp bản ghi thô - không có nhóm chủ đề hoặc các mục hành động được trích xuất.
- meetergo cần cài đặt trên máy tính để bàn và có gói miễn phí nhỏ nhất.
Ai sử dụng nó
Học sinh, sinh viên ghi âm bài giảng trên điện thoại và nhận được ghi chú sẵn sàng cho việc học sau giờ học, được nhóm theo chủ đề với dấu thời gian.
Các chuyên gia kinh doanh tải lên các cuộc gọi đã ghi âm và bản ghi nhớ giọng nói. Đối với các cuộc gọi Zoom, Teams hoặc Meet trực tiếp, hãy sử dụng công cụ ghi chú cuộc họp AI, không yêu cầu bot.
Các nhà nghiên cứu chạy các bản ghi phỏng vấn qua nó. Nhãn người nói và dấu thời gian có thể trích dẫn giúp việc tìm kiếm trích dẫn nhanh chóng.
Người sáng tạo nội dung và nhà sản xuất podcast sử dụng lại các tập thành ghi chú chương trình, bài đăng blog và các câu trích dẫn. Cũng phù hợp với các bản ghi nhớ giọng nói và ghi âm thực địa. Nếu bạn chỉ cần tóm tắt chứ không phải ghi chú đầy đủ, công cụ tóm tắt âm thanh là công cụ tóm tắt độc lập cho các bản tóm tắt tập được cắt ngắn và API tóm tắt âm thanh xử lý việc tóm tắt theo chương trình trên một danh mục cũ.
Các nhà báo ghi lại các cuộc phỏng vấn và họp báo, sau đó tìm kiếm trong các bản ghi theo từ khóa.
Ghi chú từ bản ghi có nhiều người nói chồng chéo
Âm thanh khó nhất đối với bất kỳ người ghi chú nào là một cuộc gọi mà mọi người nói chồng chéo lên nhau, và điều đáng để đặt ra kỳ vọng. Khi hai giọng nói chồng chéo, bản ghi sẽ bắt được giọng nói nổi bật và làm mờ giọng nói kia, vì vậy ghi chú từ một cuộc thảo luận nhóm sôi nổi sẽ ít đáng tin cậy hơn ghi chú từ một cuộc họp từng người một. Đó là giới hạn của âm thanh, không phải của mô hình, không có công cụ nào tách biệt tiếng nói chồng chéo thực sự một cách sạch sẽ.
Điều hữu ích là nhãn người nói, điều này yêu cầu mỗi người phải tự nói một điều gì đó ít nhất một lần để hệ thống có dấu vân giọng để gắn vào. Một vòng gọi tên ở đầu sẽ mang lại hiệu quả trên toàn bộ bản ghi. Đối với một hội thảo hoặc một cuộc tranh luận, hãy chuẩn bị sửa một vài sự phân bổ bằng tay, đối với một cuộc họp bình thường mà mọi người thay phiên nhau, các nhãn sẽ đúng hầu hết thời gian.
Câu hỏi thường gặp
Nó có miễn phí không?
Có. Các tài khoản miễn phí nhận được bộ tính năng đầy đủ: nhãn người nói, ghi chú có cấu trúc, dấu thời gian, xuất bản.
Hỗ trợ định dạng tệp nào?
MP3, WAV, M4A, FLAC, OGG, AAC và hầu hết các định dạng âm thanh phổ biến. Bạn cũng có thể trích xuất âm thanh từ tệp video, hoặc sử dụng công cụ chuyển đổi video thành ghi chú trực tiếp.
Nó chính xác đến mức nào?
Tỷ lệ lỗi từ khoảng 2-3% trên các bản ghi rõ ràng, tăng lên khoảng 8-12% trên âm thanh nhiều người nói, ồn ào. Phân đoạn người nói xử lý nhiều giọng nói, giọng điệu và từ vựng chuyên ngành, và các phần có độ tin cậy thấp sẽ được đánh dấu. Các tiêu chuẩn đầy đủ theo ngôn ngữ và theo điều kiện có trên trang độ chính xác.
Mất bao lâu?
vài phút cho một bản ghi dài 60 phút. Âm thanh rõ hơn sẽ hoàn thành nhanh hơn.
Nó có nhận dạng các giọng nói khác nhau không?
Có. Lên đến 10 người nói riêng biệt, được gắn nhãn tự động, hữu ích cho các cuộc phỏng vấn, podcast và các cuộc họp nhiều người.
ChatGPT hoặc Gemini có thể làm điều này không?
ChatGPT không chấp nhận tệp âm thanh. Gemini chấp nhận tải lên tối đa 100MB nhưng không nhận dạng người nói và yêu cầu bạn chia các bản ghi dài hơn 30 phút. Cả hai đều không tạo ra ghi chú có cấu trúc, chỉ là bản ghi thô. Công cụ này xử lý tất cả trong một bước.
Nó hỗ trợ những ngôn ngữ nào?
99 ngôn ngữ bao gồm tiếng Tây Ban Nha, Pháp, Đức, Quan Thoại, Nhật Bản, Bồ Đào Nha và Ả Rập. Ngôn ngữ được tự động phát hiện hoặc bạn có thể cài đặt thủ công.
Nó có an toàn không?
Tuân thủ SOC 2 Loại II với mã hóa AES-256. Các tệp không bao giờ được sử dụng để đào tạo các mô hình AI. Tự động xóa sau 30 ngày, hoặc xóa thủ công bất cứ lúc nào. Không có bot cuộc họp, bạn chọn những gì để tải lên.
Tôi có thể xuất các ghi chú không?
PDF, Word, văn bản thuần túy hoặc Markdown. Sao chép vào khay nhớ tạm cũng hoạt động. Dấu thời gian vẫn có thể nhấp được trong các định dạng hỗ trợ liên kết.
Nó có hoạt động với podcast không?
Có. Tải lên bất kỳ tệp âm thanh podcast nào hoặc thả URL vào nếu bạn đã tải xuống. Nhãn người nói giúp theo dõi người dẫn chương trình/khách mời tự động.
Tôi có thể ghi âm bản ghi nhớ giọng nói và chuyển đổi chúng không?
Có. Tải lên các tệp ghi nhớ giọng nói từ điện thoại của bạn, hoặc sử dụng công cụ ghi âm trong trình duyệt để ghi lại các bản ghi nhớ giọng nói trực tiếp. Dù bằng cách nào, bạn cũng nhận được ghi chú có cấu trúc.
Đây có phải là công cụ ghi chú AI từ âm thanh không?
Có. Cung cấp cho nó một tệp âm thanh hoặc ghi âm trực tiếp trong trình duyệt, và nó sẽ viết ghi chú có cấu trúc từ âm thanh: các điểm chính, các mục hành động và một bản tóm tắt. Nó là một công cụ ghi chú AI được xây dựng cho âm thanh, một bản ghi cuộc họp, một bản ghi nhớ giọng nói, một bài giảng, không chỉ là văn bản được gõ.