works like a charm, notes have been super helpful alongside chat function. loveeeee
Katharine Suy, Chrome Web Store, October 17, 2024
Metodología
Esta página es la fuente de verdad para cada afirmación de precisión, velocidad e idiomas en ScreenApp.io. Los números provienen de nuestro corpus interno de pruebas, el caso de estudio de ingeniería de Groq, los benchmarks de Whisper de OpenAI y los benchmarks publicados de Grok Speech-to-Text de xAI. Pila de proveedores verificada contra el código: septiembre de 2026.
Last updated: 2026-09-16.
The repository's default batch order is xAI, then Mistral, then Modulate, then Google, then Groq. Live captions use Groq, then xAI, then Mistral, then Modulate, then Google. Credentials, language fit and deployment overrides can change which provider handles a job. These are repository defaults checked on 2026-09-16, not a record of every production request.
| Provider | Default model or endpoint | Language routing declaration | Speaker labels |
|---|---|---|---|
| xAI | Grok STT (/v1/stt) | 25 languages declared by the adapter | Supported by adapter |
| Mistral | voxtral-mini-latest | 13 languages declared by the adapter | Supported by adapter |
| Modulate | velma-2-stt-batch | 57 languages declared by the adapter | Supported by adapter |
| gemini-2.5-flash | No fixed language list in the adapter | Supported by adapter | |
| Groq | whisper-large-v3-turbo | 24 languages in the app proficiency list, not the model total | Not supported by adapter |
The linked provider documentation describes each service. Provider language totals are not added together to calculate ScreenApp's supported-language count. In particular, Groq's internal routing list is narrower than Whisper's multilingual model coverage.
When a language is selected, batch routing prefers providers that declare it before degraded fallbacks. Live routing excludes providers marked unsuitable for that language. Automatic detection does not provide the same explicit-language filter.
No accuracy or latency benchmark for this current provider order is published here. See the dated measurements below for their original test conditions. Data handling is described in the Privacy Policy.
Esta sección es historia, no un benchmark actual. En 2025, ScreenApp migró de un despliegue autoalojado de Whisper en AWS a la infraestructura de inferencia de Groq. Groq publicó el caso de estudio a continuación; los números provienen de las mediciones de su equipo de ingeniería sobre ese flujo, que era el predeterminado en su momento. Whisper Large-v3 en Groq es ahora el último respaldo, no el proveedor predeterminado (xAI Grok Speech-to-Text encabeza la cadena). Todavía no se ha publicado ninguna cifra de velocidad o latencia para la cadena de proveedores actual, encabezada por xAI, ni para los subtítulos en vivo.
| Métrica | Antes de Groq | Después de Groq | Cambio |
|---|---|---|---|
| Trabajo de transcripción de 20 minutos | ~20 minutes | ~15 seconds | 20x faster |
| Costo de transcripción por minuto | baseline | 1/15th | 15x cheaper |
| Conversión de gratis a pago | baseline | +30% | uplift |
| Ingresos recurrentes anuales (año contra año) | baseline | +405% | crecimiento atribuido a las mejoras de velocidad y costo |
Fuente: caso de estudio ScreenApp + Groq (groq.com).
Histórico, para el flujo de Whisper en Groq de 2025: una reunión de 60 minutos se procesa en aproximadamente 3 minutos de punta a punta (transcripción, diarización, generación de resumen). Un video de 2 horas se procesa en unos 6 minutos. Estos son tiempos de punta a punta que incluyen el resumen y la creación de capítulos, no solo la transcripción cruda. Todavía no se han publicado cifras de velocidad para la cadena actual encabezada por xAI.
When a YouTube video already publishes a caption track, ScreenApp reads that track instead of transcribing the audio. No speech recognition runs at all, which is why it is fast. The text is written by YouTube, so none of the word error rates on this page describe it. Videos without a caption track go through the AI transcription path above, which is slower and is what our benchmarks measure.
| Path | Imports (n) | Median | p90 |
|---|---|---|---|
| Download + AI transcription (before, Jul 8 to 9 2026) | 61 | 41.1 sec | 159 sec |
| Caption import (after, Jul 16 to 17 2026) | 1,774 | 14.7 sec | 29 sec |
Method: both windows measure the same endpoint (import start to transcript indexed) on the same population, on production traffic. We state the gain as about 3x rather than a precise figure: the before-window sample is small (n=61), which puts the true median speedup somewhere between 1.9x and 3.7x at 95% confidence. The mean (3.58x) is inflated by a long tail of large videos, so the median is the honest central figure.
Two limits worth stating plainly. First, caption import currently serves free-tier YouTube imports; paid accounts still take the download and transcription path, which measured a 60.5 second median before and 44.7 seconds after (that difference is sampling noise, not a change in the product). Second, 14.7 seconds reflects the current implementation, which reads the captions already published with the video. Measured: July 8 to 17, 2026.
El word error rate (WER) cuenta sustituciones, eliminaciones e inserciones por cada 100 palabras de referencia. Cuanto más bajo, mejor. Las cifras de referencia a continuación provienen de los benchmarks publicados para cada modelo subyacente; las filas por condición provienen de nuestra propia repetición de prueba de abril de 2026 con 18 horas de audio de dominio público por idioma en tres condiciones: estudio (un solo hablante, sala tratada), conferencia (varios hablantes, micrófono ambiental) y campo (micrófono de teléfono en mano, ruido ambiental).
Cifra principal: 95.8% de precisión. Se midió sobre la combinación de proveedores de abril de 2026 usada en esa repetición de prueba, antes de que xAI Grok Speech-to-Text se convirtiera en el proveedor predeterminado. No se ha vuelto a medir con el proveedor predeterminado actual.
| Idioma | Locale | WER estudio | WER conferencia | WER campo | Hablantes probados |
|---|---|---|---|---|---|
| Inglés (EE. UU.) | en-US | 4.2% | 7.8% | 12.4% | 4 |
| Español (Latinoam.) | es-419 | 5.1% | 9.2% | 14.6% | 3 |
| Español (España) | es-ES | 5.4% | 9.8% | 15.1% | 3 |
| Portugués (BR) | pt-BR | 5.8% | 10.1% | 15.8% | 3 |
| Portugués (PT) | pt-PT | 6.4% | 11.2% | 17.0% | 2 |
| Francés | fr-FR | 5.9% | 10.4% | 16.2% | 3 |
| Alemán | de-DE | 6.1% | 10.8% | 16.5% | 3 |
| Italiano | it-IT | 6.3% | 11.0% | 17.1% | 3 |
| Japonés | ja-JP | 7.8% | 13.5% | 19.8% | 2 |
| Coreano | ko-KR | 7.5% | 13.1% | 19.2% | 2 |
| Mandarín (simplificado) | zh-CN | 7.9% | 14.0% | 20.4% | 3 |
| Hindi | hi-IN | 9.2% | 15.8% | 23.1% | 3 |
| Árabe (MSA) | ar | 9.6% | 16.2% | 24.0% | 2 |
| Ruso | ru-RU | 6.8% | 11.5% | 17.4% | 3 |
| Indonesio | id-ID | 7.1% | 12.4% | 18.5% | 2 |
El número de hablantes por idioma es pequeño (de 2 a 4). Las cifras anteriores son indicativas, no estadísticamente robustas, y no se publican intervalos de confianza para ellas.
Los archivos de muestra no se publican. El corpus proviene de fuentes de dominio público (ver Metodología de prueba arriba); nunca se usa audio de clientes, y los archivos de audio concretos de la repetición de prueba no se publican.
Diarization attaches speaker labels to a transcript. It depends on the provider that handles the job, the request settings and the recording. The adapter capabilities are listed in the model table above. A fallback can change whether speaker labels are available.
Language support does not guarantee correct speaker identification or word timing. We have not published a speaker-identification benchmark for every supported language.
ScreenApp's transcription providers cover 100+ languages. We count the union of their documented language lists: a language supported by several providers counts once. The list below contains 100 entries, including Sinhala (Sinhalese) and Cantonese. Gemini does not publish an exhaustive transcription-language list, so this is a documented minimum, not a claim that coverage stops here.
Whisper Large-v3 Turbo's model configuration supplies the broadest enumerated list. Its model-card tags still say 99 languages, but its language-token map includes Cantonese as another entry. We use the model configuration for the list above. For counting, Filipino and Tagalog are grouped as one entry, and Javanese code aliases are merged. Regional variants and automatic detection do not add entries. These sources were checked on 2026-09-16.
Vendor model coverage is broader than the app's 58-language selector and its provider routing lists. The union describes transcription coverage across the providers, not a guarantee that every provider or live session accepts every listed language. Transcript translation is a separate capability and does not add entries to this count.
Sinhala is present in both the app registry and Whisper's model configuration. With Sinhala explicitly selected, ScreenApp's current routing declarations prefer Google Gemini. Other batch providers are degraded fallbacks; live routing excludes them. Google's audio documentation does not separately verify Sinhala transcription accuracy.
Accuracy varies by language, accent and recording conditions. Inclusion in a vendor's language list does not establish a ScreenApp benchmark result. No Sinhala accuracy benchmark has been published on this page. The dated measurements on this page cover only their stated samples.
OpenAI GPT-5.6 Luna es el modelo predeterminado para el chat con IA, los resúmenes, los títulos, las plantillas y la traducción. Anthropic Claude Sonnet 5 and Google Gemini 3.1 Flash Lite se pueden seleccionar para tareas concretas. Ver los fotogramas de un video y escuchar el audio siempre se ejecuta con Google Gemini.
Los resúmenes y las respuestas del chat se generan a partir de la transcripción, no del audio original. Un error de transcripción se traslada al resumen y a cualquier respuesta que dependa de esa parte de la transcripción.
Los resúmenes y las respuestas de chat con IA pueden estar incompletos o equivocados. Para cualquier cosa de la que dependa una decisión, verifica el resumen o la respuesta contra la transcripción o la grabación original en lugar de darlo por bueno.
Las marcas de tiempo y la transcripción completa están ahí precisamente para esto: para que puedas ir a la fuente y verificar lo que realmente se dijo. Todavía no existe ninguna evaluación formal publicada sobre la calidad de los resúmenes o del chat.
ScreenApp is available as the web app, Mac (Apple silicon) and Windows apps, iOS and Android apps, and a Chrome extension that records tab, screen, mic and camera (Chrome, Edge, Brave, Opera and other Chromium browsers). Ratings and review counts below are pulled at build time from each platform's canonical store listing (the date is named next to each rating). Other listing details (version numbers, sizes, install dates) are point-in-time snapshots checked when this section was last edited; the live store listings are always the authoritative source.
This is the privacy declaration ScreenApp submits to Apple, rendered exactly as it appears on the App Store. Apple's listing is authoritative; if the table below ever diverges from the live App Store page, the App Store page wins and this table should be corrected. ScreenApp declares no tracking data.
| Group | Category | Data types |
|---|---|---|
| Data Used to Track You | None. ScreenApp does not declare any tracking data. | |
| Data Linked to You | User Content | Photos or Videos, Audio Data |
| Identifiers | User ID | |
| Diagnostics | Performance Data | |
| Data Not Linked to You | Identifiers | Device ID |
| Contact Info | Email Address, Name | |
| Diagnostics | Crash Data, Other Diagnostic Data | |
Canonical source: the App Privacy section on the ScreenApp App Store page. Full data handling policies on the Trust Center.
ScreenApp-latest.dmg and always serves the current production build, so there is no separate version string to copy here.io.screenapp.screenapp_mobile.Rating and review counts move daily on the App Store and Google Play. The numbers on this page are point-in-time snapshots, dated above. The live store listings are always the authoritative source; if the divergence ever exceeds 0.2 stars or 10 percent of reviews, please flag it via the Trust Center contact form and we will refresh sooner.
works like a charm, notes have been super helpful alongside chat function. loveeeee
Katharine Suy, Chrome Web Store, October 17, 2024
nice app for important summary
SAHIL, Google Play, January 30, 2026
The numbers below are real production counts, pulled at build time from the ScreenApp production database, the same one the app reads from. They are not marketing rollups, not rounded, and not estimated. Refresh cadence: every deploy. Last pulled: October 2, 2026.
5,865,124
recordings processed
transcribed and analysed in production
2,167,776
speakers diarized
unique speaker turns identified across the corpus
308,798
AI Q&A sessions
questions asked against transcribed media
136,752
voice dictations
captured via browser, iOS, and Android
70,284
meeting-bot sessions
bots that auto-joined Zoom, Google Meet and Microsoft Teams calls; recording without a bot is also available
413,860
analysed video metadata sets
meeting type, speakers, companies extracted
Recent activity (indexed proxy via videometainfo.createdAt): 1,185 recordings analysed in the last 24 hours, 6,375 in the last 7 days, 26,251 in the last 30 days. Daily rate of roughly 875 analyses per day.
Why videometainfo and not recordings directly: recordings._id is a UUID, so we cannot do indexed time-range queries on it. Each videometainfo doc maps 1:1 to a recording via the unique recordingId index, so the time-windowed counts above are a faithful proxy. Methodology and the open query module: below.
8,295,898 cuentas registradas a October 2, 2026. Es el número de registros de cuenta en la colección users de nuestra base de datos de producción, leído en cada compilación con estimatedDocumentCount() de MongoDB, que usa los metadatos de la colección y puede diferir un poco de un conteo exacto. Cuenta cuentas, no personas ni clientes de pago: incluye cuentas gratuitas y de pago, cuentas que nunca han grabado nada, y una persona con dos registros cuenta dos veces. No hay filtro por actividad, pago ni verificación de correo. Las cuentas cuyo registro se ha eliminado de la base de datos no se cuentan. Lo que esta cifra no indica: cuántas cuentas están activas, cuántas pagan, cuántas están verificadas y si las cuentas eliminadas siempre se borran o solo se marcan. La cifra se actualiza en cada despliegue.
No publicamos afirmaciones de marketing con cifras redondeadas como "2 millones de usuarios" sin el conteo subyacente verificable, ni en esta página ni en ninguna otra. Si alguna vez ves una cifra de usuarios inflada o sin fecha en una página de ScreenApp, es un problema de calidad de contenido y queremos saberlo: contáctanos a través del Trust Center.
Every numeric claim on this page and across screenapp.io that depends on production data follows the same pipeline. Numbers are not curated, edited, or rounded for marketing.
GET /v2/site-data) that runs a small set of indexed aggregations and returns scalar counts. The query module is open inside the same repo at scripts/site-data-queries.ts.data/stats.db) and read synchronously by every page at static-generation time. Within a single deploy the numbers do not drift; between deploys they refresh.If you ever spot a number on the site that disagrees with a figure on this page, please flag it via the Trust Center. A divergence is a bug.
No se requiere tarjeta de crédito
7 días gratis; después, $228/año. Se requiere tarjeta.
Auditado anualmente bajo SOC 2 Type 2. 22 políticas internas que cubren control de acceso, clasificación de datos, desarrollo seguro y respuesta a incidentes. Monitoreo continuo de controles.
Nuestro Trust Center (trust.inc/screenapp) muestra los controles de seguridad y las políticas internas que respaldan la auditoría SOC 2 Type 2, y ofrece un cuestionario de seguridad. Para recibir el informe SOC 2 Type 2, escribe a support@screenapp.io.
Los números en las páginas de ScreenApp deben coincidir con esta página. Si encuentras una página que contradiga estas cifras, es un error de calidad que queremos corregir. Escribe a support@screenapp.io; la política de correcciones explica cómo revisamos los avisos y cuándo añadimos una nota de corrección.
Pega una URL o sube un archivo de audio o video. Mira la precisión real con tu contenido, no benchmarks con el contenido de otro.
7 días gratis; después, $228/año. Se requiere tarjeta.