¿Puede Claude ver, analizar y resumir vídeos?
On this page
Claude no puede ver un video. Intenta subir un MP4 al chat y obtendrás un error de tipo de archivo no compatible, porque la lista de carga de Anthropic cubre documentos e imágenes, no videos. Tampoco hay entrada de audio, por lo que Claude no puede escuchar la banda sonora de un video, así como tampoco puede ver sus fotogramas. Lo que Claude sí puede hacer, y lo hace bien, es analizar lo que extraigas de un video primero: una transcripción, un conjunto de fotogramas clave, o ambos, y puede impulsar la propia extracción a través de Claude Code.
Ese párrafo es la respuesta honesta a “¿puede Claude ver videos?”. El resto de esta guía es la parte práctica: dónde se sitúa exactamente el límite, tres flujos de trabajo funcionales para introducir el contenido de un video en Claude de todos modos, y el punto en el que deberías dejar de montar una cadena y entregar el archivo a una herramienta diseñada para esto.
Un detalle documentado establece el límite mejor que cualquier lista de características. GIF es un formato de imagen compatible, pero la documentación de visión de Anthropic establece que las animaciones no son compatibles y que solo se utiliza el primer fotograma. La percepción de Claude no tiene eje de tiempo. Un video, para Claude, es una pila de imágenes fijas y un archivo de texto, y ese encuadre predice todo lo que sigue.
| Tarea de video | Chat de Claude | Claude Code + herramientas |
|---|---|---|
| Subir un MP4, MOV o WebM | No, formato no compatible | Lee el archivo, no puede verlo |
| Escuchar el audio del video | Sin entrada de audio en absoluto | A través de un modelo de voz a texto |
| Analizar fotogramas extraídos | Sí, hasta 20 imágenes por chat | Sí, automatizado |
| Resumir una transcripción | Sí, su habilidad de video más fuerte | Sí |
| Transcribir el video mismo | No | Sí, ejecutando Whisper o una API |
| Responder preguntas sobre el video | Después de que proporciones extractos | Sí, sobre la salida procesada |
| Ver un enlace de YouTube | Lee la página, no el video | Descarga y procesa en su lugar |
Lo que “ver un video” realmente requeriría
Vale la pena ser preciso aquí, porque “Claude puede analizar videos” y “Claude puede ver videos” se usan indistintamente y son afirmaciones diferentes.
Ver significa seguir el habla, leer el texto en pantalla, reconocer lo que está sucediendo visualmente, notar los cambios de escena y conectar todo esto en el tiempo: el presentador dijo “haz clic aquí” a las 3:42 mientras el cursor se movía a un botón específico. Modelos como Gemini ingieren video de forma nativa y pueden hacer algo de esto. Claude no puede. Sus cargas compatibles son documentos (PDF, DOCX, TXT, CSV y similares) e imágenes fijas (JPEG, PNG, GIF, WebP), con un límite de 30 MB por archivo y 20 archivos por chat. MP4, MOV, WebM, AVI y MKV simplemente no están en la lista, y ningún prompt cambia eso.
Una transcripción tampoco es un sustituto de ver. Captura cada palabra y ninguno de los píxeles. Para una conferencia, eso es la mayor parte del valor. Para una demostración de software donde el presentador dice “entonces solo haces esto” mientras hace clic en cuatro menús, la transcripción registra una oración que no significa nada sin los fotogramas. Haz coincidir la extracción con el video: los videos con mucha conversación necesitan la transcripción, los videos visuales necesitan los fotogramas, y la mayoría de los videos reales necesitan un poco de ambos.
Lo que Claude analiza bien, una vez que lo alimentas
El razonamiento de Claude sobre el contenido de video extraído es genuinamente fuerte, por eso los flujos de trabajo a continuación valen la pena.
Dale una transcripción con marcas de tiempo y extraerá temas, decisiones, elementos de acción, personas y términos nombrados, preguntas planteadas y frases citables, y maneja transcripciones largas mejor que la mayoría de los modelos de chat debido a su gran ventana de contexto. Esta es la respuesta a “¿puede Claude resumir videos?”: sí, magníficamente, un paso alejado del video.
Dale fotogramas y leerá diapositivas, interfaces, gráficos, productos y texto en pantalla. La pega es el muestreo: un fotograma cada 10 segundos comprime una demostración de 20 minutos en 120 imágenes, lo que ya es seis veces el límite de carga por chat, por lo que tendrás que elegir 20 fotogramas importantes. Los fotogramas de cambio de escena son mejores que los espaciados uniformemente. Cualquier cosa que parpadee brevemente (un mensaje de error, una notificación) es probable que quede entre tus muestras, y Claude no puede señalar lo que nunca vio.
Los resultados más sólidos provienen de entregarle ambos a la vez, etiquetados: la transcripción más fotogramas clave nombrados por marca de tiempo, con una línea que le dice a Claude cómo se relacionan. Esto le da habla y elementos visuales en una línea de tiempo compartida, que es lo más cerca que un modelo sin video llega a haber “visto”.
Cómo resumir un video con Claude
Transcribe el video con una herramienta dedicada. Un convertidor de video a texto toma el MP4 o un enlace y devuelve una transcripción con marcas de tiempo.
Exporta como TXT, DOCX, PDF o SRT. Mantén las marcas de tiempo; son lo que convierte un resumen en uno navegable.
Sube la transcripción a Claude y pide el formato que desees: notas con viñetas, capítulos, elementos de acción, una guía de estudio, un borrador de blog.
Verifica nombres, números y cualquier cosa que planees citar. La conversión de voz a texto a veces estropea los nombres propios, y Claude resumirá con confianza la versión estropeada.
Un prompt que rinde:
Resume esta transcripción de video en 10 puntos con marcas de tiempo. Luego, enumera cada decisión tomada, cada elemento de acción con su propietario si se nombra, y cualquier pregunta que se haya hecho pero nunca respondida.
Esa última cláusula, preguntas hechas pero nunca respondidas, es el tipo de cosa que Claude es inusualmente bueno en detectar a lo largo de una transcripción larga y que un revisor humano pasa por alto rápidamente.
Captura los fotogramas importantes: cambios de escena, diapositivas, momentos en que el contenido de la pantalla cambia. Las capturas de pantalla funcionan bien para unos pocos; FFmpeg lo automatiza para más.
Nombra cada imagen con su marca de tiempo antes de subirla. "frame-0342.png" le dice a Claude cuándo, no solo qué.
Sube hasta 20 y pide a Claude que los revise en orden: qué se muestra, qué cambió desde el fotograma anterior, qué texto en pantalla aparece.
La versión multimodal, y la que usaría para cualquier cosa importante: genera la transcripción con marcas de tiempo, extrae fotogramas clave en los cambios de escena, etiqueta los fotogramas con sus marcas de tiempo y sube ambos con un breve resumen de una línea ("las imágenes son fotogramas clave del mismo video que esta transcripción, las marcas de tiempo coinciden"). Pide un resumen que haga referencia tanto a lo que se dijo como a lo que se mostró. Esto requiere más trabajo de ensamblaje que cualquiera de los métodos por separado, y es la única versión que capta los momentos de la demostración donde las palabras y la pantalla cuentan mitades diferentes de la historia.
La ruta de Claude Code, para personas que procesan videos semanalmente
Si haces esto una vez, los métodos manuales anteriores están bien. Si lo haces todas las semanas, Claude Code convierte toda la extracción en un script en el que no volverás a pensar.
La división del trabajo: FFmpeg extrae la pista de audio y descarga fotogramas en los cambios de escena, un modelo de voz a texto como Whisper convierte el audio en una transcripción con marcas de tiempo, y Claude Code escribe los comandos, los ejecuta, lee los errores y luego hace la parte en la que es realmente bueno: razonar sobre el resultado combinado en un resumen, una lista de capítulos o un JSON estructurado. Claude nunca toca el video. Conduce las herramientas que sí lo hacen.
Pídele algo como “créame un script que tome un MP4, produzca una transcripción de Whisper y fotogramas de cambio de escena, y escriba un informe markdown con capítulos con marcas de tiempo”, y tendrás una pipeline funcionando en una sola sesión. Espera alimentar la primera transcripción con correcciones (la estimación de Whisper de nombres de productos es una aventura), y espera que un video largo tarde un tiempo real de procesamiento en un portátil.
¿Qué pasa con los enlaces de YouTube?
Pegar una URL de YouTube en Claude hace menos de lo que la gente asume. Con acceso web, Claude obtiene la página, lo que le proporciona el título, la descripción y los comentarios, no el flujo de vídeo. Cualquier cosa que te diga sobre el contenido más allá de eso es una inferencia del texto de la página, entregada con voz segura. Lo he visto producir un “resumen” plausible de un vídeo que estructuralmente no pudo haber visto, lo cual vale la pena recordar cada vez que una respuesta llega sospechosamente rápido.
El camino de trabajo para YouTube es el mismo que en el resto de esta guía: obtén la transcripción primero y luego llévasela a Claude. Para YouTube específicamente hay un atajo, ya que la mayoría de los vídeos ya tienen subtítulos; una herramienta que los extrae directamente es más rápida que transcribir desde cero, y cubrimos todo ese flujo de trabajo en cómo chatear con vídeos de YouTube.
La versión en la que te saltas todo esto
Todo lo anterior ensambla un aparato de “observación” alrededor de un modelo que no puede observar. La otra opción es una herramienta donde ese aparato es el producto.
Un observador de vídeo con IA toma el MP4, MOV o el enlace directamente, ejecuta la transcripción y el análisis visual por sí mismo, y te ofrece un resumen más una caja de preguntas dirigida al vídeo, sin FFmpeg, sin presupuesto de fotogramas, sin barreras de formato. El nivel gratuito de ScreenApp incluye 600 minutos de transcripción al mes, lo que cubre una temporada de reuniones semanales. Comparamos las herramientas que pueden hacer esto, incluida la nuestra, en nuestro resumen de herramientas de IA que pueden ver vídeos.
Los dos enfoques también se complementan. Deja que la herramienta de vídeo haga la observación, exporta la transcripción y el resumen, y entrégaselos a Claude para las partes en las que Claude es mejor: reescribir para una audiencia diferente, comparar tres vídeos entre sí, o convertir una grabación en un artículo, una lista de verificación y un correo electrónico de seguimiento. Esa división, herramienta dedicada para la extracción, Claude para el razonamiento, supera a cualquiera de las dos por sí sola.
Claude vs un analizador de vídeo dedicado
| Habilidad | Claude | Analizador de vídeo dedicado |
|---|---|---|
| Carga directa de MP4 o enlace | No | Sí |
| Transcripción automática | Necesita otra herramienta | Integrado |
| Análisis visual de escenas | Solo en los fotogramas que extraes | Se ejecuta en el vídeo completo |
| Resumen y razonamiento de la transcripción | Excelente, contexto amplio | Bueno, formatos fijos |
| Hacer preguntas sobre el vídeo | Después del preprocesamiento | Inmediatamente después de la carga |
| Automatización personalizada y reutilización | Lo mejor que hay | Limitado |
| Se requiere codificación | Para cualquier cosa automatizada | Ninguna |
La regla de clasificación honesta: empieza por lo que tienes. Si tienes una transcripción, o necesitas razonamiento, comparación y reutilización, Claude es la herramienta adecuada y un placer de usar. Si tienes un archivo de vídeo y la pregunta “¿qué hay en esto?”, un analizador dedicado lo responde en el tiempo que Claude tarda en rechazar la carga. Y todo este límite no es exclusivo de Claude: ChatGPT tiene la misma barrera de no-vídeo con diferentes aristas, que mapeamos en ¿puedes subir vídeo o audio a ChatGPT?. Si tu pregunta es sobre crear vídeos en lugar de entenderlos, ese es el artículo hermano: ¿puede Claude crear vídeos?.
Algunos límites a tener en cuenta, independientemente de la ruta. Los fotogramas muestreados omiten eventos breves. El reconocimiento de voz a texto destrozó los nombres, y cada resumen hereda los errores de la transcripción. Una transcripción muy larga aún puede saturar una ventana de contexto. Y un resumen seguro no es uno verificado: para cualquier cosa con implicaciones, verifica las afirmaciones con la grabación real antes de reenviarlas.
Entonces, ¿puede Claude ver vídeos? No, y no se acerca: no hay formatos de vídeo, no hay entrada de audio, no hay movimiento, solo el primer fotograma incluso en un GIF. ¿Puede analizar y resumir vídeos? Sí, tan bien como cualquier cosa en el mercado, en el momento en que le entregas el contenido del vídeo como texto e imágenes fijas. Obtén la extracción de una herramienta creada para ello, dale a Claude el trabajo de razonamiento y tendrás la mejor versión de ambos.
Preguntas Frecuentes
¿Puede Claude ver directamente un vídeo subido?
No. Los formatos de vídeo no están en la lista de cargas compatibles de Claude, por lo que un MP4, MOV o WebM es rechazado antes de que comience cualquier análisis. Claude trabaja solo con documentos e imágenes.
¿Puedo subir un archivo MP4 a Claude?
No en el chat; obtendrás un error de tipo de archivo no compatible. En Claude Code, el archivo puede estar en tu carpeta de proyecto, pero Claude aún no puede reproducirlo ni verlo, solo ejecutar herramientas sobre él.
¿Puede Claude escuchar el audio de un video?
No. Claude no tiene ningún tipo de entrada de audio. Para que el contenido hablado llegue a Claude, un modelo de voz a texto debe transcribirlo primero, y Claude trabaja a partir del texto.
¿Puede Claude resumir un video de YouTube?
No desde el enlace. Con acceso web, lee la página del video (título, descripción, comentarios), no la transmisión, y puede producir un resumen plausible que en realidad no podría verificar. Primero extrae la transcripción o los subtítulos, luego pregunta; el resumen se vuelve real.
¿Puede Claude analizar los fotogramas de un video?
Sí, y bien. Sube capturas de pantalla o fotogramas clave extraídos (hasta 20 imágenes por chat, 30 MB cada una) y Claude lee diapositivas, interfaces, gráficos y texto en pantalla. Etiqueta los fotogramas con marcas de tiempo para que pueda razonar sobre el orden.
¿Puede Claude transcribir un video?
No. La transcripción necesita procesamiento de audio que Claude no tiene. Usa una herramienta de transcripción o un modelo de voz a texto, luego lleva la transcripción a Claude para el análisis.
¿Puede Claude analizar una grabación de pantalla?
Sí, a través de extractos: la narración como una transcripción y los estados importantes de la pantalla como fotogramas. Para grabaciones de pantalla sin narración, los fotogramas contienen toda la información, así que extráelos en cada cambio significativo de la interfaz de usuario.
¿Puede Claude resumir un video sin una transcripción?
Solo a partir de fotogramas, lo que cubre lo que se mostró pero no lo que se dijo. Para cualquier video donde el habla transmite el significado, no tener transcripción significa no tener un resumen real.
¿Puede Claude Code procesar archivos de video?
Sí, mediante orquestación. Escribe y ejecuta comandos FFmpeg para extraer audio y fotogramas, llama a un modelo de voz a texto para la transcripción y luego analiza la salida combinada. Las herramientas externas hacen el trabajo de video; Claude Code las dirige y razona sobre los resultados.
¿Qué formatos de video soporta Claude?
Ninguno. Las cargas soportadas son documentos (PDF, DOCX, TXT, CSV y similares) e imágenes (JPEG, PNG, GIF, WebP). Las cargas GIF usan solo el primer fotograma, según la documentación de visión de Anthropic.
¿Cuál es la mejor manera de darle un video a Claude?
Una transcripción con marca de tiempo más un puñado de fotogramas clave etiquetados con marca de tiempo, subidos junto con una línea explicando que provienen del mismo video. Esa combinación hace que Claude se acerque lo más posible a haberlo “visto”.
¿Qué debo usar si solo quiero que el video sea analizado ahora?
Un analizador de video dedicado que acepte el archivo o enlace directamente, lo transcriba y te permita hacer preguntas inmediatamente. Luego exporta la transcripción a Claude si deseas un razonamiento más profundo o reutilización adicional.