Kan Claude video's bekijken, analyseren en samenvatten?
On this page
Claude kan geen video bekijken. Probeer een MP4 te uploaden naar de chat en je krijgt een ‘unsupported-file-type’-foutmelding, omdat de uploadlijst van Anthropic documenten en afbeeldingen omvat, niet video. Er is ook geen audio-invoer, dus Claude kan de soundtrack van een video net zo min horen als de frames ervan zien. Wat Claude wel kan, en goed doet, is analyseren wat je eerst uit een video haalt: een transcript, een reeks keyframes, of beide, en het kan de extractie zelf aansturen via Claude Code.
Die ene paragraaf is het eerlijke antwoord op de vraag “kan Claude video’s bekijken”. De rest van deze gids is het praktische deel: precies waar de grens ligt, drie werkende workflows om de inhoud van een video toch in Claude te krijgen, en het punt waarop je moet stoppen met het samenstellen van een pijplijn en het bestand moet overhandigen aan een tool die hiervoor is gebouwd.
Eén gedocumenteerd detail bepaalt de grens beter dan welke functielijst dan ook. GIF is een ondersteund afbeeldingsformaat, maar de visiedocumentatie van Anthropic vermeldt dat animaties niet worden ondersteund en dat alleen het eerste frame wordt gebruikt. De perceptie van Claude heeft geen tijdsas. Een video is voor Claude een stapel stilstaande beelden en een tekstbestand, en die benadering voorspelt alles hieronder.
| Videotaak | Claude chat | Claude Code + tools |
|---|---|---|
| Upload een MP4, MOV of WebM | Nee, niet-ondersteund formaat | Leest het bestand, kan het niet bekijken |
| Audio van de video beluisteren | Helemaal geen audio-invoer | Via een spraak-naar-tekst-model |
| Geëxtraheerde frames analyseren | Ja, tot 20 afbeeldingen per chat | Ja, geautomatiseerd |
| Een transcript samenvatten | Ja, de sterkste videovaardigheid | Ja |
| De video zelf transcriberen | Nee | Ja, door Whisper of een API uit te voeren |
| Vragen over de video beantwoorden | Nadat je extracten hebt aangeleverd | Ja, over de verwerkte uitvoer |
| Een YouTube-link bekijken | Leest de pagina, niet de video | Downloadt en verwerkt in plaats daarvan |
Wat “een video bekijken” daadwerkelijk zou vereisen
Het is de moeite waard om hierin nauwkeurig te zijn, want “Claude kan video’s analyseren” en “Claude kan video’s bekijken” worden door elkaar gebruikt, terwijl het verschillende beweringen zijn.
Bekijken betekent spraak volgen, tekst op het scherm lezen, visueel herkennen wat er gebeurt, scèneveranderingen opmerken en alles in de tijd met elkaar verbinden: de presentator zei “klik hier” om 3:42 terwijl de cursor naar een specifieke knop bewoog. Modellen zoals Gemini nemen video’s native op en kunnen dit deels. Claude kan dat niet. De ondersteunde uploads zijn documenten (PDF, DOCX, TXT, CSV en dergelijke) en stilstaande beelden (JPEG, PNG, GIF, WebP), met een limiet van 30 MB per bestand en 20 bestanden per chat. MP4, MOV, WebM, AVI en MKV staan simpelweg niet op de lijst, en geen enkele prompt verandert dat.
Een transcript is ook geen vervanging voor het bekijken. Het vangt elk woord op en geen enkele pixel. Voor een lezing is dat het grootste deel van de waarde. Voor een software demo waarbij de presentator zegt “dan doe je dit gewoon” terwijl hij door vier menu’s klikt, registreert het transcript een zin die niets betekent zonder de frames. Stem de extractie af op de video: ‘praatvideo’s’ hebben het transcript nodig, visuele video’s hebben de frames nodig, en de meeste echte video’s hebben beide nodig.
Wat Claude goed analyseert, zodra je het voedt
De redenering van Claude over geëxtraheerde video-inhoud is oprecht sterk, en daarom zijn de onderstaande workflows de moeite waard.
Geef het een transcript met tijdstempels en het zal onderwerpen, beslissingen, actiepunten, genoemde personen en termen, gestelde vragen en citeerbare zinnen eruit halen, en het verwerkt lange transcripten beter dan de meeste chatmodellen vanwege zijn grote contextvenster. Dit is het antwoord op “kan Claude video’s samenvatten”: ja, uitstekend, één stap verwijderd van de video.
Geef het frames en het leest dia’s, interfaces, grafieken, producten en tekst op het scherm. De valkuil is bemonstering: een frame elke 10 seconden comprimeert een demo van 20 minuten tot 120 afbeeldingen, wat al zes keer de uploadlimiet per chat is, dus je zult 20 frames moeten kiezen die er toe doen. Frames van scèneveranderingen zijn beter dan gelijkmatig verdeelde. Alles wat kort knippert (een foutmelding, een notificatie) zal waarschijnlijk tussen je samples vallen, en Claude kan niet markeren wat het nooit heeft gezien.
De sterkste resultaten komen voort uit het tegelijk aanleveren van beide, gelabeld: het transcript plus keyframes benoemd met tijdstempel, met één zin die Claude vertelt hoe ze gerelateerd zijn. Dat geeft het spraak en beelden op een gedeelde tijdlijn, wat het dichtst bij “bekeken hebben” komt voor een model zonder videomogelijkheden.
Hoe je een video samenvat met Claude
Transcribeer de video met een speciale tool. Een video-naar-tekst-converter neemt de MP4 of een link en levert een transcript met tijdstempels op.
Exporteer als TXT, DOCX, PDF of SRT. Houd de tijdstempels aan; zij maken een samenvatting navigeerbaar.
Upload het transcript naar Claude en vraag om het gewenste formaat: bullet points, hoofdstukken, actiepunten, een studiegids, een blogconcept.
Controleer namen, nummers en alles wat je van plan bent te citeren. Spraak-naar-tekst verminkt eigennamen, en Claude zal de verminkte versie vol vertrouwen samenvatten.
Een prompt die zijn waarde bewijst:
Vat dit video-transcript samen in 10 bullet points met tijdstempels. Vermeld vervolgens elke genomen beslissing, elk actiepunt met de eigenaar indien genoemd, en elke vraag die gesteld maar nooit beantwoord is.
Die laatste clausule, vragen die gesteld maar nooit beantwoord zijn, is het soort dingen dat Claude ongewoon goed opmerkt in een lang transcript en waar een menselijke beoordelaar snel overheen leest.
Vang de frames die ertoe doen: scèneveranderingen, dia's, momenten waarop de scherminhoud verschuift. Screenshots werken prima voor een paar; FFmpeg automatiseert het voor meer.
Geef elke afbeelding een naam met tijdstempel voordat je uploadt. "frame-0342.png" vertelt Claude wanneer, niet alleen wat.
Upload tot 20 frames en vraag Claude om ze in volgorde te doorlopen: wat wordt er getoond, wat is er veranderd sinds het vorige frame, welke tekst verschijnt op het scherm.
De multimodale versie, en degene die ik zou gebruiken voor alles wat belangrijk is: genereer het transcript met tijdstempels, extraheer keyframes bij scèneveranderingen, label de frames met hun tijdstempels, en upload beide met een korte omschrijving ("de afbeeldingen zijn keyframes van dezelfde video als dit transcript, tijdstempels komen overeen"). Vraag om een samenvatting die zowel verwijst naar wat er gezegd als naar wat er getoond werd. Dit is meer assemblagearbeid dan elk van de methoden afzonderlijk, en het is de enige versie die de demo-momenten opvangt waarbij de woorden en het scherm verschillende helften van het verhaal vertellen.
De Claude Code-route, voor mensen die wekelijks video’s verwerken
Als je dit eenmalig doet, zijn de handmatige methoden hierboven prima. Als je het wekelijks doet, verandert Claude Code de hele extractie in een script waar je nooit meer over na hoeft te denken.
De taakverdeling: FFmpeg haalt het audiospoor op en dumpt frames bij scèneveranderingen, een spraak-naar-tekst-model zoals Whisper zet de audio om in een transcript met tijdstempels, en Claude Code schrijft de commando’s, voert ze uit, leest de fouten, en doet vervolgens het deel waar het echt goed in is: redeneren over de gecombineerde uitvoer in een samenvatting, hoofdstuklijst of gestructureerde JSON. Claude raakt de video nooit aan. Het dirigeert de tools die dat wel doen.
Vraag het iets als “bouw me een script dat een MP4 neemt, een Whisper-transcript en scène-veranderingsframes produceert, en een markdown-rapport schrijft met tijdstempelhoofdstukken,” en je hebt in één keer een werkende pijplijn. Verwacht dat je het eerste transcript terug moet sturen met correcties (Whisper’s gok naar productnamen is een avontuur), en verwacht dat een lange video veel verwerkingstijd in beslag neemt op een laptop.
Hoe zit het met YouTube-links?
Een YouTube-URL in Claude plakken doet minder dan mensen aannemen. Met webtoegang haalt Claude de pagina op, wat hem de titel, de beschrijving en de opmerkingen geeft, niet de videostream. Wat het je ook vertelt over de inhoud, afgezien daarvan, is een gevolgtrekking uit de paginatekst, geleverd met een zelfverzekerde stem. Ik heb het een plausibel klinkende “samenvatting” zien produceren van een video die het structureel niet had kunnen bekijken, wat de moeite waard is om te onthouden telkens wanneer een antwoord verdacht snel arriveert.
De werkende YouTube-route is dezelfde als overal elders in deze gids: haal eerst het transcript, breng het dan naar Claude. Specifiek voor YouTube is er een kortere weg, aangezien de meeste video’s al ondertitels hebben; een tool die deze direct ophaalt is sneller dan transcriberen vanaf nul, en we hebben die hele workflow behandeld in hoe je kunt chatten met YouTube-video’s.
De versie waarin je dit allemaal overslaat
Alles hierboven bouwt een kijkapparaat rond een model dat niet kan kijken. De andere optie is een tool waarbij dat apparaat het product is.
Een AI videokijker neemt de MP4, MOV of link direct, voert zelf de transcriptie en de visuele analyse uit, en geeft je een samenvatting plus een vragenbox gericht op de video, geen FFmpeg, geen frame budgettering, geen formaatbeperking. ScreenApp’s gratis abonnement omvat 600 transcriptie-minuten per maand, wat een seizoen van wekelijkse vergaderingen dekt. We hebben de tools die dit kunnen, inclusief die van ons, vergeleken in onze samenvatting van AI tools die video’s kunnen bekijken.
De twee benaderingen stapelen zich ook op. Laat de videotool het kijken doen, exporteer het transcript en de samenvatting, en geef deze aan Claude voor de onderdelen waar Claude het beste in is: herschrijven voor een ander publiek, drie video’s met elkaar vergelijken, of één opname omzetten in een artikel, een checklist en een follow-up e-mail. Die splitsing, een speciale tool voor extractie, Claude voor redenering, verslaat elk afzonderlijk.
Claude vs een speciale video-analysator
| Mogelijkheid | Claude | Speciale video-analysator |
|---|---|---|
| Directe MP4- of linkupload | Nee | Ja |
| Automatische transcriptie | Heeft een andere tool nodig | Ingebouwd |
| Visuele scèneanalyse | Alleen op frames die je extraheert | Draait op de volledige video |
| Transcriptie samenvatting en redenering | Uitstekend, grote context | Goed, vaste formaten |
| Stel vragen over de video | Na voorverwerking | Onmiddellijk na uploaden |
| Aangepaste automatisering en hergebruik | Het beste wat er is | Beperkt |
| Coderen vereist | Voor alles wat geautomatiseerd is | Geen |
De eerlijke sorteerregel: begin met wat je in handen hebt. Als je een transcript hebt, of redenering, vergelijking en hergebruik nodig hebt, is Claude de juiste tool en een genot om te gebruiken. Als je een videobestand hebt en de vraag “wat zit hierin,” beantwoordt een speciale analysator dit in de tijd die Claude nodig heeft om de upload te weigeren. En deze hele grens is niet uniek voor Claude: ChatGPT heeft hetzelfde geen-videomuurtje met verschillende randen, die we hebben uitgestippeld in kun je video of audio uploaden naar ChatGPT. Als je vraag gaat over het maken van video’s in plaats van het begrijpen ervan, is dat het verwante artikel: kan Claude video’s maken.
Enkele beperkingen om in gedachten te houden, ongeacht de route. Bemonsterde frames missen korte gebeurtenissen. Spraak-naar-tekst verminkt namen, en elke samenvatting erft de fouten van het transcript. Een zeer lang transcript kan nog steeds een contextvenster overbelasten. En een zelfverzekerde samenvatting is geen geverifieerde: voor alles met belangen, controleer de beweringen tegen de daadwerkelijke opname voordat je ze doorstuurt.
Dus, kan Claude video’s bekijken? Nee, en het komt er niet eens in de buurt: geen videoformaten, geen audio-invoer, geen beweging, alleen het eerste frame, zelfs bij een GIF. Kan het video’s analyseren en samenvatten? Ja, net zo goed als alles op de markt, zodra je het de inhoud van de video aanlevert als tekst en stilstaande beelden. Krijg de extractie van een tool die ervoor gebouwd is, geef Claude het redeneerwerk, en je hebt de beste versie van beide.
Veelgestelde Vragen
Kan Claude direct een geüploade video bekijken?
Nee. Videoformaten staan niet op Claude’s ondersteunde uploadlijst, dus een MP4, MOV of WebM wordt geweigerd voordat enige analyse begint. Claude werkt alleen met documenten en afbeeldingen.
Kan ik een MP4-bestand uploaden naar Claude?
Niet in de chat; je krijgt een foutmelding voor een niet-ondersteund bestandstype. In Claude Code kan het bestand in je projectmap staan, maar Claude kan het nog steeds niet afspelen of bekijken, alleen tools ertegen uitvoeren.
Kan Claude luisteren naar de audio van een video?
Nee. Claude heeft geen enkele vorm van audio-input. Om gesproken inhoud in Claude te krijgen, moet een spraak-naar-tekst-model het eerst transcriberen, en Claude werkt vervolgens met de tekst.
Kan Claude een YouTube-video samenvatten?
Niet vanaf de link. Met webtoegang leest het de pagina van de video (titel, beschrijving, reacties), niet de stream, en kan het een aannemelijke samenvatting produceren die het niet daadwerkelijk kon verifiëren. Haal eerst het transcript of de ondertiteling op, vraag het dan; de samenvatting wordt dan echt.
Kan Claude videoframes analyseren?
Ja, en goed. Upload schermafbeeldingen of geëxtraheerde keyframes (maximaal 20 afbeeldingen per chat, 30 MB per stuk) en Claude leest dia’s, interfaces, grafieken en tekst op het scherm. Label frames met tijdstempels zodat het over de volgorde kan redeneren.
Kan Claude een video transcriberen?
Nee. Transcriptie vereist audioverwerking die Claude niet heeft. Gebruik een transcriptietool of een spraak-naar-tekst-model, en breng het transcript vervolgens naar Claude voor de analyse.
Kan Claude een schermopname analyseren?
Ja, via extracten: de gesproken tekst als een transcript en de belangrijke schermtoestanden als frames. Voor schermopnames zonder gesproken tekst dragen frames alle informatie, dus extraheer ze bij elke betekenisvolle UI-wijziging.
Kan Claude een video samenvatten zonder transcript?
Alleen vanuit frames, wat weergeeft wat werd getoond, maar niet wat werd gezegd. Voor elke video waarin spraak de betekenis draagt, betekent geen transcript geen echte samenvatting.
Kan Claude Code videobestanden verwerken?
Ja, door orkestratie. Het schrijft en voert FFmpeg-commando’s uit om audio en frames te extraheren, roept een spraak-naar-tekst-model aan voor het transcript en analyseert vervolgens de gecombineerde uitvoer. Externe tools doen het videowerk; Claude Code stuurt ze aan en redeneert over de resultaten.
Welke videoformaten ondersteunt Claude?
Geen. Ondersteunde uploads zijn documenten (PDF, DOCX, TXT, CSV en vergelijkbaar) en afbeeldingen (JPEG, PNG, GIF, WebP). GIF-uploads gebruiken alleen het eerste frame, volgens de visiedocumentatie van Anthropic.
Wat is de beste manier om Claude een video te geven?
Een transcript met tijdstempels plus een handvol keyframes met tijdstempels, samen geüpload met één zin die uitlegt dat ze van dezelfde video komen. Die combinatie zorgt ervoor dat Claude het meest het gevoel heeft de video te hebben bekeken.
Wat moet ik gebruiken als ik de video nu wil laten analyseren?
Een speciale video-analysetool die het bestand of de link direct accepteert, deze transcribeert en je onmiddellijk vragen laat stellen. Exporteer vervolgens het transcript naar Claude als je diepere redenering of hergebruik wilt.