Bu Yapay Zeka Görüntü Analiz Cihazı ChatGPT’nin Yapamadıklarını Yapıyor
Bir fotoğraf yükleyin ve 3 saniyeden kısa sürede etiketleri, metni ve sahne verilerini geri alın. ChatGPT, Gemini ve Claude’dan farkı, model etrafındaki iş akışıdır: aynı anda 100 görsel bırakabilir, sonuçları JSON veya CSV olarak çekebilir ve görseller herhangi bir şeyi eğitmek için kullanılmaz.
Genel sohbet robotları mesaj başına bir görsel işler, düz yazı döndürür ve genellikle yüklemeleri saklar. Bu, tek bir tatil fotoğrafı için uygun olabilir. Ancak 80 makbuzu okumanız, 300 ürün fotoğrafını etiketlemeniz veya bir fatura klasöründen kalem kalem verileri çıkarmanız gerektiğinde yetersiz kalır.
Araç üç iş için geliştirilmiştir:
- Toplu çalıştırmalar: bir klasör bırakın, görsel başına bir satır alın
- Yapılandırılmış çıktı: JSON, CSV veya tablo - paragraflar değil
- Özel görseller: hesap yok, saklama yok, model eğitimi yok
Ücretsiz sürüm ayda 50 görseli kapsar. 12 megapiksele kadar JPG, PNG, WEBP.
Toplu Görüntü Analizi - Sohbet Robotlarının Yapamadıkları
ChatGPT Plus, mesaj başına dosya yüklemelerini sınırlar ve yaklaşık 10 görselden sonra bağlamı kaybetmeye başlar. Gemini ve Claude benzer şekilde davranır. Bir sohbete 50 ekran görüntüsü yapıştırırsanız, sonuncuya ulaştığında ilktekileri unutan uzun bir yanıt alırsınız.
Bu analiz cihazı, klasörü toplu iş olarak alır. Her görsel kendi sonuç satırını alır. Tam çıktıyı CSV veya JSON olarak indirirsiniz.
Burada iyi çalışan toplu örnekler:
- E-ticaret katalog etiketlemesi için 200 ürün fotoğrafı
- Gider çıkarımı için 80 makbuz
- Haftalık raporlama için bir panonun 150 ekran görüntüsü
- OCR için 300 taranmış belge
- Otomatik alt metin için 500 stok fotoğrafı
Her görsel bağımsız olarak işlenir, bu nedenle bir bozuk dosya çalıştırmayı bozmaz. Sonuçlar, alan başına güvenilirlik puanlarını içerir.
Yapılandırılmış Çıktı - JSON, CSV, Tablo Formatı
Sohbet robotları paragraflar halinde yanıt verir. Sonuçları bir e-tabloya veya veritabanına aktarmanız gerekiyorsa bu pek kullanışlı değildir. ChatGPT’den 40 makbuzu JSON olarak biçimlendirmesini isteyin, tutarsız anahtarlar, kaçırılan alanlar ve sıyırmanız gereken ara sıra bir markdown kod çiti elde edersiniz.
Bu araç her seferinde aynı şemayı döndürür:
{
"filename": "receipt_042.jpg",
"objects": [{"label": "receipt", "confidence": 0.98}],
"text": "Whole Foods\n04/12/2026\n$47.82",
"scene": "indoor, document",
"dominant_colors": ["#ffffff", "#2a2a2a"]
}
Çıktı formatları:
- Tüm satırlarda tutarlı şemaya sahip JSON
- Excel, Sheets veya Airtable’a doğrudan içe aktarım için CSV
- Hızlı kopyala-yapıştır için düz metin
- Alan düzeyinde güvenilirlik puanları
Hangi alanları çıkaracağınızı seçebilirsiniz. Makbuzlar toplamları ve tarihleri ister. Ürün fotoğrafları renk, kategori ve nitelikleri ister. Tıbbi görüntüler yine başka bir şey ister.
Görseller Nasıl 3 Adımda Analiz Edilir
- Yükle: JPG, PNG veya WEBP dosyalarını sürükleyin (tek görsel veya klasör)
- Çıkarma alanlarını seçin: nesneler, metin, sahne, renkler, yüzler, yer işaretleri
- Sonuçları alın: tarayıcıda görüntüleyin veya JSON/CSV olarak dışa aktarın
Kurulum yok, API anahtarı yok, GCP projesi kurmaya gerek yok. “Görüntü analiz cihazı”, “image analizer” veya “pic analysis” ararsanız, bu aynı araçtır.
Analiz çıktı türleri
Analiz cihazı, sabit bir şemaya sahip, görsel başına bir JSON kaydı döndürür. Her alan isteğe bağlıdır, bu nedenle “kişi sayısı” veya “OCR” işaretini kaldırmak yanıtı kısaltır. Tipik bir tam kayıt şöyle görünür:
{
"objects": [
{"label": "laptop", "confidence": 0.96, "bbox": [120, 245, 480, 410]},
{"label": "coffee_cup", "confidence": 0.88, "bbox": [505, 350, 580, 440]}
],
"text_ocr": "Üç aylık inceleme toplantısı gündemi...",
"scene": "iç mekan ofis masa düzeni",
"dominant_colors": ["#3a4a5e", "#d4cfc7", "#1a1a1a"],
"people_count": 1,
"questions_answered": [
{"q": "Masada ne var?", "a": "Bir dizüstü bilgisayar ve kahve fincanı..."}
]
}
Desteklenen analiz görevleri
| Analiz görevi | Ne çıktısı verir | Kullanım durumu |
|---|---|---|
| Nesne tespiti | Etiketler ve sınırlayıcı kutularla liste | Ürün kataloğu etiketleme |
| OCR | Ekran görüntülerinden, belgelerden, tabelalardan çıkarılan metin | Belge dijitalleştirme |
| Sahne sınıflandırması | Genel sahne etiketi | İçerik kategorizasyonu |
| Görsel üzerinde Soru-Cevap | Görsel hakkındaki sorulara serbest biçimli yanıtlar | Görsel araştırma, öğrenme |
| Kişi sayısı | Algılanan kişi sayısı | Kitle büyüklüğü tahminleri |
| Renk paleti | Baskın hex değerleri | Tasarım ve marka denetimleri |
Sınırlayıcı kutular, sol üst başlangıç noktasından [x1, y1, x2, y2] piksel koordinatlarını takip eder. Güvenilirlik puanları 0 ila 1 arasında ondalıklı sayılardır. Yalnızca bir alan istiyorsanız (örneğin, bir makbuz çalıştırması için OCR), diğerlerini kapatabilir ve yanıtı yalnızca o anahtarla küçülterek CSV dışa aktarımlarını temiz tutabilirsiniz.
Yapay Zeka Görsel Analizörü vs ChatGPT, Gemini, Claude (2026)
| Özellik | ScreenApp | ChatGPT (GPT-5) | Gemini 2.5 | Claude 4.5 | Google Cloud Vision |
|---|---|---|---|---|---|
| Toplu yükleme (100+ görsel) | Evet | Hayır, mesaj başına sınırlı | Hayır, mesaj başına sınırlı | Hayır, mesaj başına sınırlı | Evet, API aracılığıyla |
| Yapılandırılmış JSON çıktısı | Evet, tutarlı şema | Tutarsız | Tutarsız | Tutarsız | Evet |
| CSV dışa aktarımı | Evet | Hayır | Hayır | Hayır | Betik gerektirir |
| Kayıt gerekli mi | Hayır | Evet | Evet | Evet | Evet, GCP |
| Eğitim için kullanılan görseller | Hayır | Devre dışı bırakma ayarı | Devre dışı bırakma ayarı | Devre dışı bırakma ayarı | Hayır |
| API anahtarı gerekli mi | Hayır | Evet | Evet | Evet | Evet |
| Ücretsiz sürüm | Ayda 50 görsel | Sınırlı sohbet yüklemeleri | Sınırlı sohbet yüklemeleri | Sınırlı sohbet yüklemeleri | Ayda 1.000 birim |
| Fiyat (ücretli) | Bireyler için ücretsiz | 20$/ay abonelik | 20$/ay abonelik | 20$/ay abonelik | 1.000 birim başına 1.50$ |
Bir sohbet botunun uygun olduğu zamanlar: tek bir görsel, hızlı bir soru, sohbetli bir takip.
Bu aracın kazandığı zamanlar: bir klasörünüz var, satırlar halinde geri dönüş almak istiyorsunuz ve her bir görseli bir sohbete yapıştırmak veya API kodu yazmak istemiyorsunuz.
Sohbet Botlarının İyi Yönetemediği Kullanım Durumları
Görsel analiz metalaşmıştır. Herhangi bir sınır modeli tek bir fotoğrafı tanımlayabilir. Fark, modelin etrafındaki işlerdedir.
Makbuz ve fatura çıkarma. Bir kerede 50 makbuzu OCR yapın, toplamları ve satıcıları gider raporlama için CSV’ye aktarın. ChatGPT bir düzineden sonra konuyu kaybeder ve tutarsız JSON döndürür.
Ürün kataloğu etiketleme. 300 ürün fotoğrafını çekin, renk, kategori ve görünür metni bir elektronik tabloya çıkarın. Doğrudan Shopify veya Airtable’a yazın.
Ekran görüntüsü toplu OCR. Bir gösterge paneli veya destek biletlerinin 150 ekran görüntüsünden metin okuyun. Çıktıyı bir günlük analizörüne veya arama dizinine gönderin.
Özel veya hassas görseller. Hesap yok, saklama yok, eğitim yok. Tıbbi görseller, yasal belgeler, dahili ekran görüntüleri veya bir sohbet geçmişinde kalmasını istemediğiniz herhangi bir şey için kullanışlıdır.
El yazısı not dijitalleştirme. Bir deste el yazısı sayfayı veya toplantı beyaz tahtalarını aranabilir metne OCR yapın. Tek tek sayfalar ChatGPT’de iyidir; 40 sayfalık bir çalışma iyi değildir.
Rakip görsel denetimi. Rakip sitelerden alınmış bir klasördeki ekran görüntülerini düzen kalıpları, CTA renkleri ve yaygın bileşenler açısından analiz edin.
Envanter sayımı. Raf fotoğrafları, depo çekimleri veya saha denetim fotoğrafları genelindeki öğeleri algılayın ve sayın. Sayımları CSV olarak dışa aktarın.
Kimler Kullanır?
- E-ticaret ekipleri ürün kataloglarını etiketleyen ve ölçekli alt metin oluşturanlar
- Muhasebeciler makbuz ve faturalardan kalemleri çıkaranlar
- Destek ve operasyon ekipleri biletlerden veya kontrol panellerinden ekran görüntülerini toplu OCR yapanlar
- Araştırmacılar fotoğraf veri kümelerinden yapılandırılmış veri çıkaranlar
- İçerik ekipleri görsel kitaplıklarını etiketleyen ve başlıklar oluşturanlar
- Uyum ekipleri belge gruplarını belirli metin veya etiketler için tarayanlar
Araç, “görsel analizörü”, “görsel analizi” veya “görsel çözümleyici” olarak yazsanız da aynı şekilde çalışır.
Sadece Bir Fotoğrafı Değil, Bir Grafiği Okumak
Görsel analizinin çoğu nesne fotoğraflarıyla ilgili değildir; bir gösterge paneli, bir grafik, bir hata mesajı, bir dosya yerine görsel olarak gönderilen bir tablo gibi ekran görüntüleriyle ilgilidir. Analizör bunları okur, böylece bu grafikteki eğilimin ne olduğunu sorabilir veya bir hata ekran görüntüsünü yapıştırıp ne anlama geldiğini hiçbirini yeniden yazmadan sorabilirsiniz.
Grafikler, bu aracın kendini kanıtladığı yerlerdir. Bir çubuk grafiğin arkasındaki değerleri sorun ve eksenlerden okur, gözle incelemekten daha hızlıdır. Yanılmaz değildir, dar bir grafik minik etiketlerle yanlış okunabilir, bu yüzden bir sayıyı alıntılamadan önce sağlamasını yapın. Ancak veri resmini tekrar üzerinde çalışabileceğiniz bir şeye dönüştürmek için, gözleri kısıp elle yazıya geçirmekten çok daha iyidir.
SSS
Bununla ChatGPT görsel analizi arasındaki fark nedir?
ChatGPT mesaj başına bir görseli iyi işler. Bu araç, toplu işlem yapar. 100 görsel yükleyin, aynı şemaya sahip 100 satır JSON veya CSV olarak geri alın. ChatGPT tutarlı yapılandırılmış çıktı dışa aktaramaz ve mesaj başına dosya sayısını sınırlar.
Bunu makbuzlar ve faturalar için kullanabilir miyim?
Evet. Bir makbuz fotoğrafı klasörü yükleyin, istediğiniz alanları seçin (toplam, tarih, satıcı, kalemler) ve CSV olarak dışa aktarın. Buruşuk, açılı veya loş ışıklı makbuzlarda çalışır.
Görsellerim yapay zeka modellerini eğitmek için kullanılıyor mu?
Hayır. Görseller işlendikten sonra saklanmaz ve hiçbir zaman eğitim setine girmez. Hesap gerekmez, bu nedenle kimlikle ilişkili hiçbir şey yoktur.
Bir seferde kaç görseli analiz edebilirim?
Ücretsiz sürüm ayda 50 görseli kapsar. Tek bir toplu çalıştırma, tarayıcınızın tek seferde yükleyebileceği kadar dosya içerebilir. Ücretli planlar aylık sınırı kaldırır.
Hangi çıktı formatları destekleniyor?
Sabit bir şemaya sahip JSON, elektronik tablolar için CSV ve düz metin. Her çıkarılan alan için güvenilirlik puanları dahildir.
İngilizce olmayan metinler için de çalışıyor mu?
Evet. OCR Latin, Kiril, CJK (Çince, Japonca, Korece) ve Arapça komut dosyalarını işler. İspanyolca, Almanca, Fransızca, Portekizce ve Korece kullanıcılar iyi sonuçlar bildirmektedir.
Kontrol panelimden ekran görüntülerini analiz edebilir miyim?
Evet. Ekran görüntüsü OCR yaygın bir kullanım durumudur. Metin çıkarın, kullanıcı arayüzü öğelerini algılayın ve yapılandırılmış veri olarak dışa aktarın. Tek çalıştırmada 150’den fazla ekran görüntüsünü işler.
Bir API var mı?
Bu ücretsiz araç için yok. Programatik erişime ihtiyacınız varsa, Google Cloud Vision veya AWS Rekognition daha uygun olacaktır. Bu araç, kod yazmadan sonuç almak isteyenler içindir.
Analizden sonra yüklenen görsellere ne olur?
Görseller işlenir ve sonra atılır. Oturumdan sonra sunucuda hiçbir şey saklanmaz, üçüncü taraflarla hiçbir şey paylaşılmaz ve modelleri eğitmek için hiçbir şey kullanılmaz.
Nesne algılamanın doğruluğu nasıl?
Net, iyi aydınlatılmış fotoğraflarda güçlüdür ve hareket bulanıklığı, yoğun gölge veya çok düşük çözünürlüklü görsellerde doğruluk düşer. Belirsiz sonuçları filtreleyebilmeniz için her algılama başına güvenilirlik puanları döndürülür.
Yapay zeka görsel analizörü bir fotoğrafta ne okuyabilir?
Bir görsel yükleyin ve nesneleri adlandırır, metni okur ve sahneyi tanımlar, ardından bununla ilgili soruları yanıtlar. Bir görsel analizörü olarak fotoğrafları, ekran görüntülerini ve diyagramları işler, böylece kendiniz tanımlamak yerine resimde ne olduğunu sorabilirsiniz.