İçeriğe geç

Yapay Zekâ

Veri sızıntısını görmek: MR veri setinde pHash ile tekrar eden görüntüler

Yüksek doğruluk her zaman iyi haber değildir. Tekrar eden görüntüleri nasıl bulduğumu ve bu temizliğin sonuçları nasıl değiştirdiğini anlatıyorum.

Yayın:
Okuma:
1 dk okuma

Giriş

NeuroVision AI üzerinde çalışırken ilk sonuçlar fazla iyiydi. Bir sınıflandırıcının neredeyse hiç hata yapmaması, çoğu zaman modelin değil verinin hikâyesini anlatır. Bu yazıda, sonuca güvenmeden önce veriye nasıl baktığımı anlatıyorum.

Sorun: aynı görüntü, iki küme

Açık MR veri setleri farklı kaynakların birleşiminden oluşur. Aynı görüntü farklı isimlerle, hafif kırpılmış ya da yeniden boyutlandırılmış hâlde birden fazla kez yer alabilir. Rastgele bölme yapıldığında bu kopyalar hem eğitim hem test kümesine düşer.

Sonuç: model test sırasında daha önce gördüğü bir görüntüyle karşılaşır ve raporlanan doğruluk, gerçek genelleme yeteneğinden yüksek çıkar.

pHash nedir?

Algısal özet (perceptual hash), görüntünün piksel değerlerinden değil yapısından üretilen kısa bir parmak izidir. Birebir kopyaları SHA-256 yakalar; ama yeniden boyutlandırılmış ya da sıkıştırılmış bir kopyanın SHA değeri tamamen farklıdır. pHash ise bu tür görüntüler için birbirine çok yakın değerler üretir.

Deterministik veri hazırlığı

Karşılaştırmanın adil olması için beş mimarinin hepsi aynı temizlenmiş veriyi ve aynı bölmeyi kullandı:

# Tüm deneyler aynı bölmeyi paylaşır
SEED = 42
df = dedupe(df, exact="sha256", perceptual="phash")
gss = GroupShuffleSplit(test_size=0.2, random_state=SEED)
train_idx, test_idx = next(gss.split(df, groups=df.group_id))
 
# Sızıntı kontrolü: hiçbir grup iki kümede birden olamaz
assert set(df.group_id[train_idx]).isdisjoint(df.group_id[test_idx])
  • Tekrar temizliği: önce SHA-256, sonra pHash
  • Grup bazlı bölme: GroupShuffleSplit
  • Sızıntı kontrolü: koda gömülü doğrulamalar

Ne değişti?

Temizlikten önce en zayıf sınıf meningiomaydı. Temizlikten sonra tablo değişti ve en zayıf sınıf sağlıklı (tümörsüz) görüntüler oldu. Sızıntı sınırlıydı ama gerçekti; raporlanan sonuçlar artık temizlenmiş veriye dayanıyor.

Sonuç

Model mimarisini değiştirmeden önce veriyi sorgulamak gerekiyor. Tekrar temizliği birkaç satır kod; ama sonuçlara duyulan güveni tamamen değiştiriyor. Projenin tamamı için NeuroVision AI vaka çalışmasına bakabilirsiniz.

  • Computer Vision
  • Veri sızıntısı
  • pHash
Paylaş

Bu yazı diğer dillerde: English · العربية