انتقل إلى المحتوى

الذكاء الاصطناعي

رؤية تسرّب البيانات: الصور المكرّرة في بيانات الرنين المغناطيسي باستخدام pHash

الدقّة العالية ليست دائمًا خبرًا سارًّا. كيف وجدت الصور المكرّرة، وكيف غيّر تنظيفها النتائج.

النشر:
القراءة:
1 دقائق قراءة

مقدّمة

أثناء العمل على NeuroVision AI كانت النتائج الأولى أفضل من اللازم. حين لا يكاد المصنِّف يخطئ، فغالبًا ما يحكي ذلك قصة البيانات لا قصة النموذج. أشرح في هذا المقال كيف نظرت إلى البيانات قبل أن أثق بالنتيجة.

المشكلة: الصورة نفسها في مجموعتين

تتكوّن مجموعات بيانات الرنين المغناطيسي المفتوحة من دمج مصادر مختلفة. وقد تظهر الصورة نفسها أكثر من مرة باسم مختلف، أو مقصوصة قليلًا، أو بحجم مختلف. وعند التقسيم العشوائي تقع هذه النسخ في مجموعتي التدريب والاختبار معًا.

النتيجة: يصادف النموذج أثناء الاختبار صورة رآها من قبل، فتأتي الدقّة المُعلنة أعلى من قدرته الحقيقية على التعميم.

ما هو pHash؟

البصمة الإدراكية (perceptual hash) بصمة قصيرة تُستخرج من بنية الصورة لا من قيم بكسلاتها. تلتقط SHA-256 النسخ المطابقة تمامًا، لكن قيمة SHA لنسخة مُعاد تحجيمها أو ضغطها تختلف كليًّا. أمّا pHash فيعطي قيمًا متقاربة جدًّا لمثل هذه الصور.

تحضير حتمي للبيانات

لكي تكون المقارنة عادلة، استخدمت المعماريات الخمس جميعها البيانات المنظّفة نفسها والتقسيم نفسه:

# Every experiment shares the same split
SEED = 42
df = dedupe(df, exact="sha256", perceptual="phash")
gss = GroupShuffleSplit(test_size=0.2, random_state=SEED)
train_idx, test_idx = next(gss.split(df, groups=df.group_id))
 
# Leakage check: no group may appear in both sets
assert set(df.group_id[train_idx]).isdisjoint(df.group_id[test_idx])
  • تنظيف التكرار: SHA-256 أولًا ثم pHash
  • التقسيم حسب المجموعات: GroupShuffleSplit
  • فحص التسرّب: تحقّقات مدمجة في الشيفرة

ما الذي تغيّر؟

قبل التنظيف كانت أضعف فئة هي الورم السحائي. وبعد التنظيف تغيّرت الصورة وأصبحت أضعف فئة هي الصور السليمة (بلا ورم). كان التسرّب محدودًا لكنه حقيقي، والنتائج المُعلنة تستند الآن إلى البيانات المنظّفة.

الخلاصة

قبل تغيير معمارية النموذج، ينبغي مساءلة البيانات. تنظيف التكرار بضعة أسطر من الشيفرة، لكنه يغيّر الثقة بالنتائج تغييرًا كاملًا. للاطّلاع على المشروع كاملًا، راجع دراسة حالة NeuroVision AI.

  • Computer Vision
  • Data leakage
  • pHash
مشاركة

هذا المقال بلغات أخرى: Türkçe · English