cover

الگوریتم FCMdc چیست؟ خوشه‌بندی فازی پویا (Dynamic Fuzzy C-Means)

 

1. چکیده

الگوریتم Fuzzy C-Means with Dynamic Clusters (FCMdc) یکی از توسعه‌های مهم خانواده Fuzzy C-Means است که برای داده‌هایی طراحی شده است که در آن‌ها ساختار خوشه‌ها ایستا نیست و می‌تواند در طول فرایند خوشه‌بندی تغییر کند. در FCM کلاسیک، معمولاً تعداد خوشه‌ها از ابتدا ثابت در نظر گرفته می‌شود؛ اما در بسیاری از مسائل واقعی، این فرض محدودکننده است، زیرا ممکن است داده‌ها دارای خوشه‌های در حال شکل‌گیری، ادغام‌شونده یا حذف‌شونده باشند. FCMdc با افزودن سازوکار پویا برای مدیریت ساختار خوشه‌ها، تلاش می‌کند بازنمایی واقع‌بینانه‌تری از داده ارائه دهد. این ویژگی به‌ویژه در تحلیل داده‌های زمانی، داده‌های جریان‌پیوسته، الگوهای متغیر و برخی مسائل زیستی و صنعتی اهمیت دارد.

در این مقاله، ابتدا مفاهیم پایه و مسئله‌ای که FCMdc حل می‌کند توضیح داده می‌شود، سپس مبانی نظری و ریاضی آن، مراحل اجرای الگوریتم، مثال‌های عددی، کاربردهای واقعی، مزایا، محدودیت‌ها و مقایسه آن با روش‌های مشابه بررسی می‌شود. در پایان نیز نوآوری‌های اخیر و مسیرهای پژوهشی آینده این روش بر پایه کتاب‌ها و مقالات معتبر، به‌ویژه منابع پس از 2015، مرور خواهد شد.

.

2. مقدمه

خوشه‌بندی فازی یکی از ابزارهای مهم در یادگیری بدون ناظر است و زمانی اهمیت بیشتری پیدا می‌کند که مرز میان گروه‌های داده روشن و قطعی نباشد. در این چارچوب، هر داده می‌تواند با درجات مختلف به چند خوشه تعلق داشته باشد و همین ویژگی، آن را برای مدل‌سازی داده‌های مبهم، هم‌پوشان و پیچیده مناسب می‌کند. با این حال، بسیاری از نسخه‌های کلاسیک خوشه‌بندی فازی، از جمله Fuzzy C-Means (FCM)، بر یک فرض مهم تکیه دارند: تعداد خوشه‌ها ثابت است و ساختار خوشه‌ها در طول یادگیری تغییر نمی‌کند.

این فرض در مسائل واقعی همیشه برقرار نیست. در بسیاری از داده‌های پویا، مانند داده‌های زمانی، سنسوری، زیستی، تراکنشی یا جریان‌داده، ساختار خوشه‌ها می‌تواند تغییر کند. گاهی یک خوشه جدید ظاهر می‌شود، گاهی دو خوشه به یکدیگر نزدیک می‌شوند و ادغام آن‌ها معنادار است، و گاهی نیز یک خوشه کارکرد تحلیلی خود را از دست می‌دهد. در چنین شرایطی، استفاده از الگوریتمی که بتواند ساختار خوشه‌ها را به‌صورت پویا تنظیم کند، ضروری است.

الگوریتم FCMdc با همین هدف مطرح شده است. این روش تلاش می‌کند ضمن حفظ منطق خوشه‌بندی فازی، امکان مدیریت پویایی خوشه‌ها را نیز فراهم کند. در این مقاله، ابتدا مفاهیم پایه معرفی می‌شوند، سپس ضرورت وجودی این روش توضیح داده می‌شود، بعد به مبانی ریاضی و فرایند اجرایی آن می‌پردازیم و در ادامه، با مثال‌های عددی، کاربردهای عملی، مزایا و محدودیت‌ها، تصویری روشن از جایگاه FCMdc ارائه می‌کنیم.

.

3. تعاریف و مفاهیم پایه

3.1. خوشه‌بندی فازی

در خوشه‌بندی فازی (Fuzzy Clustering) هر داده به‌جای آن‌که فقط به یک خوشه تخصیص یابد، دارای درجه عضویت در چند خوشه است. این عضویت‌ها معمولاً مقادیری بین صفر و یک هستند و مجموع آن‌ها برای هر داده برابر 1 در نظر گرفته می‌شود.

به‌صورت ریاضی، اگر uij​ درجه عضویت داده xi​ در خوشه j باشد، داریم:

0  ≤ uij ≤ 1

و برای هر داده xi​:

  uij =1     (j=1to c)

که در آن:

  • uij​: درجه عضویت داده i در خوشه j
  • c: تعداد خوشه‌ها

3.2 الگوریتم Fuzzy C-Means

الگوریتم FCM یکی از رایج‌ترین روش‌های خوشه‌بندی فازی است که با کمینه‌سازی یک تابع هدف مبتنی بر فاصله، هم‌زمان مراکز خوشه‌ها و درجات عضویت را به‌روزرسانی می‌کند (Bezdek, 1981).

3.3 خوشه‌های پویا (Dynamic Clusters)

منظور از خوشه‌های پویا این است که ساختار خوشه‌ها در طول فرایند تحلیل ثابت نیست. این پویایی می‌تواند به چند شکل ظاهر شود:

  • ایجاد یک خوشه جدید
  • حذف یک خوشه کم‌اهمیت یا کم‌جمعیت
  • ادغام دو خوشه نزدیک
  • شکستن یک خوشه بزرگ به چند خوشه کوچک‌تر
  • تغییر معنادار مرکز یا شکل خوشه در داده‌های زمان‌مند

3.4 FCMdc چیست؟

FCMdc را می‌توان یک توسعه از FCM دانست که در آن، علاوه بر به‌روزرسانی درجات عضویت و مراکز خوشه‌ها، یک سازوکار تصمیم‌گیری برای مدیریت پویای تعداد یا ساختار خوشه‌ها نیز وارد الگوریتم می‌شود. در نتیجه، FCMdc تنها یک روش برای «تقسیم داده‌ها» نیست، بلکه یک چارچوب برای «سازگاری ساختار خوشه‌بندی با خود داده» است.

3.5 تمایز FCMdc با FCM کلاسیک

تفاوت اصلی این دو روش در این است که:

  • در FCM کلاسیک، تعداد خوشه‌ها ccc از ابتدا تعیین می‌شود و تا پایان ثابت می‌ماند.
  • در FCMdc، تعداد یا ساختار خوشه‌ها می‌تواند بر اساس شواهد موجود در داده و معیارهای اعتبار خوشه، در طول اجرا تنظیم شود.

.

4. مسئله‌ای که این روش حل می‌کند؛ اهمیت و ضرورت

الگوریتم FCMdc برای حل یک مسئله مشخص طراحی شده است: خوشه‌بندی فازی در شرایطی که ساختار خوشه‌ها از پیش کاملاً معلوم یا ثابت نیست. در بسیاری از کاربردها، تعیین تعداد دقیق خوشه‌ها پیش از تحلیل دشوار است و حتی اگر در ابتدای کار یک تعداد اولیه انتخاب شود، ممکن است این انتخاب در ادامه با ساختار واقعی داده سازگار نباشد.

مشکل اصلی FCM کلاسیک این است که به یک تعداد خوشه ثابت وابسته است. اگر این تعداد کمتر از مقدار مناسب انتخاب شود، خوشه‌های ناهمگون در یک گروه ادغام می‌شوند. اگر بیشتر از مقدار مناسب باشد، ساختار واقعی داده به‌طور مصنوعی خرد می‌شود. این مسئله در داده‌های پویا، جریان‌داده، داده‌های دارای تغییر مفهوم (concept drift) و داده‌های زیستی یا صنعتی که الگوهای آن‌ها در طول زمان تغییر می‌کند، شدیدتر است.

ضرورت FCMdc از همین‌جا ناشی می‌شود: نیاز به روشی که نه‌تنها عضویت فازی را مدل کند، بلکه بتواند ساختار خوشه‌ها را با رفتار واقعی داده تطبیق دهد. بنابراین، FCMdc پاسخ به محدودیت ساختاری FCM است، نه صرفاً یک نسخه «بهتر» از آن. ارزش این روش در این است که به تحلیل‌گر اجازه می‌دهد بدون اتکای کامل به یک انتخاب اولیه ثابت، به ساختار منعطف‌تری از خوشه‌ها برسد.

.

5. مبانی نظری و ریاضی

5.1 فرمول‌بندی پایه FCM

برای مجموعه داده

X = {x1 , x2 , … , xn}  ,  xi ∈ R^d

تابع هدف کلاسیک FCM به‌صورت زیر تعریف می‌شود:

که در آن:

  • Jm(U,V)  : تابع هدف فازی
  •  [uij]U =  :  ماتریس عضویت
  • V = {v1​ ,…, vc​}  : مجموعه مراکز خوشه
  • uij​: درجه عضویت داده xi​ در خوشه j
  • m>1: پارامتر فازی‌ساز
  •  ^2∥xi​−vj​∥ : مربع فاصله اقلیدسی بین داده و مرکز خوشه
  • n: تعداد داده‌ها
  • c: تعداد خوشه‌ها
  • d: بُعد داده‌ها

قیود ماتریس عضویت نیز به‌صورت زیر هستند:

0 ≤ uij ≤ 1

uij=1  ∀i  (j=1 to c)  

5.2 روابط به‌روزرسانی در FCM

مرکز خوشه j از رابطه زیر به‌دست می‌آید:

در این رابطه:

  • vj​: مرکز خوشه j
  • uij^m​: وزن فازی داده xi​ در خوشهj

رابطه به‌روزرسانی عضویت‌ها نیز برابر است با:

این رابطه نشان می‌دهد که عضویت هر داده به فاصله نسبی آن از همه مراکز خوشه وابسته است.

5.3 ایده ریاضی FCMdc

در FCMdc، تابع هدف پایه معمولاً حفظ می‌شود، اما یک یا چند ترم تنظیم‌کننده یا قاعده ساختاری برای مدیریت پویایی خوشه‌ها به آن افزوده می‌شود. یک فرم کلی و مفهومی از تابع هدف می‌تواند چنین باشد:

JFCMdc = Jm(U,V) + λ Ω(C)

که در آن:

  • JFCMdc ​: تابع هدف توسعه‌یافته
  •  (U,V) Jm​: تابع هدف کلاسیک FCM
  •  (C) Ω: ترم ساختاری مرتبط با پویایی خوشه‌ها
  • λ: ضریب تنظیم شدت اثر ترم پویایی
  • C: ساختار خوشه‌بندی، مانند تعداد خوشه‌ها یا روابط بین خوشه‌ها

تفسیر ترم  (C) Ω

بسته به نسخه دقیق FCMdc، این ترم می‌تواند یکی از نقش‌های زیر را بازی کند:

  • جریمه برای تعداد بیش از حد خوشه‌ها
  • جریمه برای خوشه‌های بسیار نزدیک که باید ادغام شوند
  • تشویق به ایجاد خوشه جدید در صورت بالا بودن خطای بازسازی
  • کنترل اندازه یا پایداری خوشه‌ها در طول زمان

.

5.4 معیارهای تصمیم برای پویایی خوشه‌ها

در بسیاری از نسخه‌های خوشه‌بندی فازی پویا، تصمیم درباره ایجاد، حذف یا ادغام خوشه‌ها بر اساس شاخص‌های اعتبار خوشه انجام می‌شود. به‌صورت مفهومی، اگر فاصله دو مرکز خوشه کم باشد، یعنی:

vp−vq∥ < τmerge ​

ممکن است دو خوشه p و q برای ادغام مناسب باشند.

در اینجا:

  •  vp,  vq ​: مراکز دو خوشه
  • τmerge: آستانه ادغام

به‌طور مشابه، اگر وزن مؤثر یک خوشه بسیار کوچک باشد:

uij^m < τremove    (i=1 to n) ​

خوشه j می‌تواند نامعتبر تلقی شود.

در این رابطه:

  • τremove ​  : آستانه حذف خوشه

5.5 شاخص‌های اعتبار در تنظیم ساختار خوشه

نسخه‌های پویا معمولاً از شاخص‌هایی مانند Xie-Beni Index، Partition Coefficient یا Partition Entropy برای ارزیابی کیفیت ساختار خوشه‌بندی استفاده می‌کنند (Xie & Beni, 1991; Pal & Bezdek, 1995).

برای مثال، شاخص Xie-Beni به‌صورت زیر نوشته می‌شود:

که در آن:

  • XB   : شاخص Xie-Beni
  • صورت کسر: فشردگی درون‌خوشه‌ای
  • مخرج کسر: جدایی کمینه بین خوشه‌ها

مقدار کمتر XB معمولاً نشان‌دهنده خوشه‌بندی بهتر است، زیرا هم‌زمان فشردگی بالاتر و جدایی بیشتر را بازتاب می‌دهد.

.

5.6 فرض‌های پایه

مبانی نظری FCMdc معمولاً بر چند فرض استوار است:

  • داده‌ها قابلیت بازنمایی در یک فضای برداری را دارند.
  • مفهوم شباهت یا فاصله میان داده‌ها قابل تعریف است.
  • عضویت فازی برای مسئله معنادارتر از انتساب سخت است.
  • ساختار خوشه‌ها ممکن است ثابت نباشد و باید توسط داده هدایت شود.
  • تصمیم‌های پویای مربوط به خوشه‌ها نیازمند آستانه یا شاخص اعتبار هستند.

.

6. مراحل گام به گام اجرای الگوریتم

در این بخش، منطق اجرایی FCMdc را به‌صورت عمومی و آموزشی بیان می‌کنیم. توجه داشته باشید که نسخه‌های مختلف این الگوریتم ممکن است در جزئیات متفاوت باشند، اما اسکلت اجرایی آن‌ها معمولاً مشابه است.

6.1 ورودی‌ها

  • مجموعه داده X
  • تعداد اولیه خوشه‌ها
  • پارامتر فازی‌ساز m
  • آستانه توقف ε
  • آستانه ادغام τmerge
  • آستانه حذف τremove
  • در صورت نیاز، آستانه ایجاد خوشه جدید τcreate
  • حداکثر تعداد تکرار Tmax ​

6.2 گام‌های اجرا

گام 1: مقداردهی اولیه

ابتدا یک تعداد اولیه برای خوشه‌ها در نظر گرفته می‌شود و ماتریس عضویت اولیه U0یا مراکز اولیه V0  ساخته می‌شوند. این مقدار اولیه می‌تواند بر اساس تجربه، نمونه‌گیری یا یک الگوریتم کمکی تعیین شود.

گام 2: به‌روزرسانی مراکز خوشه

برای هر خوشه j، مرکز جدید از رابطه زیر محاسبه می‌شود:

گام 3: به‌روزرسانی درجات عضویت

پس از به‌روزرسانی مراکز، ماتریس عضویت جدید محاسبه می‌شود:

در اینجا Ct تعداد خوشه‌ها در تکرار t است؛ یعنی تعداد خوشه‌ها می‌تواند از یک تکرار به تکرار بعدی تغییر کند.

گام 4: ارزیابی ساختار خوشه‌ها

در این مرحله، ساختار فعلی خوشه‌ها بررسی می‌شود. معمولاً سه نوع تصمیم ممکن است گرفته شود:

الف) ادغام خوشه‌ها

اگر دو مرکز بسیار نزدیک باشند یا ادغام آن‌ها باعث بهبود شاخص اعتبار شود، دو خوشه ادغام می‌شوند.

ب) حذف خوشه

اگر جرم فازی یک خوشه بسیار کم باشد یا خوشه از نظر تحلیلی پایدار نباشد، حذف می‌شود.

ج) ایجاد خوشه جدید

اگر خطای بازنمایی در یک ناحیه از فضا زیاد باشد یا داده‌های خاصی به‌خوبی توسط خوشه‌های موجود پوشش داده نشوند، یک خوشه جدید ساخته می‌شود.

گام 5: بازتنظیم ماتریس عضویت

اگر ساختار خوشه‌ها تغییر کرده باشد، ماتریس عضویت باید متناسب با ساختار جدید بازتنظیم شود تا قیود فازی حفظ شوند.

گام 6: بررسی معیار توقف

اگر یکی از شرایط زیر برقرار باشد، الگوریتم متوقف می‌شود:

  • تغییر مراکز خوشه کمتر از ε باشد
  • تغییر تابع هدف ناچیز باشد
  • ساختار خوشه‌ها در چند تکرار متوالی پایدار بماند
  • تعداد تکرارها به Tmax ​ برسد

6.3 شبه‌کد

Input: X, c0, m, ε, τmerge, τremove, τcreate, Tmax
Initialize cluster centers or membership matrix
Set c = c0

for t = 1 to Tmax:
    Update cluster centers V
    Update membership matrix U
    Evaluate cluster validity and structure

    if two clusters are too close:
        merge them

    if a cluster has very low fuzzy mass:
        remove it

    if representation error is high in some region:
        create a new cluster

    Recalculate U if cluster structure changed

    if convergence criteria satisfied:
        break

Return final clusters, centers, and memberships

6.4 نکته پیاده‌سازی

در عمل، FCMdc بیش از آن‌که یک فرمول واحد و استاندارد جهانی داشته باشد، یک خانواده از روش‌های پویا است. بنابراین، هنگام پیاده‌سازی باید مشخص شود که سیاست پویایی دقیقاً بر چه مبنایی تعریف شده است: ادغام، حذف، ایجاد، شکافت، یا ترکیبی از این‌ها.

.

7. مثال‌های عددی

مثال 1: محاسبه مرکز فازی یک خوشه

صورت مسئله

سه داده یک‌بعدی داریم و می‌خواهیم مرکز یک خوشه را با فرض m = 2 محاسبه کنیم.

داده ورودی

درجات عضویت نسبت به خوشه اول:

حل گام‌به‌گام

ابتدا توان دوم عضویت‌ها را محاسبه می‌کنیم:

حال مرکز خوشه:

پاسخ نهایی

v1 ≈ 1.94

تفسیر نتیجه

چون داده‌های 1 و 3 عضویت بیشتری در خوشه دارند، مرکز خوشه به آن‌ها نزدیک‌تر شده است و تأثیر داده 8 محدود مانده است.

.

مثال 2: تصمیم برای حذف خوشه کم‌اثر

صورت مسئله

فرض کنید در یک تکرار از FCMdc، جرم فازی یک خوشه باید بررسی شود تا مشخص شود آیا حذف آن مناسب است یا نه.

داده ورودی

برای خوشه j:

و m=2 همچنین:

τremove = 0.08

حل گام‌به‌گام

جرم فازی خوشه را حساب می‌کنیم:

حال مقایسه می‌کنیم:

0.0625<0.08

پاسخ نهایی

از آنجا که جرم فازی خوشه کمتر از آستانه حذف است، این خوشه می‌تواند نامعتبر تلقی شود و نامزد حذف باشد.

تفسیر نتیجه

FCMdc از چنین قاعده‌ای برای جلوگیری از باقی‌ماندن خوشه‌های ضعیف، مصنوعی یا کم‌اثر استفاده می‌کند.

.

مثال 3: تصمیم برای ادغام دو خوشه

صورت مسئله

دو مرکز خوشه در فضای دوبعدی داریم. می‌خواهیم بررسی کنیم آیا این دو خوشه باید ادغام شوند یا نه.

داده ورودی

آستانه ادغام:

τmerge=0.6

حل گام‌به‌گام

فاصله اقلیدسی دو مرکز:

حال مقایسه می‌کنیم:

0.5 < 0.6

پاسخ نهایی

دو خوشه به‌اندازه کافی به هم نزدیک هستند و می‌توانند نامزد ادغام باشند.

تفسیر نتیجه

در FCMdc، چنین تصمیمی از خردشدن مصنوعی ساختار داده جلوگیری می‌کند و مدل را فشرده‌تر و واقع‌بینانه‌تر می‌سازد.

.

مثال 4: ارزیابی ساده نیاز به خوشه جدید

صورت مسئله

فرض کنید میانگین خطای بازنمایی برای یک ناحیه از داده برابر 1.8 است و آستانه ایجاد خوشه جدید برابر 1.2 در نظر گرفته شده است.

داده ورودی

Elocal = 1.8    ,    τcreate = 1.2

حل گام‌به‌گام

قاعده تصمیم ساده:

اگر Elocal > τcreate ، خوشه جدید ایجاد شود.

حال:

1.8 > 1.2

پاسخ نهایی

ایجاد یک خوشه جدید در این ناحیه قابل توجیه است.

تفسیر نتیجه

این سازوکار به FCMdc کمک می‌کند نواحی‌ای را که خوشه‌های فعلی به‌خوبی توضیح نمی‌دهند، بهتر مدل کند.

.

8. کاربردهای واقعی

  • تحلیل جریان‌داده (Data Streams): در داده‌هایی که به‌صورت پیوسته وارد می‌شوند و ساختار آن‌ها در طول زمان تغییر می‌کند.
  • پایش فرایندهای صنعتی: برای شناسایی حالت‌های عملیاتی متغیر، خطاهای تدریجی و تغییر الگوهای عملکرد.
  • پردازش سیگنال و حسگرها: در محیط‌هایی که الگوهای رفتاری سیستم ایستا نیستند.
  • تحلیل داده‌های زیستی و پزشکی: برای مدل‌سازی زیرگروه‌هایی که در طول زمان یا تحت شرایط مختلف تغییر می‌کنند.
  • بخش‌بندی تصویر پویا: به‌ویژه در ویدئو یا تصاویر چندزمانه که الگوهای ناحیه‌ای ثابت نیستند.
  • تحلیل رفتار مشتریان: زمانی که خوشه‌های رفتاری بازار دچار تغییر، ادغام یا ظهور الگوهای جدید می‌شوند.
  • امنیت و کشف ناهنجاری: برای تشخیص تغییر ساختار الگوهای عادی و ظهور رفتارهای جدید.
  • سامانه‌های هوشمند حمل‌ونقل: در تحلیل الگوهای ترافیکی متغیر در بازه‌های زمانی مختلف.

.

9. مزایا

  • توانایی مدل‌سازی ساختارهای خوشه‌ای پویا به‌جای فرض ساختار کاملاً ثابت
  • حفظ مزیت اصلی خوشه‌بندی فازی، یعنی مدل‌سازی ابهام و هم‌پوشانی
  • کاهش وابستگی مطلق به یک تعداد خوشه ثابت از پیش تعیین‌شده
  • سازگاری بهتر با داده‌های زمانی، تکاملی و جریان‌محور
  • امکان استفاده از شاخص‌های اعتبار برای تنظیم داده‌محور ساختار خوشه‌ها
  • انعطاف‌پذیری در طراحی سیاست‌های ادغام، حذف و ایجاد خوشه
  • مناسب برای مسائل مهندسی که در آن‌ها ساختار داده در طول زمان تغییر می‌کند

.

10. محدودیت‌ها و معایب

  • نبود یک نسخه کاملاً یکنواخت و استاندارد از FCMdc در همه مراجع
  • حساسیت عملکرد به انتخاب آستانه‌های  τmerge​، τremove​ و τcreate
  • پیچیدگی محاسباتی بیشتر نسبت به FCM کلاسیک
  • امکان ناپایداری ساختار خوشه‌ها در صورت تنظیم نامناسب قواعد پویا
  • نیاز به طراحی دقیق شاخص اعتبار یا معیار تصمیم‌گیری
  • حساسیت به نویز، به‌ویژه اگر سیاست ایجاد خوشه بیش از حد تهاجمی باشد
  • دشواری بیشتر در ارزیابی و تفسیر نتایج نسبت به روش‌های با تعداد خوشه ثابت
  • در برخی مسائل، افزایش انعطاف می‌تواند به بیش‌برازش ساختار خوشه‌ای منجر شود

.

11. مقایسه با روش‌های مشابه

ویژگیFCM کلاسیکFCMdcK-MeansGustafson-Kessel
نوع عضویتفازیفازیسختفازی
تعداد خوشهثابتپویا/قابل‌تنظیمثابتثابت
مناسب برای داده‌های پویامحدودبالاپایینمحدود
پیچیدگی محاسباتیمتوسطبیشترکمترمتوسط تا بالا
مدل‌سازی هم‌پوشانیبلهبلهخیربله
نیاز به تنظیم آستانه ساختاریخیربلهخیرخیر
انعطاف ساختاریمتوسطزیادکممتوسط

مقایسه کاملتر

معیار مقایسهFCMFCMdcPCMGustafson-KesselKernel FCM
نام کاملFuzzy C-MeansFuzzy C-Means with Dynamic ClustersPossibilistic C-MeansGustafson-Kessel Fuzzy ClusteringKernel Fuzzy C-Means
نوع خوشه‌بندیفازیفازی و پویاامکان‌گرا / Possibilisticفازی با شکل خوشه انعطاف‌پذیرفازی مبتنی بر کرنل
نوع عضویتنسبی و نرمال‌شدهنسبی و قابل‌تنظیم با ساختار پویادرجه تیپیکال بودن، نه الزاماً نرمال‌شدهنسبی و نرمال‌شدهنسبی در فضای ویژگی کرنلی
قید مجموع عضویت‌هادارد؛ مجموع عضویت هر داده برابر 1 استمعمولاً دارد، اما بسته به نسخه قابل تغییر استندارد؛ عضویت‌ها مستقل‌ترنددارددارد
تعداد خوشه‌هاثابت و از پیش تعیین‌شدهقابل تغییر یا قابل تنظیم در طول اجراثابت، مگر در نسخه‌های توسعه‌یافتهثابتثابت، مگر در نسخه‌های توسعه‌یافته
هدف اصلیمدل‌سازی هم‌پوشانی خوشه‌هامدل‌سازی هم‌پوشانی همراه با پویایی ساختار خوشه‌هاکاهش حساسیت به اجبار تقسیم نسبی داده‌هامدل‌سازی خوشه‌های بیضوی و جهت‌دارمدل‌سازی مرزهای غیرخطی خوشه‌ها
تابع هدفمبتنی بر فاصله داده تا مرکز خوشهتوسعه‌یافته بر پایه FCM همراه با قواعد یا جریمه‌های ساختاریدارای ترم تیپیکال بودن و پارامترهای مقیاسمبتنی بر فاصله ماهالانوبیس تطبیقیمبتنی بر فاصله در فضای کرنل
معیار فاصله رایجاقلیدسیاقلیدسی یا معیارهای سفارشیاقلیدسی یا اصلاح‌شدهفاصله ماهالانوبیس تطبیقیفاصله کرنلی
توان مدل‌سازی خوشه‌های هم‌پوشانخوبخوبخوب، اما با تفسیر متفاوتخوبخوب
توان مدل‌سازی خوشه‌های غیرکرویمحدودبسته به نسخه، متوسطمحدود تا متوسطبالابالا برای ساختارهای غیرخطی
توان مدیریت تعداد خوشه نامعلومضعیفبهتر از FCMضعیف در نسخه پایهضعیف در نسخه پایهضعیف در نسخه پایه
حساسیت به مقداردهی اولیهمتوسط تا زیادزیاد، به‌خصوص در نسخه‌های دارای تصمیم ساختاریزیادزیادزیاد
حساسیت به نویزنسبتاً زیاداگر مقاوم‌سازی نشود، زیادکمتر از FCM در برخی شرایطمتوسطمتوسط تا زیاد
خطر خوشه‌های هم‌مکانکم‌تر از PCMبسته به نسخهبالا؛ یکی از مشکلات شناخته‌شده PCMمتوسطمتوسط
پیچیدگی محاسباتیمتوسطبیشتر از FCMمتوسط تا زیادبیشتر از FCMبیشتر از FCM
مناسب برای داده‌های پویامحدودمناسب‌ترمحدودمحدودمحدود، مگر در نسخه‌های آنلاین
مناسب برای داده‌های غیرخطیمحدودبسته به معیار فاصله یا embeddingمحدودمتوسطخوب
مناسب برای داده‌های دارای نویزمتوسط رو به ضعیفدر نسخه مقاوم، خوبنسبتاً خوبمتوسطبسته به کرنل و تنظیمات
مناسب برای تصویر و پزشکیبسیار رایجمناسب در نسخه‌های مکانی و پویااستفاده‌شده، اما کمتر از FCMمناسب برای ساختارهای بیضویمناسب برای مرزهای پیچیده
نیاز به تنظیم پارامترccc، mmm، معیار توقفc0c_0c0​، mmm، آستانه‌های ایجاد/حذف/ادغامccc، mmm، پارامترهای مقیاسccc، mmm، ماتریس‌های کوواریانس یا قیود آن‌هاccc، mmm، نوع کرنل، پارامتر کرنل
تفسیرپذیریخوبخوب، اگر تصمیم‌های ساختاری توضیح داده شوندمتوسط تا خوبمتوسطکمتر از FCM به دلیل فضای کرنل
مزیت اصلیسادگی، شهرت و تفسیرپذیریانعطاف در ساختار خوشه‌هاکاهش اثر اجبار عضویت نسبیتشخیص خوشه‌های کشیده و بیضویتوانایی مدل‌سازی ساختارهای غیرخطی
محدودیت اصلینیاز به تعیین تعداد خوشه و حساسیت به نویزپیچیدگی، نبود استاندارد واحد و حساسیت به آستانه‌هامشکل خوشه‌های هم‌مکان و تنظیم پارامترهاحساسیت به تخمین ماتریس کوواریانسانتخاب کرنل و هزینه محاسباتی
بهترین کاربردداده‌های هم‌پوشان با ساختار نسبتاً سادهداده‌های متغیر، جریان‌داده و ساختارهای نامعلومداده‌هایی که مفهوم تیپیکال بودن مهم استداده‌هایی با خوشه‌های بیضوی یا جهت‌دارداده‌های دارای مرز غیرخطی

تحلیل مقایسه‌ای روش‌ها

  • FCM در برابر FCMdc

FCM روش پایه و ساده‌تر است. اگر تعداد خوشه‌ها مشخص باشد و ساختار داده نسبتاً پایدار بماند، FCM انتخابی مناسب، قابل‌تفسیر و کم‌هزینه‌تر است. اما اگر ساختار داده در طول زمان تغییر کند یا تعداد خوشه‌ها از ابتدا معلوم نباشد، FCMdc گزینه انعطاف‌پذیرتری است.

تفاوت اصلی این دو روش در این است که FCM فقط عضویت‌ها و مراکز را تنظیم می‌کند، اما FCMdc علاوه بر آن، می‌تواند ساختار خوشه‌ها را نیز تغییر دهد.

  • FCMdc در برابر PCM

PCM برای رفع یکی از محدودیت‌های FCM طراحی شد: در FCM، چون مجموع عضویت‌های هر داده باید برابر 1 باشد، حتی نقاط پرت نیز ناچارند میان خوشه‌ها تقسیم شوند. PCM این قید را حذف می‌کند و به‌جای عضویت نسبی، مفهوم تیپیکال بودن (typicality) را وارد می‌کند.

با این حال، PCM در نسخه پایه مشکل مهمی دارد: ممکن است چند خوشه روی یک ناحیه متمرکز شوند. FCMdc از زاویه دیگری به مسئله نگاه می‌کند. هدف آن نه فقط اصلاح مفهوم عضویت، بلکه مدیریت پویای ساختار خوشه‌هاست. بنابراین، PCM بیشتر برای کاهش اجبار عضویت نسبی مفید است، در حالی که FCMdc برای تغییرپذیری تعداد یا ساختار خوشه‌ها اهمیت دارد.

.

  • FCMdc در برابر Gustafson-Kessel

الگوریتم Gustafson-Kessel یا GK برای شرایطی مناسب است که خوشه‌ها شکل کروی ندارند. FCM کلاسیک با فاصله اقلیدسی معمولاً خوشه‌های تقریباً کروی را بهتر مدل می‌کند، اما GK با استفاده از ماتریس کوواریانس تطبیقی می‌تواند خوشه‌های کشیده، بیضوی و جهت‌دار را بهتر شناسایی کند.

با این حال، GK الزاماً مسئله تعداد خوشه‌های پویا را حل نمی‌کند. تعداد خوشه‌ها معمولاً از ابتدا مشخص است. بنابراین، اگر مسئله اصلی «شکل خوشه‌ها» باشد، GK انتخاب مناسبی است؛ اما اگر مسئله اصلی «تغییر ساختار یا تعداد خوشه‌ها» باشد، FCMdc مناسب‌تر است.

  • FCMdc در برابر Kernel FCM

Kernel FCM برای زمانی مفید است که خوشه‌ها در فضای اصلی به‌صورت خطی یا ساده جداشدنی نیستند. این روش داده‌ها را به‌صورت ضمنی به فضای ویژگی با ابعاد بالاتر نگاشت می‌کند و سپس خوشه‌بندی فازی را در آن فضا انجام می‌دهد. به همین دلیل، Kernel FCM می‌تواند ساختارهای غیرخطی را بهتر از FCM کلاسیک مدل کند.

اما Kernel FCM نیز در نسخه پایه معمولاً تعداد خوشه ثابت دارد. بنابراین، مزیت آن در مدل‌سازی مرزهای غیرخطی است، نه در پویایی تعداد خوشه‌ها. ترکیب ایده Kernel FCM با FCMdc می‌تواند یک مسیر پژوهشی جذاب باشد: یعنی الگوریتمی که هم مرزهای غیرخطی را مدل کند و هم ساختار خوشه‌ها را به‌صورت پویا تغییر دهد.

جمع‌بندی کاربردی انتخاب روش

اگر مسئله شما این ویژگی را داردروش مناسب‌تر
ساختار داده ساده، هم‌پوشان و تعداد خوشه مشخص استFCM
تعداد خوشه‌ها نامعلوم یا در حال تغییر استFCMdc
نقاط پرت زیادند و عضویت نسبی FCM مشکل‌ساز استPCM یا نسخه‌های مقاوم FCM
خوشه‌ها بیضوی، کشیده یا جهت‌دار هستندGustafson-Kessel
مرز خوشه‌ها غیرخطی استKernel FCM
داده‌ها هم پویا هستند و هم مرز غیرخطی دارندترکیب FCMdc با Kernel یا embedding
داده‌ها بزرگ، آنلاین یا جریان‌پیوسته هستندنسخه‌های آنلاین، توزیع‌شده یا mini-batch از FCMdc
تفسیرپذیری برای کاربرد حساس مهم استFCM یا FCMdc توضیح‌پذیر

.

12. نوآوری‌ها و چشم‌انداز آینده

الگوریتم FCMdc یا خوشه‌بندی فازی با خوشه‌های پویا را باید در امتداد تحول خانواده Fuzzy C-Means در نظر گرفت؛ خانواده‌ای که از یک روش کلاسیک با تعداد خوشه ثابت، به‌تدریج به سمت روش‌های تطبیقی، مقاوم، مقیاس‌پذیر، آنلاین و قابل‌ترکیب با یادگیری عمیق حرکت کرده است. از سال 2015 به بعد، مسئله اصلی در بسیاری از پژوهش‌ها دیگر فقط «بهینه‌سازی عضویت فازی» نیست، بلکه پرسش مهم‌تر این است که الگوریتم چگونه می‌تواند با داده‌های بزرگ، نویزی، غیرایستا، چندمنبعی و دارای ساختار متغیر سازگار شود.

در این چارچوب، FCMdc را نباید یک نسخه کاملاً بسته و واحد از FCM دانست، بلکه بهتر است آن را یک جهت‌گیری پژوهشی در خوشه‌بندی فازی تلقی کنیم؛ جهت‌گیری‌ای که تلاش می‌کند ساختار خوشه‌ها را در طول فرایند یادگیری، بر اساس شواهد داده و معیارهای اعتبار خوشه، تغییر دهد.

.

12.1 گذار از FCM ایستا به خوشه‌بندی فازی تطبیقی

در FCM کلاسیک، تعداد خوشه‌ها از ابتدا تعیین می‌شود و در تمام تکرارها ثابت می‌ماند. این فرض در داده‌های ساده و کنترل‌شده قابل قبول است، اما در داده‌های واقعی اغلب محدودکننده است. پس از 2015، بخش مهمی از پژوهش‌ها به سمت روش‌هایی حرکت کرده‌اند که بتوانند ساختار خوشه‌ها را به‌صورت تطبیقی (adaptive) تنظیم کنند.

در چنین رویکردی، الگوریتم فقط مراکز و عضویت‌ها را به‌روزرسانی نمی‌کند، بلکه درباره خود ساختار خوشه‌بندی نیز تصمیم می‌گیرد. برای مثال، اگر دو خوشه از نظر مرکز، چگالی یا الگوی عضویت بیش از حد به هم نزدیک باشند، ادغام آن‌ها می‌تواند منطقی باشد. اگر یک ناحیه از داده‌ها با خوشه‌های موجود به‌خوبی مدل نشود، ایجاد خوشه جدید می‌تواند کیفیت بازنمایی را افزایش دهد. همچنین اگر جرم فازی یک خوشه بسیار کم باشد، حذف آن می‌تواند از پیچیدگی غیرضروری مدل جلوگیری کند.

این نگاه با مسیر کلی پژوهش‌های جدید در خوشه‌بندی فازی و داده‌های غیرایستا هم‌راستا است؛ جایی که الگوریتم باید میان دو هدف تعادل برقرار کند: حفظ سادگی ساختار و افزایش وفاداری به داده.

.

12.2 استفاده فعال از شاخص‌های اعتبار خوشه درون الگوریتم

در نسخه‌های قدیمی‌تر خوشه‌بندی فازی، شاخص‌های اعتبار خوشه معمولاً پس از پایان اجرای الگوریتم استفاده می‌شدند؛ یعنی پژوهشگر چند مقدار مختلف برای تعداد خوشه‌ها امتحان می‌کرد و سپس با شاخص‌هایی مانند Xie-Beni، Partition Coefficient یا Partition Entropy نتیجه بهتر را انتخاب می‌کرد. اما در رویکردهای جدیدتر، این شاخص‌ها به‌تدریج وارد منطق درونی الگوریتم شده‌اند.

در FCMdc، این تغییر اهمیت زیادی دارد. شاخص اعتبار می‌تواند نقش یک سیگنال بازخوردی را بازی کند و به الگوریتم نشان دهد که آیا ساختار فعلی مناسب است یا باید تغییر کند. برای مثال، اگر مقدار شاخص Xie-Beni پس از ایجاد یک خوشه جدید کاهش یابد، این تغییر می‌تواند نشانه بهبود هم‌زمان فشردگی و جدایی خوشه‌ها باشد. اگر ادغام دو خوشه کیفیت شاخص را بهتر کند، ادغام می‌تواند پذیرفته شود.

بنابراین، در نسخه‌های جدید، شاخص اعتبار فقط ابزار گزارش‌گیری نیست؛ بلکه بخشی از سازوکار تصمیم‌گیری الگوریتم است. این موضوع به FCMdc کمک می‌کند از حالت کاملاً تجربی فاصله بگیرد و تصمیم‌های ساختاری را بر پایه معیارهای کمی‌تری انجام دهد.

.

12.3 خوشه‌بندی فازی برای داده‌های جریان‌پیوسته و غیرایستا

یکی از مهم‌ترین مسیرهای پژوهشی پس از 2015، استفاده از خوشه‌بندی فازی در داده‌های جریان‌پیوسته (data streams) است. در داده‌های جریان‌پیوسته، همه داده‌ها از ابتدا در دسترس نیستند. داده‌ها به‌مرور وارد سیستم می‌شوند و توزیع آن‌ها ممکن است در طول زمان تغییر کند. این پدیده معمولاً با عنوان تغییر مفهوم (concept drift) شناخته می‌شود.

در چنین شرایطی، FCM کلاسیک کارایی محدودی دارد، زیرا فرض می‌کند کل داده‌ها در یک مجموعه ثابت وجود دارند و ساختار خوشه‌بندی پس از آموزش تغییر نمی‌کند. اما FCMdc می‌تواند با ماهیت جریان‌داده سازگارتر باشد، زیرا اساساً بر تغییرپذیری ساختار خوشه‌ها تکیه دارد.

در نسخه‌های آنلاین یا تکاملی، معمولاً از ایده‌هایی مانند پنجره زمانی، وزن‌دهی بیشتر به داده‌های جدید، کاهش اثر داده‌های قدیمی و تشخیص تغییر توزیع استفاده می‌شود. هدف این است که الگوریتم بتواند بدون اجرای کامل از ابتدا، خوشه‌های موجود را به‌روزرسانی کند، خوشه‌های جدید بسازد یا خوشه‌های قدیمی را حذف کند. این مسیر برای کاربردهایی مانند اینترنت اشیا، پایش صنعتی، تحلیل ترافیک، امنیت سایبری و تحلیل رفتار کاربران اهمیت زیادی دارد.

.

12.4 مقاوم‌سازی FCMdc در برابر نویز و داده‌های پرت

یکی از ضعف‌های شناخته‌شده FCM کلاسیک، حساسیت آن به نویز و داده‌های پرت است. دلیل این حساسیت آن است که همه نقاط، حتی نقاط غیرعادی، در محاسبه مراکز خوشه‌ها نقش دارند. در FCMdc این مسئله جدی‌تر می‌شود، زیرا نقاط پرت ممکن است به‌اشتباه به‌عنوان نشانه‌ای برای ایجاد خوشه جدید تفسیر شوند.

از سال 2015 به بعد، پژوهش‌های زیادی در خانواده خوشه‌بندی فازی به سمت نسخه‌های robust یا مقاوم در برابر نویز حرکت کرده‌اند. در این روش‌ها، معمولاً یکی از راهکارهای زیر استفاده می‌شود:

  • تعریف وزن کمتر برای نقاط مشکوک یا پرت
  • افزودن ترم منظم‌ساز به تابع هدف
  • استفاده از اطلاعات محلی یا مکانی برای کاهش اثر نویز
  • تعریف خوشه نویز یا ناحیه ابهام
  • جایگزینی فاصله اقلیدسی با معیارهای مقاوم‌تر
  • استفاده از فیلترهای عضویت برای پایدارسازی خروجی

برای FCMdc، مقاوم‌سازی اهمیت بنیادین دارد. اگر سازوکار ایجاد و حذف خوشه در برابر نویز مقاوم نباشد، الگوریتم ممکن است دچار نوسان ساختاری شود؛ یعنی خوشه‌های کاذب بسازد، سپس حذف کند و دوباره در تکرارهای بعدی خوشه‌های مشابه ایجاد کند. بنابراین، یکی از مسیرهای آینده FCMdc طراحی معیارهایی است که بتوانند میان «الگوی جدید واقعی» و «نویز گذرا» تمایز بگذارند.

.

12.5 ترکیب با اطلاعات مکانی، محلی و ساختاری

در بسیاری از کاربردها، به‌خصوص در پردازش تصویر و تصویربرداری پزشکی، رابطه میان نقاط فقط با فاصله عددی در فضای ویژگی‌ها مشخص نمی‌شود. برای مثال، در تصویر پزشکی، دو پیکسل یا وکسل مجاور معمولاً از نظر معنایی به یکدیگر مرتبط‌اند. اگر الگوریتم این اطلاعات مکانی را نادیده بگیرد، خروجی آن ممکن است پراکنده، نویزی یا از نظر ساختاری ناپایدار شود.

پژوهش‌های جدید در خوشه‌بندی فازی، به‌ویژه پس از 2015، نشان داده‌اند که ترکیب FCM با اطلاعات مکانی، همسایگی محلی، فیلترهای مورفولوژیک یا ساختارهای گرافی می‌تواند کیفیت خوشه‌بندی را افزایش دهد. این ایده برای FCMdc نیز بسیار مهم است، زیرا تصمیم‌هایی مانند ایجاد، حذف یا ادغام خوشه‌ها اگر فقط بر پایه فاصله مراکز باشند، ممکن است ساده‌انگارانه باشند. اما اگر این تصمیم‌ها با شواهد مکانی و ساختاری همراه شوند، پایداری بیشتری پیدا می‌کنند.

برای مثال، در بخش‌بندی تصویر، ایجاد خوشه جدید زمانی معنادارتر است که یک ناحیه پیوسته از تصویر به‌طور مداوم خطای بازنمایی بالایی داشته باشد، نه اینکه فقط چند پیکسل منفرد با فاصله زیاد دیده شوند. این تمایز، FCMdc را از یک روش عددی ساده به یک روش زمینه‌آگاه‌تر تبدیل می‌کند.

.

12.6 خوشه‌بندی فازی در فضای نهفته و embeddingها

یکی از تحولات مهم در یادگیری ماشین مدرن، انتقال تحلیل از فضای خام داده به فضای نهفته (latent space) یا embedding space است. در داده‌هایی مانند تصویر، متن، صوت و داده‌های زیستی، فضای خام معمولاً ابعاد بالا، نویز زیاد و روابط غیرخطی دارد. در چنین شرایطی، اجرای مستقیم FCM یا FCMdc روی داده خام ممکن است نتیجه مناسبی ندهد.

پس از 2015، پژوهش‌های زیادی به ترکیب خوشه‌بندی با روش‌های یادگیری بازنمایی پرداخته‌اند. در این چارچوب، ابتدا داده‌ها با روش‌هایی مانند Autoencoder، شبکه‌های عصبی عمیق، embeddingهای زبانی یا روش‌های کاهش بعد به فضایی فشرده‌تر منتقل می‌شوند. سپس خوشه‌بندی در این فضای جدید انجام می‌شود.

برای FCMdc، این مسیر بسیار مهم است. اگر ساختار خوشه‌ها در فضای نهفته واضح‌تر باشد، تصمیم‌های پویا نیز قابل‌اعتمادتر می‌شوند. به‌عبارت دیگر، الگوریتم بهتر می‌تواند تشخیص دهد که آیا یک ناحیه واقعاً خوشه جدیدی را نشان می‌دهد یا صرفاً نویز و پراکندگی در فضای خام است.

در آینده، انتظار می‌رود نسخه‌های پیشرفته FCMdc نه‌تنها روی داده‌های خام، بلکه روی embeddingهای حاصل از مدل‌های عمیق، مدل‌های زبانی، شبکه‌های گرافی و مدل‌های چندوجهی اجرا شوند.

.

12.7.پیوند FCMdc با Deep Fuzzy Clustering

Deep Fuzzy Clustering یکی از مسیرهای فعال پژوهشی در سال‌های اخیر است. در این رویکرد، شبکه عصبی و خوشه‌بندی فازی به‌صورت جداگانه استفاده نمی‌شوند، بلکه گاهی در یک چارچوب مشترک آموزش داده می‌شوند. هدف این است که مدل هم‌زمان دو کار انجام دهد: یادگیری بازنمایی مناسب و تولید ساختار خوشه‌بندی فازی.

FCMdc می‌تواند در این مسیر نقش مهمی داشته باشد. در نسخه‌های عمیق آینده، می‌توان سازوکاری طراحی کرد که شبکه عصبی، فضای بازنمایی را یاد بگیرد و بخش فازی مدل، عضویت‌ها و ساختار خوشه‌ها را به‌صورت پویا تنظیم کند. چنین رویکردی به‌ویژه برای داده‌های پیچیده مانند تصاویر پزشکی، متن‌های بلند، رفتار کاربران، داده‌های چندرسانه‌ای و داده‌های زیستی ارزشمند است.

چالش اصلی در این مسیر، افزایش پیچیدگی مدل و کاهش تفسیرپذیری است. FCMdc در حالت کلاسیک نسبتاً قابل‌توضیح است، زیرا مراکز خوشه و درجات عضویت قابل مشاهده‌اند. اما وقتی با شبکه‌های عمیق ترکیب می‌شود، بخشی از این شفافیت از دست می‌رود. بنابراین، یکی از مسیرهای آینده، طراحی نسخه‌های تفسیرپذیر از Deep Fuzzy Dynamic Clustering است.

.

12.8 تنظیم خودکار تعداد خوشه‌ها و پارامترهای کنترلی

یکی از چالش‌های اصلی FCMdc، انتخاب پارامترهای کنترلی است. این پارامترها می‌توانند شامل موارد زیر باشند:

m ,c0 , τmerge ,τremove , τcreate

در اینجا:

  • m: پارامتر فازی‌ساز
  • C0: تعداد اولیه خوشه‌ها
  •  τmerge ​: آستانه ادغام خوشه‌ها
  •  τremove ​: آستانه حذف خوشه
  •  τcreate ​: آستانه ایجاد خوشه جدید

در نسخه‌های ساده، این پارامترها معمولاً به‌صورت دستی انتخاب می‌شوند. اما در مسائل واقعی، تنظیم دستی آن‌ها می‌تواند دشوار، زمان‌بر و وابسته به تجربه باشد. به همین دلیل، از سال‌های اخیر استفاده از روش‌های بهینه‌سازی فراابتکاری، اعتبارسنجی داخلی و تنظیم داده‌محور پارامترها افزایش یافته است.

روش‌هایی مانند الگوریتم ژنتیک، ازدحام ذرات، الگوریتم گرگ خاکستری، بهینه‌سازی مبتنی بر ازدحام و جست‌وجوی چندهدفه می‌توانند برای انتخاب بهتر پارامترها استفاده شوند. در FCMdc، این موضوع اهمیت بیشتری دارد، زیرا پارامترها فقط بر کیفیت عضویت‌ها اثر نمی‌گذارند، بلکه مستقیماً ساختار خوشه‌بندی را تغییر می‌دهند.

چشم‌انداز آینده در این بخش، طراحی نسخه‌هایی از FCMdc است که بتوانند تعداد خوشه‌ها و آستانه‌های ساختاری را با کمترین دخالت انسانی تنظیم کنند.

.

12.9 مقیاس‌پذیری برای داده‌های بزرگ

یکی دیگر از محورهای مهم پژوهشی پس از 2015، مقیاس‌پذیری خوشه‌بندی فازی برای داده‌های بزرگ (Big Data) است. FCM کلاسیک برای هر داده، عضویت آن را نسبت به همه خوشه‌ها محاسبه می‌کند. بنابراین، با افزایش تعداد داده‌ها، تعداد خوشه‌ها و ابعاد ویژگی‌ها، هزینه محاسباتی به‌سرعت افزایش می‌یابد.

در FCMdc، این مسئله شدیدتر است، زیرا علاوه بر محاسبه عضویت‌ها و مراکز، باید تصمیم‌های ساختاری نیز گرفته شود. برای حل این مشکل، چند مسیر پژوهشی مهم مطرح شده است:

  • استفاده از نمونه‌گیری هوشمند
  • کاهش بعد پیش از خوشه‌بندی
  • اجرای موازی به‌روزرسانی عضویت‌ها
  • استفاده از چارچوب‌های توزیع‌شده مانند Spark
  • خوشه‌بندی مرحله‌ای یا mini-batch
  • تقریب محاسبات فاصله
  • حذف ارزیابی‌های غیرضروری در تصمیم‌های ساختاری

در آینده، موفقیت عملی FCMdc به توانایی آن در پردازش داده‌های بزرگ وابسته خواهد بود. اگر این الگوریتم فقط در مجموعه‌داده‌های کوچک قابل اجرا باشد، کاربرد صنعتی محدودی خواهد داشت. اما اگر نسخه‌های موازی و توزیع‌شده آن توسعه یابند، می‌تواند در پایش صنعتی، سامانه‌های هوشمند، تحلیل کاربران و اینترنت اشیا نقش جدی‌تری پیدا کند.

.

12.10 توسعه FCMdc برای داده‌های چندنمایی و چندوجهی

داده‌های مدرن معمولاً فقط از یک نوع ویژگی تشکیل نشده‌اند. برای مثال، در تحلیل مشتریان، ممکن است داده‌های خرید، رفتار وب‌گردی، متن نظرات، موقعیت مکانی و ویژگی‌های جمعیت‌شناختی هم‌زمان وجود داشته باشد. در پزشکی نیز ممکن است تصویر، آزمایش خون، سیگنال، متن گزارش پزشک و اطلاعات ژنتیکی برای یک بیمار در دسترس باشد.

این نوع داده‌ها را می‌توان چندنمایی (multi-view) یا چندوجهی (multi-modal) دانست. یکی از مسیرهای جدید خوشه‌بندی فازی، طراحی الگوریتم‌هایی است که بتوانند چند نمایش مختلف از داده را هم‌زمان در فرایند خوشه‌بندی وارد کنند.

برای FCMdc، این موضوع بسیار مهم است. در یک مدل پویا، تصمیم برای ایجاد یا ادغام خوشه نباید الزاماً بر پایه یک نمای منفرد از داده باشد. ممکن است در نمای متنی دو گروه متفاوت دیده شوند، اما در نمای رفتاری به هم نزدیک باشند. بنابراین، الگوریتم آینده باید بتواند شواهد چندمنبعی را ترکیب کند و تصمیم ساختاری متوازن‌تری بگیرد.

چشم‌انداز این حوزه، توسعه نسخه‌هایی از FCMdc است که بتوانند وزن هر نما را به‌صورت خودکار یاد بگیرند و ساختار خوشه‌ها را بر اساس توافق یا تضاد میان نماها تنظیم کنند.

.

12.11 FCMdc در یادگیری فدرال و محیط‌های حفظ حریم خصوصی

از سال‌های اخیر، یادگیری فدرال (Federated Learning) و روش‌های حفظ حریم خصوصی در یادگیری ماشین اهمیت زیادی پیدا کرده‌اند. در بسیاری از کاربردها، داده‌ها در یک مرکز واحد جمع‌آوری نمی‌شوند. برای مثال، بیمارستان‌ها، دستگاه‌های اینترنت اشیا یا سازمان‌های مالی ممکن است اجازه انتقال مستقیم داده‌های خام را نداشته باشند.

در چنین شرایطی، ایده خوشه‌بندی فازی پویا می‌تواند با یادگیری فدرال ترکیب شود. هر گره محلی می‌تواند ساختار خوشه‌بندی خود را یاد بگیرد و سپس فقط اطلاعات خلاصه، مانند مراکز خوشه، وزن‌های فازی یا شاخص‌های اعتبار، با سرور مرکزی به اشتراک گذاشته شود. سرور مرکزی می‌تواند ساختارهای محلی را ادغام کند و یک نمای کلی از خوشه‌ها بسازد.

این مسیر هنوز نسبتاً باز و پژوهشی است، اما برای FCMdc ظرفیت بالایی دارد. چون در محیط‌های فدرال، داده‌ها ممکن است در هر گره ساختار متفاوتی داشته باشند و این تفاوت‌ها در طول زمان نیز تغییر کنند. بنابراین، پویایی خوشه‌ها و حفظ حریم خصوصی می‌توانند در آینده به یک مسئله مشترک تبدیل شوند.

.

12.12 افزایش تفسیرپذیری و قابلیت توضیح تصمیم‌های ساختاری

یکی از مزیت‌های مهم خانواده FCM نسبت به بسیاری از مدل‌های پیچیده، ارائه درجات عضویت است. این درجات عضویت می‌توانند به تحلیل‌گر نشان دهند که یک داده تا چه اندازه به هر خوشه تعلق دارد. در FCMdc، علاوه بر عضویت، خود تغییرات ساختاری نیز اهمیت دارند؛ برای مثال، چرا یک خوشه حذف شد، چرا دو خوشه ادغام شدند یا چرا خوشه جدیدی ایجاد شد.

در کاربردهای حساس مانند پزشکی، امنیت، صنعت و مالی، فقط نتیجه خوشه‌بندی کافی نیست. کاربر باید بداند تصمیم‌های الگوریتم بر چه اساسی گرفته شده‌اند. بنابراین، یکی از مسیرهای آینده FCMdc توسعه نسخه‌های توضیح‌پذیر (explainable) است.

یک نسخه توضیح‌پذیر از FCMdc باید بتواند برای هر تغییر ساختاری اطلاعاتی مانند موارد زیر ارائه دهد:

  • تغییر شاخص اعتبار قبل و بعد از تصمیم
  • فاصله میان مراکز خوشه‌های ادغام‌شده
  • جرم فازی خوشه حذف‌شده
  • ناحیه‌ای از داده که باعث ایجاد خوشه جدید شده است
  • اثر تصمیم بر تابع هدف
  • پایداری تصمیم در چند تکرار متوالی

چنین قابلیت‌هایی FCMdc را برای سامانه‌های تصمیم‌یار قابل‌اعتمادتر می‌کند.

.

12.13 جمع‌بندی چشم‌انداز آینده

مسیر آینده FCMdc را می‌توان در چند محور اصلی خلاصه کرد. این الگوریتم در آینده باید از یک روش فازیِ صرفاً فاصله‌محور به یک چارچوب هوشمندتر، داده‌محورتر و مقاوم‌تر تبدیل شود. مهم‌ترین جهت‌گیری‌های آینده عبارت‌اند از:

  • تنظیم خودکار تعداد خوشه‌ها و آستانه‌های ساختاری
  • ترکیب با شاخص‌های اعتبار برای تصمیم‌گیری درون‌الگوریتمی
  • استفاده در داده‌های جریان‌پیوسته و محیط‌های دارای concept drift
  • مقاوم‌سازی در برابر نویز و نقاط پرت
  • ترکیب با embeddingها و یادگیری عمیق
  • توسعه نسخه‌های مقیاس‌پذیر و توزیع‌شده
  • گسترش به داده‌های چندنمایی و چندوجهی
  • حرکت به سمت یادگیری فدرال و حفظ حریم خصوصی
  • افزایش تفسیرپذیری تصمیم‌های ساختاری

بنابراین، FCMdc را باید یکی از مسیرهای مهم در تکامل خوشه‌بندی فازی دانست؛ مسیری که تلاش می‌کند میان انعطاف ساختاری، ابهام فازی، مقیاس‌پذیری و قابلیت تفسیر تعادل برقرار کند.

.

13. جمع‌بندی

الگوریتم FCMdc را می‌توان توسعه‌ای معنادار از خوشه‌بندی فازی کلاسیک دانست که برای شرایطی طراحی شده است که در آن‌ها ساختار خوشه‌ها ثابت، قطعی یا از پیش معلوم نیست. این روش، در کنار حفظ ویژگی مهم FCM یعنی مدل‌سازی عضویت نرم، تلاش می‌کند با استفاده از سازوکارهایی مانند ادغام، حذف یا ایجاد خوشه، ساختار خوشه‌بندی را با واقعیت داده هماهنگ‌تر کند.

در این مقاله دیدیم که FCMdc از نظر مفهومی بر تابع هدف FCM تکیه دارد، اما با افزودن قواعد یا ترم‌های ساختاری، از حالت ایستا خارج می‌شود. همچنین روشن شد که ارزش اصلی این روش در داده‌های پویا، پیچیده و دارای تغییر ساختاری بیشتر نمایان می‌شود. در مقابل، این انعطاف با هزینه‌هایی مانند افزایش پیچیدگی محاسباتی، وابستگی به آستانه‌ها و دشواری ارزیابی همراه است.

اگر هدف، تحلیل داده‌هایی باشد که ساختار آن‌ها در زمان یا در مقیاس‌های مختلف تغییر می‌کند، FCMdc می‌تواند چارچوبی مناسب و پژوهش‌محور باشد. برای مطالعه بیشتر، پیشنهاد می‌شود خواننده ابتدا بر FCM کلاسیک، شاخص‌های اعتبار خوشه و نسخه‌های مقاوم و مکانی این خانواده مسلط شود و سپس به سراغ مدل‌های پویا و تطبیقی برود.

.

14. منابع

lqahtani, A., Xie, X., & Jones, M. W. (2021). Deep fuzzy clustering by maximizing cluster-wise sample separation. Information Sciences, 577, 226–246.

Bezdek, J. C. (1981). Pattern recognition with fuzzy objective function algorithms. Springer.

Cui, B., Zhang, X., & Gao, Y. (2021). Multi-view fuzzy clustering: A survey. Artificial Intelligence Review, 54(7), 5279–5315.

Gustafson, D. E., & Kessel, W. C. (1979). Fuzzy clustering with a fuzzy covariance matrix. In Proceedings of the IEEE Conference on Decision and Control.

Havens, T. C., Bezdek, J. C., Leckie, C., Hall, L. O., & Pal, N. R. (2012). Fuzzy c-means algorithms for very large data. IEEE Transactions on Fuzzy Systems, 20(6), 1130–1146.

Krishnapuram, R., & Keller, J. M. (1993). A possibilistic approach to clustering. IEEE Transactions on Fuzzy Systems, 1(2), 98–110.

Kumar, V., & Kaur, A. (2020). A review on fuzzy clustering with metaheuristic optimization techniques. Archives of Computational Methods in Engineering, 27, 1337–1354.

Lei, T., Jia, X., Zhang, Y., He, L., Meng, H., & Nandi, A. K. (2018). Significantly fast and robust fuzzy c-means clustering algorithm based on morphological reconstruction and membership filtering. IEEE Transactions on Fuzzy Systems, 26(5), 3027–3041.

Min, E., Guo, X., Liu, Q., Zhang, G., Cui, J., & Long, J. (2018). A survey of clustering with deep learning: From the perspective of network architecture. IEEE Access, 6, 39501–39514.

Silva, L. E. B., Sadaei, H. J., Guimarães, F. G., & Ballini, R. (2020). Evolving clustering methods for nonstationary data streams: A survey. Information Fusion, 58, 1–16.

Xie, X. L., & Beni, G. (1991). A validity measure for fuzzy clustering. IEEE Transactions on Pattern Analysis and Machine Intelligence, 13(8), 841–847.

دکتر محمدرضا عاطفی

عضو هیئت علمی دانشگاه
رئیس هیئت مدیره گروه ناب
هم بنیان گذار شرکت دانش بنیان
مشاور شرکت ها و سازمان های بزرگ کشور

آنچه می خوانید

هوش مصنوعی

الگوریتم DENCLUE چیست؟ آموزش، پیاده‌سازی و کاربرد در خوشه‌بندی داده‌ها

1. مقدمه در بخش قبل، الگوریتم DENCLUE از دیدگاه نظری، بر اساس تخمین چگالی هسته (Kernel Density Estimation) و مفهوم جاذب‌های چگالی بررسی شد. در این بخش هدف، پیاده‌سازی عملی الگوریتم و بررسی عملکرد آن روی داده‌های واقعی است. از آنجا که DENCLUE به‌صورت پیش‌فرض در کتابخانه‌های رایج یادگیری ماشین

توضیحات بیشتر »
هوش مصنوعی

الگوریتم DENCLUE چیست؟ خوشه‌بندی مبتنی بر تخمین چگالی

  1.چکیده خوشه‌بندی یکی از ارکان اصلی یادگیری بدون نظارت است که هدف آن شناسایی الگوهای پنهان در داده‌هاست. الگوریتم DENCLUE (مخفف DENsity-based CLUstering) با بهره‌گیری از مفاهیم آماری “تخمین چگالی هسته” (Kernel Density Estimation)، فضایی پیوسته از چگالی داده‌ها ایجاد می‌کند. در این مقاله، ما به بررسی دقیق نحوه

توضیحات بیشتر »
هوش مصنوعی

کاربرد سنسور دمای دیود سیلیکونی در صنعت، خودرو و HVAC

ابتدا مقاله سنسور دمای دیود سیلیکونی؛ عملکرد، مزایا و کاربردهای صنعتی را مطالعه نمایید.سپس این مقاله را مطالعه کنید. 2.5.کاربرد سنسور دمای دیود سیلیکونی در سیستم تهویه مطبوع (HVAC) 2.5.1.مکان‌های دقیق استفاده در سیستم‌های HVAC سنسورهای دمای دیود سیلیکونی در نقاطی که نیاز به اندازه‌گیری دمای تماسی و دقیق قطعات

توضیحات بیشتر »
error: Content is protected !!