پیشنهاد میکنیم ابتدا مقاله الگوریتم AGNES چیست؟ آموزش خوشهبندی سلسلهمراتبی تجمیعی را مطالعه نمایید.
24. مزایا

24.1 عدم نیاز به تعیین تعداد خوشه در آغاز
یکی از مزایای اصلی AGNES این است که کاربر مجبور نیست از ابتدا تعداد خوشهها را مشخص کند. الگوریتم کل ساختار سلسلهمراتبی را میسازد و سپس میتوان در مرحله تفسیر، تعداد خوشهها را انتخاب کرد.
24.2 تولید دندروگرام
دندروگرام یک ابزار بصری قدرتمند است. این نمودار نشان میدهد نمونهها و خوشهها چگونه و در چه سطحی با یکدیگر ادغام شدهاند. این ویژگی AGNES را برای تحلیل اکتشافی بسیار ارزشمند میکند.
24.3 تفسیرپذیری بالا
در مقایسه با بسیاری از روشهای پیچیدهتر، AGNES خروجی قابلفهمتری دارد. پژوهشگر میتواند مسیر تشکیل خوشهها را مشاهده کند و درباره ساختار داده توضیح دهد.
24.4 انعطاف در انتخاب فاصله
AGNES میتواند با معیارهای فاصله مختلف کار کند. این ویژگی باعث میشود برای انواع دادهها، از دادههای عددی تا دودویی و متنی، قابل استفاده باشد؛ البته به شرط آنکه فاصله مناسب انتخاب شود.
24.5 مناسب برای دادههای کوچک و متوسط
برای دادههایی با اندازه کوچک تا متوسط، AGNES میتواند روشی دقیق، شفاف و آموزشی باشد. بهویژه زمانی که هدف تحلیل ساختار داده است، نه صرفاً پیشبینی سریع.
.
25. محدودیتها

25.1 پیچیدگی محاسباتی بالا
یکی از مهمترین محدودیتهای AGNES هزینه زمانی آن است. در پیادهسازیهای ساده، پیچیدگی زمانی میتواند به O(n^3) برسد. حتی در پیادهسازیهای بهتر نیز ذخیره و پردازش فاصلهها برای دادههای بزرگ چالشبرانگیز است.
25.2 نیاز به حافظه زیاد
اغلب پیادهسازیها نیازمند ذخیره ماتریس فاصله هستند که حافظهای در حدO(n^2) لازم دارد. این موضوع AGNES را برای مجموعهدادههای بسیار بزرگ محدود میکند.
25.3 حساسیت به معیار فاصله
اگر معیار فاصله مناسب انتخاب نشود، خروجی الگوریتم میتواند گمراهکننده باشد. برای مثال، استفاده از فاصله اقلیدسی برای دادههای متنی خام یا دادههای با ابعاد بسیار بالا ممکن است مناسب نباشد.
25.4 حساسیت به مقیاس ویژگیها
اگر ویژگیها در مقیاسهای متفاوت باشند، ویژگیهای با دامنه بزرگتر بر محاسبه فاصله غالب میشوند. بنابراین، پیشپردازش و استانداردسازی معمولاً ضروری است.
25.5 برگشتناپذیری ادغامها
AGNES یک روش حریصانه است. وقتی دو خوشه ادغام شدند، این تصمیم در مراحل بعدی قابل اصلاح نیست. اگر در مراحل اولیه ادغام نامناسبی رخ دهد، میتواند بر کل ساختار نهایی اثر بگذارد.
25.6 وابستگی شدید به Linkage
انتخاب single، complete، average یا Ward میتواند نتایج بسیار متفاوتی ایجاد کند. بنابراین، AGNES یک پاسخ مطلق تولید نمیکند؛ بلکه خروجی آن وابسته به تصمیمهای طراحی الگوریتم است.
.
26. مقایسه با الگوریتمهای مشابه
26.1 مقایسه AGNES و K-Means
| معیار | AGNES | K-Means |
| نوع روش | سلسلهمراتبی | افرازگرا |
| نیاز به تعیین تعداد خوشه | در ابتدا خیر، در خروجی نهایی بله | بله |
| خروجی | دندروگرام و خوشهها | خوشههای تخت |
| نوع تصمیمگیری | ادغام حریصانه | کمینهسازی تابع هدف |
| مقیاسپذیری | محدودتر | بهتر |
| حساسیت به مقداردهی اولیه | ندارد | دارد |
| تفسیر ساختار چندسطحی | قوی | ضعیف |
K-Means برای دادههای بزرگ و خوشههای تقریباً کروی مناسب است. AGNES زمانی مناسبتر است که ساختار سلسلهمراتبی و تفسیرپذیری اهمیت داشته باشد.

26.2 مقایسه AGNES و K-Medoids
K-Medoids مانند K-Means یک روش افرازگراست، اما بهجای میانگین از نمونه واقعی بهعنوان مرکز خوشه استفاده میکند. این ویژگی آن را نسبت به دادههای پرت مقاومتر میکند. AGNES برخلاف K-Medoids، ساختار سلسلهمراتبی تولید میکند و از ابتدا به تعداد خوشه نیاز ندارد.
26.3 مقایسه AGNES و DIANA
DIANA که مخفف Divisive Analysis است، رویکردی معکوس AGNES دارد. AGNES از خوشههای تکعضوی شروع میکند و آنها را ادغام میکند؛ اما DIANA از یک خوشه شامل همه دادهها آغاز میکند و آن را بهتدریج تقسیم میکند (Kaufman & Rousseeuw, 1990).
| معیار | AGNES | DIANA |
| جهت حرکت | پایین به بالا | بالا به پایین |
| نقطه شروع | هر داده یک خوشه | همه دادهها یک خوشه |
| عملیات اصلی | ادغام | تقسیم |
| کاربرد آموزشی | بسیار رایج | کمتر رایج |
| خروجی | دندروگرام | دندروگرام |

26.4 مقایسه AGNES و DBSCAN
DBSCAN یک روش مبتنی بر چگالی است. این الگوریتم میتواند خوشههایی با شکلهای نامنظم را شناسایی کند و نقاط پرت را نیز تشخیص دهد. اما به پارامترهای چگالی مانند ε\varepsilonε و حداقل تعداد نقاط نیاز دارد.
AGNES در مقابل، ساختار سلسلهمراتبی ارائه میدهد، اما بهطور مستقیم برای تشخیص نقاط پرت طراحی نشده است.
26.5 مقایسه AGNES و HDBSCAN
HDBSCAN را میتوان توسعهای سلسلهمراتبی و چگالیمحور از DBSCAN دانست. این روش برای دادههایی با چگالیهای متفاوت مناسبتر است و نسبت به DBSCAN در بسیاری از مسائل پیچیده عملکرد پایدارتری دارد. در مقایسه، AGNES سادهتر، کلاسیکتر و از نظر آموزشی شفافتر است، اما در مسائل بزرگ و پیچیده ممکن است کارایی کمتری داشته باشد.
.
27. توسعههای جدید و روندهای پژوهشی
اگرچه AGNES کلاسیک الگوریتمی قدیمی است، ایده خوشهبندی سلسلهمراتبی همچنان در پژوهشهای جدید حضور پررنگی دارد. تمرکز پژوهشهای جدید معمولاً بر خود AGNES بهعنوان یک نام مستقل نیست، بلکه بر گسترش، شتابدهی و ترکیب ایدههای سلسلهمراتبی با روشهای نوین یادگیری ماشین است.

27.1 شتابدهی محاسباتی
یکی از مسیرهای مهم پژوهشی، کاهش هزینه محاسباتی خوشهبندی سلسلهمراتبی است. آثار کلاسیک و مرورهای پژوهشی نشان دادهاند که پیچیدگی روشهای سلسلهمراتبی به نوع linkage و ساختار داده وابسته است (Murtagh & Contreras, 2012). توسعه دادهساختارهای کارآمد، روشهای تقریبی و محاسبات موازی از راهکارهای مهم در این زمینه است.
27.2 خوشهبندی سلسلهمراتبی روی بازنماییهای عمیق
در سالهای اخیر، بسیاری از دادهها ابتدا با مدلهای یادگیری عمیق به فضای نهفته یا embedding منتقل میشوند و سپس خوشهبندی روی این بازنمایی انجام میشود. برای مثال، در متنکاوی، اسناد میتوانند با embeddingهای زبانی نمایش داده شوند و سپس AGNES یا روشهای سلسلهمراتبی مشابه برای کشف ساختار موضوعی به کار روند. این رویکرد، پیوندی میان یادگیری بازنمایی (Representation Learning) و خوشهبندی کلاسیک ایجاد میکند.
27.3 خوشهبندی سلسلهمراتبی مقیاسپذیر
برای دادههای بزرگ، AGNES کلاسیک بهتنهایی کافی نیست. بنابراین، روشهای ترکیبی مانند نمونهگیری، خوشهبندی اولیه با روشهای سریعتر، و سپس اعمال خوشهبندی سلسلهمراتبی روی نمایندهها مورد توجه قرار گرفتهاند. ایدههایی مانند BIRCH نیز دقیقاً در پاسخ به نیاز مقیاسپذیری در خوشهبندی سلسلهمراتبی توسعه یافتهاند (Zhang et al., 1996).
27.4 خوشهبندی سلسلهمراتبی محدودیتمحور
در برخی مسائل، دانش حوزه وجود دارد. برای مثال، ممکن است بدانیم دو نمونه باید در یک خوشه باشند یا نباید در یک خوشه قرار گیرند. این نوع اطلاعات با عنوان محدودیتهای must-link و cannot-link شناخته میشود. ترکیب خوشهبندی سلسلهمراتبی با چنین محدودیتهایی یکی از مسیرهای مهم پژوهشی در یادگیری نیمهنظارتی است.
27.5 کاربرد در دادههای چندوجهی
دادههای جدید اغلب چندوجهیاند؛ یعنی شامل متن، تصویر، سیگنال، داده عددی و گراف هستند. در چنین شرایطی، تعریف فاصله به مسئلهای پیچیده تبدیل میشود. یکی از روندهای آینده، طراحی معیارهای فاصله ترکیبی و استفاده از خوشهبندی سلسلهمراتبی برای کشف روابط چندسطحی میان دادههای چندوجهی است.
27.6 تفسیرپذیری و علم داده قابل توضیح
با افزایش اهمیت هوش مصنوعی قابل توضیح (Explainable AI)، الگوریتمهایی که خروجی قابلتفسیر دارند دوباره مورد توجه قرار گرفتهاند. دندروگرام AGNES میتواند به متخصصان کمک کند روند شکلگیری گروهها را ببینند. البته تفسیرپذیری AGNES وابسته به انتخاب درست ویژگیها و فاصلههاست.
.
28.نوآوریها و چشمانداز آینده AGNES
1. ملاحظه روششناختی برای این بخش
برای الگوریتم AGNES (Agglomerative Nesting)، اگر بخواهیم صرفاً به نسخه کلاسیک کتابی و پیادهسازیهای متعارف بسنده کنیم، بخش «نوآوریها و آینده» بسیار محدود خواهد شد. دلیل آن روشن است: در ادبیات 2020 به بعد، بسیاری از پیشرفتها نه با نام مستقیم AGNES، بلکه در قالبهای گستردهتری مانند موارد زیر منتشر میشوند:
- Agglomerative Hierarchical Clustering
- Scalable Hierarchical Clustering
- Graph-based Hierarchical Clustering
- Hierarchical Representation Clustering
- Constraint-based Hierarchical Clustering
- Differentiable / Deep Hierarchical Clustering
بنابراین، در این بخش، تمرکز بر خانواده روشهای تجمیعی سلسلهمراتبی و توسعههای معاصر آن است؛ یعنی همان منطق بنیادی AGNES که با فناوریها، دادهساختارها، معیارهای شباهت و بسترهای محاسباتی جدید بازآفرینی شده است.
این بخش نیز عمداً از تکرار تعریف پایه الگوریتم، گامهای کلاسیک و جمعبندی متعارف مقاله پرهیز میکند.
.
2. روندهای جدید و بهبودهای اخیر
2.1 گذار از AGNES کلاسیک به AGNES مقیاسپذیر
2.1.1 مسئله اصلی
AGNES کلاسیک از نظر محاسباتی برای دادههای بزرگ محدودیت جدی دارد، زیرا:
- نیازمند محاسبه یا نگهداری ماتریس فاصله است؛
- در هر گام باید نزدیکترین دو خوشه شناسایی شوند؛
- بهروزرسانی فاصلهها پس از ادغام میتواند پرهزینه باشد.
در نتیجه، اگرچه از نظر تفسیری جذاب است، اما در دادههای بزرگ، خام و پرتعداد، اجرای مستقیم آن دشوار میشود.
2.1.2 بهبودهای 2020 به بعد
در ادبیات جدید، چند رویکرد مهم برای رفع این محدودیت دیده میشود:
- استفاده از approximate nearest neighbor برای یافتن همسایههای نزدیک بهجای جستجوی کامل؛
- اجرای hierarchical clustering on representatives بهجای تمام نقاط؛
- استفاده از coreset یا فشردهسازی داده پیش از خوشهبندی؛
- طراحی نسخههای parallel و distributed؛
- محدود کردن فضای جستجو با graph sparsification یا k-nearest neighbor graph.
2.1.3 دلالت علمی
این تغییرات نشان میدهد که AGNES از یک الگوریتم کاملاً جفتفاصلهمحور، به سمت یک چارچوب چندمرحلهای و مهندسیشده حرکت کرده است؛ یعنی ابتدا داده خلاصه یا ساختاربندی میشود، سپس منطق ادغام سلسلهمراتبی روی نمایش فشردهتر اجرا میشود.
.
2.2 حرکت از شباهت خام به بازنمایی یادگرفتهشده
2.2.1 وضعیت سنتی
AGNES کلاسیک فرض میکند که شباهت یا فاصله بین نمونهها از ابتدا معلوم و مناسب است؛ مثلاً فاصله اقلیدسی یا منهتن.
2.2.2 تحول جدید
در مقالات 2020 به بعد، این فرض غالباً کنار گذاشته میشود. ابتدا داده در یک فضای بهتر نمایش داده میشود و سپس AGNES یا یکی از گونههای آن روی آن فضا اعمال میشود. این بازنمایی ممکن است از طریق موارد زیر حاصل شود:
- self-supervised representation learning
- contrastive embeddings
- transformer embeddings
- graph embeddings
- autoencoder latent space
2.2.3 اهمیت برای AGNES
این تحول از دو جهت مهم است:
- مشکل قدیمی AGNES در مواجهه با دادههای با ابعاد بالا و فاصلههای کممعنا کاهش مییابد.
- ساختار سلسلهمراتبی خروجی، بیشتر منعکسکننده معنای نهفته داده میشود تا صرفاً نزدیکی هندسی خام.
در نتیجه، AGNES امروز در بسیاری از کاربردها نه بهعنوان «خوشهبندی مستقیم روی داده خام»، بلکه بهعنوان مرحله ساخت سلسلهمراتب روی embeddingها عمل میکند.
.
2.3 توسعه معیارهای ادغام فراتر از linkageهای کلاسیک
2.3.1 محدودیت linkageهای سنتی
Single, complete, average و Ward هنوز مرجعاند، اما برای دادههای پیچیده همواره کافی نیستند.
مثلاً:
- single linkage به chaining حساس است؛
- complete linkage ممکن است بیش از حد فشردهساز باشد؛
- average linkage ممکن است ساختارهای موضعی را کمرنگ کند؛
- Ward بیشتر برای خوشههای نسبتاً کروی مناسب است.
2.3.2 نوآوریهای جدید
در ادبیات معاصر، توسعهها بیشتر به این سو رفتهاند:
- linkageهای graph-aware؛
- linkageهای density-aware؛
- linkageهای representation-adaptive؛
- linkageهای constraint-aware؛
- linkageهای stability-driven.
به بیان دقیقتر، معیار ادغام دیگر صرفاً تابعی از فاصله بین دو خوشه نیست، بلکه ممکن است تابعی از موارد زیر نیز باشد:
- پایداری خوشهها؛
- چگالی موضعی؛
- همگنی در فضای embedding؛
- محدودیتهای دامنه؛
- کیفیت ساختار درختی حاصل.
2.3.3 نتیجه
این روند نشان میدهد که «قلب الگوریتم AGNES» در حال جابهجایی از یک قاعده هندسی ساده به یک تابع تصمیمگیری آگاه از بافت داده است.
.
2.4 پیوند AGNES با گراف و خوشهبندی شبکهای
2.4.1 چرایی این روند
برای بسیاری از دادههای مدرن، ساختار اصلی نه در فضای برداری، بلکه در رابطهها نهفته است. دادههای زیر نمونهاند:
- شبکههای اجتماعی
- ارتباطات سایبری
- همرخدادی اسناد
- شبکههای زیستی
- گرافهای دانش
2.4.2 شکل توسعه
در این محیطها، AGNES یا منطق agglomerative به این صورت بازطراحی میشود:
- خوشهبندی روی similarity graph بهجای ماتریس فاصله خام؛
- ادغام اجتماعها (communities) بهصورت سلسلهمراتبی؛
- استفاده از modularity, conductance یا معیارهای ساختاری برای ادغام؛
- ساخت درخت سلسلهمراتبی روی زیرگرافها یا node embeddings.
2.4.3 پیامد
این روند سبب شده AGNES از یک ابزار کلاسیک تحلیل عددی، به یک روش مناسب برای ساخت سلسلهمراتب ساختاری در دادههای رابطهای تبدیل شود.
.
2.5 بازگشت AGNES در چارچوب Explainable Clustering
2.5.1 زمینه
در بسیاری از روشهای مدرن، خروجی فقط یک برچسب خوشه است. اما در کاربردهای حساس، کاربران میخواهند مسیر شکلگیری خوشهها را نیز ببینند.
2.5.2 مزیت AGNES
AGNES ذاتاً این مزیت را دارد که:
- تاریخچه ادغامها را حفظ میکند؛
- درخت سلسلهمراتبی تولید میکند؛
- امکان مشاهده سطحهای مختلف دانهبندی را فراهم میکند.
2.5.3 روند جدید
به همین دلیل، در پژوهشهای جدید، AGNES بهعنوان یک ابزار برای توضیحپذیری ساختاری مورد توجه قرار گرفته است؛ بهویژه وقتی خروجی مدلهای عمیق یا embeddingهای پیچیده باید برای انسان معنادار شود.
.
3. امکان ترکیب AGNES با روشهای دیگر

3.1 ترکیب با K-Means و Mini-Batch K-Means
3.1.1 الگوی ترکیب
یک الگوی رایج در کارهای جدید این است:
- ابتدا داده با K-Means یا Mini-Batch K-Means به چند خوشه اولیه تقسیم شود؛
- سپس AGNES روی مراکز، نمایندهها یا micro-clusterها اجرا شود.
3.1.2 مزایا
- بهبود مقیاسپذیری؛
- کاهش اندازه مسئله؛
- حفظ ساختار سلسلهمراتبی در سطح کلان.
3.1.3 محدودیت
- بخشی از ساختار ظریف داده ممکن است در مرحله پیشخوشهبندی از بین برود؛
- نتیجه نهایی به کیفیت خوشهبندی اولیه وابسته میشود.
3.1.4 نتیجه تحلیلی
این ترکیب برای کاربردهای صنعتی، از عملیترین مسیرهای احیای AGNES در دادههای بزرگ است.
.
3.2 ترکیب با DBSCAN و HDBSCAN
3.2.1 منطق ترکیب
AGNES نسبت به نویز و نقاط پرت حساس است، بهخصوص در برخی linkageها. از اینرو، یک راهکار مؤثر آن است که ابتدا با یک روش چگالیمحور:
- نویز حذف شود،
- نقاط هستهای شناسایی شوند،
- یا خوشههای اولیه چگالیمحور ساخته شوند.
سپس AGNES بر روی ساختار پالایششده اعمال شود.
3.2.2 مزایا
- کاهش حساسیت به outlier؛
- بهبود کیفیت دندروگرام؛
- مناسب برای دادههای نامنظم و آلوده.
3.2.3 کاربرد
این ترکیب در دادههای حسگری، صنعتی، رفتاری و امنیتی بسیار امیدبخش است.
.
3.3 ترکیب با Spectral Clustering
3.3.1 چرایی
در دادههایی که مرز خوشهها غیرخطی است، AGNES مستقیم روی داده خام ممکن است ناکافی باشد.
3.3.2 الگوی ترکیب
دو مسیر رایج وجود دارد:
- اجرای spectral embedding و سپس اعمال AGNES در فضای طیفی؛
- ساخت گراف شباهت و استفاده از معیارهای طیفی برای هدایت ادغام.
3.3.3 مزیت
- کشف ساختارهای manifold؛
- کاهش اتکای صرف به فاصله اقلیدسی؛
- مناسب برای دادههای پیچیده و غیرکروی.
.
3.4 ترکیب با یادگیری عمیق
3.4.1 قالبهای رایج
در آثار 2020 به بعد، ترکیب AGNES با یادگیری عمیق عمدتاً در قالبهای زیر دیده میشود:
- Deep embedding + AGNES
- Autoencoder + hierarchical agglomerative clustering
- Transformer representation + agglomerative tree building
- Contrastive learning + hierarchical clustering
3.4.2 مزایا
- مناسب برای متن، تصویر، صوت و سیگنال؛
- افزایش معناداری شباهتها؛
- ساخت سلسلهمراتب قابل تفسیر روی بازنماییهای قوی.
3.4.3 چالشها
- جداسازی اثر کیفیت embedding از کیفیت AGNES دشوار است؛
- تفسیر خوشهها نیازمند تفسیر فضای نهفته نیز هست؛
- پایداری نسبت به تغییرات مدل بازنمایی هنوز یک مسئله باز است.
.
3.5 ترکیب با روشهای محدودیتمحور
3.5.1 مسئله
در کاربردهای واقعی، اغلب دانش کارشناسی وجود دارد. برای مثال:
- برخی نمونهها باید در یک خوشه باشند؛
- برخی نمونهها نباید ادغام شوند؛
- ترتیب یا مرزهای سازمانی خاصی باید رعایت شود.
3.5.2 توسعهها
AGNES میتواند با:
- must-link / cannot-link
- قواعد کارشناسی
- قیود سازمانی
- برچسبهای جزئی
ترکیب شود. در این صورت، معیار ادغام یا ترتیب ادغام بازطراحی میشود.
3.5.3 اهمیت
این توسعه AGNES را از یک الگوریتم اکتشافی عمومی، به یک ابزار نیمهنظارتی و تصمیمیار نزدیک میکند.
.
3.6 ترکیب با گراف دانش و دانش دامنه
در کاربردهای پیشرفته، شباهت فقط از داده خام استخراج نمیشود، بلکه از ساختارهای معنایی نیز استفاده میشود.
اگر داده در یک knowledge graph یا ساختار معنایی دامنهمحور مستقر باشد، AGNES میتواند بر پایه شباهت معنایی غنیشده اجرا شود. این مسیر برای:
- اسناد تخصصی
- تحلیل فرایند
- پزشکی
- مدیریت دانش سازمانی
بسیار ارزشمند است.
.
4. کاربردهای آینده AGNES
4.1 تحلیل سلسلهمراتبی embeddingهای زبانی
با فراگیر شدن embeddingهای زبانی، نیاز به ساخت طبقهبندی دادهمحور برای متن افزایش یافته است. AGNES میتواند برای موارد زیر به کار رود:
- کشف ساختار موضوعات در اسناد؛
- گروهبندی سؤالات و پاسخها؛
- خوشهبندی شکایات مشتریان؛
- تحلیل دانش سازمانی و محتوای اسنادی.
مزیت اصلی آن این است که برچسب نهایی کافی نیست؛ کاربران اغلب میخواهند سطوح مختلف موضوعی را ببینند.
.
4.2 خوشهبندی چندسطحی مشتریان و کاربران
در تحلیل کسبوکار، تقسیمبندی تخت اغلب پاسخگوی نیاز مدیران نیست. مدیر میخواهد بداند:
- مشتریان در سطح راهبردی به چند گروه اصلی تقسیم میشوند؛
- هر گروه، در سطح عملیاتی چه زیرگروههایی دارد.
AGNES برای این نوع تصمیمسازی مدیریتی مناسب است، بهویژه اگر روی embeddingهای رفتاری یا تراکنشی اجرا شود.
.
4.3 تحلیل خطا، رخداد و HSE
در دادههای رخداد، شبهرخداد، عدمانطباق و رویدادهای HSE، AGNES میتواند ساختارهای سلسلهمراتبی مهمی را آشکار کند؛ برای مثال:
- خانوادههای اصلی رخدادها؛
- زیرالگوهای علّی در هر خانواده؛
- رابطه میان انواع خطا و شرایط عملیاتی.
این کاربرد بهویژه زمانی ارزشمند است که سازمان فقط به «چند خوشه» نیاز ندارد، بلکه به درختی از الگوهای ریشهای و فرعی نیاز دارد.
.
4.4 پزشکی و زیستداده
در زیستدادهها و پزشکی، ساختارهای سلسلهمراتبی اغلب طبیعیاند؛ مثلاً:
- زیرگونههای سلولی؛
- زیرگروههای بیماران؛
- الگوهای چندسطحی پاسخ به درمان.
AGNES، بهویژه همراه با representation learning و دادههای چندوجهی، میتواند در ساخت taxonomyهای دادهمحور بسیار مفید باشد.
.
4.5 امنیت سایبری و تحلیل رویدادها
در امنیت سایبری، رویدادها و هشدارها میتوانند در چند سطح تجمیع شوند:
- خانوادههای کلان رفتار مشکوک؛
- زیرخانوادههای تخصصیتر؛
- الگوهای محلی حمله.
AGNES برای ساخت این ساختارهای چندسطحی، بهخصوص پس از embedding رفتاری یا graph representation، ظرفیت بالایی دارد.
.
4.6 سازماندهی دانش و مخازن سازمانی
در سامانههای AI سازمانی، یکی از مسائل مهم، ساختاردهی سلسلهمراتبی به محتوای دانش است. AGNES میتواند در:
- خوشهبندی اسناد،
- طبقهبندی تجربههای عملیاتی،
- ساخت درخت دانش سازمانی،
- گروهبندی رویهها و درسآموختهها
بهکار رود؛ بهویژه وقتی سازمان به یک طبقهبندی پویا و دادهمحور نیاز داشته باشد.
.
5. مسیرهای پژوهشی و فرصتهای توسعه
5.1 AGNES مقیاسپذیر برای دادههای بسیار بزرگ
یکی از مهمترین مسیرهای پژوهشی، طراحی نسخههایی است که بدون نیاز به ماتریس فاصله کامل بتوانند ساختار تجمیعی را حفظ کنند.
فرصتهای پژوهشی در این حوزه عبارتاند از:
- nearest-neighbor graph based agglomeration
- streaming summarization + hierarchical merging
- coreset-driven AGNES
- GPU-enabled agglomerative procedures
این حوزه از نظر صنعتی بسیار ارزشمند است.
.
5.2 AGNES مقاوم به نویز و outlier
نسخههای کلاسیک در برابر دادههای پرت آسیبپذیرند.
فرصتهای توسعه شامل موارد زیر است:
- linkageهای robust؛
- ادغام مبتنی بر medoid یا نماینده مقاوم؛
- پالایش پیشینی با روشهای چگالیمحور؛
- معیارهای ادغام با وزندهی به اطمینان نمونهها.
این مسیر برای دادههای واقعی، از پژوهشهای بسیار کاربردی و ضروری است.
.
5.3 یادگیری linkage بهجای انتخاب دستی آن
در نسخههای سنتی، کاربر باید linkage را انتخاب کند. اما در بسیاری از مسائل، معلوم نیست کدام linkage مناسبتر است.
یکی از جذابترین مسیرهای پژوهش، یادگیری قاعده ادغام از داده است؛ یعنی:
- متناسب با ساختار مسئله،
- بازنمایی داده،
- و بازخورد کیفیت خوشهها،
خود سیستم تصمیم بگیرد که چه خوشههایی ادغام شوند.
این ایده AGNES را به سمت data-adaptive hierarchical clustering سوق میدهد.
.
5.4 AGNES محدودیتمحور و نیمهنظارتی
در مسائل سازمانی، بانکی، پزشکی و صنعتی، دانش دامنه ارزشمند است.
پژوهشهای آینده میتوانند بر طراحی نسخههایی متمرکز شوند که:
- محدودیتهای کارشناسی را در هر مرحله ادغام لحاظ کنند؛
- از برچسبهای جزئی استفاده کنند؛
- ساختار درختی را با نیاز تصمیمگیری هماهنگ کنند.
این مسیر برای کاربردهای تنظیمشده و حرفهای، بسیار مهم است.
.
5.5 AGNES در فضای چندوجهی و چندنما
برای دادههای مدرن، پرسش اصلی این است که چگونه:
- متن،
- عدد،
- تصویر،
- گراف،
- و داده زمانی
را در یک سازوکار تجمیعی سلسلهمراتبی ادغام کنیم.
فرصت پژوهشی مهم در اینجا، طراحی فاصلهها یا شباهتهای چندنما و سپس اجرای AGNES روی آنهاست.
این مسیر بهویژه در سامانههای سازمانی و پزشکی آیندهدار است.
.
5.6 AGNES تفسیری برای مدلهای عمیق
با گسترش مدلهای عمیق، نیاز به ابزارهایی برای تبیین ساختار داده در فضای نهفته افزایش یافته است.
AGNES میتواند بهعنوان یک لایه تفسیری عمل کند، اما هنوز پرسشهای پژوهشی باز فراوانی وجود دارد:
- چگونه شاخههای دندروگرام را تفسیر کنیم؟
- چگونه پایداری ساختار سلسلهمراتبی را بسنجیم؟
- چگونه ویژگیهای توضیحدهنده هر ادغام را استخراج کنیم؟
این حوزه در پیوند با Explainable AI بسیار مهم است.
.
5.7 AGNES پویا و برخط
نسخه کلاسیک AGNES برای دادههای ایستا طراحی شده است.
در حالیکه در محیطهای واقعی، دادهها:
- بهصورت جریانداده وارد میشوند؛
- تغییر مفهوم (concept drift) دارند؛
- ساختار خوشهای آنها در زمان دگرگون میشود.
طراحی AGNES افزایشی، برخط و سازگار با drift، یکی از خلأهای جدی پژوهشی است.
.
5.8 اعتبارسنجی ساختار سلسلهمراتبی
یکی از مسائل کمتر حلشده، ارزیابی کیفیت دندروگرام است.
بسیاری از معیارهای سنتی برای خوشهبندی تخت طراحی شدهاند، نه ساختار سلسلهمراتبی.
در نتیجه، از منظر پژوهشی نیاز به موارد زیر وجود دارد:
- معیارهای پایداری برای سطوح مختلف درخت؛
- سنجههای کیفیت ادغام؛
- معیارهای تفسیرپذیری سلسلهمراتب؛
- روشهای مقایسه دو دندروگرام.
این حوزه، هم نظری و هم کاربردی، بسیار مهم است.
.
6. نوآوریهای مفهومی مهم پیرامون AGNES در ادبیات جدید
6.1 AGNES بهعنوان «موتور ساخت سلسلهمراتب» نه فقط «الگوریتم خوشهبندی»
در ادبیات جدید، AGNES دیگر صرفاً برای تولید چند خوشه استفاده نمیشود، بلکه برای ساخت یک ساختار درختی تفسیری روی داده به کار میرود.
6.2 AGNES بهعنوان لایه پساتحلیلی روی embeddingها
در بسیاری از کاربردهای جدید، AGNES مرحله نهایی است، نه مرحله اول؛ یعنی ابتدا representation learning انجام میشود و سپس AGNES ساختار را آشکار میکند.
6.3 AGNES بهعنوان ابزار ترکیبی
پیشرفتهای جدید بیشتر حول AGNES خالص نیستند، بلکه حول AGNES ترکیبی (hybrid AGNES) شکل گرفتهاند.
6.4 AGNES بهعنوان چارچوب قابل انطباق با دانش دامنه
در کاربردهای واقعی، ارزش اصلی AGNES در این است که میتواند به قیود، شباهتهای خاص دامنه و ساختارهای معنایی متصل شود.
.
7. چشمانداز آینده AGNES
7.1 آینده محتمل
آینده AGNES احتمالاً در یکی از این چهار مسیر تثبیت میشود:
- AGNES مقیاسپذیر برای دادههای بزرگ؛
- AGNES مبتنی بر embedding برای دادههای پیچیده؛
- AGNES محدودیتمحور برای مسائل حرفهای و تصمیمیار؛
- AGNES تفسیری برای Explainable AI و مدیریت دانش.
7.2 فرصت نوآوری پژوهشی
اگر هدف، تولید کار پژوهشی جدید بر پایه AGNES باشد، حوزههای زیر بسیار مناسباند:
- linkage یادگیرنده و تطبیقی؛
- hierarchical clustering با graph sparsification؛
- AGNES مقاوم به نویز و drift؛
- AGNES برای دادههای چندوجهی؛
- AGNES برای تحلیل ساختار دانش سازمانی؛
- AGNES در کنار LLM embeddings و enterprise AI.
7.3 نکته مهم برای تألیف کتاب
در فصل کتاب، بهتر است AGNES نه فقط بهعنوان یک روش کلاسیک، بلکه بهعنوان الگوی بنیادین تجمیع سلسلهمراتبی معرفی شود که در پژوهشهای جدید، در قالبهای ترکیبی و مقیاسپذیر، دوباره زنده شده است.
.
8. منابع پیشنهادی برای پوشش این بخش با تأکید بر 2020 به بعد
نکته علمی: چون بسیاری از توسعههای جدید با نام مستقیم AGNES منتشر نمیشوند، در اینجا علاوه بر منابع مرجع، منابع حوزههای همپوشان نیز پیشنهاد میشوند تا بخش تألیف از نظر استناد بهروز و قوی باشد.
8.1 مرورها و زمینهسازها
- Xu, D., & Tian, Y. (2015). A comprehensive survey of clustering algorithms. Annals of Data Science, 2, 165–193.
- Murtagh, F., & Contreras, P. (2012). Algorithms for hierarchical clustering: An overview. WIREs Data Mining and Knowledge Discovery, 2(1), 86–97.
- Saxena, A., Prasad, M., Gupta, A., et al. (2017). A review of clustering techniques and developments. Neurocomputing, 267, 664–681.
8.2 منابع جدیدتر مرتبط با representation و hierarchical clustering
- Murphy, K. P. (2022). Probabilistic machine learning: An introduction. MIT Press.
- Bishop, C. M., & Bishop, H. (2024). Deep learning: Foundations and concepts. Springer.
- Leskovec, J., Rajaraman, A., & Ullman, J. D. (2020). Mining of massive datasets (3rd ed.). Cambridge University Press.
8.3 منابع کاربردی و پیادهسازی
- Pedregosa, F., et al. / Scikit-learn documentation (نسخههای جدید 2024–2026)، بخش:
- AgglomerativeClustering
- FeatureAgglomeration
- connectivity constraints
- SciPy documentation (2024–2026):
- scipy.cluster.hierarchy
8.4 برای بخش ترکیب با گراف، embedding و مقیاسپذیری
- مقالات جدید حوزههای:
- scalable hierarchical clustering
- graph hierarchical clustering
- deep clustering with hierarchical structure
- constrained agglomerative clustering
- explainable hierarchical clustering
.
29. جمعبندی
AGNES یکی از روشهای بنیادین خوشهبندی سلسلهمراتبی تجمیعی است. این الگوریتم از هر مشاهده بهعنوان یک خوشه مستقل آغاز میکند و در هر مرحله، نزدیکترین دو خوشه را بر اساس یک معیار پیوند ادغام میکند. خروجی این فرایند، دندروگرام است؛ ساختاری درختی که روابط چندسطحی میان دادهها را نمایش میدهد.
مزیت اصلی AGNES در تفسیرپذیری، عدم نیاز به تعیین تعداد خوشه در آغاز، و توانایی نمایش ساختار سلسلهمراتبی دادههاست. در مقابل، هزینه محاسباتی و حافظهای بالا، حساسیت به متریک فاصله و linkage، و برگشتناپذیری ادغامها از محدودیتهای جدی آن هستند.
از منظر آموزشی، AGNES الگوریتمی بسیار مهم است؛ زیرا مفاهیم بنیادینی مانند فاصله، شباهت، دندروگرام، تصمیمگیری حریصانه و نقش پیشپردازش را بهصورت ملموس نشان میدهد. از منظر کاربردی، این الگوریتم در تحلیل ژن، بخشبندی مشتریان، متنکاوی، پزشکی و تحلیل اکتشافی داده کاربرد دارد؛ هرچند در دادههای بزرگ معمولاً باید با روشهای مقیاسپذیرتر یا تقریبی ترکیب شود.
.
30. نکات کلیدی فصل
- AGNES مخفف Agglomerative Nesting است.
- این الگوریتم در خانواده خوشهبندی سلسلهمراتبی تجمیعی قرار دارد.
- AGNES از پایین به بالا عمل میکند.
- در ابتدا هر مشاهده یک خوشه مستقل است.
- در هر گام، نزدیکترین دو خوشه ادغام میشوند.
- خروجی اصلی الگوریتم، دندروگرام است.
- انتخاب linkage نقش تعیینکننده در نتیجه دارد.
- single linkage ممکن است اثر زنجیرهای ایجاد کند.
- complete linkage معمولاً خوشههای فشردهتری میسازد.
- average linkage تعادلی میان single و complete ایجاد میکند.
- Ward linkage افزایش پراکندگی درونخوشهای را کمینه میکند.
- AGNES معمولاً به حافظه O(n2)O(n^2)O(n2) نیاز دارد.
- پیچیدگی زمانی آن در پیادهسازیهای ساده میتواند بالا باشد.
- استانداردسازی دادهها پیش از اجرای الگوریتم بسیار مهم است.
- AGNES برای تحلیل اکتشافی و دادههای کوچک تا متوسط مناسبتر است.
.
31. پرسشهای مفهومی
- چرا AGNES را یک الگوریتم پایینبهبالا مینامند؟
- تفاوت اصلی AGNES و K-Means چیست؟
- دندروگرام چه اطلاعاتی درباره ساختار داده ارائه میدهد؟
- چرا انتخاب معیار فاصله در AGNES مهم است؟
- اثر زنجیرهای در single linkage به چه معناست؟
- چرا complete linkage معمولاً خوشههای فشردهتری ایجاد میکند؟
- Ward linkage چه چیزی را کمینه میکند؟
- چرا AGNES برای دادههای بسیار بزرگ مناسب نیست؟
- چگونه میتوان از دندروگرام تعداد خوشه مناسب را انتخاب کرد؟
- چرا ادغامهای اولیه در AGNES اهمیت زیادی دارند؟
.
32. تمرینهای پایان فصل
تمرین 1: اجرای دستی AGNES
دادههای یکبعدی زیر را در نظر بگیرید:
X={2,3,7,10,11}
- ماتریس فاصله را محاسبه کنید.
- AGNES را با single linkage اجرا کنید.
- مراحل ادغام را در یک جدول بنویسید.
- اگر دندروگرام را در ارتفاع 3 برش دهید، چند خوشه به دست میآید؟
تمرین 2: مقایسه Linkageها
نقاط زیر را در نظر بگیرید:
x1=(0,0) , x2=(0,1) , x3=(5,5) , x4=(6,5)
- فاصله اقلیدسی بین تمام نقاط را محاسبه کنید.
- دو مرحله نخست AGNES را با single linkage اجرا کنید.
- همان مراحل را با complete linkage اجرا کنید.
- تفاوت نتایج را توضیح دهید.
تمرین 3: تحلیل دندروگرام
یک دندروگرام فرضی شامل 10 نمونه در اختیار دارید. در ارتفاعهای پایین، چندین ادغام کوچک رخ میدهد، اما در ارتفاع 8 یک جهش بزرگ دیده میشود.
- این جهش چه معنایی دارد؟
- برش دندروگرام پیش از این جهش چه تفسیری دارد؟
- آیا همیشه باید دندروگرام را در بزرگترین جهش برش داد؟ توضیح دهید.
تمرین 4: پیادهسازی در Python
با استفاده از دادههای Iris در کتابخانه scikit-learn:
- دادهها را استانداردسازی کنید.
- AGNES را با Ward linkage اجرا کنید.
- دندروگرام رسم کنید.
- خروجی را با برچسبهای واقعی مقایسه کنید.
- شاخص silhouette را محاسبه کنید.
تمرین 5: سؤال مناسب امتحان دانشگاه
توضیح دهید چرا AGNES یک الگوریتم حریصانه است. سپس بیان کنید این ویژگی چه مزایا و چه محدودیتهایی برای الگوریتم ایجاد میکند.
تمرین 6: سؤال مناسب مصاحبه شغلی
فرض کنید یک مجموعه داده شامل 50 هزار مشتری دارید و میخواهید از AGNES برای خوشهبندی استفاده کنید. چه چالشهایی پیش میآید و چه راهکارهایی پیشنهاد میکنید؟
.
33. پروژه پیشنهادی
عنوان پروژه
تحلیل سلسلهمراتبی مشتریان فروشگاه آنلاین با استفاده از AGNES
هدف پروژه
هدف این پروژه آن است که دانشجو بتواند یک مسئله واقعی یا شبهواقعی را با استفاده از خوشهبندی سلسلهمراتبی تحلیل کند و نتیجه را بهصورت فنی و مدیریتی تفسیر نماید.
دادههای پیشنهادی
یک مجموعه داده شامل ویژگیهای زیر برای مشتریان:
- تعداد خرید
- میانگین مبلغ خرید
- تعداد بازدید از سایت
- تعداد کالاهای بازگشتی
- مدت عضویت
- تعداد استفاده از کد تخفیف
مراحل انجام پروژه
- جمعآوری یا تولید داده
- پاکسازی دادهها
- تحلیل توصیفی اولیه
- استانداردسازی ویژگیها
- اجرای AGNES با چند linkage مختلف
- رسم و مقایسه دندروگرامها
- انتخاب تعداد خوشه مناسب
- تحلیل ویژگیهای هر خوشه
- مقایسه با K-Means
- ارائه گزارش نهایی
خروجیهای مورد انتظار
- کد Python مستند
- دندروگرامها
- نمودار پراکندگی خوشهها
- جدول خلاصه ویژگیهای هر خوشه
- تحلیل مدیریتی خوشهها
- مقایسه انتقادی AGNES و K-Means
- گزارش نهایی 10 تا 15 صفحهای
معیارهای ارزیابی پروژه
| معیار | امتیاز |
| پاکسازی و آمادهسازی داده | 15٪ |
| اجرای صحیح الگوریتم | 20٪ |
| تحلیل دندروگرام | 20٪ |
| مقایسه linkageها | 15٪ |
| تفسیر کاربردی خوشهها | 20٪ |
| کیفیت گزارش و کد | 10٪ |
34. منابع
Aggarwal, C. C. (2013). Data clustering: Algorithms and applications. CRC Press.
Defays, D. (1977). An efficient algorithm for a complete link method. The Computer Journal, 20(4), 364–366.
Han, J., Kamber, M., & Pei, J. (2011). Data mining: Concepts and techniques (3rd ed.). Morgan Kaufmann.
Hastie, T., Tibshirani, R., & Friedman, J. (2009). The elements of statistical learning: Data mining, inference, and prediction (2nd ed.). Springer.
Jain, A. K., Murty, M. N., & Flynn, P. J. (1999). Data clustering: A review. ACM Computing Surveys, 31(3), 264–323.
Johnson, S. C. (1967). Hierarchical clustering schemes. Psychometrika, 32(3), 241–254.
Kaufman, L., & Rousseeuw, P. J. (1990). Finding groups in data: An introduction to cluster analysis. Wiley.
Manning, C. D., Raghavan, P., & Schütze, H. (2008). Introduction to information retrieval. Cambridge University Press.
Murtagh, F., & Contreras, P. (2012). Algorithms for hierarchical clustering: An overview. WIREs Data Mining and Knowledge Discovery, 2(1), 86–97.
Pedregosa, F., Varoquaux, G., Gramfort, A., Michel, V., Thirion, B., Grisel, O., Blondel, M., Prettenhofer, P., Weiss, R., Dubourg, V., Vanderplas, J., Passos, A., Cournapeau, D., Brucher, M., Perrot, M., & Duchesnay, É. (2011). Scikit-learn: Machine learning in Python. Journal of Machine Learning Research, 12, 2825–2830.
.
Rousseeuw, P. J. (1987). Silhouettes: A graphical aid to the interpretation and validation of cluster analysis. Journal of Computational and Applied Mathematics, 20, 53–65.
Sibson, R. (1973). SLINK: An optimally efficient algorithm for the single-link cluster method. The Computer Journal, 16(1), 30–34.
Tan, P.-N., Steinbach, M., & Kumar, V. (2019). Introduction to data mining (2nd ed.). Pearson.
Virtanen, P., Gommers, R., Oliphant, T. E., Haberland, M., Reddy, T., Cournapeau, D., Burovski, E., Peterson, P., Weckesser, W., Bright, J., van der Walt, S. J., Brett, M., Wilson, J., Millman, K. J., Mayorov, N., Nelson, A. R. J., Jones, E., Kern, R., Larson, E., Carey, C. J., … SciPy 1.0 Contributors. (2020). SciPy 1.0: Fundamental algorithms for scientific computing in Python. Nature Methods, 17, 261–272.
Ward, J. H. (1963). Hierarchical grouping to optimize an objective function. Journal of the American Statistical Association, 58(301), 236–244.
Xu, R., & Wunsch, D. (2009). Clustering. Wiley-IEEE Press.
Zhang, T., Ramakrishnan, R., & Livny, M. (1996). BIRCH: An efficient data clustering method for very large databases. ACM SIGMOD Record, 25(2), 103–114.



