4 . معیارهای انتخاب فراپارامترهای مدل ها
4.1 . ویژگی های بهینه
PCA زمانی ترجیح داده می شود که بین ویژگی های مجموعه داده توسعه یافته همبستگی وجود داشته باشد. ترکیبات خطی از𝑛ویژگیهای ابعادی که بیشترین تغییرات در مجموعه داده را تشکیل میدهند به عنوان اجزای اصلی (PC) شناخته میشوند. تأثیر تعداد مؤلفههای اصلی بر تغییرات محاسبهشده در پراکندگی دادهها با استفاده از ضریب پراکندگی و شاخص PSI اندازهگیری میشود. رایانه های شخصی از شماره گذاری می شوند1به𝑛به طوری که درصد تغییرات آنها از PC 1 به PC n افزایش نمی یابد ، به عنوان مثال،𝑉𝑎𝑟(𝑃𝐶1)≥𝑉𝑎𝑟(𝑃𝐶2)≥…≥𝑉𝑎𝑟(𝑃𝐶𝑛). منطق پشت تعداد بهینه انتخاب رایانههای شخصی برای یادگیری بیشتر بر اساس درصد تغییرات توجیه میشود و متعاقباً با آزمایش جایگشت تأیید میشود.
4.1.1 . ضریب پراکندگی
ضریب پراکندگی یا نسبت اندازه گیری میزان پراکندگی در مجموعه داده است که پس از نمایش مجموعه داده بر روی زیرفضای برداری که توسط رایانه های شخصی پوشانده شده است، حفظ می شود. مقدار تعیین کننده ماتریس همبستگی برای تعیین ضریب پراکندگی استفاده می شود. حجم فوق العاده مشاهده شده در فضای برداری با افزایش همبستگی بین ویژگی های مجموعه داده کاهش می یابد [ 29 ]. از این رو، یک مقدار ضریب پراکندگی پایین نشان دهنده مناسب بودن بالای PCA برای مجموعه داده است. مقدار ضریب پراکندگی 0.00000425 در آزمایشهای ما، مناسب بودن رایانههای شخصی انتخاب شده برای توصیف مجموعه داده را تأیید میکند.
4.1.2 . شاخص Psi
شاخص Psi برای تعیین کمیت مزایای استفاده از PCA در مجموعه داده استفاده می شود. اگر مجموعه داده دارای ویژگی های نامرتبط باشد، شاخص Psi 0 خواهد بود. از سوی دیگر، مجموعه دادهای که ویژگیهای همبستگی بالایی دارد، تمایل به داشتن شاخص Psi نزدیک به n(n-1) دارد، که در آن n تعداد ویژگیهای مجموعه داده را نشان میدهد [ 29 ]. مقدار شاخص Psi به دست آمده برای مجموعه داده فرودگاه 23.11 است که مزایای استفاده از PCA در مجموعه داده توسعه یافته را نشان می دهد.
4.1.3 . تغییر
تنوع به مقدار تنوع در مجموعه داده اشاره دارد و به عنوان مجموع مجذور اختلاف بین هر ویژگی به میانگین متناظر آن اندازهگیری میشود [ 30 ]. نمودار تغییرات توضیح داده شده در شکل 2 اهمیت رایانه های شخصی را در کاهش ابعاد داده ها در حالی که الگوهای اصلی ارتباط در پراکندگی داده ها را حفظ می کند، نشان می دهد. بدیهی است که ترکیبی از شش رایانه شخصی حدود 80 درصد از کل تنوع در مجموعه داده را توضیح می دهد. از این رو، تاپل 17 بعدی برای تجزیه و تحلیل خوشه بندی بیشتر به حداقل تاپل 6 بعدی کاهش می یابد.
- دانلود: دانلود تصویر با وضوح بالا (182 کیلوبایت)
- دانلود: دانلود تصویر در اندازه واقعی
شکل 2 . رایانه های شخصی و تنوع تجمعی آنها در مجموعه داده
4.1.4 . تست جایگشت
تعداد رایانه های شخصی استفاده شده بر اساس تغییرات از نظر آماری با انجام آزمایش جایگشت تأیید می شود. نمونه گیری همبستگی بین ویژگی های مجموعه داده را کاهش می دهد [ 29 ]. تست جایگشت برای بررسی اینکه آیا اجزای اصلی انتخاب شده (PC) واریانس قابل توجهی در پراکندگی داده ها را می گیرند یا نه استفاده می شود [ 31 ]. برای تایید این موضوع، ابتدا PCA روی مجموعه داده با تمام ویژگی ها اعمال می شود و واریانس محاسبه شده توسط هر یک از اجزای اصلی محاسبه می شود. متعاقباً، ویژگیها به هم ریخته یا جابهجا میشوند و در فهرست ویژگیهای جابجا شده، زیرمجموعهای از ویژگیها بهطور تصادفی بدون جایگزینی نمونهبرداری میشوند تا یک مجموعه داده جایگزین شده را تشکیل دهند. PCA بر روی مجموعه داده جابجایی اعمال می شود و واریانس محاسبه شده توسط هر یک از اجزای اصلی مجموعه داده جابجایی محاسبه می شود. برای اینکه تعداد مؤلفههای اصلی بهینه باشد، تفاوت در واریانس محاسبهشده توسط رایانههای شخصی در مجموعه دادههای جابجا شده نباید بیشتر از مجموعه داده اصلی تغییرناپذیر باشد. اهمیت آماری این تفاوت که در چندین اجرای آزمایش جایگشت با تعداد معینی از رایانه های شخصی گرفته شده است در شکل 3 گزارش شده است . مقادیر p به دست آمده از شکل 3 نشان می دهد که 4 رایانه شخصی و بالاتر در طول کاهش ابعاد معقول هستند. نمودارهای تغییر و جایگشت برای کاهش ابعاد بهینه مورد استفاده قرار گرفته اند که ثبت دقیق حداکثر تنوع در مجموعه داده را تضمین می کند.
- دانلود: دانلود تصویر با وضوح بالا (127 کیلوبایت)
- دانلود: دانلود تصویر در اندازه واقعی
شکل 3 . مقادیر p رایانه های شخصی از آزمایش جایگشت.
4.1.5 . انتخاب اجزای اصلی
جدول 1 درصد کل تغییرات نمایش داده شده توسط رایانه های شخصی را به همراه ضریب پراکندگی، شاخص psi و مقادیر جایگشت مجموعه داده نشان می دهد. سطوح کاهش ابعاد بهینه بر اساس تغییر و جایگشت به عنوان PC 6 به دست می آید. با این حال، سطوح PC از 6 تا 12 برای تمرین خوشه بندی سلسله مراتبی در نظر گرفته می شود، زیرا PC 12 به حساب می آید.≈95%تنوع در پراکندگی داده ها مجموعه داده کاهش ابعاد برای یادگیری چهار مدل خوشهبندی سلسله مراتبی استفاده میشود: i) تقسیمکننده (DHC) و تجمعی (AHC) – ii) پیوند منفرد (SL)، iii) پیوند کامل (CMPL) و IV) پیوند مرکز (CL) ). بنابراین، در مجموع 20 مدل توسعه یافته است که از آنها دو مدل خوشه ای مناسب بر اساس معیار عملکرد نسبی بالای آنها به تفصیل مورد بحث قرار می گیرند . اساس ساخت مدل از گردش کار نشان داده شده در شکل 4 پیروی می کند .
میز 1 . معیارهای آماری برای انتخاب رایانه های شخصی
| شماره S.No | معیارهای | ارزش های | ||
|---|---|---|---|---|
| 1 | ضریب پراکندگی | 0.00000425 | ||
| 2 | شاخص PSI | 23.11 | ||
| 3 | تست جایگشت | تعداد رایانه های شخصی≥4 | ||
| 4 | تغییر (٪) | PC 1–31.45 | PC 7 – 84.61 | PC 13–96.93 |
| PC 2–49.26 | PC 8 – 87.70 | PC 14–97.00 | ||
| PC 3–61.67 | PC 9 – 90.54 | PC 15–98.83 | ||
| PC 4–68.71 | PC 10 – 92.91 | PC 16–99.49 | ||
| PC 5–74.48 | PC 11 – 94.48 | PC 17 – 100 | ||
| PC 6 – 79.80 | PC 12 – 95.77 | |||
- دانلود: دانلود تصویر با وضوح بالا (211 کیلوبایت)
- دانلود: دانلود تصویر در اندازه واقعی
شکل 4 . اساس ساخت مدل
برای ارزیابی انطباق نمونههای داده منفرد با زیرفضای برداری که توسط مؤلفههای اصلی پوشانده شده است، معمولاً از آماره Q در ادبیات استفاده میشود. با این حال، دلیلی که این مطالعه از PCA استفاده کرده است، کاهش ابعاد است به گونهای که نقاط داده در پراکندگی داده کاهش ابعاد، بیشترین تغییرات را در پراکندگی اولیه نسبت به یکدیگر حفظ کنند. این تضمین میکند که خوشهبندی سلسله مراتبی بعدی نتایج صحیح معنایی تولید میکند زیرا خوشهبندی بر روی ماتریسی از فواصل زوجی بین نقاط داده عمل میکند که تحت تأثیر تغییرات نسبی بین نقاط داده است. بنابراین، برای افزایش ارزیابی کاهش ابعاد، تعدادی دیگر از معیارهای عملکرد که بر حفظ تغییرات پراکندگی دادهها تمرکز میکنند مانند ضریب پراکندگی، آزمون جایگشت شاخص psi و درصد تغییرات به کار گرفته شدهاند. ضریب پراکندگی داده ها را در فضای کاهش یافته ارزیابی می کند، در حالی که آزمون جایگشت شاخص psi دقت آماری را به نتایج اضافه می کند. درصد تغییرات نشان میدهد که 95 درصد واریانس دادهها توسط 12 مؤلفه اصلی ثبت میشود. این رویکرد جامع یک ارزیابی قوی از عملکرد کاهش ابعاد را قادر میسازد تا اطمینان حاصل شود که به صحت مرحله خوشهبندی بعدی کمک میکند، در عین حال نویز در پراکندگی دادهها را کاهش میدهد و زمان اجرای خوشهبندی سلسله مراتبی را با کاهش ابعاد به حداقل میرساند.
4.2 . خوشه های بهینه
هر مدل خوشهبندی منجر به خروجی به شکل دندروگرام میشود، با این حال، ساخت دندروگرام از یک رویکرد بالا به پایین و پایین به بالا برای خوشهبندی سلسله مراتبی تقسیمبندی و تجمعی پیروی میکند. هر دندروگرام از یک ریشه و𝑚 گره های برگ . به منظور تعمیم، بدون به خطر انداختن دقت SSLM، تعیین تعداد بهینه خوشه ها ضروری است. نمرات اعوجاج بر اساس منحنی آرنج و مقادیر ضریب شبح به طور موثر تعداد بهینه خوشه ها را برای مدل آموخته شده تعیین می کند. ارقام مربوط به PC 6 در این بخش مورد بررسی قرار می گیرند و معیارهای عملکرد همه رایانه های شخصی به طور مفصل در بخش 5 مورد بحث قرار می گیرند .
4.2.1 . روش منحنی آرنج
روش منحنی آرنج (ECM) یک روش تجربی برای تعیین تعداد بهینه خوشه ها است. ECM بر اساس تنوع درون خوشهای (WCV) است که مجموع مجذور فواصل تمام تاپلهای یک خوشه تا مرکز آن است. مقادیر WCV در برابر تعداد خوشه ها به ترتیب غیر کاهشی رسم می شوند. تعداد بهینه خوشه ها منجر به بیشترین کاهش در مقادیر WCV می شود که ممکن است در نمودار به صورت یک زانو منعکس شود [ 32 ]. پس از نقطه آرنج، افزایش تعداد خوشه ها منجر به تغییر بسیار کمی در مقادیر WCV می شود.
شکل . تعداد بهینه خوشه های 20 مدل یادگیری در محدوده 10-13 قرار دارد. با این حال، یک روش تجربی مانند منحنی زانویی به تنهایی نمی تواند تعداد بهینه خوشه ها را تایید کند.
- دانلود: دانلود تصویر با وضوح بالا (165 کیلوبایت)
- دانلود: دانلود تصویر در اندازه واقعی
شکل 5 . منحنی آرنج و امتیاز اعوجاج AHC (CL) – PC6.
- دانلود: دانلود تصویر با وضوح بالا (176 کیلوبایت)
- دانلود: دانلود تصویر در اندازه واقعی
شکل 6 . منحنی آرنج و امتیاز اعوجاج DHC – PC6.
4.2.2 . ضریب سیلوئت
ضریب (s) silhouette معیاری برای تشابه یک تاپل به خوشه خودش به خوشه های دیگر است، با مقادیر متغیر از−1به+1. نمره شبح یک𝑖 امین تاپل با استفاده از رابطه (4) به عنوان نسبت اختلاف بین میانگین فاصله یک تاپل به تمام قلابهای دیگر درون خوشه آن محاسبه میشود.(𝑎𝑖)و میانگین فاصله یک تاپل تا همه تاپل های دیگر در نزدیکترین خوشه(𝑏𝑖)تا حداکثر این دو مقدار فاصله(𝑎𝑖,𝑏𝑖).(4)𝑠𝑖=𝑏𝑖−𝑎𝑖max(𝑎𝑖,𝑏𝑖)𝑠𝑖مقادیر نزدیک به 1+ نشاندهنده تخصیص کامل تاپل به خوشه مربوطه آن است، در حالی که مقادیر نزدیکتر به 0 نشان میدهد که فاصله بین خوشهها ناچیز است و انتساب تاپل میتواند به هر صورت باشد.𝑠𝑖مقادیر نزدیک به 1- نشان دهنده انتساب ناقص تاپل است (کومار، 2020؛ و روسیو، 1987).
جدول 2 نمرات شبح اعداد خوشه های مختلف از 2 تا 15 را نشان می دهد. از جدول 2 مشهود است ،𝑠𝑖مقادیر AHC – SL عمدتاً منفی هستند که نشان دهنده انتساب نامناسب خوشه است. CL روش ارجح در AHC نسبت به CMPL بر اساس میانگین نسبتاً بالاتر آنها است𝑠𝑖ارزش های. در مرحله اولیه ساخت دندروگرام، مدل بدون نظارت و در نتیجه بهینه ارائه می شود𝑠𝑖مقادیر کمتر و در محدوده بین 0.30 و 0.35 مشاهده می شود. اعداد خوشه بهینه در AHC و DHC 9 مشاهده می شود.
جدول 2 . میانگین امتیازات Silhouette AHC و DHC مربوط به PC 6.
| خوشه ها | میانگین امتیاز Silhouette | |||
|---|---|---|---|---|
| AHC | DHC | |||
| SL | CMPL | CL | سلول خالی | |
| 2 | 0.2095 | 0.2441 | 0.2358 | 0.2652 |
| 3 | 0.2048 | 0.2225 | 0.2503 | 0.3166 |
| 4 | 0.0701 | 0.2786 | 0.2779 | 0.3154 |
| 5 | −0.1452 | 0.2871 | 0.2924 | 0.3222 |
| 6 | −0.1489 | 0.2279 | 0.2999 | 0.3302 |
| 7 | −0.1633 | 0.2401 | 0.3120 | 0.2631 |
| 8 | −0.1730 | 0.2510 | 0.3253 | 0.3364 |
| 9 | −0.2060 | 0.2647 | 0.3407 | 0.3494 |
| 10 | −0.2231 | 0.2808 | 0.3395 | 0.3425 |
| 11 | −0.2596 | 0.2686 | 0.2996 | 0.3036 |
| 12 | 0.2742- | 0.2574 | 0.3050 | 0.3126 |
| 13 | 0.3004- | 0.2712 | 0.3129 | 0.3264 |
| 14 | 0.3042- | 0.2749 | 0.3230 | 0.3110 |
| 15 | −0.2966 | 0.2804 | 0.3351 | 0.3178 |
خطوط قرمز و آبی در شکل 7 شباهت میانگین AHC-CL و DHC را نشان می دهد𝑠𝑖مقادیری که از 8 خوشه شروع می شوند. برای تشکیل خوشه ها، دندروگرام ها می توانند خوشه هایی به ترتیب 1، 2، 4، 8، 16 و 32 ایجاد کنند. بنابراین، بر اساس رسیده𝑠𝑖مقادیر، همه اعداد خوشه بین 8 و 16 باید هنگام ارزیابی عملکرد آنها در نظر گرفته شوند.
- دانلود: دانلود تصویر با وضوح بالا (352 کیلوبایت)
- دانلود: دانلود تصویر در اندازه واقعی
شکل 7 . اعداد خوشه بهینه بر اساس مقادیر ضریب شبح متوسط (PC-6).
شکل 8 (i) و شکل 9 (i) را نشان می دهد𝑠𝑖مقادیر مدلهای AHC-CL و DHC از مجموعه داده به شش رایانه کاهش یافت. میانگین𝑠𝑖مقادیر برای 9 خوشه 0.34 مشاهده می شود و پراکندگی داده مربوطه آنها در شکل 8 (ii) و شکل 9 (ii) مشاهده می شود.
- دانلود: دانلود تصویر با وضوح بالا (322 کیلوبایت)
- دانلود: دانلود تصویر در اندازه واقعی
شکل 8 . من)𝑆𝑖مقادیر AHC (CL) – PC 6، و 2) تجسم متناظر برای 9 خوشه.
- دانلود: دانلود تصویر با وضوح بالا (316 کیلوبایت)
- دانلود: دانلود تصویر در اندازه واقعی
شکل 9 . من)𝑆𝑖مقادیر DHC – PC 6، و ب) تجسم متناظر برای 9 خوشه.
تعداد خوشه ها با در نظر گرفتن مقادیر ضریب شبح در ارتباط با نقطه زانو از ECM مقداردهی اولیه می شود. از آنجایی که مقادیر خوشهای نشاندادهشده در جدول 3 بین 9 تا 13 است، پنج سطح در دندروگرام در نظر گرفته شده است که با تعداد خوشههای بین 8 تا 16 مطابقت دارد.
جدول 3 . آمار توصیفی برای انتخاب تعداد خوشه برگ.
| تعداد خوشه ها | AHC (CL) – PC 6 | DHC – PC 6 |
|---|---|---|
| روش منحنی آرنج | 11 | 13 |
| ضریب سیلوئت | 9 | 9 |

Leave A Comment