- সঠিক দূরত্ব এবং সংযোগ নির্বাচন করলে ক্লাস্টারের আকৃতি এবং ডেনড্রোগ্রামের ব্যাখ্যা পরিবর্তন হয়।
- আদর্শ কাটটি চাক্ষুষ পরিদর্শনের সাথে কনুই এবং ফাঁক পরিসংখ্যানের মতো পদ্ধতিগুলিকে একত্রিত করে।
- PERMANOVA, RDA/db-RDA, এবং স্থানিক নিয়ন্ত্রণ (MEM/MSR) ব্যবহার করে গোষ্ঠীগুলি যাচাই করুন।
- মডেল-ভিত্তিক পদ্ধতি (মাল্টিভেরিয়েট জিএলএম) প্রাচুর্যের ধরণগুলির উপর আলোকপাত করে।
একটি রৈখিক চিত্রে ডেটা পয়েন্টের গ্রুপ খুঁজে বের করার অর্থ প্রায়শই একটি ডেনড্রোগ্রাম ব্যাখ্যা করা, যা একটি সাদৃশ্য বৃক্ষ ছাড়া আর কিছুই নয়। যদি আপনার প্রশ্ন হয় যে সুসংগত ক্লাস্টারগুলি পেতে এই চিত্রটি কোথায় কাটবেন তা কীভাবে চিহ্নিত করবেন, তাহলে উত্তরের মধ্যে রয়েছে দূরত্ব, সংযোগের মানদণ্ড এবং ক্লাস্টারের মানের মেট্রিক্স বোঝা।এই নির্দেশিকা জুড়ে, আমরা মৌলিক থেকে উন্নত স্তরে যাব, 'রৈখিক চিত্র' ধারণাটিকে ডেনড্রোগ্রামের ব্যবহারিক ব্যবহারের সাথে সংযুক্ত করব, সেইসাথে অন্যান্য বহুমুখী কৌশল যা পর্যবেক্ষণ করা গোষ্ঠীগুলিকে যাচাই এবং ব্যাখ্যা করতে সহায়তা করে।
তত্ত্বের বাইরে, আমি উদাহরণ, সাধারণভাবে ব্যবহৃত মেট্রিক্স, একটি ডেটা প্রস্তুতির চেকলিস্ট এবং আধুনিক বিকল্পগুলি (যেমন PERMANOVA, RDA, এবং মডেল-চালিত পদ্ধতি) সহ একটি ব্যবহারিক দৃষ্টিভঙ্গি অফার করি। ধারণাটি হল আপনি আত্মবিশ্বাসের সাথে একটি ডেনড্রোগ্রাম পড়তে পারেন, বস্তুনিষ্ঠভাবে গ্রুপের সংখ্যা নির্বাচন করতে পারেন এবং প্রয়োজনে, পর্যবেক্ষণ করা প্যাটার্নগুলি বাস্তব এবং ব্যাখ্যাযোগ্য কিনা তা নিশ্চিত করার জন্য শক্তিশালী বিশ্লেষণের সাথে এটির পরিপূরক করতে পারেন।.
হায়ারার্কিকাল ক্লাস্টারিং কী এবং কেন এটি একটি 'লিনিয়ার ডায়াগ্রাম' পড়তে সাহায্য করে?
শ্রেণিবিন্যাস ক্লাস্টারিংয়ে, আমরা পর্যবেক্ষণের মধ্যে মিলের একটি 'বৃক্ষ' তৈরি করি, তথাকথিত ডেনড্রোগ্রাম, যাকে অনেকে অনানুষ্ঠানিকভাবে একটি রৈখিক চিত্র বলে কারণ এটি দূরত্বের একটি উল্লম্ব রেখা বরাবর সম্পর্কগুলিকে সংগঠিত করে। দুটি প্রধান স্বাদ আছে: সমষ্টিগত (নীচ থেকে উপরে) এবং বিভাজনকারী (উপর থেকে নীচে)।.
সমষ্টিগত মোডে, প্রতিটি বিন্দু বিচ্ছিন্নভাবে শুরু হয় এবং প্রতিটি পুনরাবৃত্তিতে, আমরা নিকটতম জোড়া ক্লাস্টারগুলিকে একত্রিত করি যতক্ষণ না কেবল একটি অবশিষ্ট থাকে। বিভাজক পদ্ধতিতে, বিপরীতটি ঘটে: আমরা সমস্ত নমুনা ধারণকারী একটি একক গোষ্ঠী দিয়ে শুরু করি এবং আরও দূরবর্তী উপসেটগুলিকে পৃথক করি, সেটটিকে ক্রমবর্ধমান ছোট শাখায় ভেঙে ফেলি।উভয় ক্ষেত্রেই, একটি শ্রেণিবিন্যাস পাওয়া যায় যা K গ্রুপগুলি পেতে বিভিন্ন উচ্চতায় 'কাটা' করা যেতে পারে।
ডেনড্রোগ্রামটি উল্লম্ব অক্ষের উপর একটি দূরত্ব (অথবা অসামঞ্জস্য) পরিমাপ দেখায়: লম্বা উল্লম্ব রেখাগুলি খুব ভিন্ন গোষ্ঠীর মধ্যে মিলন নির্দেশ করে, এবং ছোট রেখাগুলি কাছাকাছি ক্লাস্টারগুলির মধ্যে সংযোগ নির্দেশ করে।এই 'লাফ'গুলি পর্যবেক্ষণ করেই আমরা গুচ্ছগুলিতে প্রাকৃতিক বিরতি সনাক্ত করতে পারি।
সমষ্টিগত পদ্ধতি ধাপে ধাপে কীভাবে কাজ করে
একটি সমতলে মাত্র কয়েকটি বিন্দু নিয়ে একটি সরল বিন্দুর সেট কল্পনা করুন। প্রাথমিকভাবে, প্রতিটি বিন্দু একটি গুচ্ছ, এবং এর 'কেন্দ্র' নিজের সাথে মিলে যায়। আমরা সকল জোড়া ক্লাস্টারের মধ্যে দূরত্ব গণনা করি, সবচেয়ে ছোট দূরত্বের জোড়াটি বেছে নিই এবং তাদের একটি নতুন ক্লাস্টারে একত্রিত করি।আমরা প্রক্রিয়াটি পুনরাবৃত্তি করি: আমরা নতুন ক্লাস্টার থেকে অন্য ক্লাস্টারগুলির দূরত্ব পুনঃগণনা করি এবং ঘনিষ্ঠ জোড়াগুলিকে যুক্ত করতে থাকি, N থেকে N-1 পর্যন্ত গোষ্ঠীর সংখ্যা কমিয়ে আনি, ইত্যাদি।
নৈকট্য পরিমাপ করার জন্য, আপনি বেশ কয়েকটি মেট্রিক ব্যবহার করতে পারেন: ইউক্লিডীয় (একটিনা স্থানে সবচেয়ে সাধারণ), ম্যানহাটন (নির্দিষ্ট পরিস্থিতিতে বহিরাগতদের বিরুদ্ধে শক্তিশালী), এবং কোসাইন (দিকনির্দেশ ভেক্টরের জন্য ভাল)। বাস্তুসংস্থানগত এবং রচনাগত প্রেক্ষাপটে, অন্যান্য পদ্ধতিও দেখা যায়, যেমন ব্রে-কার্টিস, জ্যাকার্ড, সোরেনসেন, হেলিঙ্গার, কর্ড, ক্যানবেরা, মহলানোবিস, এমনকি চি-বর্গ দূরত্ব, প্রতিটি নির্দিষ্ট ধরণের তথ্য এবং ব্যাখ্যার জন্য উপযুক্ত।.
ক্লাস্টারগুলির মধ্যে দূরত্ব কীভাবে গণনা করা যায় তা লিঙ্কেজ মানদণ্ডের উপর নির্ভর করে: একক (নিকটতম প্রতিবেশী), সম্পূর্ণ (দূরতম প্রতিবেশী), গড়/UPGMA (গাণিতিক গড়), ওয়ার্ড (বর্গক্ষেত্রের আন্তঃ-ক্লাস্টার যোগফলকে ছোট করে), অন্যান্য।সংযোগের পছন্দ ডেনড্রোগ্রামের চূড়ান্ত আকৃতি পরিবর্তন করে এবং তাই, চিত্রটি কীভাবে ব্যাখ্যা করা হয়।
ডেনড্রোগ্রামে ক্লাস্টারের সংখ্যা কীভাবে নির্বাচন করবেন
কোন 'জাদু' K নেই। আমরা যা করি তা হল ডেনড্রোগ্রামে বড় 'ধাপ' খোঁজা: একটি অনুভূমিক কাটা যা লম্বা শাখা অতিক্রম করা এড়িয়ে যায় এবং ছোট শাখা সংরক্ষণ করে। ব্যবহারিক অর্থে, দূরত্বের স্তরে একটি অনুভূমিক রেখা আঁকুন যেখানে একটি তীব্র লাফ রয়েছে; শাখা সহ ছেদ সংখ্যা K নির্ধারণ করে।.
চাক্ষুষ পরিদর্শন ছাড়াও, দরকারী হিউরিস্টিক রয়েছে: ক্লাস্টারের ভেতরের বর্গক্ষেত্রের সমষ্টি বক্ররেখার জন্য কনুই পদ্ধতি এবং ফাঁক পরিসংখ্যান, যা একটি শূন্য বন্টনের অধীনে প্রত্যাশিত WCSS-এর সাথে পর্যবেক্ষণ করা WCSS-এর তুলনা করে।সমস্যা ডোমেনের সাথে সামঞ্জস্যপূর্ণ একটি দূরত্বের থ্রেশহোল্ড নির্বাচন করাও বৈধ।
একটি ভালো ক্লাস্টার গ্রুপের মধ্যে উচ্চ সাদৃশ্য প্রদর্শন করে এবং গ্রুপের মধ্যে কম সাদৃশ্য প্রদর্শন করে। চূড়ান্ত গুণমান দূরত্বের মেট্রিক, সংযোগ এবং নির্বাচিত K-মানের উপর নির্ভর করে; বিকল্পগুলি নিয়ে পরীক্ষা-নিরীক্ষা করা এবং কোনটি সবচেয়ে স্থিতিশীল এবং তথ্যপূর্ণ প্যাটার্ন প্রকাশ করে তা মূল্যায়ন করা মূল্যবান।বিবেচনা করার জন্য ব্যবহারিক বিষয়গুলি: সম্ভাব্য গোষ্ঠীর সংখ্যা, প্রতি ক্লাস্টারের পরিসংখ্যান (গড়, সর্বোচ্চ, সর্বনিম্ন), বহির্মুখীদের প্রভাব এবং ডোমেন জ্ঞান।
(অসাদৃশ্য) এর মেট্রিক্স: কখন প্রতিটি ব্যবহার করতে হবে
অবিচ্ছিন্ন তথ্যের জন্য, ইউক্লিডীয় দূরত্ব আদর্শ। তবে, 'প্রক্সিমেট' হিসেবে বিবেচিত বিষয়ের গুরুত্ব পরিবর্তন করে এমন বিকল্প রয়েছে: ম্যানহাটন, ক্যানবেরা, মহলানোবিস (কোভেরিয়েন্স বিবেচনা করে), কর্ড, হেলিঙ্গার এবং চি-স্কোয়ার।বাস্তুশাস্ত্রে, শূন্যগুলি সাধারণ এবং বিশেষ যত্নের প্রয়োজন।
উপস্থিতি/অনুপস্থিতি নিয়ে কাজ করার সময়, জ্যাকার্ড এবং সোরেনসেনের মতো অসমমিত সূচকগুলি যুগপত অনুপস্থিতি (দ্বৈত শূন্য) উপেক্ষা করে এবং বিটা বৈচিত্র্যের জন্য খুব ভালোভাবে কাজ করে।গণনা/প্রাচুর্যের তথ্যের জন্য, ব্রে-কার্টিস, কর্ড, লগ-কর্ড, হেলিঙ্গার, চি-স্কোয়ার এবং মরিসিতা-হর্নের মতো সহগগুলি সাধারণ এবং সাধারণত আধা-মেট্রিক।
যদি তোমার ম্যাট্রিক্স ভেরিয়েবলের ধরণ (ক্রমাগত, বাইনারি, ক্রমিক, বৃত্তাকার) মিশ্রিত করে, গাওয়ারের সূচক হল প্রস্তাবিত ওয়াইল্ডকার্ড।Q-মোডে (বস্তুর মধ্যে সাদৃশ্য) আমরা (অ) সাদৃশ্য ব্যবহার করি; R-মোডে (বর্ণনাকারীর মধ্যে), পারস্পরিক সম্পর্ক/সহ-প্রকরণ। মানকীকরণ এবং রূপান্তর পক্ষপাত কমায়। বিভিন্ন ইউনিটে ভেরিয়েবল স্কেল করার জন্য z-স্কোর; চরম প্রাচুর্য এবং একাধিক শূন্যের প্রভাব হ্রাস করার জন্য Hellinger/Chord।.
ডেনড্রোগ্রাম সংযোগ পদ্ধতি এবং গুণমান
UPGMA (গাণিতিক গড়) বস্তুর সমান ওজন দেয় এবং গোষ্ঠীর মধ্যে গড় দূরত্ব গণনা করে; ওয়ার্ড ক্লাস্টারের মধ্যে বর্গক্ষেত্রের যোগফলকে কমিয়ে দেয় (OLS/ANOVA এর অনুরূপ) এবং কম্প্যাক্ট গ্রুপ তৈরি করে।সংযোগ পরিবর্তন করলে গাছটি উল্লেখযোগ্যভাবে পরিবর্তিত হতে পারে।
ডেনড্রোগ্রামটি মূল (অ) মিলগুলি কতটা ভালোভাবে সংরক্ষণ করে তা পরীক্ষা করার জন্য, আমরা সহ-সম্পর্ক সহগ ব্যবহার করি। ~0,7 এর উপরে মানগুলি সাধারণত ভাল উপস্থাপনা নির্দেশ করে, মনে রাখবেন যে এটি একটি সাধারণ নিয়ম, কোনও মতবাদ নয়।যখন পরিসংখ্যানগত সহায়তার প্রয়োজন হয়, তখন pvclust-এর মতো বুটস্ট্র্যাপ প্যাকেজগুলি নোডের স্থায়িত্ব অনুমান করে, যদিও তারা গৃহীত দূরত্ব সীমিত করতে পারে।
দ্রুত প্রাক-প্রক্রিয়াকরণ চেকলিস্ট: স্পেস ছাড়া নাম; প্রাচুর্যের তথ্য প্রায়শই হেলিঞ্জারের মতো রূপান্তরের আহ্বান জানায়।যদি অনেক বহির্মুখী থাকে, তাহলে log1p বিবেচনা করুন (কিন্তু একই সময়ে log এবং Hellinger প্রয়োগ করা এড়িয়ে চলুন); বিভিন্ন স্কেলে চলকগুলিকে 0 এর গড় এবং 1 এর একটি আদর্শ বিচ্যুতিতে মানানসই করা উচিত।
অন্যান্য ক্লাস্টারিং পদ্ধতি: K-মানে এবং অনুরূপ পদ্ধতি
K-মানে অ-শ্রেণীবদ্ধ: আপনি আগে থেকে K নির্বাচন করেন, এবং অ্যালগরিদম স্কোয়ারের আন্তঃক্লাস্টার যোগফলকে কমিয়ে ডেটা পার্টিশন করে।এটি সহজ এবং দক্ষ, কিন্তু এটি গোষ্ঠীর শ্রেণিবিন্যাস প্রকাশ করে না (কোনও ডেনড্রোগ্রাম নেই) এবং স্থানীয় ন্যূনতম সংখ্যায় একত্রিত হতে পারে।
K-মান ব্যবহার করে K খুঁজে পেতে, একাধিক মানের জন্য ফিটিং পুনরাবৃত্তি করুন এবং ক্যালিনস্কি-হারাবাজ এবং SSI এর মতো মানদণ্ড মূল্যায়ন করুন, অথবা কনুই পদ্ধতি ব্যবহার করুন। ক্যাসকেডকেএম-এর মতো টুলগুলি সর্বোত্তম K+ অনুসন্ধান স্বয়ংক্রিয়ভাবে করতে সাহায্য করে।শ্রেণিবদ্ধ পদ্ধতির বিপরীতে, K-মানে বৃহত্তরগুলির মধ্যে ছোট গোষ্ঠীগুলিকে নেস্টেড দেখায় না।
অ্যাপ্লিকেশন: বিপণন থেকে সুপারিশ পর্যন্ত
ক্লাস্টারিং সর্বব্যাপী। মার্কেটিংয়ে, আমরা ক্রয় আচরণের মাধ্যমে গ্রাহকদের ভাগ করি।সার্চ ইঞ্জিনে, আমরা ফলাফলগুলিকে বিষয়ভিত্তিক সাদৃশ্য অনুসারে সাজান। সুপারিশ ব্যবস্থায়, আমরা এমন বিকল্পগুলি সুপারিশ করার জন্য আইটেমগুলিকে গোষ্ঠীবদ্ধ করি যা ব্যক্তির পছন্দের 'নিকটবর্তী'।
পাইথনে ব্যবহারিক উদাহরণ: ডেনড্রোগ্রাম থেকে ক্লাস্টার লেবেল পর্যন্ত
একটি ছোট দ্বি-মাত্রিক অ্যারে বিবেচনা করুন। প্রথমে, আমরা ডেটা তৈরি করি এবং এটি একটি স্ক্যাটার প্লটে কল্পনা করি। এরপর, আমরা ওয়ার্ডের লিঙ্কেজ ব্যবহার করে ডেনড্রোগ্রাম তৈরি করেছি এবং n ক্লাস্টার সংজ্ঞায়িত করে একটি অ্যাগ্লোমেরেটিভ ক্লাস্টারিং প্রশিক্ষণ দিয়েছি।অবশেষে, আমরা উদ্দেশ্যযুক্ত লেবেল অনুসারে রঙিন বিন্দুগুলি প্লট করি।
ধাপের রূপরেখা (চিত্রণমূলক): import matplotlib.pyplot as plt; import pandas as pd; import scipy.cluster.hierarchy as sc; from sklearn.cluster import AgglomerativeClustering. প্রতিটি পর্যবেক্ষণকে দৃশ্যত শনাক্ত করার জন্য ডেটাফ্রেম তৈরি করুন, পয়েন্টগুলি প্লট করুন এবং তাদের সূচকগুলি নোট করুন।ডেনড্রোগ্রামের জন্য: sc.dendrogram(sc.linkage(dados, method='ward'))মডেলের জন্য: AgglomerativeClustering(n_clusters=3, affinity='euclidean', linkage='ward').
হাইপারপ্যারামিটার সম্পর্কে: n_clusters আউটপুট ক্লাস্টারের সংখ্যা নির্ধারণ করে; অ্যাফিনিটি হল মেট্রিক (ইউক্লিডিয়ান, ম্যানহাটন, কোসাইন, প্রিকম্পিউটেড); লিঙ্কেজ ওয়ার্ড, গড়, একক বা সম্পূর্ণ হতে পারে।অ্যাফিনিটি এবং লিঙ্কেজের পছন্দ আপনার মেট্রিক/উদ্দেশ্যের সাথে সামঞ্জস্যপূর্ণ হওয়া উচিত। অবশেষে, লেবেলগুলি বের করুন এবং স্বতন্ত্র রঙে ক্লাস্টারগুলি কল্পনা করুন। আপনি যদি অন্যান্য K পরীক্ষা করতে চান, তাহলে n_cluster পরিবর্তন করুন এবং মানচিত্রে পরিবর্তনগুলি পর্যবেক্ষণ করুন।
ক্রম: যখন বিন্দু মেঘকে একটি সুস্পষ্ট মানচিত্রে পরিণত করতে হবে।
PCA এবং PCoA এর মতো অবাধ ক্রমগুলি মাত্রার সারসংক্ষেপ এবং নিদর্শন কল্পনা করতে সাহায্য করে। PCA-তে, আমরা ইউক্লিডীয় দূরত্ব ব্যবহার করি; PCoA-তে, আমরা অন্যান্য দূরত্ব (Bray-Curtis, Jaccard, Gower, ইত্যাদি) গ্রহণ করি, যা শ্রেণীগত, বাইনারি এবং মিশ্র ডেটা অন্তর্ভুক্ত করার জন্য পরিসরকে বিস্তৃত করে।.
পিসিএ ডেটা কেন্দ্রীভূত করে, সহ-ভ্যারিয়েন্স গণনা করে এবং এটিকে আইজেনভেক্টর/মানে বিভক্ত করে: আইজেন মানগুলি দেখায় যে প্রতিটি অক্ষ কতটা পরিবর্তনশীলতা ব্যাখ্যা করে; লোডিংগুলি প্রতিটি অক্ষের উপর ভেরিয়েবলের 'ওজন' নির্দেশ করে; স্কোরগুলি স্থানের মধ্যে বস্তুর অবস্থান নির্দেশ করে।সতর্কতা: রচনাগত তথ্য (অনেক শূন্য) PCA কে বিকৃত করতে পারে; হেলিঞ্জারের সাহায্যের মতো মানদণ্ড।
PCoA তে আমরা ডেটা টাইপের সাথে উপযুক্ত একটি (অ)সাদৃশ্য ম্যাট্রিক্স দিয়ে শুরু করি। নেতিবাচক আইজেনভ্যালু দেখা দিতে পারে; Lingoes এবং Cailliez এর মতো সংশোধন বিদ্যমান, কিন্তু সাধারণভাবে প্রথম প্রাসঙ্গিক অক্ষগুলি প্রভাবিত হয় না।মিশ্র ডেটা (গওয়ার) এর জন্য অথবা যখন ইউক্লিডীয় মেট্রিক অর্থহীন হয় তখন PCoA ব্যবহার করুন।
সীমাবদ্ধ অর্ডারিং: RDA, আংশিক RDA, এবং db-RDA
RDA একটি প্রতিক্রিয়া ম্যাট্রিক্স (Y, যেমন, প্রজাতির গঠন) এবং ভবিষ্যদ্বাণীকারী (X, যেমন, জলবায়ু) এর মধ্যে রৈখিক সম্পর্ক মডেল করে। এটি ক্যানোনিকাল অক্ষ তৈরি করে যা X দ্বারা ব্যাখ্যা করা Y-এর প্রকরণকে সর্বাধিক করে তোলে, সামঞ্জস্যপূর্ণ R² এবং বিন্যাস পরীক্ষার মতো পরিসংখ্যান ব্যবহার করে।মোটামুটিভাবে বলতে গেলে, এটি 'একাধিক রিগ্রেশন দ্বারা পূর্বাভাসিত মানগুলির একটি PCA'।
স্থানিক তথ্য অবশিষ্টাংশে স্বয়ংক্রিয় সম্পর্ক স্থাপন করে এবং টাইপ I কে স্ফীত করতে পারে। আংশিক RDA স্থানিক ভবিষ্যদ্বাণী (MEMs) কে কন্ডিশনিং ফ্যাক্টর হিসেবে অন্তর্ভুক্ত করে, পরিবেশের 'বিশুদ্ধ' প্রভাবকে বিচ্ছিন্ন করে এটিকে এড়িয়ে যায়।MEM গুলি আশেপাশের নেটওয়ার্ক (যেমন ন্যূনতম স্প্যানিং ট্রি) এবং একটি সুনির্বাচিত স্থানিক ওজন ম্যাট্রিক্স (SWM) থেকে উদ্ভূত হয়।
যদি প্রাকৃতিক প্রতিক্রিয়া দূরত্বের হয় (বিটা ডাইভারসিটি, ব্রে-কার্টিস, ইত্যাদি), db-RDA ডিসিমিলারিটি ম্যাট্রিক্সের একটি PCoA দিয়ে শুরু হয়, তারপর অক্ষগুলিকে X এর সাথে সম্পর্কিত করে, উভয় জগতের সেরাটিকে একত্রিত করে।বাস্তব-বিশ্বের অ্যাপ্লিকেশনগুলিতে, যখন ইউক্লিডীয় দূরত্ব সঠিক মেট্রিক না হয় তখন db-RDA প্রায়শই RDA-কে ছাড়িয়ে যায়।
পারমানোভা এবং বিচ্ছুরণের বৈচিত্র্য (PERMDISP)
পারমানোভা দূরত্বের উপর ভিত্তি করে গ্রুপগুলির মধ্যে পার্থক্য এবং ANOVA-এর অনুরূপ একটি ছদ্ম-F পরীক্ষা করে: F_pseudo = (SSa/SSr)*((N-g)/(g-1)). এটি বহুমুখী স্বাভাবিকতার প্রয়োজন ছাড়াই বহুমুখী অনুমানের জন্য শক্তিশালী।.
তবে, পরিসংখ্যান অবস্থানের পার্থক্য (কেন্দ্রিক) এবং/অথবা বিচ্ছুরণ (অন্তঃগ্রুপ বৈচিত্র্য) দ্বারা প্রভাবিত হতে পারে। বিচ্ছুরণের বৈচিত্র্য পরীক্ষা করার জন্য PERMDISP (BETADISPER) এর সাথে একত্রিত করুন; যদি তাৎপর্যপূর্ণ হয়, তাহলে PERMANOVA দ্বারা সনাক্ত করা প্রভাবটি মূলত অসম বৈচিত্র্য থেকে উদ্ভূত হতে পারে।একসাথে, দুটি বিশ্লেষণ 'রচনা পরিবর্তন' এবং 'পরিবর্তনশীলতার পরিবর্তন' এর মধ্যে পার্থক্য করতে সাহায্য করে।
ম্যান্টেল, আংশিক ম্যান্টেল এবং আধুনিক স্থান বিকল্প
ম্যান্টেল পরীক্ষা দুটি দূরত্বের ম্যাট্রিক্সের সাথে সম্পর্ক স্থাপন করে; আংশিক পরীক্ষা তৃতীয়টির জন্য নিয়ন্ত্রণ করে (যেমন, ভৌগোলিক দূরত্ব নিয়ন্ত্রণ করে পরিবেশগত বৈষম্য প্রজাতির বৈষম্য ব্যাখ্যা করে কিনা তা মূল্যায়ন করে)। এটি ব্যাপকভাবে ব্যবহৃত হয়, কিন্তু স্থানিক স্বয়ংসম্পূর্ণতা উপস্থিত থাকলে এর সীমাবদ্ধতা থাকে।.
একটি বিকল্প হল একটি নাল মডেল তৈরি করা যা বিশ্বব্যাপী স্বয়ংক্রিয় সম্পর্ক (মোরান স্পেকট্রাল র্যান্ডমাইজেশন) সংরক্ষণ করে। এই পদ্ধতিটি স্থানিক কাঠামো (MEM-এর মাধ্যমে) ব্যবহার করে মোরানের I বজায় রেখে ডেটা এলোমেলো করে, যার ফলে স্থানিকভাবে নির্ভরশীল পরিস্থিতিতে আরও বাস্তবসম্মত p-মান তৈরি হয়।বাস্তবে, সাধারণ ম্যান্টেলের অনেক 'অর্থপূর্ণ' সম্পর্ক স্থানিকভাবে সীমাবদ্ধ শূন্যের সাথে আর থাকে না।
প্রোক্রাস্টেস এবং প্রোটেস্ট: বহুমুখী মানচিত্রের মধ্যে চুক্তি
যখন আপনি দুটি ক্রমযুক্ত স্থানের মধ্যে সমঝোতার তুলনা করতে চান (উদাহরণস্বরূপ, মাছের PCoA এবং বৃহৎ অমেরুদণ্ডী প্রাণীর PCoA), প্রোক্রাস্টেস বিশ্লেষণ একটি ম্যাট্রিক্সকে অন্য একটিতে 'ফিট' করার জন্য সারিবদ্ধ করে, ঘোরায় এবং স্কেল করে, বিচ্যুতির বর্গক্ষেত্রের যোগফলকে কমিয়ে দেয়।m12 পরিসংখ্যান 0 (সর্বোচ্চ সম্মতি) থেকে 1 (কিছুই নয়) পর্যন্ত।
PROTEST পরীক্ষাটি র্যান্ডমাইজেশনের মাধ্যমে এই সমন্বয়ের তাৎপর্য মূল্যায়ন করে। সাধারণ কর্মপ্রবাহ: দূরত্বের তথ্যের জন্য, প্রতিটি ম্যাট্রিক্সে PCoA (অথবা nMDS) চালান, Procrustes প্রয়োগ করুন এবং তারপর PROTEST; কাঁচা তথ্যের জন্য, Procrustes এর আগে PCA/CA ব্যবহার করুন।তীর রেখাচিত্রগুলি প্রতিটি স্থানে একটি সেট অন্যটির অনুকরণ থেকে 'কত দূরে' তা দেখতে সাহায্য করে।
বহুমুখী মডেল-ভিত্তিক পদ্ধতি: যখন বৈষম্য যথেষ্ট নয়।
গণনার তথ্য সাধারণত গড় এবং প্রকরণের মধ্যে একঘেয়ে সম্পর্ক দেখায় (আরও সাধারণ প্রজাতিগুলি আরও বেশি পরিবর্তিত হয়)। বৈষম্য-ভিত্তিক পদ্ধতিগুলি সবসময় এটিকে ভালভাবে পরিচালনা করে না; এই কারণেই বহুমুখী GLM পদ্ধতির উদ্ভব হয়েছে, যেমন mvabund প্যাকেজে।.
এই লাইন ধরে, আমরা উপযুক্ত বন্টন (পয়সন, ঋণাত্মক দ্বিপদী, ইত্যাদি) দিয়ে প্রাচুর্যের মডেল তৈরি করি, বহুবিধ পদ্ধতিতে কারণগুলির প্রভাব (যেমন, 'ক্ষেত্র বনাম সংগ্রহ') পরীক্ষা করি। বিশ্বব্যাপী পরীক্ষার পাশাপাশি, প্রজাতি অনুসারে বিচ্যুতি প্রজাতিগুলিকে বিভাজন করা সম্ভব, কোনটি প্যাটার্নটিকে চালিত করে তা সনাক্ত করা সম্ভব।আরেকটি সুবিধা হল অবশিষ্ট রোগ নির্ণয়, যা অনুমানের উপর আস্থা উন্নত করে।
সেরা অনুশীলন, রেফারেন্স এবং অধ্যয়নের পথ।
বিশ্লেষণে ডুব দেওয়ার আগে, নিশ্চিত করুন যে আপনার তথ্য প্রস্তুত আছে: স্কেলগুলিকে মানসম্মত করুন, শূন্যগুলি পরিচালনা করুন, ভবিষ্যদ্বাণীকারীদের মধ্যে সমরৈখিকতা হ্রাস করুন, বহির্মুখীগুলি পরীক্ষা করুন এবং চলকগুলিকে রূপান্তর করার প্রয়োজনীয়তা পরীক্ষা করুন।স্থানিক সমস্যায়, MEM এবং সীমাবদ্ধ নাল মডেল ব্যবহারের পরিকল্পনা করুন।
প্রস্তাবিত পাঠের মধ্যে রয়েছে: লেজেন্ড্রে এবং লেজেন্ড্রে (সংখ্যাসূচক বাস্তুবিদ্যা), বোরকার্ড এবং অন্যান্য (সংখ্যাসূচক বাস্তুবিদ্যা সহ R), থিওলুস এবং অন্যান্য (ade4), ওভাসকেইনেন এবং আব্রেগো (JSDM), এবং মডেল-ভিত্তিক ক্লাস্টারিংয়ের উপর নির্দেশিকা।এই উপকরণগুলি আমরা এখানে যা আলোচনা করেছি তার উপর বিস্তারিতভাবে আলোকপাত করে, বিস্তারিত উদাহরণ এবং কোড সহ।
অনুশীলনের জন্য অনুশীলন এবং ধারণা
নিশ্চিত করতে: UPGMA এবং Bray-Curtis দিয়ে একটি hclust করুন, তারপর দূরত্ব পরিবর্তন করুন এবং ডেনড্রোগ্রাম তুলনা করুন। একই ডেটাসেটে RDA, আংশিক RDA (MEM সহ), db-RDA, এবং PERMANOVA ব্যবহার করে দেখুন কিভাবে প্রতিটি ভিন্ন প্রশ্নের উত্তর দেয়।অবশেষে, দুটি সম্প্রদায় এবং একটি বহুমুখী GLM-এর মধ্যে চুক্তি পরিমাপ করতে Procrustes/PROTEST পরীক্ষা ব্যবহার করুন যাতে যৌথভাবে প্রাচুর্য পরিবর্তনকারী কারণগুলি অনুসন্ধান করা যায়।
যদি আপনার লক্ষ্য কেবল 'একটি রৈখিক চিত্রে একটি ক্লাস্টার খুঁজে বের করা' হয়, তাহলে তিনটি ধাপের উপর মনোযোগ দিন: কাটঅফ পয়েন্ট নির্ধারণের জন্য ডেনড্রোগ্রামে সবচেয়ে স্পষ্ট লাফটি চিহ্নিত করুন; অন্য একটি মেট্রিক/লিংকেজ ব্যবহার করে দৃঢ়তা যাচাই করুন এবং সম্ভব হলে বুটস্ট্র্যাপ করুন; এবং পরিপূরক পরিসংখ্যান (PERMANOVA, RDA/db-RDA) এবং বিচ্ছুরণ পরিদর্শনের মাধ্যমে এই গোষ্ঠীগুলির পরিবেশগত/কার্যক্ষম তাৎপর্য যাচাই করুন।এইভাবে, আপনি একটি দৃশ্যমান পাঠকে একটি দৃঢ় বিশ্লেষণাত্মক সিদ্ধান্তে রূপান্তরিত করেন।
ডেনড্রোগ্রাম পড়া কেবল শুরু: মূল কথা হলো দূরত্ব এবং সংযোগের সঠিক পছন্দ, একটি সু-ন্যায্য কাট, এবং নিশ্চিতকরণের সাথে অর্ডার এবং পরীক্ষার সমন্বয় করা যা আপনার ডেটার প্রকৃতির সাথে অনুরণিত হয়।যখন পদ্ধতির এই 'বাস্তুতন্ত্র' একসাথে কাজ করে, তখন গোষ্ঠীগুলি কেবল কাগজে-কলমে সুন্দর শাখা-প্রশাখা হিসাবে থাকে না এবং সিদ্ধান্ত গ্রহণের জন্য বাস্তব এবং কার্যকর নিদর্শন প্রকাশ করতে শুরু করে।
