- قم باختيار بيرسون أو سبيرمان أو كيندال بناءً على شكل اللعبة والتوزيع الطبيعي وحجم البطولة.
- تستخدم الفئات المتغيرة chi-quadro/Fisher وتخلط الارتباط مع V di Cramér أو φ.
- Valuta confondenti con correlazione parziale ويدعم التحليل بالرسومات والتشخيص.
- العلاقة الجبرية (insiemi، funzioni، composizione) هي التي تشكل pensiero والتطبيق في قاعدة البيانات.

اكتشف أن نوع القانون الذي يرجع إلى المتغيرات هو أحد الطلبات الأكثر تكرارًا في تطبيقات الإحصاء وعلم البيانات والبحث التجريبي والبحث الكمي . الطريقة الأخرى حول العلاقة هي خطية ودائمًا ما تكون جزءًا من cogliere، وطريقة أخرى للعودة هي رتيبة ولكنها غير خطية، ومقابل فئة متطابقة وnon numeri، تعتمد المرساة على متغير ثالث ينسجم مع المعنى: insomma، not è una passeggiata.
في هذا الدليل العملي والنظري باللغة الإيطالية، نستعرض بأسلوبٍ سلسٍ جوهر العلاقات الرياضية بين المتغيرات ، بدءًا من التشخيص البصري والاختبار الرسمي، مرورًا بالمعاملات النوعية المستخدمة (بيرسون، سبيرمان، كيندال)، وصولًا إلى التعامل مع متغيرات متعددة (اختبار مربع كاي للاستقلال، اختبار فيشر، معامل كرامر، معامل التوافق، فاي)، وقياس قيمة التوافق باستخدام معامل كابا، وكيفية إدارة تباين التوافق لمعالجة الارتباط بين المتغيرات. كما نتعرف على نافذة في جبر العلاقات (بالمعنى الدلالي والحسابي)، وهو أمرٌ أساسيٌ لصياغة مفاهيم مثل المجال، والتركيب، والمعكوس، والدوال.
ما نقصده بـ "العلاقات" بسبب التباين
في اللغة الرياضية، العلاقة R بين A وB هي sottoinsieme للمنتج الديكارتي A×B : الإحداثي النسخي (a, b) الظاهر لـ R يشير إلى أن العنصر a di A "على علاقة" مع العنصر b di B. في المصطلحات التطبيقية، هناك علاقة يمكن أن تكون حتمية (وظيفة) مقابل الاحتمالية (associazione stochastica): في الحالة الأولى ad ogni a matche في الحقيقة un b، في الثانية، خدمنا اتجاهًا (أكثر أو أقل قوة) وليس مشروعًا uno-a-uno.
جميع العلاقات الجبرية الداخلية (بالمعنى الجبر الداخلي) لها خصائص مثيرة للاهتمام، مثل خاصية الانعكاس (أي أن كل a يستلزم (b, a)) ، والتناظر (إذا كان (a, b) و(b, a) فإن a = b)، والتعدي (إذا كان (a, b) و(b, c) يتبع (a, w)). هذه الخاصية أساسية: إذا كانت العلاقة معقدة ومتناظرة ومتعدية ، فإنها تكشف عن علاقة تكافؤ تُقسّم المجموعة A إلى فئات من العناصر المتكافئة. أما إذا كانت العلاقة انعكاسية ومتناظرة ومتعدية، فإننا نملك علاقة ترتيب.
في هذا التحليل، نترجم هذه الفكرة عمليا: تقييم نوع التباين (استمرارية كمية، ترتيبية، اسمية/ثنائية) والتصنيف الإحصائي واختيار الأدوات المناسبة لتغيير العلاقة، مع العلم أن "العلاقة" لا تعني دائمًا "السبب".
التحليل البصري: تناول نمط واتجاه riconoscere
أول دعم بدون أرقام، رسم متشتت وذو مظهر أكثر ذكاءً. تشير السحابة الممتدة على طول خط مستقيم إلى وجود علاقة خطية (إيجابية أو سلبية)؛ هيكلة المنحنى الذي يشير إلى العلاقات غير الخطية (لكن رتيبة). إذا لم تتدخل في النمط، فإن العلاقة الخطية قد تدمر الموافقة.
مع القيم المتغيرة، يمكن أن يساعد المخطط المبعثر pannelli (والمثال في R مع أزواج(dati) ) وخط الاتجاه smussate (geom_smooth في ggplot2) في ملاحظة الارتباطات والمجموعات والقيم المتطرفة . تنبيه: العوامل الخارجية التي يمكن أن تؤثر على العديد من المعاملات والمعاملات، نوع بيرسون.
على سبيل المثال، في لغة R يمكنك البدء على النحو التالي: pairs(dati)
# Matrice di grafici a dispersione
pairs(dati)
# Correlazioni grezze (matrice)
cor(dati, use = "pairwise.complete.obs")
يساعد الفحص البصري الأولي، المصحح بالرقم، على مراقبة الاختبار بناءً على الشكل والرتابة والخطية الظاهرة.
تحقق من حالته الطبيعية: عند تقديم الدافيرو
ويفترض الاختبار البارامتري (وكذلك اختبار بيرسون)، في بعض الحالات، بنية عادية أو متماثلة بدون تعليمات برمجية ثقيلة. للتحكم في الرهانات، استخدم أدوات رسومية مثل الرسم التخطيطي بالكثافة ومخطط QQ.
في لغة البرمجة R، قد تتضمن البطارية الدنيا ما يلي :
# Istogrammi con densità e curva normale sovrapposta
par(mfrow = c(2, 2))
plot_hist <- function(x) {
hist(x, prob = TRUE)
lines(density(x), col = "red")
curve(dnorm(x, mean(x), sd(x)), add = TRUE, col = "blue")
}
plot_hist(dati$GASTEDU)
plot_hist(dati$GASAUDE)
plot_hist(dati$GASLAZER)
plot_hist(dati$IDADE)
لمقارنة الكميات المرصودة بمعيار طبيعي، فإن مخطط QQ غير مؤسسي:
par(mfrow = c(2, 2))
qqfun <- function(x) {
qqnorm(x, main = "", xlab = "Quantili teorici N(0,1)", pch = 20)
qqline(x, col = "red", lty = 1)
}
qqfun(dati$IDADE)
qqfun(dati$GASAUDE)
qqfun(dati$GASLAZER)
qqfun(dati$GASTEDU)
في ضوء ذلك، إذا لم أتمكن من استخدام اختبار التوزيع الطبيعي الرسمي لتجميع الأدلة: اختبار كولموغوروف-سميرنوف مع المعلمات الإحصائية، واختبار ليليفورس، واختبار كرامر-فون ميزس، واختبار شابيرو-ويلك، واختبار شابيرو-فرانس، واختبار أندرسون-دارلينج، واختبار بيرسون (كاي-كوادرو) للتوزيع الطبيعي.
normalita <- function(x) {
t1 <- ks.test(x, "pnorm", mean(x), sd(x)) # Kolmogorov–Smirnov
t2 <- nortest::lillie.test(x) # Lilliefors
t3 <- nortest::cvm.test(x) # Cramér–von Mises
t4 <- shapiro.test(x) # Shapiro–Wilk
t5 <- nortest::sf.test(x) # Shapiro–Francia
t6 <- nortest::ad.test(x) # Anderson–Darling
t7 <- PearsonDS::pearson.test(x) # Pearson chi-quadro di normalità
pv <- c(t1$p.value, t2$p.value, t3$p.value, t4$p.value, t5$p.value, t6$p.value, t7$p.value)
data.frame(p_value = pv, row.names = c(t1$method, t2$method, t3$method, t4$method, t5$method, t6$method, t7$method))
}
normalita(dati$GASAUDE)
إذا قمت بتحديد التاريخ إلى الوضع الطبيعي وكانت العلاقة خطية ، فإن معامل بيرسون هو خيار أولي جيد؛ وإلا فمن الحكمة تفضيل مزج basate sui ranghi مع سبيرمان أو كيندال.
العلاقة بين التباين الكمي: التباين والارتباط
المشكلة تكمن في أن التباين المشترك يعتمد على الوحدة المختلطة ، وهو أمر يصعب مقارنته.
يحل معامل ارتباط بيرسون الخطي مشكلة توحيد الانحراف المعياري: يتراوح معامل الارتباط r بين -1 و1، حيث تشير القيم من ±1 إلى وجود علاقة خطية قوية (موجبة أو سالبة)، بينما تشير القيمة 0 إلى وجود علاقة خطية. تنبيه: لا ينفي r = 0 وجود علاقات غير خطية.
الحساب لكل ارتباط في R:
# Coefficiente di Pearson e test di significatività
cor(dati$GASTEDU, dati$GASAUDE, method = "pearson")
cor.test(dati$GASTEDU, dati$GASAUDE, method = "pearson")
عندما تكون العلاقة رتيبة ولكن غير خطية أو عندما لا تكون طبيعية (الخارجة)، فمن المنطقي استخدام Spearman (ranghi؛ قوي ومتكيف مع Campioni المتوسط والكبير) أو Kendall τ (basato su concordanze/discordanze؛ مفضل su Campioni piccoli أو con molti pareggi):
# Correlazioni non parametriche
cor.test(dati$GASTEDU, dati$GASAUDE, method = "spearman")
# Su un sottoinsieme più piccolo, meglio Kendall
dati2 <- head(dati, 20)
cor.test(dati2$IDADE, dati2$GASAUDE, method = "kendall")
فكرة مفيدة: معامل تحديد R² في نموذج خطي دون إعادة حساب معدل المتغير Y خطيًا من X. في R:
summary(lm(GASAUDE ~ ESTCIVIL, data = dati))$r.squared
بالنسبة للثنائية مقابل التباين الكمي، يتطابق معامل الارتباط الثنائي النقطي مع حساب بيرسون مع متغير مشفر 0/1؛ عمليًا، cor(dichotomous, quantitative) مع method = “pearson”.
الفئات المتغيرة: الاستقلال، وقوة الارتباط، وبيكولي كامبيوني
عند إدخال تباين النوم الاسمي أو الترتيبي ، تُدرس العلاقة باستخدام جدول توافق (التكرار مع تصنيف دوبيا). الفرضية النموذجية هي: H0 = الاستقلالية (ارتباط ضروري)، H1 = التبعية.
اختبار الفرق هو إطار عمل استقلالية كاي . إذا كان نومك أقل من ذلك بشكل متكرر (عادةً أقل من 5)، أو إذا استخدمت معامل ارتباط ييتس للعينات 2×2 أو اجتزت اختبار فيشر ، وهو أمرٌ يُنصح به تحديدًا في حالة المرضى ذوي النوم القصير.
# Tabella incrociata e chi-quadro
xtabs(~ PROFI + ESTCIVIL, data = dati) -> tab1
chisq.test(dati$PROFI, dati$ESTCIVIL) # p-value non significativo => indipendenza plausibile
# Campioni piccoli: test di Fisher
chisq.test(dati$PROFI, dati$RENDA)
fisher.test(dati2$PROFI, dati2$RENDA)
لتحديد شدة الارتباط في جدول I×J إذا استخدمت: V di Cramér (0–1)، معامل التوافق (0–1، قيد)، وفي 2×2 il phi (φ) ، وهو تطبيق رسمي لـ Pearson r على الجدول الثنائي.
# Misure di associazione per tabelle
library(vcd)
xtabs(~ PROFI + RENDA, data = dati) -> tab2
assocstats(tab2) # riporta V di Cramér, coeff. di contingenza e test
# Attenzione: cor() su codifiche numeriche di categorie non è equivalente a φ in generale
إذا كان الهدف هو مقارنة مجموعات ذات متغيرات كمية (مثل عدد مستخدمي ريديت حسب المهنة)، وإذا تم تقييم الاختبار ، فإن تحليل التباين (ANOVA ) والبديل غير البارامتري المقابل لا يوفران فاصل ثقة. وبشكل عام، يتوافق ذلك مع نوع التباين والطريقة الأساسية.
اتفاق التقييم: كابا دي كوهين
عندما يصنف (più) giudici gli stessi oggetti في الفئة، لا يكفي خلط نسبة الاتفاق، perché a quita può essere dovuta في هذه الحالة . يحدد Il Kappa di Cohen الاتفاقية الصحيحة للاتفاقية غير الرسمية: أقدرها أيضًا إلى 0 تشير إلى الاتفاقية pari al caso، وأنا أقدر ذلك ماجيوري أقترح في الاتفاقية المتزايدة (تفسيرات comuni: Scarso، سرية، معتدلة، جيدة، جيدة جدًا).
في R من الممكن تقدير Kappa anche في إصدار التفكير (لكل فئة ترتيبية):
set.seed(1)
val1 <- sample(0:1, 10, replace = TRUE)
val2 <- sample(0:1, 10, replace = TRUE)
# Kappa non ponderato
fmsb::Kappa.test(val1, val2)
إذا لم تكن الفئة طبيعية بشكل غير عادي (وأحيانًا خفيفة/متوسطة/شديدة)، فإن كابا تعتبر العقوبة أقل في حالات الخلاف "القريبة" وأقل "البعيدة"، مما ينتج عنه عقوبة أكثر إفادة.
العلاقة ومتغيرات الارتباك: الارتباط الجزئي
Può capitare che بسبب المتغير في السؤال، إذا قمت بحساب العلاقة بين X و Y المتحكمين في Z.
في R، مع ggm::pcor سيحقق الارتباط الجزئي من الترتيب الأول ويمكنه اختبار الأهمية. من المفيد مقارنة الكلاسيكية والجزئية لكل رأس بـ Z "spiega" dellegam grezzo.
library(ggm)
# Correlazione parziale tra GASLAZER e GASAUDE controllando GASTEDU
rp <- pcor(c("GASLAZER", "GASAUDE", "GASTEDU"), var(dati))
# Correlazione grezza
r <- cor(dati$GASLAZER, dati$GASAUDE)
# Test della correlazione parziale (1 variabile di controllo)
pcor.test(rp, 1, length(dati$GASAUDE))
# Confronto R^2 grezzo vs parziale
data.frame("Senza_controllo" = r^2, "Con_controllo" = rp^2)
إذا كان الصنبور "يتدفق" في وضع التحكم، فإنّ allora Z كان شريكًا مهمًا . عندما يكون متغير التحكم هو الفئة (مثل المهنة)، لا يمكنني استخدام مناهج أو نماذج مماثلة تتضمن الفئة كعامل.
الحدود والممارسات الجيدة في استخدام الارتباط
يُراعي معامل بيرسون الخطية فقط . أما إذا كانت العلاقة غير خطية (تربيعية، أو سبيرمانية، أو لوغاريتمية)، فقد تكون قيمته صفرًا في حالة وجود تبعية قوية. في هذه الحالة، تُستخدم قيم سبيرمان ، مما يُحوّل النموذج غير الخطي وفقًا لذلك.
قد تؤدي القيم الشاذة إلى تشويه النتائج. لذا، من الأنسب أولاً فحص الرسم البياني، وإذا لزم الأمر، إجراء تحليل دقيق أو التحقق من حساسية النتيجة عند استبعاد النقاط المتطرفة.
كلاسيكي آخر: الارتباط ≠ السببية . بسبب التباين لا أستطيع ربط أنفلونزا النوم perché يعطي فتور ثالث، مجرد مصادفة أو حسب تأثير آلية عكسية. أجهزة مصممة تجريبيًا، وأدوات سببية، أو نماذج مناسبة للحديث عن السبب.
نوع العلاقة: خطية، رتيبة، خالية، فئوية
غالبًا ما يكون هذا مختلطًا (كمي مقابل ثنائي التفرع/اسمي/عادي) إذا أصبح اختبارًا للمقارنة بين المجموعات، أو الارتباطات الثنائية/النقطة الثنائية أو النموذج (ومثال الانحدار مع العوامل التنبؤية). مع فئات الإدخال المتغيرة ، إذا كنت ستوافق على Chi-Quadro/Fisher وكل قوة الارتباط في رؤيتك.
Funzioni eat special relations
الدالة هي علاقة تربط، لكل عنصر من عناصر المجال، عنصرًا واحدًا من عناصر المجال المقابل. في النهاية، هي علاقة من نوع sottoinsieme di A×B تربط كل عنصر a في A بعنصر واحد من عناصر المجال المقابل. من العمليات المهمة الأخرى في جبر هذه العلاقة: الاتحاد (R1 ∪ R2)، والتقاطع (R1 ∩ R2)، والتركيب (R2 ∘ R1) ، والمعكوس (R⁻¹، وهو نسخة بسيطة من (a, b) في (b, a)).
هذه المسائل المفاهيمية المستخدمة في الرياضيات هي في الرياضيات البحتة (التكافؤ، الترتيب، فئات التكافؤ) وهي في التطبيقات الملموسة تخدم إضفاء الطابع الرسمي على العلاقات من الكيان.
جبر العلاقات والعلوم أعطيته
في عالم قواعد البيانات، يُمثل الجبر النسبي البنية النظرية للغة SQL: عمليات مثل التحديد، والتكرار، والربط، والاتحاد، والدمج، هي نسخ عملية من العمليات على الجبر النسبي. هذه الصياغة الرسمية أداة فعّالة لوصف البيانات وتحسينها ومعالجتها بسرعة.
في سياق الذكاء الاصطناعي والتعلم الآلي، تسمح القدرة على نمذجة العلاقات بين الكيانات ببناء المعرفة وأنظمة التوصية وقنوات التكامل بطريقة فعالة من حيث التكلفة؛ هذه القيمة صالحة في الاقتصاد والإحصاء الحيوي والعلوم الاجتماعية، وهي دائمًا تقريبًا " chi è legato a chi, e in che mode ".
أمثلة كلاسيكية للعلاقات في نظرية المجموعات
علاقة التكافؤ : النوم الواقعي والمتماثل والمتعد. تتضمن الأمثلة النموذجية "أن تكون لديك هذه القيمة الأساسية" سواء كانت حقيقية أو تطابق الوحدة مع الاقتراحات الداخلية. كل علاقة من التكافؤ تحث على تصنيف التكافؤ الذي يفصل بين الكتل المتباينة.
علاقة النظام : غير متكافئ، ومضاد للتماثل، ومتعد. أمثلة: ≥ الأرقام الطبيعية الخاصة بك، التضمين ⊆ متضمن للجزء P(X)، أو "تقسيم" (|) طبيعي خاص بك. وهي أساسية لتحديد الترتيبات الكلية أو الجزئية ولتحديد الكتل والحد الأدنى والسلسلة ومضادات السلاسل.
ترتيب التسلسل : كما ذكرتُ سابقاً، هو ترتيب في سلسلة (سلسلة نصية، أو رقم مكتوب بالتسلسل) يقارن عنصراً بعنصر؛ يوجد تشويش كبير في هذا التركيب، لذا أتجاهل الخوارزميات.
يعد هذا القسم مفيدًا لأن "العلاقة" في الرياضيات هي مفهوم رئيسي للارتباط الوحيد : بما في ذلك uguaglianze، ordini، والتركيب وأكثر من ذلك بكثير، وكلها لا غنى عنها لنماذج الأنظمة الشاملة.
سير العمل العملي: التحكم في النتائج
من الممكن إنجاز العمل دون فقدانه أثناء عملية البناء، وأحيانًا:
- التفتيش الرسومي: مؤامرة مبعثر، تجانس، istogrammi، QQ-المؤامرة. إنه غريب وشكل غير خطي.
- الشيكات:إذا نجح الأمر، اختبر الحالة الطبيعية؛ عناصر التحكم في التباين إذا تم توقع نموذج خطي.
- Scelta del coefficiente: بيرسون (خطي، بيانات حوالي نورمالي)، سبيرمان/كيندال (رتابة/غير عادية/بيكولي كامبيوني).
- تصنيفي: chi-quadro/Fisher + misure d'associazione (V di Cramér، coeff. di contingenza، φ). لمقارنة المجموعة، اختبار t/ANOVA أو البديل.
- كونفوندينتي: ربط نموذج بارزيالي أو متعدد المتغيرات (بما في ذلك فئة فاتوري).
مهما كان الاختيار، تفسيرات المسابقة والمفتاح: زيادة التأثير، والأهمية الإحصائية، وحجم الحملة، وجودة البيانات الواردة كرقم نهائي (إن لم يكن أكبر).
Esempi di codice R ricorrenti
باختصار، يمكنك استخدام هذه الطريقة لجعلها أكثر دقة في تحليل العلاقة بين المتغيرات، ثم تكييفها مع مجموعة البيانات الخاصة بك:
# 1) Correlazioni
cor(x, y, method = "pearson")
cor.test(x, y, method = "spearman")
cor.test(x_small, y_small, method = "kendall")
# 2) Grafici (base e ggplot2)
plot(x, y)
# ggplot2: geom_point() + geom_smooth(method = "lm" o se = FALSE)
# 3) Normalità
shapiro.test(x)
nortest::ad.test(x)
# 4) Tabelle e test
xtabs(~ a + b, data = dati) -> tab
chisq.test(tab)
fisher.test(tab) # campioni piccoli o celle con attesi < 5
vcd::assocstats(tab) # V di Cramér e coeff. di contingenza
# 5) Kappa
afmsb::Kappa.test(giudice1, giudice2)
# 6) Correlazione parziale
ggm::pcor(c("x", "y", "z"), var(dati))
ملاحظة عملية : تعتمد الخيارات "الصحيحة" على البيانات. من المفيد التحقق من صحة الفرضية، ومقارنة الطريقة، وعندما تنجح، إنشاء برنامج نصي صغير لتشخيص المشكلة بسرعة وبطريقة موثوقة.
لاحظنا أن مصطلح "relazione" قد يعني في أغلب الأحيان: الشكل الخطي مع بيرسون، والرتابة مع سبيرمان/كيندال، والارتباط داخل الفئة مع كاي كوادرو/فيشر، والقياس مع V دي كرامر وφ؛ دون إغفال التوافق بين القيم المطلقة (كابا) والإدارة التي قدمتها مع الارتباط الجزئي. لذلك، فإن الجبر العلائقي يوفر الدوال المفاهيمية لتحديد المجال والمعكوس والتركيب، ويوجه الجبر العلائقي الطريقة التي نحفظ بها البيانات في قواعد البيانات ونستعلم عنها. الفكرة الرئيسية هي اختيار الأدوات بناءً على نوع المتغيرات، في شكل قانوني ومتابعة التحليل ، وتسجيل ما لا يوجد به معامل، ويمكن فقط معرفة القصة بأكملها.